Говорящий аватар из одной фотографии, бесплатно

Аватар, который говорит твоим текстом, собирается из одной фотографии и делается бесплатно. Ниже весь путь: какое фото годится и какое развалится, где взять голос, чем оживить лицо, как собрать вертикальный ролик и что делать, когда картинка плывёт. Плюс готовый промпт, если показывать собственное лицо не хочешь.

Полный путь от одной фотографии до говорящего вертикального ролика: требования к кадру, два способа получить голос, оживление лица на бесплатном тарифе Hedra, сборка ролика и разбор частых поломок. Промпты внутри, копируются одной кнопкой.

Какое фото годится, а какое развалится

Половина провалов случается ещё до генерации, на выборе кадра.

Модель оживляет ровно то, что видит. Она достраивает движение губ, век и головы вокруг тех пикселей, которые ты дал, поэтому кадр решает больше, чем сервис. Хорошее фото делается за минуту на телефон, у окна, без вспышки.

  • Лицо анфас или в лёгком развороте до 15 градусов. Профиль модель достраивает наугад, и на середине фразы человек становится чужим.
  • Лицо занимает от трети до половины кадра. Мелкое лицо в общем плане расплывается на первых же словах.
  • Рот закрыт, зубы не видны. Открытый рот на исходнике даёт кашу при первой же артикуляции.
  • Ровный мягкий свет, лицо целиком освещено. Жёсткая тень на половине лица начинает жить своей жизнью и дрожит.
  • Без очков с бликом, без микрофона у губ, без руки у лица. Всё, что перекрывает рот и подбородок, ломает синхрон.
  • Фон простой и статичный. Люди и машины на заднем плане поплывут вместе с лицом.
  • Разрешение от 1024 пикселей по короткой стороне. Скриншот из мессенджера уже сжат, лучше взять оригинал.
Проверка на глаз перед загрузкой: закрой ладонью всё, кроме области от бровей до ключиц. Если в этом куске лицо читается чётко и ничем не перекрыто, кадр рабочий.

Голос: два пути, и первый сильнее

Аватар настолько живой, насколько живой голос под ним.

Путь 1. Записать самому на телефон

Диктофон в телефоне даёт то, чего пока не даёт ни один синтез: паузы в неожиданных местах, смену темпа, лёгкую хрипоту, живое дыхание. Пиши текст заранее и читай его вслух, глядя в одну точку. Записывай в комнате с мягкими вещами, шторы и диван съедают эхо лучше любого шумодава. Телефон держи на расстоянии ладони и чуть сбоку от рта, тогда не будет взрывных «п» и «б».

Путь 2. Синтез, когда своего голоса не хочешь

Синтез берут, когда лицо на ролике вымышленное или когда нужно много роликов подряд. Русский звучит убедительно у ElevenLabs, там же есть бесплатный тариф с лимитом символов в месяц, точную цифру смотри в кабинете, она меняется. Ставь скорость чуть ниже стандартной и добавляй в текст запятые там, где хочешь паузу: синтез читает знаки препинания как ритм.

Длина решает. Для первого ролика бери 12-18 секунд речи, это 35-50 слов. Чем длиннее дорожка, тем заметнее накапливается рассинхрон губ, и первый же провал происходит на длинных монологах.

Оживление лица: Hedra, бесплатный тариф

Пять генераций в день бесплатно, этого хватает на ролик в день с запасом на пересъёмку.

Hedra делает говорящее видео из пары фотография плюс аудио. Их модель Character-3 обрабатывает картинку, текст и звук вместе, поэтому губы попадают в слова точнее, чем у классических липсинк-моделей, которые клеят рот поверх готового видео. На бесплатном тарифе дают 100 кредитов в месяц и до пяти генераций в день.

  1. Открой hedra.com и заведи аккаунт. Выбирай режим создания видео из изображения и аудио.
  2. Загрузи фото по требованиям из первого раздела. Сервис сам найдёт лицо, ничего размечать не надо.
  3. Загрузи свою запись голоса файлом. Если пользуешься синтезом, сначала скачай дорожку, потом загрузи её сюда же.
  4. Поставь вертикальный формат 9:16 сразу на генерации. Обрезать горизонтальный ролик потом значит потерять половину лица.
  5. В поле подсказки опиши поведение в кадре одной строкой, пример ниже. Длинные описания модель размывает.
  6. Запусти и жди. Первый результат смотри со звуком и на телефоне. Зритель увидит его именно так.
Промпт
Спокойный говорящий портрет, лёгкие естественные движения головы, взгляд в камеру, мягкая мимика, без резких жестов, фон остаётся неподвижным.
Пять бесплатных генераций в день это ровно тот бюджет, при котором стоит заранее написать текст и записать голос. Сжигать попытки на подбор фразы прямо в сервисе дорого.

Если своё лицо показывать не хочешь

Персонажа под свою нишу проще сгенерировать один раз и дальше держать его постоянным.

Сгенерируй портрет в любом знакомом генераторе картинок и сохрани исходник. Дальше это лицо становится твоим постоянным ведущим: тот же файл идёт в каждый следующий ролик, и человек привыкает к персонажу. Промпт ниже написан так, чтобы результат годился именно для оживления: анфас, закрытый рот, ровный свет, простой фон.

Промпт
Фотопортрет человека средних лет, анфас, взгляд в камеру, рот закрыт, спокойное доброжелательное выражение, мягкий рассеянный свет из окна слева, ровное освещение всего лица, простой однотонный фон светло-серого цвета, поясной кадр, лицо занимает около сорока процентов кадра, реалистичная кожа с видимыми порами и лёгкой асимметрией, естественная зернистость, без очков, без головных уборов, без надписей и логотипов, вертикальный кадр
Один раз выбрал лицо, дальше не меняй. Новый персонаж каждую неделю читается как чужой аккаунт, и узнаваемость обнуляется.

Сборка ролика: что докрутить после генерации

Голая говорящая голова редко удерживает внимание дольше пяти секунд.

  • Субтитры обязательны. Большая часть людей смотрит без звука, и без текста аватар выглядит как молчащая картинка.
  • Первые две секунды отдай самой сильной фразе. Представление и приветствие убивают ролик на старте.
  • Каждые 4-6 секунд меняй картинку: врезка, скриншот, текст на весь экран. Статичное лицо на всю длину даёт провал в досмотрах.
  • Держи вертикаль 1080 на 1920 от начала и до конца, без чёрных полей.
  • В конце оставь одно действие. Одно, не три.

Монтировать можно чем угодно, вплоть до телефона. Субтитры сейчас автоматически ставит и CapCut, и встроенный редактор Instagram, ручная расшифровка тут не нужна.

Почему аватар плывёт и как это чинить

Разбор поломок, которые встречаются чаще всего.

Лицо дрожит и меняется по ходу фразы

Почти всегда причина в исходнике: разворот головы, тень на половине лица или мелкое лицо в кадре. Перевыбери фото по требованиям из первого раздела, перегенерация того же кадра результата не даст.

Губы отстают от слов

Дорожка слишком длинная либо в записи есть длинные паузы и посторонние звуки. Режь речь до 15-20 секунд и вычищай тишину в начале и конце файла.

Зубы превращаются в кашу

На исходнике рот приоткрыт. Возьми кадр с закрытым ртом, модель дорисует артикуляцию сама и сделает это чище.

Ролик выглядит мёртвым, хотя губы попадают

Не хватает движения вокруг. Добавь врезки, укрупнение кадра, текст на экране. Оживлять надо весь ролик, лицо тут только часть.

Персонаж узнаётся с трудом от ролика к ролику

Каждый раз берётся новое фото или новая генерация. Зафиксируй один исходник и используй только его.

Что сделать сегодня

Порядок на один вечер, без пропусков.

  1. Выбери или сними одно фото по требованиям. Пятнадцать минут.
  2. Напиши текст на 40 слов и запиши его на диктофон с третьего дубля. Двадцать минут.
  3. Сгенерируй говорящее видео и посмотри его на телефоне со звуком. Десять минут.
  4. Добавь субтитры и одну врезку, поставь вертикаль. Двадцать минут.
  5. Выложи. Второй ролик сделаешь вдвое быстрее, потому что фото и голос уже отработаны.
Первый ролик почти всегда получается средним. Ценность в том, что после него у тебя остаётся готовая связка фото плюс голос плюс сервис, и следующий ролик стоит уже двадцать минут.

Читать дальше в блоге

Эту тему я разбираю подробно в статье как собрать Рилс без съёмок и монтажа. Там же лежат остальные разборы про короткие ролики.

Следующий шаг
Хочешь так же, но под свой блог и продукт?

Я собрал систему, по которой обычный человек запускает блог с нуля и набирает аудиторию без съёмок, монтажа и команды. Внутри разбор, с которого стартовал сам.

Открыть разбор: с чего начать