Нейросеть HeyGen делает из фотографии говорящее видео, переводит ролик на другой язык голосом того, кто в кадре, и подгоняет губы под новую запись. HeyGen — компания из Лос-Анджелеса, её в 2020 году основали Джошуа Сюй и Уэйн Лян. Известна она цифровыми аватарами: двойник по фото или видео читает любой текст. На сайте есть четыре её нейросети, формы у всех на русском, а платите вы в рублях за секунды видео или звука.
Чтобы показать всю линейку, мы провели через неё одну ведущую. Керамистки Веры не существует: портрет сделали в GPT Image 2, объявление озвучили голосом Alicia в ElevenLabs Eleven v3, а заговорила она в Heygen 720p.
Текст, который прочитала ElevenLabs Eleven v3:
Привет! Я Вера, у меня маленькая мастерская керамики. В эту субботу в двенадцать проводим мастер-класс: за два часа слепите свою кружку, а глазурь выберете сами. Места ещё есть, пишите нам в сообщения!
Heygen 720p · фото 9:16 и запись 18 секунд · 1 ₽/сек., от 30 ₽
Ролик пришёл через 1 минуту 46 секунд. Вера моргает, слегка кивает и улыбается между фразами, губы попадают в слова. Фартук и полки за спиной неподвижны. Портрет мы заказали анфас, с закрытым ртом и опущенными руками, и ролик получился с первого запуска. Задание (промпт) для GPT Image 2, качество Medium, 9:16:
Вертикальное фото, как снятое на телефон: женщина лет 35 стоит в своей маленькой мастерской керамики и смотрит прямо в камеру. Спокойная лёгкая улыбка, рот закрыт, лицо полностью видно, руки опущены и не касаются лица. Тёмные волосы собраны в пучок, льняной фартук с пятнами глины. За спиной полки с кружками и мисками ручной работы, гончарный круг, мягкий дневной свет из окна. Реалистичная фотография, естественная кожа, без текста.
В форме Heygen 720p всего два поля: Изображение и Аудио с записью до 60 секунд. Поля для задания и выбора движений нет. Видео выходит в 720p, этого хватает для экрана телефона: из вертикального фото получился ролик 720×1280. Платите за секунды звука, но минимум за 30: за 18 секунд Веры мы заплатили как за полминуты. Для фразы на 5 секунд поэтому дешевле, например, Pruna AI P-Video Avatar, а другие нейросети для говорящего фото со своими плюсами разобраны в разделе «Говорящее фото».
Обе версии распознают речь в ролике, переводят её, озвучивают голосом того же человека и перерисовывают губы. Образец голоса не нужен. В списке Язык перевода 178 вариантов, от русского и китайского до испанского для Мексики.
Первая, HeyGen Translate, проще и дешевле: в форме только видео до 2 минут и язык.
Во вторую, Heygen Translate 2, можно загрузить запись до 6 часов. В поле Тип генерации есть Speed и Precision. Первый дешевле и, по словам разработчиков, рассчитан на лицо, повёрнутое от камеры не больше чем на 45°. Второй, по тем же словам, нужен для съёмки в профиль, рта, заслонённого рукой или микрофоном, и разговора нескольких людей. Ещё здесь есть Только перевод аудио, когда лицо трогать не надо, Количество спикеров до 20 и Динамическая длительность, которая разрешает переводу стать длиннее или короче оригинала. Как перевод выглядит рядом со сменой формата кадра и субтитрами, показано в разделе «Изменение видео».
Перевода здесь нет. В Heygen Lipsync V3 вы загружаете видео и новую запись, а она делает липсинк, то есть перестраивает движения губ под звук. Режим бывает Быстро и Точно, второй дороже и, по описанию в форме, даёт более качественный липсинк. Под галочкой Дополнительные настройки лежат переключатели Автоподгонка длительности, Убрать музыку, Улучшить речь, Добавить субтитры и поля Начало фрагмента и Конец фрагмента, чтобы переделать кусок. Цена считается по длине всего ролика, даже если правите фрагмент. Нейросеть рассчитана на видео, где уже звучит речь: на беззвучном ролике она у нас не сработала. С нейросетями Kling, Sync и ByteDance её сравнивали в разделе «Липсинк».
Ролик Веры мы отправили на английский в обе версии, во вторую в режиме Speed. Динамическую длительность не трогали, в форме она включена.
английский
Heygen Translate 2 · английский, Speed · от 8 ₽/сек.
Смысл обе передали верно, но слова подобрали разные. Первая версия начала с «Hi, I'm Vera, I have a small ceramics workshop» и через фразу снова сказала «workshop», уже про мастер-класс: мастерская и занятие слились в одно слово. Вторая их развела, мастерская стала «pottery studio». Голос в обоих роликах женский и той же высоты, что в оригинале.
Губы мы сравнили покадрово и заметной разницы не нашли. Первая версия сократила ролик с 18,4 до 17,7 секунды. Вторая растянула его до 18,6. Короткому ролику, где говорят в камеру, хватит первой версии, секунда у неё дешевле. Вторая нужна для записи длиннее 2 минут, а в режиме Precision — для профиля и нескольких собеседников: у первой нет ни режимов, ни поля для числа спикеров.
Допустим, занятие перенесли на воскресенье. Мы озвучили ту же фразу с одной заменой, «в это воскресенье в три» вместо «в эту субботу в двенадцать», и отдали её Heygen Lipsync V3 вместе с готовым роликом.
Привет! Я Вера, у меня маленькая мастерская керамики. В это воскресенье в три проводим мастер-класс: за два часа слепите свою кружку, а глазурь выберете сами. Места ещё есть, пишите нам в сообщения!
Heygen Lipsync V3 · режим «Быстро» · от 8 ₽/сек.
Через 2 минуты 16 секунд Вера назвала новую дату. Кивки, улыбка и кадр остались от исходника, а длина подстроилась под новую запись: ролик укоротился до 17,1 секунды. Это работа переключателя Автоподгонка длительности, у нас он был включён. В форме он уходит выключенным, пока не отмечена галочка Дополнительные настройки. Поэтому, если новая запись длиннее или короче старой, отметьте галочку и проверьте, что переключатель включён.
Слабое место режима Быстро видно на крупном плане: рот открывается меньше, чем в оригинале, и на «в это воскресенье» губы едва расходятся. Для ролика, который увидят клиенты, мы бы запустили Точно. Весь сюжет обошёлся нам примерно в 470 ₽.
| Нейросеть | Цена | На входе | Настройки | Когда брать |
|---|---|---|---|---|
| Heygen 720p | 1 ₽/сек., от 30 ₽ | фото и звук до 60 с | нет | Обращение или поздравление от лица снимка |
| Heygen Translate 2 | от 8 ₽/сек. | видео до 6 ч | Speed или Precision, Только перевод аудио, Количество спикеров | Длинная запись; профиль и двое в кадре — в Precision |
| Heygen Lipsync V3 | от 8 ₽/сек. | видео с речью и новая запись | Быстро или Точно, Начало фрагмента, Конец фрагмента, Убрать музыку | Замена фразы или новая озвучка своим звуком |
Есть фото и запись голоса, а видео нет — берите Heygen 720p. Ролик нужно показать зрителям из другой страны: для короткого обращения в камеру хватит первой версии перевода, лекцию, интервью или разговор двоих отдайте второй. А если новый текст уже озвучен, например в разделе «Озвучка текста», губы под него подгонит липсинк.
Статья обновлена 26 сентября 2026 г.