OmniHuman — нейросеть ByteDance, которая превращает одно фото и запись голоса в видео: человек на снимке говорит или поёт ваши слова, двигает губами, бровями и головой. На сайте две версии: OmniHuman 1.5 и OmniHuman 1.0. Две пробы мы сделали в обеих версиях с одинаковыми фото и записями, чтобы понять, за что 1.5 берёт больше. Третью, про жесты, только в 1.5.
Всё для проб сделали здесь же, на сайте. Портреты и енота нарисовала Nano Banana Pro, речь озвучила Мега, песню написал Suno. Людей на фото не существует.

Первая проба: ветеринар Ольга говорит «Добрый вечер, я Ольга, ветеринар. Кот чихает уже третий день? Не пугайтесь, чаще всего это обычная простуда».
OmniHuman 1.0 · ролик 544×720 · 20 ₽/сек.
OmniHuman 1.5 · ролик 834×1104 · 35 ₽/сек.
Губы попадают в слова у обеих, на словах «Кот чихает уже третий день?» обе поднимают брови. Повороты головы совпадают почти кадр в кадр. Разница в мелочах: 1.0 чаще щурится, а ролик у неё меньше по размеру, 544×720 точек против 834×1104, поэтому мягче в деталях. На телефоне этого почти не видно.
Первую версию ByteDance показала в феврале 2025 года. По словам разработчиков, ей подходит фото любого плана, от лица крупным планом до человека в полный рост, а вместо речи можно загрузить песню.
Версию 1.5 ByteDance представила в августе 2025 года. Она устроена сложнее: одна её часть разбирает смысл сказанного, другая рисует движение. Поэтому жесты и мимика должны следовать за смыслом слов, а не за одной громкостью голоса. Разработчики обещают у 1.5 ещё текстовые подсказки и сцены с несколькими героями, но в форме на сайте нет ни поля для подсказки, ни выбора, кто из героев говорит.
Форма у обеих версий одинаковая: поле Фото (JPG, PNG, WebP или снимок с iPhone в HEIC) и поле Аудио (MP3, WAV, M4A и другие), по одному файлу. Поля Задание, куда пишут, что должно происходить в кадре, здесь нет: всё поведение нейросеть берёт из звука. Пропорции ролика повторяют фото, вертикальный снимок даст вертикальное видео, а размер ролика не выбирается. Звук из записи уже вшит в видео.
Платите за каждую секунду записи, неполная секунда считается целой. Цена видна на кнопке Отправить до запуска. Как устроены запуски и где потом искать ролик, рассказывает инструкция по сайту.
Вторая проба — мультяшный енот в красном шарфе. Вместо речи загрузили кусок песни Suno длиной 7,85 секунды, с музыкой, отдельно голос не вырезали. Енот поёт: «Я енот в красном шарфе, я пою на сцене вам».
OmniHuman 1.0 · песня 7,85 с · 20 ₽/сек.
OmniHuman 1.5 · песня 7,85 с · 35 ₽/сек.
Здесь 1.5 живее. На словах «я пою на сцене вам» енот отводит свободную лапу в сторону, как артист перед залом, и покачивается всем телом. В 1.0 двигаются только голова и мордочка, лапы стоят на месте, а пару раз енот сонно прищуривается. Мультяшного героя обе версии не испортили: шерсть, шарф и микрофон остались как на картинке.
Жесты — главное, что разработчики обещают в 1.5, поэтому мы проверили их отдельно, на экскурсоводе. На фото он снят по пояс, руки за краем кадра, а в записи говорит: «Посмотрите направо: вот этот дом построили в тысяча восемьсот девяносто первом году. А теперь налево!»
OmniHuman 1.5 · запись 7,7 с · 35 ₽/сек.
На словах «вот этот дом» экскурсовод поднимает обе руки в кадр и разводит их, пальцы на месте, по пять на каждой. Направо при этом не показывает: жест вышел общий, «рассказывающий», а не указание. Попросить нужное движение словами нельзя. Если нужен конкретный жест, подберите нейросеть с полем Задание в разделе говорящего фото. Там же версия 1.5 стоит в сравнении с пятью другими нейросетями на одном портрете.
На крупных портретах рук у нас не появилось. Так устроен и готовый пример со страницы OmniHuman 1.5: портрет девушки по грудь нарисовала GPT Image 2, а запись стихотворения перед загрузкой очистили от шума в ElevenLabs Audio Isolation. Девушка читает с паузами, наклоняет голову и несколько раз прикрывает глаза.
OmniHuman 1.5 · запись 8 с · 35 ₽/сек.
| Нейросеть | Цена | Размер ролика из фото 3:4, точек | Что двигалось в наших пробах | Ждали ролик на 8 с |
|---|---|---|---|---|
| OmniHuman 1.5 | 35 ₽/сек. | 834×1104 | Лицо, голова, руки и лапы | 3,5–4 мин |
| OmniHuman 1.0 | 20 ₽/сек. | 544×720 | Лицо и голова | 2–2,5 мин |
Если в кадре крупное лицо и человек просто говорит (поздравление, объявление, приветствие), берите OmniHuman 1.0. На ветеринаре она почти не уступила 1.5, а секунда у неё дешевле. Версию 1.5 стоит брать, когда в кадре видно тело: для песни, выступления, рассказа с жестами, а ещё когда нужна картинка чётче, ведь размер ролика у неё больше.
В форме на сайте у обеих версий нельзя выбрать, кто из двоих на фото говорит. Для диалога двух людей есть отдельные нейросети в том же разделе говорящего фото. Если у вас готовое видео и в нём надо заменить речь, нужен липсинк. Если записи голоса нет, её сделают нейросети озвучки текста.
Три картинки, две озвучки, песня и пять роликов обошлись нам в 1 273 ₽, почти всё ушло на ролики.
Статья обновлена 26 сентября 2026 г.