Gemini Omni: как сделать видео из фото и текста

Gemini Omni — видеонейросеть Google, её показали 19 мая 2026 года. Она собирает ролик до 10 секунд со звуком из текста, фото и чужого видео, а готовое видео переделывает по просьбе словами. На Братухе в Omni чаще всего превращают фото человека в 3D-мультик: за последний месяц об этом просили в 358 из 515 удачных запусков. Мы сделали такой мультик с выдуманной героиней за 95 ₽.

Лиза выдуманная, её «фото с прогулки» мы сгенерировали в GPT Image 2, чтобы не показывать в статье живого человека. Ролики ниже сделаны на сайте по промптам из текста и не смонтированы. Если вы у нас впервые, загляните в инструкцию по сайту: там про баланс и ленту результатов.

Gemini Omni или 1.1: какую открыть

Для видео открывайте версию 1.1: поля у неё те же, десятисекундный ролик на 25 ₽ дешевле, а в 4K он стоит 158 ₽ вместо 330, почти вдвое меньше, чем в первой версии. Google выпустила 1.1 27 августа. Первая версия нужна для режимов Персонаж и Аудио, они бесплатные. В 1.1 эти кнопки тоже есть, но сейчас запуски в них заканчиваются ошибкой.

OmniOmni 1.1
Видео 4 / 6 / 8 / 10 секунд60 / 80 / 100 / 120 ₽48 / 65 / 80 / 95 ₽
10 секунд в 4K330 ₽158 ₽
Правка своего видео150 ₽126 ₽
Персонаж и Аудио0 ₽сейчас с ошибкой

В 1.1 разрешения 360p, 720p и 1080p стоят одинаково, так что берите 1080p. Кадр бывает горизонтальный 16:9 или вертикальный 9:16.

3D-мультик из фотографии по шагам

  1. Откройте Omni 1.1. Тип генерации оставьте Видео.
  2. В поле Задание 1 опишите, что происходит в мультике. Наш промпт ниже.
  3. В Референсные изображения 2 загрузите фото, где человек виден хотя бы по пояс при дневном свете.
  4. Выберите Длительность 10, Соотношение сторон 9:16 для Reels и Shorts, Разрешение 1080p и нажмите Отправить 3. Цена на кнопке — 95 ₽.

Вертикальный 3D-мультфильм. Девушка с фото превращается в мультяшную героиню: узнаваемое лицо, рыжие волосы до плеч, веснушки, горчичный свитер и джинсы как на фото, но пропорции мультяшные — большие глаза, мягкие формы. Осенний парк, тёплый золотой свет, в воздухе кружатся кленовые листья.

0–4 с: она ловит лист ладонью и улыбается.

4–7 с: набирает охапку листьев с земли и подбрасывает их вверх, кружится.

7–10 с: листья оседают, она смеётся и машет рукой в камеру.

Камера медленно наезжает, в конце средний план. Звук: шелест листьев, лёгкая весёлая музыка, без слов. Без текста в кадре.

Лицо и одежду Omni берёт с фото, но мы всё равно перечислили приметы словами. Для своего снимка замените «рыжие волосы до плеч, веснушки, горчичный свитер и джинсы» на [цвет и длину волос, приметы, одежду]. Разметку по секундам нейросеть выполнила точно: лист в ладони в начале, охапка листьев в середине, взмах рукой в конце. «Медленный наезд» она поняла по-своему и в середине отвела камеру назад, чтобы в кадр влезла охапка.

Слева исходное фото девушки в горчичном свитере в осеннем парке, справа кадр 3D-мультика с ней

Перед десятисекундным роликом мы сделали пробу на 4 секунды за 48 ₽, убрав из промпта разметку по секундам и оставив одно действие с листом. Лицо узнавалось, веснушки остались, и только тогда мы заказали 10 секунд. Проба готовилась две минуты, полный ролик три с половиной.

Промпт сохранён шаблоном «3D-мультик по фото». Нажмите на его странице Повторить 1, загрузите своё фото и поправьте приметы в задании.

Реплика на русском без фото

Omni озвучивает героя сама. Нужно написать фразу в кавычках и сказать, каким голосом её произнести. Ролик ниже сделан только по тексту:

  1. В Omni 1.1 оставьте Референсные изображения пустыми.
  2. Вставьте промпт в Задание.
  3. Поставьте Длительность 6 и Соотношение сторон 16:9, нажмите Отправить. Это 65 ₽ и около двух минут ожидания.

3D-мультфильм, горизонтальный кадр. Ёжик-почтальон в синей фуражке и с сумкой через плечо стоит у деревянной двери деревенского дома, в лапах небольшая посылка. Он поднимает глаза на зрителя и говорит по-русски бодрым высоким голосом: «Вам посылка! Распишитесь вот здесь». На последних словах протягивает посылку к камере. Утро, мягкий солнечный свет, статичная камера, средний план. Звук: только его голос и тихое пение птиц, без музыки. Без текста в кадре.

Голос звучит с первой по четвёртую секунду, между фразами короткая пауза, в конце ёжик протягивает посылку к камере. На 6 секунд давайте не больше 8–10 слов, иначе выйдет скороговорка. Русский Google официально не проверяла: в документации Gemini API полностью поддержан только английский. Если голос не подошёл, поменяйте его описание («низким спокойным голосом», «шёпотом») и запустите снова.

Как переделать готовое видео словами

Ролик загружают в ту же форму. Omni берёт из него фрагмент до 10 секунд, а цена не зависит от его длины: 126 ₽ в 1.1.

  1. В поле Видео 1 загрузите ролик. Свой результат с сайта скачивать не нужно: нажмите значок облака в углу поля и выберите его из своих файлов.
  2. В Начало фрагмента видео 2 и Конец фрагмента видео укажите секунды, которые нужно переделать. У нас 0 и 10, весь ролик.
  3. В Задание напишите одну правку и перечислите, что оставить как было. Длительность, формат и разрешение поставьте как у исходника, у нас 10 секунд, 9:16 и 1080p. Нажмите Отправить 3.

Список «что не трогать» важен: без него нейросеть меняет лишнее. Google в руководстве по промптам советует просить точечную правку, а не описывать сцену заново. Мы отдали Omni осенний мультик и попросили зиму.

Измени в загруженном видео только время года: вместо осени зима. Вместо кленовых листьев падает и взлетает снег, земля и деревья в снегу, свет холодный и мягкий. Героиня, её лицо, причёска, свитер, джинсы, все движения, камера и длительность — как в исходном видео.

Один и тот же кадр мультика: слева осенний парк с листьями, справа зимний парк со снегом

Движения совпали кадр в кадр. Кое-что Omni додумала сама: кленовый лист в ладони превратился в снежинку, вместо охапки листьев героиня подбросила горсть снега. Правка готовилась дольше обычного ролика, около шести минут.

Персонаж и голос для серии роликов

Если герой будет в нескольких роликах, сохраните его один раз: Omni выдаст ID, и дальше вы вставляете этот ID вместо фото в каждый новый ролик, а внешность и одежда остаются теми же. Всё в этом разделе мы делали в первой версии Omni, потому что в 1.1 режим Персонаж сейчас не запускается. Там же и видео: ролик на 4 секунды в 720p стоит 60 ₽.

В Тип генерации 1 выберите Персонаж, опишите героя, загрузите фото в Изображение персонажа 2, дайте имя и нажмите Отправить 3. Это бесплатно, ответ пришёл через три секунды.

В ленте результатов под формой появится короткий текст с именем и ID. Кнопка Скопировать берёт весь текст, а нужна только строка после «Id:», поэтому лишнее удалите.

Теперь верните Тип генерации на Видео, в поле Персонажи нажмите Добавить персонажа и вставьте ID. Фото больше не нужно, в задании хватит имени. Лизу мы отправили в кофейню.

Лиза сидит у окна в маленькой кофейне, дует на чашку какао с зефиром, делает глоток и улыбается. За окном идёт дождь. Реалистичное видео, тёплый свет ламп, крупный план, камера неподвижна. Звук: шум дождя и тихий гул кафе.

Мультика в задании не было, и Omni сделала реалистичное видео, но это та же Лиза с веснушками. Про свитер мы не написали ни слова, а он всё равно горчичный: его нейросеть взяла из описания персонажа.

Режим Аудио сохраняет голос так же, как Персонаж сохраняет внешность. В поле Голос выберите один из 30 готовых тембров, у каждого подписаны пол, характер и высота: например, «Aoede — женский, бодрый, средний». Заполните Название голоса, Описание голоса и Пример реплики и нажмите Отправить. Через несколько секунд придёт ID. Его вставляют в ID аудио при создании видео или в ID аудио для голоса, когда создаёте персонажа.

С голосом у нас вышло хуже, чем с внешностью. Ролик с Лизой и её голосом дважды подряд закончился ошибкой, оба раза минут через десять ожидания, деньги вернулись. Без персонажа, с одним ID голоса, видео собралось за три минуты, только девушку Omni нарисовала заново и слишком юной: голос внешность не хранит. Пока надёжнее так: героя задавать ID персонажа, а голос описывать словами в задании, как у ёжика выше.

В один запуск помещается до семи вложений: картинки, видео (каждое считается за два) и ID персонажей. Три персонажа и одно видео — уже пять.

Чем Omni отличается от Seedance и Kling

То же фото и тот же промпт мы отдали Kling 3.0 и Seedance 2.0 mini, только фото в тексте назвали @image1, как они требуют. У Omni нет пятисекундных роликов, поэтому её проба длится 4 секунды, у остальных по 5. Kling со звуком в 720p обошёлся в 70 ₽, Seedance в 75 ₽, Omni в 1080p — в 48 ₽.

Три мультяшные версии одной девушки с кленовым листом: Omni 1.1, Kling 3.0 и Seedance 2.0 mini

Слева Omni: парк перерисован целиком, веснушки на месте. В центре Kling оставил серый фон почти как на фото и даже сумку на плече, а лицо сделал гладким, как у наклейки, веснушки пропали. Справа Seedance с самым киношным светом, солнце бьёт сквозь листву, лицо взрослее и ближе к снимку. Для мультика по фото мы бы выбрали Omni, у неё самый мультяшный результат и самые дешёвые 10 секунд в 1080p. Seedance подойдёт, если нужна картинка «как в кино» и хватит 720p.

Нейросеть10 секунд со звуком
Omni 1.195 ₽ в 1080p
Kling 3.0140 ₽ в 720p, 180 ₽ в 1080p
Seedance 2.0 mini150 ₽ с фото-референсом, только 720p

Минусы у Omni тоже есть: больше 10 секунд за раз не сделать, тогда как Kling 3.0 и Seedance 2.0 mini на сайте дают до 15, а музыку или голос файлом в Omni не загрузить, Seedance такие файлы принимает.

Почему видео не создалось

  • «Ваш запрос не прошел модерацию». За последний месяц так заканчивался примерно каждый десятый запуск Omni на сайте. В причинах чаще всего знаменитости, бренды и чужие персонажи, реже откровенное фото. Уберите их из задания и со снимков.
  • «Максимальное количество изображений и видео в запросе ограничено семью». Посчитайте вложения по правилу из раздела про персонажа.
  • «Нейросеть временно недоступна». Сбой на стороне сервиса. Повторите запуск: у нас так заканчивались проба мультика, правка и ролик с персонажем, и каждый получился со второго раза.

За запуск с ошибкой деньги возвращаются на баланс сами, в момент, когда приходит ошибка.

Короткие ответы

У Omni на сайте есть и готовые эффекты. Самый популярный из них, «человек уходит по лестнице в небо», мы разбирали в отдельной инструкции.

Фото в стиле ГТА 6 нейросетью: постер, заставка и трейлер
6 октября 2026 г.

Фото в стиле ГТА 6 нейросетью: постер, заставка и трейлер

Из одного селфи делаем постер «Разыскивается», загрузочный экран, кадр «Потрачено» и вертикальный трейлер под synthwave. С промптами, ценами и нашими промахами.

Видео для карточки товара из одного фото: WB и Ozon
6 октября 2026 г.

Видео для карточки товара из одного фото: WB и Ozon

Делаем из одного снимка ролик 3:4 на 8–10 секунд для Ozon и Wildberries: вращение, товар на кухне и распаковка. Показываем, где нейросеть искажает товар и что подогнать перед загрузкой.

GPT Image 2 и 2.5: как пользоваться и какую выбрать
5 октября 2026 г.

GPT Image 2 и 2.5: как пользоваться и какую выбрать

Что выбрать в форме GPT Image 2, как получить на картинке ровно ваш русский текст, собрать кадр из двух фото и когда быстрее и дешевле взять версию 2.5.