Создаёт короткие видео по описанию, картинкам и исходному ролику, а ещё умеет делать персонажей и голоса для озвучки. Цена за видео - от 48 до 190 ₽ в зависимости от длительности, разрешения и наличия исходного видео.
Gemini Omni 1.1 - нейросеть Google для создания и редактирования коротких видео из текста, изображений, аудио и готовых роликов. В этой версии упор сделан на мультимодальную работу: можно не только описать сцену словами, но и задать внешний вид через картинки, передать движение через исходное видео, отдельно подготовить персонажа и голос.
По заявлениям Google, Gemini Omni умеет собирать видео "из чего угодно": текста, фото, аудио и видео, а в версии 1.1 Flash добавлены более точные инструменты управления сценой и поддержка 4K. В официальных материалах модель описывают как систему для генерации и редактирования роликов с пониманием реального мира - например, она старается правдоподобно передавать движение, свет и взаимодействие объектов.
Ещё одна полезная часть - работа со звуком и голосами. В документации Google для TTS, то есть синтеза речи, указаны готовые пресеты голосов вроде Achernar, Charon, Puck и других. Это хорошо сочетается с режимом персонажа: можно отдельно придумать героя, задать ему внешний вид и потом использовать его в видео с подходящим голосом.
В режиме видео вы пишете задание: что происходит в кадре, какой нужен стиль, как движется камера, какая атмосфера нужна. После этого можно добавить референсные изображения или кусок исходного видео, чтобы модель не придумывала всё с нуля, а опиралась на ваши материалы.
Режим персонажа нужен для заготовки постоянного героя. Вы описываете внешность и загружаете одно изображение, а потом используете полученный ID персонажа в новых роликах. Это полезно, когда нужен один и тот же человек или маскот в серии видео.
Режим аудио - отдельная настройка голоса. Там выбирается пресет, имя и словесное описание манеры речи. Такой голос можно подготовить заранее, а потом подключать к персонажу или видео.
Gemini Omni 1.1 рассчитана именно на короткие ролики. В вашей форме доступны генерации до 10 секунд, а при работе с исходным видео используется только фрагмент длиной не больше 10 секунд. Для длинных сцен это значит, что историю придётся собирать из нескольких кусков.
С постоянством деталей у таких моделей всё ещё бывают сложности. Одежда, мелкие предметы в руках, надписи на вывесках и черты лица могут слегка меняться от кадра к кадру, особенно в сложных сценах с движением. Чем точнее референсы и описание, тем меньше таких сюрпризов.
Ещё один момент - цена заметно растёт на 4K и на генерации с исходным видео. Для черновиков разумнее сначала проверять идею в 360p, 720p или 1080p, а финальный вариант уже запускать в более высоком разрешении.
Главное отличие Gemini Omni 1.1 - связка трёх режимов в одной логике работы: видео, персонаж и аудио. У многих похожих инструментов это разбито на разные сервисы или делается менее цельно, а здесь можно сначала собрать голос и героя, а потом использовать их в ролике.
Ещё одна сильная сторона - опора на разные типы входных данных. Модель рассчитана не только на "текст в пустоту", а на комбинацию описания, картинок, видеофрагментов и аудио. Для обычного пользователя это проще: не нужно добиваться результата одним идеальным промптом, когда можно показать пример картинкой или роликом.