Создаёт короткие видео по описанию, картинкам и исходному видео, а ещё помогает делать персонажей и заготовки голосов для озвучки. Цена за видео - от 48 до 190 ₽: обычная генерация в 360p-1080p стоит 48-95 ₽, в 4K - 110-158 ₽, а генерация с исходным видео - 126 ₽ или 190 ₽ в 4K.
Gemini Omni 1.1 (Character) - модель Google для создания коротких видео из текста, изображений, аудио и исходных роликов. В этой версии упор сделан на генерацию сцен с сохранением персонажей, а в карточке доступны три режима: видео, персонаж и аудио.
По заявлениям Google, Gemini Omni 1.1 Flash рассчитана на быстрое создание и редактирование видео с более точным контролем движения, сцены и визуальной целостности. Разработчики пишут, что модель умеет брать несколько типов входных данных сразу и собирать их в один ролик, а для редактирования видео использует до 10 последних секунд исходника как контекст - это помогает лучше держать движение, внешний вид героя и логику сцены.
В описаниях модели отдельно делают упор на персонажей и работу с референсами. Можно задать героя по картинке и описанию, а потом использовать его ID в новых видео, чтобы образ меньше "плыл" от сцены к сцене. Для аудио у модели есть голосовые пресеты: это удобно, когда нужно заранее подготовить тембр для озвучки или связать голос с персонажем.
В режиме видео вы описываете сцену обычным языком: кто в кадре, что делает, как двигается камера, какое настроение нужно получить. Дальше модель собирает ролик по тексту, а при желании опирается на картинки, готовое видео или сохранённых персонажей.
С исходным видео схема другая: вы загружаете ролик, выбираете фрагмент и просите модель его изменить или продолжить. Такой подход подходит для замены героя, смены стиля, освещения, одежды, фона или общей атмосферы сцены без пересъёмки с нуля.
Режим персонажа нужен, чтобы подготовить "карточку" героя заранее. Вы загружаете одно изображение, описываете внешность и характер, при желании привязываете голос - после этого персонажа можно вызывать в следующих генерациях по ID.
Клипы здесь короткие: в интерфейсе доступны ролики до 10 секунд. Для работы с исходным видео используется только выбранный фрагмент, причём его длина не должна превышать 10 секунд, так что длинный монтаж таким способом не собрать.
С персонажами и речью результат обычно зависит от качества исходных материалов. Размытая картинка героя, перегруженное описание или слишком сложная сцена с множеством действий могут дать "плавающее" лицо, странные жесты или не совсем ту эмоцию, которую вы ожидали.
Есть и практические рамки по входным файлам: до 7 изображений, одно видео до 100 МБ и до 30 секунд, одно изображение для создания персонажа. Для видео с исходником цена фиксированная внутри выбранного разрешения, а 4K обходится заметно дороже.
Главная особенность Gemini Omni 1.1 - мультимодальный подход: модель изначально рассчитана на работу не только с текстом, но и с картинками, видео и аудио в одном процессе. Упор идёт не просто на генерацию "красивого ролика", а на редактирование сцен, перенос движения, удержание персонажа и связку видео с голосом.
От обычных текст-в-видео моделей она отличается режимом персонажа и возможностью заранее готовить голосовые и визуальные заготовки для повторного использования. Это полезно, когда нужно не один раз сгенерировать случайный ролик, а собрать серию сцен с узнаваемым героем и похожей подачей.