Создаёт короткие видео по описанию, изображениям и исходному видео, а ещё умеет делать персонажей и настраивать голоса для аудио. Цена на видео - от 48 до 190 ₽ за генерацию, зависит от длительности, разрешения и того, загружено ли исходное видео.
Gemini Omni 1.1 (Audio) - модель от Google для создания и редактирования коротких роликов с поддержкой текста, картинок, видео, персонажей и озвучки. В этой версии акцент сделан не только на генерации с нуля, но и на более управляемом монтаже: можно задать сцену словами, добавить референсные изображения, взять кусок готового видео и получить новый фрагмент в том же духе.
По заявлениям создателей, Gemini Omni 1.1 Flash умеет генерировать видео вместе со звуком, включая речь, движения губ и фоновые шумы сцены. Google делает упор на больший контроль над результатом: модель понимает сочетание разных типов входных данных и рассчитана на редактирование роликов, где нужно сохранить движение, образ персонажа и общее настроение кадра.
В найденных описаниях этой версии часто упоминаются 360p, 720p, 1080p и 4K, работа с короткими видеореференсами, продолжение сцены и использование последних секунд исходного ролика как контекста. Для обычного пользователя это означает простую вещь: модель лучше держит логику движения между кадрами, чем инструменты, которые просто рисуют отдельные красивые, но слабо связанные фрагменты.
Схема простая: вы выбираете режим, загружаете нужные материалы и пишете, что хотите получить. Для видео это может быть текстовое задание, несколько картинок для внешнего вида сцены, а иногда и исходный ролик, из которого берётся короткий фрагмент. Модель смотрит на все подсказки сразу и собирает новый результат - с учётом стиля, движения и звука.
Режим персонажа нужен, когда вы хотите заранее подготовить героя, а потом использовать его в роликах повторно. Это помогает не описывать одного и того же человека заново в каждом запросе.
Режим аудио работает как заготовка голоса. Вы выбираете голосовой пресет, задаёте название и при желании описываете манеру речи - например, спокойный диктор, бодрый ведущий или мягкий разговорный тон.
Ролики здесь короткие: в настройках доступны от 4 до 10 секунд. Для длинных историй придётся собирать несколько сцен по частям.
Исходное видео ограничено по размеру и длине, а используемый фрагмент не должен быть длиннее 10 секунд. Из-за этого инструмент больше заточен под короткие вставки, продолжения сцен и переработку отдельных моментов, а не под монтаж большого фильма.
Судя по найденным материалам о модели, основной упор сделан на видео. Режим аудио в такой форме больше похож на создание голосовой заготовки, чем на полноценный редактор звука с тонкой правкой каждой фразы.
Главная особенность Gemini Omni 1.1 - сочетание нескольких режимов в одной модели: видео, персонажи и аудио связаны между собой. У похожих решений часто бывает перекос в одну сторону: одни лучше рисуют красивые сцены с нуля, другие - лучше редактируют готовый ролик. Здесь сильная сторона именно в комбинировании источников: текст, картинки, кусок видео и голосовые настройки могут работать вместе.
Ещё одно отличие - упор на согласованность сцены. Когда модель учитывает короткий фрагмент исходного видео и референсы персонажа, легче получить ролик, где герой, движение и общий стиль меньше "прыгают" от кадра к кадру. Для человека без опыта это полезно: меньше времени уходит на бесконечные перегенерации из-за того, что лицо, одежда или ракурс внезапно меняются.