Видео по референсу — ролик, который нейросеть собирает по вашим образцам: вы загружаете фото героя, снимок товара или места, короткий ролик с нужным движением или запись голоса. Такой файл и называется референсом. В новом ролике сохраняются лицо, одежда, этикетка и интерьер, а что происходит в кадре, решает ваше задание. Так снимают серию роликов с одним персонажем, рекламу конкретного товара или сценку для сторис в знакомом месте.
От видео из фото это отличается тем, что картинка не становится первым кадром. Из нескольких картинок собирается новая сцена, которой не было ни на одной из них. Мы проверили это на трёх своих картинках в пяти нейросетях-лидерах. Сцену с первого раза собрали все пять, а различались они местом, этикеткой и речью: одна нейросеть придумала свою пекарню, другая не выговорила русскую фразу.
Исходники мы сгенерировали сами в Nano Banana Pro: женщина-пекарь, которой не существует, банка вишнёвого варенья с рисунком вместо надписи и пустая пекарня с голубой плиткой.
Задание у всех одно. Отличается только то, как в нём названы картинки: у каждой нейросети своя запись, о ней ниже. Все ролики на 6 секунд, 720p, вертикальные 9:16, со звуком.
Героиня с @image1 стоит за прилавком в пекарне с @image3. Она ставит на прилавок банку варенья с @image2, поворачивает её этикеткой к камере, улыбается и говорит по-русски: «Вишнёвое, сами варили. Попробуйте!» Камера медленно приближается. Реалистичная съёмка, тёплый утренний свет.
Seedance 2.5 · 6 с, 720p · от 8 ₽/сек.
Grok Video · 6 с, 720p · от 2 ₽/сек
Wan 3.0 Video Prime · 6 с, 720p · от 9 ₽/сек.
Kling 3.0 · 6 с, 720p
Героиню узнать можно везде: чёлка, веснушки, горчичный фартук, рубашка в полоску. Пекарню и банку ближе всех к картинкам перенесли Wan 3.0 Video Prime и Gemini Omni, с той же плиткой, латунными лампами и вишнями на этикетке. Лицо ближе всего к фото у Omni и Seedance 2.5, причём Seedance единственная по-настоящему выполнила «камера медленно приближается»: подвела камеру к крупному плану лица, и черты при этом не поплыли. Grok Video героиню сохранила, а пекарню придумала свою: серая плитка, полок больше, окна нет, вишни на этикетке перерисованы.
Речь мы проверяли распознаванием. Фразу слово в слово сказали четыре нейросети, а у Kling 3.0 вышло что-то вроде «вишня мы саби это сделать», хотя картинку она собрала точно. Всё сравнение обошлось нам в 458 ₽, больше половины из них пришлось на две самые дорогие нейросети, Seedance 2.5 и Wan 3.0 Video Prime.
Откройте нейросеть по карточке выше. У большинства лидеров в поле Тип генерации нужно выбрать «Видео по референсам». У Grok Video такого пункта нет: там режим «Видео из изображений», и картинок в него можно загрузить до 7. У Gemini Omni режим называется «Видео». Загрузите файлы, в поле Задание (это и есть промпт) опишите сцену, выберите длительность, разрешение и пропорции кадра и нажмите Отправить. Цена видна на кнопке до запуска и меняется вместе с настройками. Разрешение 480p годится для проб, 720p — для телефона, 1080p и 4K — для большого экрана.
Готовый ролик появится под формой и в разделе Мои результаты, хранится 7 дней. Если сайт для вас новый, начните с инструкции по сайту.
Главное в задании: сказать, какой файл за что отвечает. Файлы нумеруются в порядке загрузки, а записывать номер нейросети просят по-разному:
@image1, @video1, @audio1, в Kling 3.0 — только @image1 и дальше по номерам, потому что видео и аудио в этом режиме она не берёт; можно набрать @ и выбрать файл из меню;@image1 в Omni.Seedance 2.5 от ByteDance вышла в конце июля 2026. Она принимает до 30 картинок, до 10 видео и до 10 аудиофайлов. Каждое видео и аудио длится от 2 до 30 секунд; все видео вместе — не больше 30 секунд, все аудио — тоже. Ролик выходит на 4–30 секунд, в 480p, 720p или 1080p. Платите за секунду: с видео-референсом ставка ниже, но к секундам ролика прибавляются секунды образца. Наши 5 секунд ролика с 6-секундным образцом посчитались как 11. Самая низкая ставка: от 8 ₽/сек..
Видео-референс есть не у всех нейросетей категории. Мы сняли в Grok Video 6-секундный ролик: парень в студии делает два шага, поворачивается и поднимает руки. Героиня повторила всё это за 5 секунд, уже в пекарне и в своём фартуке. С первого раза образец не приняли: у Grok он вышел 416×752, меньше 480p, а Seedance 2.5 берёт видео-референс в 480p, 720p или 1080p. Мы увеличили ролик до 720×1280, а деньги за отклонённый запуск вернулись. Сами разработчики в блоге ByteDance Seed пишут, что сложные движения и сцены с несколькими героями модель пока передаёт не всегда правдоподобно.
Слева образец движения, справа результат.
Героиня с @image1 в пекарне с @image2 повторяет движения из @video1: два шага вправо, поворот вокруг себя и руки вверх. Камера облетает её на полкруга, как в @video1. Лицо, причёска и одежда — как на @image1, фон — пекарня, а не студия.
Seedance 2.5 · 2 картинки и видео, 5 с, 720p · от 8 ₽/сек.
Grok Video от xAI дешевле остальных лидеров: от 2 ₽/сек, самый короткий ролик у неё 6 секунд в 480p. В режиме «Видео из изображений» она берёт до 7 картинок, ролик тянется до 30 секунд, разрешение 480p или 720p.
Пекарню в сравнении Grok придумала свою, зато героиню держит долго. Мы расписали ролик на 20 секунд по отрезкам: открывает пекарню, раскладывает хлеб, ставит банку, встречает покупателя. Все четыре отрезка Grok выполнила по порядку, и героиня до конца осталась той же. От себя нейросеть добавила покупательницу и реплики «Доброе утро! Добро пожаловать в нашу пекарню», хотя речи в задании не было. Если слова не нужны, так и напишите: «без речи».
Один ролик на 20 секунд. 0–5 с: раннее утро, героиня с изображения 1 открывает дверь пекарни с изображения 3 и включает лампы над прилавком. 5–10 с: она достаёт из печи румяные караваи и раскладывает их по плетёным корзинам. 10–15 с: ставит на прилавок банку варенья с изображения 2 рядом с хлебом. 15–20 с: входит первый покупатель, героиня машет ему рукой и улыбается. Реалистичная съёмка, тёплый утренний свет.
Grok Video · 3 картинки, 20 с, 720p · от 2 ₽/сек
Wan 3.0 Video Prime от Alibaba вышла в августе 2026. В режиме «Видео по референсам» она принимает до 10 картинок, до 5 видео и до 5 аудио: каждый файл от 1 до 15 секунд, всего не больше 15. Ролик длится от 2 до 30 секунд. Цена за секунду зависит только от разрешения, звук на неё не влияет: от 9 ₽/сек.. У Wan 3.0 Video такие же лимиты, а секунда дешевле: от 5 ₽/сек.. Ещё обе умеют собрать ролик по документу (PDF, презентация, таблица) или по публичной странице, это пригодится для роликов-объяснений.
В сравнении Prime перенесла пекарню почти кадр в кадр. Потом мы проверили аудио-референс: записали в «Меге» фразу женским голосом и попросили героиню сказать этим голосом другую. Слова Wan произнесла чисто, но голос в ролике заметно выше, чем в образце, так что точной копии не ждите. Когда голос должен совпасть, надёжнее говорящее фото: там ваша запись идёт в ролик без изменений.
Образец голоса, который мы загрузили:
Героиня с изображения 1 стоит за прилавком в пекарне с изображения 2, смотрит в камеру и говорит по-русски голосом из аудио 1: «Хлеб только из печи, берите горячим!» Реалистичная съёмка, тёплый утренний свет.
Wan 3.0 Video Prime · 2 картинки и аудио, 6 с, 720p · от 9 ₽/сек.
Kling 3.0 принимает до 7 картинок-референсов (JPG или PNG, от 300×300) и делает ролик на 3–15 секунд в 720p, 1080p или 4K. Главное в её форме — поле Сцены. В режиме «Один ролик» получается один план, в «Умном планировании» нейросеть сама режет задание на планы, а в «Своих сценах» длительность и задание каждой сцены пишете вы. В поле Элементы загружают картинки героя или предмета, который должен остаться узнаваемым. Цена — от 11 ₽/сек.; в 720p и 1080p со звуком (переключатель Нативное аудио) секунда дороже.
В «Умном планировании» мы расписали три сцены на 10 секунд: общий план у полок, крупно руки с банкой, героиня смотрит в камеру. Получилось ровно три плана, героиня и банка в каждом одинаковые. Русскую фразу Kling и здесь не выговорила, поэтому звук в этом примере мы убрали.
Три сцены с одной героиней. Сцена 1: героиня с @image1 раскладывает караваи по полкам в пекарне с @image3, общий план. Сцена 2: крупный план её рук, она ставит банку варенья с @image2 на прилавок. Сцена 3: героиня улыбается в камеру и говорит по-русски: «Ждём вас с утра!»
Kling 3.0 · «Умное планирование», 10 с, 720p, звук убран · от 11 ₽/сек.
Gemini Omni от Google принимает до 7 картинок и исходный ролик до 30 секунд, из которого берётся фрагмент до 10 секунд. Платите не за секунду, а за ролик на 4, 6, 8 или 10 секунд: от 60 ₽. В режиме Персонаж нейросеть по одной картинке и описанию создаёт героя, и потом его можно добавить в новый ролик через поле Персонажи, до трёх в одном. Лимит у Omni общий: картинки, по 2 за каждое видео и персонажи вместе дают не больше 7.
Для примера мы дали ей двух выдуманных людей, продавщицу и пожилого покупателя, и ту же пекарню. Оба узнаются, а реплики «Ваш любимый, ещё тёплый» и «Спасибо, дочка!» распознались слово в слово.
@image1 — продавщица за прилавком в пекарне с @image3. @image2 — пожилой покупатель, он входит и подходит к прилавку. Она протягивает ему бумажный пакет с багетом и говорит по-русски: «Ваш любимый, ещё тёплый». Он улыбается и отвечает: «Спасибо, дочка!» Реалистичная съёмка, тёплый утренний свет.
Gemini Omni · 3 картинки, 6 с, 720p · от 60 ₽
Gemini Omni 1.1 новее и дешевле Omni при той же длине ролика, а задание в ней может быть до 20 000 знаков. У Seedance 2.0 Mini та же запись @image1 и те же три вида файлов, что у Seedance 2.5, а секунда дешевле: ролик на 4–15 секунд в 480p или 720p. Наш ролик из сравнения в 480p вышел узнаваемым, но без звука: переключателя звука в её форме нет, и героиня шевелит губами молча.
То же задание, что в сравнении выше.
Seedance 2.0 Mini · 5 с, 480p, без звука · от 5 ₽/сек.
У Seedance 2.0 до 9 картинок-референсов, две модели (быстрая Fast и обычная) и правка готового ролика до 15 секунд. Seedance 1.5 Pro ближе к видео из фото: картинок в ней не больше двух. Wan 2.7 Video в режиме «Видео по референсам» принимает одну картинку и до 4 роликов, ролик на 2–10 секунд, а ещё умеет править и продлевать видео. У Wan 2.6 Flash до 5 референсов (видео среди них до 3), ролик на 5 или 10 секунд и режим «Несколько кадров». Veo 3.1 от Google умеет работать по референсам в вариантах 1 и 3 поля Версия: до 3 картинок, разрешение до 4K.
MiniMax H3 делает ролик сразу в 2K на 5–15 секунд. Кроме картинок она принимает видео и аудио, но аудио одно не сработает, а каждая секунда видео-референса добавляется к цене. HappyHorse 1.1 берёт до 9 картинок и снимает 3–15 секунд в 720p или 1080p. PixVerse C1 умеет и референсы, и переход между первым и последним кадром, звук добавляет по желанию, разрешение от 360p до 1080p. Flux 3 Video собирает ролик на 5–20 секунд из 1–10 картинок: сначала можно сделать дешёвый черновик, а удачный потом довести до HD или FHD.
В Pika 2.2 режим Scenes собирает сцену из 2–5 картинок (точно или свободнее), а Pikaframes делает переходы между ключевыми кадрами, до 25 секунд. Vidu One-Click V2 MV превращает 1–3 фото и музыку в клип с движением камеры и субтитрами. Vidu Q3 Drama работает от сценария до 5000 знаков и ассетов: персонажей, мест и предметов, до 14 штук. Vidu Q3 Ad снимает рекламный ролик на 3–16 секунд по 1–7 фото товара, со звуком.
В таблице лидеры и заметные нейросети категории, остальные видны карточками выше. Цена указана за самые дешёвые настройки.
| Нейросеть | Цена | Референсы | Длина ролика | Чем выделяется |
|---|---|---|---|---|
| Seedance 2.5 | от 8 ₽/сек. | до 30 картинок, 10 видео, 10 аудио | 4–30 с | образец движения, наезд до крупного плана |
| Grok Video | от 2 ₽/сек | до 7 картинок | 6–30 с | самая дешёвая из лидеров |
| Wan 3.0 Video Prime | от 9 ₽/сек. | до 10 картинок, 5 видео, 5 аудио | 2–30 с | точнее всех перенесла место |
| Wan 3.0 Video | от 5 ₽/сек. | до 10 картинок, 5 видео, 5 аудио | 2–30 с | те же лимиты, дешевле Prime |
| Kling 3.0 | от 11 ₽/сек. | до 7 картинок | 3–15 с | несколько планов, 4K; русская речь неразборчива |
| Gemini Omni | от 60 ₽ | до 7 файлов и персонажей | 4–10 с | двое людей в кадре, лицо близко к фото |
| Gemini Omni 1.1 | от 48 ₽ | до 7 файлов и персонажей | 4–10 с | новее и дешевле Omni |
| Seedance 2.0 Mini | от 5 ₽/сек. | до 9 картинок, 3 видео, 3 аудио | 4–15 с | дёшево, без звука |
| Seedance 2.0 | от 5 ₽/сек. | до 9 картинок | 5, 10 или 15 с | правка готового ролика |
Как придумать героев и снять с ними несколько серий, мы разобрали в инструкции «Сериал с помощью нейросети», а рекламный ролик по шагам — в статье о рекламном видео. Если нужно перенести движение из готового ролика на другого героя или заменить человека в видео, загляните в раздел «Видео из видео».
Статья обновлена 25 сентября 2026 г.
Gemini Omni · 6 с, 720p · от 60 ₽
| MiniMax H3 |
| от 6 ₽/сек. |
| до 8 картинок, 4 видео, 4 аудио |
| 5–15 с |
| сразу 2K |
| HappyHorse 1.1 | от 18 ₽/сек. | до 9 картинок | 3–15 с | 1080p |
| Wan 2.7 Video | от 90 ₽ | 1 картинка и до 4 видео | 2–10 с | правка и продление ролика |
| Flux 3 Video | от 8 ₽/сек. | 1–10 картинок | 5–20 с | черновик, потом HD или FHD |
| Vidu Q3 Drama | 14 ₽/сек. | до 14 ассетов | 2–30 с | ролик по сценарию |
| Vidu Q3 Ad | от 22,5 ₽/сек. | 1–7 фото товара | 3–16 с | реклама со звуком |