Создаёт видео по референсам, изображениям, текстовому описанию или исходному видео. Цена зависит от разрешения и нативного аудио: 720p - 11/14 ₽ за секунду, 1080p - 14/18 ₽ за секунду, 4K - 50 ₽ за секунду.
Понравилось? Зарегистрируйтесь и создайте свой результат.
Kling 3.0 - нейросеть для генерации видео от компании Kuaishou. Она умеет собирать ролики из текста, картинки, набора референсов или готового видео, а ещё помогает держать один стиль и одного персонажа на протяжении всей сцены.
По заявлениям создателей, серия Kling 3.0 получила более точное понимание запросов, лучшую согласованность кадров, генерацию роликов до 15 секунд и нативное аудио - звук создаётся вместе с видео, без отдельного этапа озвучки. Компания делает упор на то, что модель работает с разными типами входных данных сразу: текстом, изображениями, аудио и видео.
Авторы модели отдельно выделяют гибкое управление сценами. В версии Video 3.0 Omni заявлена раскадровка с покадровым планированием: можно задавать длительность сцены, тип плана, ракурс, содержание и движение камеры. Ещё одна заявленная особенность - element binding, то есть привязка элементов кадра, чтобы герой, предмет или стиль меньше "плавали" от сцены к сцене.
Из того, что видно по настройкам в этой карточке, Kling 3.0 заточена под несколько сценариев сразу: обычную генерацию, видео по первому кадру, работу с несколькими референсами и трансформацию готового ролика. Это полезно, когда нужен не просто красивый короткий клип, а более управляемый результат.
Вы выбираете, от чего отталкиваться: от текста, одного изображения, набора референсов или исходного видео. Дальше задаёте описание сцены - кто в кадре, что происходит, какой нужен стиль, как двигается камера, какой темп у ролика.
Для более точного результата можно разбить ролик на сцены. Тогда нейросеть не пытается уместить всё в один общий клип, а строит его по частям: например, сначала общий план комнаты, потом крупный план лица, потом движение камеры вдоль стола. Такой подход обычно помогает, когда ролик должен выглядеть как мини-сцена, а не как случайная анимация.
Режим с элементами нужен для сохранения узнаваемых объектов. Вы добавляете основное изображение персонажа или предмета, а нейросеть старается держать его ближе к исходнику во время генерации.
Kling 3.0 рассчитана в первую очередь на короткие ролики. По официальным материалам у серии 3.0 заявлена длительность до 15 секунд, так что для длинных историй придётся собирать видео из нескольких кусков.
Даже при хорошем контроле сцены генерация видео всё ещё может ошибаться на сложных движениях. Обычно это заметно на руках, мелких предметах, быстром взаимодействии объектов и резкой смене ракурса. В таких сценах лучше писать запрос конкретнее и разбивать идею на несколько фрагментов.
Трансформация по исходному видео помогает удержать движение, но не гарантирует, что все детали останутся один в один. А режим с референсами улучшает узнаваемость персонажа, но не заменяет полноценную ручную анимацию.
Главное отличие Kling 3.0 - упор на управляемость, а не только на "сгенерируй красивый ролик". По официальным описаниям модель поддерживает мультимодальный ввод и вывод: может опираться на текст, картинки, аудио и видео в одном рабочем процессе.
Ещё один заметный момент - раскадровка с управлением сценами и возможность закреплять элементы кадра. У многих генераторов самая слабая часть - постоянство героя и логика переходов между кусками. Kling 3.0 как раз делает ставку на это: больше контроля над сценами, движением камеры и повторяемостью персонажей.
По цене сервис сильно зависит от качества вывода. Для простых тестов разумно начинать с 720p, а 4K оставлять для финальных версий, когда уже понятен результат и не хочется переплачивать за черновики.