Клип на песню нейросетью: сцены под бит в Seedance 2.5
Клип на песню нейросетью удобнее всего собирать из кусков до 30 секунд: столько Seedance 2.5 снимает за один запуск, со сменой планов по таймкодам. Так мы сделали припев синти-поп песни «Ночной маршрут»: семь планов на ночной крыше, два крупных плана с липсинком (губы подогнаны под наш голос) и звук из исходного трека. Ниже покажем промпт, где резать песню, сколько это стоит и как собрать из таких кусков клип целиком.
Ролик снят в Seedance 2.5 в 480p. Дубль стоил 420 ₽, липсинк двух крупных планов добавил 180 ₽. Песню и героиню мы тоже сделали на сайте, реальных людей в кадре нет.
Когда сюжет не важен и хватит пары фото, откройте шаблон Музыкальный клип и нажмите Повторить. В нём работает нейросеть Vidu One-Click V2 MV: сама двигает камеру в ритм, но сцены по секундам не расставляет. Этот путь подробно разобран в статье про клип для аудиотрека. Мы пойдём длинным путём.
Песня и её разметка: где куплет, где припев
Своей песни пока нет? Её сделает Suno, 10 ₽ за два варианта. Мы выбрали режим Продвинутый 1 и вставили свой текст в Текст песни. В Стиль 2 написали жанр, темп и голос, Длительность, секунд 3 поставили 190. Оба трека пришли через 70 секунд, по 3:09 каждый.
Темп считают в BPM, ударах в минуту. Мы заказали 120, а по барабанам вышло около 122. Такт из четырёх ударов от этого стал 1,97 секунды вместо двух, и за 30 секунд набегает полсекунды. Поэтому такты считайте по настоящему темпу. Проще всего измерить его в видеоредакторе: отметьте удар бочки в начале куплета и такой же удар через 16 тактов. У нас между ними 31,5 секунды, 64 удара × 60 / 31,5 = 122.
Части песни размечает нейросеть Разделить на дорожки. Загрузите трек в Аудиофайл и нажмите Отправить. За 6 ₽ она вернёт отдельно вокал, барабаны, бас и инструментал и картинку с разметкой; ждали мы около четырёх минут.
Под полосой подписано начало каждой части: intro (вступление), verse (куплет), chorus (припев), outro (концовка). У нас первый куплет начинается на 0:32, припев на 1:03, второй куплет на 1:23.
Режьте песню по границам частей и по тактам. Такт при темпе 122 длится 240 / 122 = 1,97 секунды: четыре удара по 60 / 122 секунды. Часть песни обычно занимает 8 или 16 тактов, и 16 тактов при 122 BPM длятся 31,5 секунды, в один дубль они не влезают. Поэтому мы взяли 15 тактов, предприпев и весь первый припев. Предприпев начинается там, где после куплета смолкает голос; ближайший к этой паузе удар бочки стоит на 0:54,4, от него и отрезали 29,6 секунды, до 1:24,0. Если песню вы ещё только заказываете, просите у Suno 128 BPM: тогда 16 тактов займут ровно 30 секунд.
Нарезки на сайте нет. Кусок вырежьте в видео- или аудиоредакторе, например в CapCut: там видна волна звука, и разрез легко поставить на удар. Сохраните в MP3 или WAV, Seedance принимает файлы от 2 до 30 секунд, до 15 МБ.
Почему Seedance не поставит вашу песню сама
Seedance 2.5 принимает кусок песни как аудио-референс, то есть образец. Но звук ролика модель генерирует сама: ByteDance пишет в описании модели, что референсы передают замысел. Что это значит для песни, мы проверили на 10-секундном куске припева за 140 ₽.
Музыку модель повторила, но со второй секунды куска, а последние две секунды досочинила. Голос не наш: мы сравнили звук ролика с вокальной дорожкой песни, совпадения нет. Героиня поёт мелодию, которую придумала модель, и губы идут за этим пением.
В 30-секундном дубле нашу музыку было слышно только с 12-й по 20-ю секунду, остальное модель тоже дописала. Поэтому звук из Seedance в клип не идёт: в редакторе поверх ролика кладём исходный трек с первой секунды куска.
Сцены под бит: промпт с таймкодами
Таймкоды вида «0–4 с: …» говорят Seedance, что показать в каждом отрезке ролика. Меняйте планы на сильную долю, первый удар такта: это каждые 1,97 секунды, удобный шаг в два такта, около 4 секунд. Припев у нас начинается на восьмой секунде куска, туда и поставили первый крупный план с пением.
Героиню мы нарисовали в Nano Banana Pro, по 8 ₽ за кадр: сначала портрет, а по нему кадр, где она поёт. Второй нужен для крупных планов: в прошлых роликах Seedance меняла лицо на эмоции, которой не было ни на одном фото.
Кинематографичный портрет молодой певицы для музыкального клипа, по пояс, смотрит в камеру, спокойное лицо. Ей около 25 лет, короткое чёрное каре с прямой чёлкой, светлая кожа, тонкие серебряные кольца в ушах. Одета в серебристую блестящую куртку-бомбер поверх чёрной майки. Тёмный однотонный фон студии, слева розовый неоновый контровой свет, справа холодный синий. Реалистичная фотография, резкое лицо, без текста и логотипов.
Дальше в Seedance 2.5:
- В Тип генерации выберите Видео по референсам.
- В Референсные изображения 1 загрузите фото героя, одно или несколько.
- В Аудио-референсы 2 загрузите кусок песни.
- В Задание вставьте промпт. Метки @image1 и @audio1 можно выбрать из меню, если ввести @, но меню появится только после загрузки файлов.
- Длительность 3 равна длине куска с округлением вверх: для 29,6 секунды ставим 30. В 480p секунда стоит 14 ₽, наш дубль обошёлся в 420 ₽.
Вот промпт целиком. На втором фото у героини микрофон на стойке, поэтому мы отдельно написали, что микрофона нет, и в ролике его не было ни в одном плане.
@image1 и @image2 — певица: лицо, чёрное каре с чёлкой, серьги-кольца, серебристый бомбер, чёрная майка. Во всех планах она одета одинаково, микрофона нет.
@audio1 — её песня, клип снят под неё. Темп 122 BPM, планы меняются точно на сильную долю.
Ночной город, мокрый после дождя, розовый и синий неоновый свет, кинематографичная съёмка.
0–4 с: вид со спины, певица поднимается по железной пожарной лестнице на крышу, на ступенях блики неона.
4–8 с: средний план, она выходит на мокрую крышу и оборачивается к камере, в лужах отражаются огни.
8–12 с: крупный план, певица поёт в камеру, ветер шевелит чёлку.
12–16 с: общий план сверху, она стоит на краю крыши и раскидывает руки, внизу город.
16–20 с: крупно рука на мокрых перилах, в каплях отражается неон; внизу по улице проезжает трамвай с горящими окнами.
20–24 с: крупный план, певица поёт, камера медленно наезжает.
24–30 с: средний план, она танцует под бит, в конце замирает и смотрит в камеру.
Без текста и субтитров.
Дубль пришёл через 6 минут, со звуком модели:
Все семь планов на месте. Мы писали в промпте круглые секунды, но первые четыре склейки модель поставила на 3,96, 7,92, 11,88 и 15,83 секунды: это доли куска с разницей в один-два кадра. Две последние встали на 20,0 и 24,1 секунды, как написано, на 0,3–0,5 секунды позже доли; в редакторе их можно подвинуть. Трамвай мы просили один, а по улице проехали два.
Где без липсинка не обойтись
Липсинк нужен только там, где крупно видно поющий рот. В нашем дубле таких планов два, на 8–12 и 20–24 секундах, остальным хватает песни поверх.
Для липсинка нужен голос без музыки: его отдала «Разделить на дорожки», файл mdx_vocals. Из дубля и из вокала вырежьте один и тот же отрезок: у нас это 7,92–11,88 секунды ролика, то есть 1:02,4–1:06,3 песни. Потом откройте Sync Lipsync 3.0, загрузите план в Видео 1, вокал в Аудио 2 и оставьте Режим синхронизации 3 на Обрезать лишнее: отрезки одной длины, обрезать почти нечего.
Липсинк стоит 20 ₽ за секунду видео с округлением вверх: план на 3,9 секунды обошёлся в 80 ₽, на 4,1 секунды в 100 ₽. Первый был готов через полторы минуты. В ролике сначала план из Seedance, потом он же после липсинка, звук у обоих наш:
Рот теперь открывается на наших слогах. Только там, где ветер бросил прядь на губы, картинка стала мягче: липсинку мешает всё, что перекрывает рот.
Из скольких кусков собрать клип на всю песню
Трёхминутной песне нужно шесть-семь дублей: один запуск длится не больше 30 секунд. Наша идёт 3:09, и по тактам вышло семь кусков:
| Кусок | Что в песне | Липсинк |
|---|---|---|
| 0:00–0:29 | Вступление, голоса нет | Не нужен |
| 0:29–0:54 | Конец вступления и первый куплет | На крупных планах |
| 0:54–1:24 | Предприпев и припев, наш дубль | Два плана, 180 ₽ |
| 1:24–1:54 | Второй куплет | На крупных планах |
| 1:54–2:21 | Второй припев и бридж | На крупных планах |
| 2:21–2:51 | Последний припев и проигрыш | На крупных планах |
| 2:51–3:09 | Концовка | Не нужен |
Все семь кусков в 480p обойдутся в 2 674 ₽: 191 секунда по 14 ₽, потому что каждый кусок округляется вверх. В 720p секунда стоит 28 ₽, выйдет 5 348 ₽. Липсинк по два крупных плана на каждый кусок с голосом добавит ещё 800–1 000 ₽.
Чтобы героиня во всех кусках была одной, прикладывайте к каждому одни и те же фото и начинайте каждый промпт той же строкой: кто на фото и во что одета. Мы сняли один кусок, но внутри него лицо и одежда не менялись ни в одном из семи планов.
Собирают клип в видеоредакторе, в том же CapCut:
- Положите исходный трек целиком на звуковую дорожку.
- Расставьте дубли по времени начала кусков из таблицы и выключите у них звук.
- Замените крупные планы версиями после липсинка, начало каждой вставки ставьте точно на место вырезанного отрезка.
- Проверьте склейки по долям, те, что отстают, обрежьте на пару кадров.
Если вышло не то
- После липсинка рот мутный. Посмотрите, не закрывают ли губы волосы, рука или микрофон. Для крупных планов убирайте из промпта ветер в волосах и предметы у лица.
- Склейка отстаёт от доли. Подвиньте её в редакторе на 0,3–0,5 секунды. В следующем промпте можно писать границы с десятыми по тактам, например «19,7–23,7 с», этот вариант мы не проверяли.
- В кадре лишний предмет с фото героя. Запретите его в промпте прямо, как мы микрофон. Лишнее, чего на фото не было, вроде второго трамвая, запретом не убрать: такой план проще переснять или прикрыть соседним.
Что спрашивают про клипы на свою песню
Песню, героиню и все ролики из статьи мы сделали на Братухе по промптам из текста, а звук поверх и склейку собрали в редакторе. На генерации ушло 772 ₽: песня 10, героиня 16, дорожки 6, проба 140, дубль 420 и липсинк 180. Цена каждой видна на кнопке Отправить до запуска.
Читайте также

Как перевести или исправить текст на картинке нейросетью
Меняем дату и цену на афише, исправляем опечатку в имени и переводим меню с английского в GPT Image 2.5. Промпты, настройки и что делать, если строка не влезла.

