Песня своим голосом: запись, обучение модели и замена вокала
Песня своим голосом получится, даже если вы не попадаете в ноты. Сначала нейросеть учит голосовую модель по записи вашего пения на 5–10 минут, а потом перепевает ею готовый трек: ноты берутся из трека, из вашей записи только тембр. На Братухе модель стоит от 70 до 120 ₽, каждая следующая песня обходится в 30 ₽. Вот припев одной и той же песни: сначала его спела Suno, потом наша модель.
Своего голоса для статьи у нас не было, поэтому образец спел выдуманный певец, баритон из Suno. Остальные шаги такие же, как у вас. Цены и время ожидания взяты из наших запусков на сайте.
Каждый запуск платный, цена на кнопке Отправить. Файлы хранятся в ленте под формой 7 дней. Впервые на сайте? Вот инструкция по сайту.
Что записать и как держать телефон
Нужна запись пения без музыки длиной от 5 до 30 минут: так написано в форме обучения. Минуты не хватит. Форма проверяет длину файла, а сколько в нём настоящего пения, решаете вы, и чем его больше, тем лучше. Студия не нужна, нужна тихая комната.
| Что | Как |
|---|---|
| Длина | 5–10 минут, и почти всё время звучит голос. В нашем восьмиминутном файле пения набралось около трёх минут, остальное ушло на паузы. Модель обучилась, но так мало лучше не делать. |
| Формат | MP3, WAV, M4A, OGG или FLAC, до 200 МБ. Диктофон iPhone сохраняет M4A, его можно загружать сразу. |
| Музыка | Минус (музыку без голоса) слушайте только в наушниках. Из колонки он попадёт в запись. |
| Эхо | Комната с мебелью и шторами. Одежда в открытом шкафу гасит эхо, а ванная и пустая кухня с кафелем его добавляют. |
| Телефон | 15–20 см от рта, на одном месте всю запись. На подставке, а не в руке. |
| Что петь | Несколько знакомых песен: тихо и в полную силу, низко и высоко, с разными гласными. |
Диапазон стоит записать целиком, и дальше мы покажем почему. Наш образец почти всё время держался между си большой октавы и ля малой. Всё, что в песне окажется выше, модели придётся угадывать.
Нашего певца мы попросили спеть без музыки, но Suno всё равно подложила под голос бас. С телефонной записью бывает так же: где-то шумит холодильник, где-то пробивается минус. Это убирает следующий шаг.
Если в запись попал шум или минус
Запись с пением лучше чистить в нейросети Разделить на дорожки: 6 ₽ за файл любой длины. Она раскладывает запись на голос, бас, барабаны и остальное. В ленте под формой придёт восемь файлов. Нажмите Показать всё и скачайте строку Аудио 6: mdx_vocals, это голос без музыки. Его и загрузите потом для обучения. Шестиминутный файл нейросеть разбирала 6–8 минут.
ElevenLabs Audio Isolation тоже убирает шум и музыку, но по описанию на сайте она нужна, чтобы чище звучала речь, и берёт 0,4 ₽ за секунду. Кусок на 20 секунд она обработала за 12 секунд. Пять минут пения обойдутся в 120 ₽. Мы прогнали через обе нейросети один и тот же кусок на 20 секунд. Сначала исходник с подложкой:
После Разделить на дорожки:
После Audio Isolation:
Послушайте, что стало с протяжной нотой на десятой секунде. Audio Isolation приняла её хвост за шум и вырезала: с 9,6 по 10,9 секунду там тишина. Разделение сохранило ноту целиком. Поэтому для пения мы советуем дорожки: дешевле, и голос не теряется. Audio Isolation оставьте для разговорных записей.
Обучаем модель по записи
Откройте нейросеть Замена голоса и в ряду Режим нажмите Создать голосовую модель. Дальше:
- Придумайте Название модели: от 2 до 12 символов, буквы, цифры и пробелы. Мы назвали «Баритон».
- Выберите Пол голоса: по нему сайт потом сдвигает высоту в песнях, где поёт человек другого пола.
- Загрузите запись в поле Аудиофайл 1.
- В Тип материала выберите Пение 2. По умолчанию стоит Речь, она для разговорных записей.
- Выберите Качество тренировки: Быстрое за 70 ₽, Стандартное за 90 ₽ или Максимальное за 120 ₽.
- Отметьте галочку «Я подтверждаю, что это мой голос или у меня есть согласие правообладателя» 3, и нажмите Отправить.
Мы выбрали Максимальное: образец у нас небольшой, и экономить 30–50 ₽ на модели, которой пользоваться долго, не хотелось. С Быстрым мы не сравнивали. Обучение заняло 9 минут 46 секунд. В ленте появилось сообщение, что модель создана и доступна в режиме Замена голоса. Модель остаётся в аккаунте, пока вы её не удалите.
Песня в Suno под ваш диапазон
Для замены подойдёт любой трек с вокалом длиной от 30 секунд до 6 минут. Удобнее сделать его в Suno: 10 ₽ за два варианта, и можно попросить нужный пол и диапазон певца. В режиме Продвинутый 1 вставьте свой текст в Текст песни и опишите музыку в поле Стиль. Потом откройте Дополнительные параметры 2 и выберите Пол вокалиста 3, как у вас. Длительность мы поставили 150 секунд. Песня у нас про кухню, где собираются друзья, вот стиль:
acoustic pop ballad, warm male vocal, mid range, acoustic guitar, soft piano, light percussion, 92 BPM, cozy
Через минуту пришли два трека по 2:28. Для замены мы взяли первый.
Даже со словами «mid range» в стиле Suno подняла припев до ре-диеза первой октавы. Это на шесть полутонов выше, чем обычно поднимался наш образец. Что с этим делать, мы разобрали в разделе про высоту.
Меняем вокал на свой
Скачайте трек из Suno кнопкой Скачать, откройте ту же страницу нейросети Замена голоса и переключите Режим обратно на Замена голоса. Загрузите трек в Аудиофайл и выберите свою модель в поле Выбор голоса 1. В Пол голоса в оригинале 2 укажите, кто поёт в треке. Музыку отделять заранее не нужно: нейросеть сама разберёт трек на вокал и музыку и соберёт обратно.
Затем откройте Дополнительные настройки и выберите пресет Мягкое пение 3. Сайт советует его для песен, особенно с мягким или женским тембром. Пресет ослабляет Силу голоса модели с 0,66 до 0,5, сильнее бережёт согласные и другим способом определяет высоту звука. Из-за меньшей силы в результате остаётся чуть больше манеры исходного певца.
Замена стоит 20 ₽ и заняла у нас 5 минут 42 секунды. Вот вся песня:
А это припев из той же песни с пресетом по умолчанию, Чистый. Он обработался быстрее, за 2 минуты 15 секунд. Если вариант не понравился, поменяйте пресет и запустите замену ещё раз за те же 20 ₽.
Голос ушёл выше или ниже
Если результат звучит пискляво или гудит, дело почти всегда в высоте. Мы отделили вокал в каждом результате и измерили его высоту программой. Простая проверка на слух: если припев вам самим было бы неудобно петь, модели тоже неудобно.
Женская песня мужским голосом
Мы сделали ту же песню с женским вокалом и забыли поменять Пол голоса в оригинале, там остался Мужской. Наш баритон запел на высоте певицы, в среднем на ноте до первой октавы, хотя в образце он поднимался только до ля малой:
Со значением Женский сайт сам опустил голос на октаву, в среднем на ноту до малой октавы. Это нижняя часть диапазона нашего образца, там ему удобно:
Точная подстройка и тональность
Если пол указан верно, а голосу всё равно тесно, в Дополнительных настройках есть два ползунка:
- Точная подстройка высоты от −2 до 2 с шагом 0,5 двигает только вокал, музыка остаётся на месте. Единица здесь равна октаве: с −1 наш баритон в женской песне попал ровно туда же, куда его опустил выбор пола.
- Тональность всей песни от −6 до 6 полутонов двигает вокал вместе с музыкой. Мы опустили песню про кухню на −3: верхние ноты припева опустились с ре-диеза на ноту до первой октавы, ближе к диапазону образца.
Подстройку ставьте только на целые октавы, −1 или 1: значение 0,5 равно шести полутонам, и вокал уйдёт из тональности музыки. Мелкую подгонку делайте тональностью.
Чужой голос — только с согласия
Модель можно обучить на чьём угодно голосе, но форма не отправится без галочки «Я подтверждаю, что это мой голос или у меня есть согласие правообладателя». Отдельной статьи о голосе в Гражданском кодексе пока нет. Законопроект № 718834-8 об охране голоса внесён в Госдуму в 2024 году и дорабатывается. По нему распространять запись с чужим или воссозданным голосом можно будет только с согласия его владельца.
Поёте сами, значит, вопросов нет. Хотите в подарочной песне голос друга или мамы, спросите их заранее, а голос известного певца для роликов в соцсетях лучше не брать вовсе: разрешения у вас нет.
Вопросы про голосовую модель
Как написать текст песни в нейросети и подобрать стиль в Suno, мы рассказали в инструкции о песне с нейросетью.
Читайте также

Nano Banana Pro и Nano Banana 2: чем отличаются и что выбрать
Одну правку фото, сборку из четырёх снимков и афишу с русским текстом мы сделали в Nano Banana Pro, 2 и Lite. Показываем, где разница, сколько стоит и сколько ждать.

