Песня своим голосом: запись, обучение модели и замена вокала

Песня своим голосом получится, даже если вы не попадаете в ноты. Сначала нейросеть учит голосовую модель по записи вашего пения на 5–10 минут, а потом перепевает ею готовый трек: ноты берутся из трека, из вашей записи только тембр. На Братухе модель стоит от 70 до 120 ₽, каждая следующая песня обходится в 30 ₽. Вот припев одной и той же песни: сначала его спела Suno, потом наша модель.

Своего голоса для статьи у нас не было, поэтому образец спел выдуманный певец, баритон из Suno. Остальные шаги такие же, как у вас. Цены и время ожидания взяты из наших запусков на сайте.

Каждый запуск платный, цена на кнопке Отправить. Файлы хранятся в ленте под формой 7 дней. Впервые на сайте? Вот инструкция по сайту.

Что записать и как держать телефон

Нужна запись пения без музыки длиной от 5 до 30 минут: так написано в форме обучения. Минуты не хватит. Форма проверяет длину файла, а сколько в нём настоящего пения, решаете вы, и чем его больше, тем лучше. Студия не нужна, нужна тихая комната.

ЧтоКак
Длина5–10 минут, и почти всё время звучит голос. В нашем восьмиминутном файле пения набралось около трёх минут, остальное ушло на паузы. Модель обучилась, но так мало лучше не делать.
ФорматMP3, WAV, M4A, OGG или FLAC, до 200 МБ. Диктофон iPhone сохраняет M4A, его можно загружать сразу.
МузыкаМинус (музыку без голоса) слушайте только в наушниках. Из колонки он попадёт в запись.
ЭхоКомната с мебелью и шторами. Одежда в открытом шкафу гасит эхо, а ванная и пустая кухня с кафелем его добавляют.
Телефон15–20 см от рта, на одном месте всю запись. На подставке, а не в руке.
Что петьНесколько знакомых песен: тихо и в полную силу, низко и высоко, с разными гласными.

Диапазон стоит записать целиком, и дальше мы покажем почему. Наш образец почти всё время держался между си большой октавы и ля малой. Всё, что в песне окажется выше, модели придётся угадывать.

Нашего певца мы попросили спеть без музыки, но Suno всё равно подложила под голос бас. С телефонной записью бывает так же: где-то шумит холодильник, где-то пробивается минус. Это убирает следующий шаг.

Если в запись попал шум или минус

Запись с пением лучше чистить в нейросети Разделить на дорожки: 6 ₽ за файл любой длины. Она раскладывает запись на голос, бас, барабаны и остальное. В ленте под формой придёт восемь файлов. Нажмите Показать всё и скачайте строку Аудио 6: mdx_vocals, это голос без музыки. Его и загрузите потом для обучения. Шестиминутный файл нейросеть разбирала 6–8 минут.

ElevenLabs Audio Isolation тоже убирает шум и музыку, но по описанию на сайте она нужна, чтобы чище звучала речь, и берёт 0,4 ₽ за секунду. Кусок на 20 секунд она обработала за 12 секунд. Пять минут пения обойдутся в 120 ₽. Мы прогнали через обе нейросети один и тот же кусок на 20 секунд. Сначала исходник с подложкой:

После Разделить на дорожки:

После Audio Isolation:

Послушайте, что стало с протяжной нотой на десятой секунде. Audio Isolation приняла её хвост за шум и вырезала: с 9,6 по 10,9 секунду там тишина. Разделение сохранило ноту целиком. Поэтому для пения мы советуем дорожки: дешевле, и голос не теряется. Audio Isolation оставьте для разговорных записей.

Обучаем модель по записи

Откройте нейросеть Замена голоса и в ряду Режим нажмите Создать голосовую модель. Дальше:

  1. Придумайте Название модели: от 2 до 12 символов, буквы, цифры и пробелы. Мы назвали «Баритон».
  2. Выберите Пол голоса: по нему сайт потом сдвигает высоту в песнях, где поёт человек другого пола.
  3. Загрузите запись в поле Аудиофайл 1.
  4. В Тип материала выберите Пение 2. По умолчанию стоит Речь, она для разговорных записей.
  5. Выберите Качество тренировки: Быстрое за 70 ₽, Стандартное за 90 ₽ или Максимальное за 120 ₽.
  6. Отметьте галочку «Я подтверждаю, что это мой голос или у меня есть согласие правообладателя» 3, и нажмите Отправить.

Мы выбрали Максимальное: образец у нас небольшой, и экономить 30–50 ₽ на модели, которой пользоваться долго, не хотелось. С Быстрым мы не сравнивали. Обучение заняло 9 минут 46 секунд. В ленте появилось сообщение, что модель создана и доступна в режиме Замена голоса. Модель остаётся в аккаунте, пока вы её не удалите.

Песня в Suno под ваш диапазон

Для замены подойдёт любой трек с вокалом длиной от 30 секунд до 6 минут. Удобнее сделать его в Suno: 10 ₽ за два варианта, и можно попросить нужный пол и диапазон певца. В режиме Продвинутый 1 вставьте свой текст в Текст песни и опишите музыку в поле Стиль. Потом откройте Дополнительные параметры 2 и выберите Пол вокалиста 3, как у вас. Длительность мы поставили 150 секунд. Песня у нас про кухню, где собираются друзья, вот стиль:

acoustic pop ballad, warm male vocal, mid range, acoustic guitar, soft piano, light percussion, 92 BPM, cozy

Через минуту пришли два трека по 2:28. Для замены мы взяли первый.

Даже со словами «mid range» в стиле Suno подняла припев до ре-диеза первой октавы. Это на шесть полутонов выше, чем обычно поднимался наш образец. Что с этим делать, мы разобрали в разделе про высоту.

Меняем вокал на свой

Скачайте трек из Suno кнопкой Скачать, откройте ту же страницу нейросети Замена голоса и переключите Режим обратно на Замена голоса. Загрузите трек в Аудиофайл и выберите свою модель в поле Выбор голоса 1. В Пол голоса в оригинале 2 укажите, кто поёт в треке. Музыку отделять заранее не нужно: нейросеть сама разберёт трек на вокал и музыку и соберёт обратно.

Затем откройте Дополнительные настройки и выберите пресет Мягкое пение 3. Сайт советует его для песен, особенно с мягким или женским тембром. Пресет ослабляет Силу голоса модели с 0,66 до 0,5, сильнее бережёт согласные и другим способом определяет высоту звука. Из-за меньшей силы в результате остаётся чуть больше манеры исходного певца.

Замена стоит 20 ₽ и заняла у нас 5 минут 42 секунды. Вот вся песня:

А это припев из той же песни с пресетом по умолчанию, Чистый. Он обработался быстрее, за 2 минуты 15 секунд. Если вариант не понравился, поменяйте пресет и запустите замену ещё раз за те же 20 ₽.

Голос ушёл выше или ниже

Если результат звучит пискляво или гудит, дело почти всегда в высоте. Мы отделили вокал в каждом результате и измерили его высоту программой. Простая проверка на слух: если припев вам самим было бы неудобно петь, модели тоже неудобно.

Женская песня мужским голосом

Мы сделали ту же песню с женским вокалом и забыли поменять Пол голоса в оригинале, там остался Мужской. Наш баритон запел на высоте певицы, в среднем на ноте до первой октавы, хотя в образце он поднимался только до ля малой:

Со значением Женский сайт сам опустил голос на октаву, в среднем на ноту до малой октавы. Это нижняя часть диапазона нашего образца, там ему удобно:

Точная подстройка и тональность

Если пол указан верно, а голосу всё равно тесно, в Дополнительных настройках есть два ползунка:

  • Точная подстройка высоты от −2 до 2 с шагом 0,5 двигает только вокал, музыка остаётся на месте. Единица здесь равна октаве: с −1 наш баритон в женской песне попал ровно туда же, куда его опустил выбор пола.
  • Тональность всей песни от −6 до 6 полутонов двигает вокал вместе с музыкой. Мы опустили песню про кухню на −3: верхние ноты припева опустились с ре-диеза на ноту до первой октавы, ближе к диапазону образца.

Подстройку ставьте только на целые октавы, −1 или 1: значение 0,5 равно шести полутонам, и вокал уйдёт из тональности музыки. Мелкую подгонку делайте тональностью.

Чужой голос — только с согласия

Модель можно обучить на чьём угодно голосе, но форма не отправится без галочки «Я подтверждаю, что это мой голос или у меня есть согласие правообладателя». Отдельной статьи о голосе в Гражданском кодексе пока нет. Законопроект № 718834-8 об охране голоса внесён в Госдуму в 2024 году и дорабатывается. По нему распространять запись с чужим или воссозданным голосом можно будет только с согласия его владельца.

Поёте сами, значит, вопросов нет. Хотите в подарочной песне голос друга или мамы, спросите их заранее, а голос известного певца для роликов в соцсетях лучше не брать вовсе: разрешения у вас нет.

Вопросы про голосовую модель

Как написать текст песни в нейросети и подобрать стиль в Suno, мы рассказали в инструкции о песне с нейросетью.

Nano Banana Pro и Nano Banana 2: чем отличаются и что выбрать
30 сентября 2026 г.

Nano Banana Pro и Nano Banana 2: чем отличаются и что выбрать

Одну правку фото, сборку из четырёх снимков и афишу с русским текстом мы сделали в Nano Banana Pro, 2 и Lite. Показываем, где разница, сколько стоит и сколько ждать.

Какая нейросеть лучше для видео: пять моделей на трёх задачах
1 октября 2026 г.

Какая нейросеть лучше для видео: пять моделей на трёх задачах

Дали Seedance 2.5, Kling 3.0, Veo 3.1, Grok Video 1.5 и Gemini Omni одинаковые задания: старое фото, фразу по-русски и собаку с фрисби. Все ролики, цены и время.

Комикс нейросетью: один герой на шести кадрах и реплики по-русски
29 сентября 2026 г.

Комикс нейросетью: один герой на шести кадрах и реплики по-русски

Делаем страницу комикса с одним героем по портрету: сюжет в чате, рисунок в Nano Banana Pro, русские реплики без ошибок. Манга, американский и детский стиль, промпты и наши неудачи.