Нейросеть ElevenLabs чаще всего ищут ради озвучки текста, но у компании есть модели и для других задач со звуком. На Братухе их семь: Eleven v4, Eleven v4 Turbo и Eleven v3 озвучивают текст, Sound Effect V2 делает звуковые эффекты, Audio Isolation убирает фон из записи, а Music v2.5 и Music v2 пишут музыку и песни.
Чтобы показать линейку в деле, мы собрали из неё одну сцену: анонс выдуманного радиоспектакля «Дом на Садовой, 17». Голос рассказчика, дождь, стук в дверь и музыку сделали четыре нейросети ElevenLabs. Дорожки в один файл мы свели сами: приглушили музыку под голосом и поставили стук после слов о нём. Мы делали это программой ffmpeg, но подойдёт любой аудиоредактор.
ElevenLabs основали в 2022 году Пётр Домбковский и Матеуш Станишевский, оба выросли в Польше. По их словам, идею подсказал монотонный одноголосый закадровый перевод американских фильмов, привычный для польского телевидения.
Из России на сайт самой ElevenLabs не попасть: компания закрывает доступ из нескольких стран, и Россия в этом списке (справка ElevenLabs, на английском). На Братухе не нужны ни VPN, ни зарубежная карта, ни подписка: баланс пополняется в рублях, а сколько стоит запуск, написано на кнопке Отправить до нажатия. Готовый файл появится под формой и в разделе Мои результаты. Там его можно прослушать и скачать в течение 7 дней. Как пополнить баланс и где искать историю, рассказано в инструкции по сайту.
Все звуки из этой статьи обошлись нам примерно в 145 ₽, больше всего ушло на музыку. Ниже каждая дорожка отдельно, как её вернула нейросеть, с заданием и настройками.
Реплику озвучила Eleven v3 голосом Brian в режиме подачи Творческая: эмоций в нём больше, но результат менее предсказуем. Интонацию задают теги в квадратных скобках, по-английски даже в русском тексте: [whispers] значит шёпот, [sighs] вздох, [nervous] волнение. Срабатывают они не всегда, и если интонация не легла, реплику можно озвучить ещё раз. Символы тегов тоже оплачиваются, а вслух теги не звучат. Мы проверили файл распознаванием речи, то есть перевели запись обратно в текст: всё совпало слово в слово, без «whispers» и «sighs». Ждали мы две с половиной минуты.
[calm] Ноябрь, половина двенадцатого ночи. Дождь не стихает уже третий час. [whispers] И тут кто-то стучит в дверь. [nervous] Я никого не жду… [sighs] Хотя нет. Жду. Уже двенадцать лет. [curious] Кто там? Первая серия «Дома на Садовой, 17» — в эту пятницу.
ElevenLabs Eleven v3 · голос Brian, подача «Творческая» · 30 ₽ за 1000 символов
Оба эффекта сделала Sound Effect V2, каждый пришёл через 9–13 секунд. Дождь по окну с далёким громом мы заказали на 10 секунд с переключателем Зацикливать (loop) и в сцене повторили три раза подряд, провала на стыках нет.
Steady heavy rain against a window at night, water dripping from the roof, soft distant thunder. No music.
ElevenLabs Sound Effect V2 · 10 с, Зацикливать (loop), Следование описанию 0,3 · 1.5 ₽ + 0.5 ₽/сек.
Со стуком вышла заминка. Мы просили три медленных удара в старую деревянную дверь, а пришло шесть: сначала два, потом ещё четыре. Во второй попытке подняли ползунок Следование описанию (чем выше, тем точнее нейросеть держится описания) с 0,5 до 0,8 и дописали в описание «ровно три, потом тишина». Ударов стало семь. Ни в одной попытке число не совпало с заданием, поэтому в сцену мы вырезали нужный кусок из первого варианта. Ниже он целиком, как пришёл.
Three slow heavy knocks on an old wooden front door, recorded from inside a quiet hallway. No music.
ElevenLabs Sound Effect V2 · 3 с, Следование описанию 0,5 · 1.5 ₽ + 0.5 ₽/сек.
Фон написала Music v2.5 с включённым переключателем Только инструментал, трек был готов через 17 секунд. В задании мы попросили тихую тревожную музыку без запоминающейся мелодии, чтобы она не спорила с рассказчиком. Длину поставили 30 секунд, но платить пришлось как за минуту: эта нейросеть берёт деньги за каждую начатую минуту. Поэтому короткий фон лучше сразу заказывать на минуту. Цена та же, а лишнее можно обрезать.
Dark cinematic underscore for the intro of a mystery radio drama. Low sustained cello and double bass drone, sparse soft felt piano notes, a slow heartbeat-like pulse on a muffled bass drum, 70 BPM, quiet and tense, builds slightly toward the end, no melody hooks, leaves room for a narrator voice.
ElevenLabs Music v2.5 · 30 с, Только инструментал · от 100 ₽/мин.
Eleven v4 и её быструю версию v4 Turbo ElevenLabs выпустила в конце сентября 2026 года. Разработчики заявляют больше 90 языков и более точное выполнение тегов, чем у v3. В форме 22 готовых голоса с именами латиницей и образцом звучания у каждого, фильтр Женские / Мужские и выбор Языка, по умолчанию русский. Теги те же, что у v3, а ещё модель понимает звуки окружения вроде [door slams] и произношение слова, записанное в косых чертах. В Дополнительно есть Стабильность подачи, Сходство с голосом, Чтение чисел и дат и Seed. За один запуск можно отправить до 5000 символов. Цена за символы текста: у v4 12 ₽ за 1000 символов, у v4 Turbo 7 ₽ за 1000 символов. Это в 2,5 и в 4 с лишним раза дешевле v3. Клона голоса в форме нет.
Реплику рассказчика мы озвучили ещё раз тем же голосом Brian в v4 и v4 Turbo. Стабильность подачи поставили 0,3, чтобы подача была живее, как у «Творческой» в v3.
ElevenLabs Eleven v4 · голос Brian, стабильность 0,3 · 12 ₽ за 1000 символов
ElevenLabs Eleven v4 Turbo · голос Brian, стабильность 0,3 · 7 ₽ за 1000 символов
ElevenLabs Eleven v3 · голос Brian, подача «Творческая» · 30 ₽ за 1000 символов
[calm] Ноябрь, половина двенадцатого ночи. Дождь не стихает уже третий час. [whispers] И тут кто-то стучит в дверь. [nervous] Я никого не жду… [sighs] Хотя нет. Жду. Уже двенадцать лет. [curious] Кто там? Первая серия «Дома на Садовой, 17» — в эту пятницу.
Все три версии прочитали реплику без ошибок: распознавание речи вернуло текст слово в слово, теги вслух не прозвучали. По темпу они почти не отличаются, каждая запись длится 18–19 секунд, паузы стоят на тех же местах. Разница в скорости и цене. v4 вернула файл через 18 секунд и списала 3,08 ₽, v4 Turbo — через 11 секунд за 1,80 ₽, а v3 мы ждали две с половиной минуты. Если нужна одна короткая реплика с игрой голосом, берите v4. Для большого объёма текста, например карточек товаров или уведомлений, подойдёт Turbo.
ElevenLabs показала тестовую версию Eleven v3 в июне 2025 года, полноценной модель стала в начале 2026-го. Разработчики заявляют больше 70 языков, русский в их списке есть. В форме 64 готовых голоса с именами латиницей, фильтр Женские / Мужские и кнопка прослушивания образца у каждого. Подача бывает трёх видов: Творческая, Естественная для большинства текстов и Стабильная, ровная и почти без эмоций. За один запуск можно отправить до 5000 символов, цена за символы текста: 30 ₽ за 1000 символов. Клона голоса в форме нет. Как Eleven v3 звучит рядом с другими голосами, слышно в сравнении из раздела «Озвучка текста».
Вторая версия модели вышла в сентябре 2025 года. Поле Описание звука понимает только английский, до 450 символов, длина эффекта от 0,5 до 22 секунд. Платите за запуск и за каждую секунду. С другими генераторами эффектов она сравнивается в разделе «Звуковые эффекты».
Audio Isolation принимает аудио (MP3, WAV, M4A, FLAC и другие) или видео (MP4, MOV, WEBM) и возвращает только голос в MP3, без картинки. Платите за каждую секунду записи. Для проверки мы положили реплику рассказчика поверх шума улицы, который тоже сделали в Sound Effect V2: машины, гудки, тормоз автобуса. Так звучит запись до очистки:
ElevenLabs Audio Isolation · тип «Аудио», запись 20 секунд · 0.4 ₽/сек.
Через 13 секунд пришёл голос без улицы. Шум перед первым словом пропал почти до полной тишины: по замеру громкость упала с −26 до −88 дБ. Распознавание разобрало все слова. Когда чужие голоса и музыка звучат вровень с речью, вместе с фоном страдает и сам голос: такое сравнение есть в разделе «Улучшение аудио».
Music v2 вышла в мае 2026 года и, по словам ElevenLabs, умеет менять жанр посреди трека. Music v2.5 появилась в сентябре 2026-го. Чем версии отличаются, сказано в вопросах ниже. В поле Задание до 4000 символов можно писать по-русски, вместе с текстом песни. Длина трека от 3 секунд до 10 минут. Песню с русским вокалом от ElevenLabs и других нейросетей можно послушать в разделе «Музыка».
| Нейросеть | Цена | Задача | На входе | Результат |
|---|---|---|---|---|
| ElevenLabs Eleven v4 | 12 ₽ за 1000 символов | озвучка текста | текст до 5000 символов, 22 голоса, выбор языка | речь в MP3 |
| ElevenLabs Eleven v4 Turbo | 7 ₽ за 1000 символов | быстрая озвучка | текст до 5000 символов, 22 голоса, выбор языка | речь в MP3 |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | озвучка текста, прошлая версия | текст до 5000 символов, 64 голоса | речь в MP3 |
| ElevenLabs Sound Effect V2 | 1.5 ₽ + 0.5 ₽/сек. | звуковые эффекты | описание по-английски | от 0,5 до 22 секунд, можно зациклить |
| ElevenLabs Audio Isolation | 0.4 ₽/сек. | очистка голоса | аудио или видео | голос без фона, MP3 |
| ElevenLabs Music v2.5 | от 100 ₽/мин. | музыка и песни | задание до 4000 символов | от 3 секунд до 10 минут |
| ElevenLabs Music v2 | от 100 ₽/мин. | музыка и песни, прошлая версия | задание до 4000 символов | от 3 секунд до 10 минут |
Статья обновлена 3 октября 2026 г.