Озвучивает английский текст живым голосом и может подстроить речь под ваш образец голоса. Цена - 5 ₽ за 1000 символов текста.
Chatterbox TTS — нейросеть Resemble AI для озвучки английского текста встроенным голосом или голосом с короткой записи, которую можно загрузить или наговорить прямо в форме. Ползунок выразительности делает подачу спокойнее или ярче. Русский текст модель не читает.
Для статьи мы сделали в Chatterbox TTS шесть записей, каждая была готова за 17–33 секунды. Слова сверяли распознаванием речи, а длительность, паузы и высоту голоса мерили по самим файлам. Тембр и характер подачи замер не передаёт, поэтому плееры ниже лучше послушать. Голоса реальных людей мы не повторяли: образцами послужили записи, которые раньше озвучили другие нейросети сайта.
Короткий монолог про неудачный хлеб мы прочитали встроенным голосом дважды. Первый раз переключатель Дополнительно не трогали. Во второй включили его, подняли Выразительность до 0,7 и опустили Точность до 0,3: такое сочетание для живой речи советуют сами разработчики.
Chatterbox TTS · «Дополнительно» выключено · 5 ₽ за 1000 символов
Chatterbox TTS · Выразительность 0,7, Точность 0,3 · 5 ₽ за 1000 символов
Okay, so I finally tried baking bread at home. <sigh> Three hours of work. I followed every step, I even bought a thermometer. And the result? <laugh> A brick. A beautiful, golden, two-kilo brick. My dog wouldn't touch it. <chuckle> Tomorrow I'm trying again, and this time I'm reading the recipe twice.
Разница заметна и по цифрам. Спокойный вариант длится 23,4 секунды, в нём три паузы длиннее 0,4 секунды. Яркий уложился в 19,9 секунды, без единой такой паузы, а голос в среднем стал выше и чуть громче. По замеру монолог стал быстрее и выше, а насколько взволнованно это звучит, проверьте на слух. Для рекламы и сценки мы бы взяли второй вариант, для инструкции или урока первый.
В подсказке поля Текст на английском перечислены восемь меток звуков: <laugh>, <sigh>, <chuckle> и другие. В монологе выше их три. Распознавание речи на месте каждой записало само слово: «sigh», «laugh», «chuckle». В третьей пробе мы заменили угловые скобки квадратными, и «laugh» с «chuckle» снова распознались словами. Похоже, в наших записях модель произносит метку, а не смеётся. Прежде чем расставлять метки по всему тексту, проверьте одну на короткой фразе, а для смеха и вздоха надёжнее xAI TTS v1: в наших пробах её теги словами не звучали.
Ради голоса по образцу эту нейросеть и стоит открывать. Мы взяли две записи по 22–23 секунды. Первая — английская страшилка, её озвучила Seed Speech TTS 2.0 голосом Стоки. Вторая, русское сообщение мастерской, начитана в Inworld TTS 1.5 голосом Николай.
ByteDance Seed Speech TTS 2.0 · образец 1: английский, 22 секунды · 10 ₽ за 1000 символов
Inworld TTS 1.5 · образец 2: русский, 23 секунды · от 6 ₽ за 1000 символов
Оба образца мы по очереди загрузили в поле Образец голоса и озвучили одно и то же объявление пекарни. Остальные настройки не меняли.
Chatterbox TTS · голос с образца 1 · 5 ₽ за 1000 символов
Chatterbox TTS · голос с образца 2 · 5 ₽ за 1000 символов
Hi there! This is Maple Street Bakery. Our autumn menu starts on October 15: pumpkin rolls, apple pie and hot cider. We're open every day from 8 a.m. to 9 p.m. Order before noon and get free delivery on orders over $25. Call us at 555-0142, or just drop by and say hello!
Высоту голоса модель перенесла близко к образцу. У мужского образца средняя высота 132 Гц, у результата 131. Женский образец звучит в среднем на 238 Гц, результат на 214. Похоже, вместе с тембром переехал и темп: с медленной страшилки объявление растянулось на 25,3 секунды, с паузами до 0,7 секунды между фразами, а с делового русского образца заняло 19 секунд. Дату, время и сумму распознавание в обеих записях разобрало без ошибок, а номер телефона неуверенно, так что цифры в номерах проверяйте на слух. Русский образец годится для английского текста, все слова на месте. Остался ли в речи русский акцент, распознавание не скажет, это лучше услышать самим.
Ради проверки мы отправили короткую русскую фразу встроенным голосом. Вместо неё пришла запись на 0,84 секунды: два невнятных звука, которые распознавание записало как «Nga! Grr!». Ошибки при этом не было, и запись оплачена как обычная. Название поля прямо предупреждает: текст нужен английский.
В поле Голос две кнопки. «Встроенный» читает текст единственным голосом модели, выбирать там нечего. «Образец голоса» открывает поле для записи от 5 до 30 секунд: загрузите файл до 10 МБ или нажмите запись и наговорите речь прямо в форме. Модель снимет с образца тембр и манеру и прочитает ваш текст похожим голосом; слова из образца в результат не попадают. Повторяйте свой голос или голос человека, который на это согласился.
Текст на английском, до 5000 символов, вставьте в поле Текст на английском. Переводить модель не умеет, поэтому русский черновик сначала переведите, например в чате с нейросетями. Переключатель Дополнительно открывает три ползунка подачи, без него модель читает со своими обычными настройками. Цена зависит только от длины текста и видна на кнопке Отправить до запуска.
Готовая запись в формате WAV появится в ленте под формой. Под ней есть кнопки Скачать, Изменить (текст и настройки вернутся в форму) и Повторить (то же задание запустится ещё раз, удобно, если первый дубль не понравился). В Моих результатах запись хранится 7 дней, удачную стоит сохранить в библиотеку. Образец не сохраняется: для следующей записи тем же голосом загрузите его снова.
| Поле | Зачем | Что ставить |
|---|---|---|
| Голос | встроенный или по образцу | «Встроенный» для черновика, «Образец голоса» для своего диктора |
| Образец голоса | тембр, манера и темп будущей речи | 15–25 секунд одного голоса без музыки и эха; спокойный кусок для объявления, живой для сценки |
| Текст на английском | что прочитать, до 5000 символов | только английский; короткие предложения и знаки препинания дают паузы |
| Выразительность | от 0 до 1, по умолчанию 0,25 | 0,25 для урока и инструкции, 0,6–0,7 для рекламы и персонажей |
| Вариативность | от 0,05 до 2, по умолчанию 0,7 | 0,7; если речь сбивается, опустите до 0,5 |
| Точность | от 0,1 до 1, по умолчанию 0,5 | 0,5; вместе с высокой выразительностью около 0,3, как во второй записи выше |
Последние три ползунка видны, только когда включён переключатель Дополнительно. По словам разработчиков, при высокой выразительности речь ускоряется, и пониженная точность это уравновешивает. В нашей пробе с 0,7 и 0,3 запись всё равно вышла на три с половиной секунды короче спокойной.
Модель читает ровно то, что написано, поэтому текст стоит писать для уха. В хорошем тексте четыре вещи: короткие фразы, знаки препинания там, где нужен вдох, раскрытые сокращения и эмоция в самих словах. Три заготовки:
Welcome back to the channel! Today we're making a simple tomato soup. It takes twenty minutes, and you only need five ingredients.
Attention, please. The museum will close in fifteen minutes. Thank you for visiting, and see you again soon.
You did WHAT? You painted the whole kitchen... pink? Okay. Okay. I need a minute.
Частые ошибки:
Плата берётся за каждую начатую тысячу символов, пробелы тоже считаются. Наш монолог на 303 символа стоил как полная тысяча. Образец голоса и ползунки на цену не влияют.
| Длина текста | Цена |
|---|---|
| до 1000 символов | 5 ₽ |
| 2500 символов | 15 ₽ |
| 5000 символов, максимум за раз | 25 ₽ |
Пробовать голос и настройки выгоднее на одном куске до тысячи символов, а целиком отправлять уже проверенный вариант.
Других версий Chatterbox на сайте нет. В таблице собраны озвучки, к которым стоит присмотреться вместо неё или вместе с ней. Все озвучки сайта с общей фразой для сравнения собраны в разделе «Озвучка текста», а клон голоса по шагам разобран в инструкции про клон голоса.
| Нейросеть | Цена | Русский | Чем отличается |
|---|---|---|---|
| Chatterbox TTS | 5 ₽ за 1000 символов | нет | английский встроенным голосом или по образцу 5–30 с, ползунок выразительности |
| ByteDance Seed Speech TTS 2.0 | 10 ₽ за 1000 символов | нет | 10 языков, 40 готовых голосов, подача словами |
| Zonos2 | 3 ₽ | да | голос по образцу до 30 с в каждом запуске, текст до 10 000 символов |
| Qwen3 TTS | 10 ₽ за 1000 символов | да | 9 готовых голосов, голос по описанию и клон по записи |
| xAI TTS v1 | 3 ₽ за 1000 символов | да | 28 голосов, теги смеха, шёпота и манеры чтения |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | да | 64 голоса, эмоции тегами в квадратных скобках |
Описание обновлено 2 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.