Озвучивает текст готовыми голосами на 10 иностранных языках и даёт настроить подачу речи. Цена - 10 ₽ за 1000 символов.
ByteDance Seed Speech TTS 2.0 — нейросеть для озвучки текста на английском, китайском и ещё восьми языках, русского у неё нет. Голосов 40, а тон, темп и громкость описывают словами в отдельном поле. Подойдёт для роликов, уроков и презентаций на иностранном языке.
Озвучку текста на английском мы проверили на четырёх записях, каждую ждали от 15 до 18 секунд. Слова сверяли распознаванием речи, а громкость, паузы и длительность мерили по самим файлам, но интонацию никакой замер не оценит, так что её советуем послушать самим.
Короткая страшилка про маяк, голос Стоки, остальные настройки не трогали. Первый раз поле Как произнести оставили пустым, во второй написали подсказку по-русски, в третий ту же мысль по-английски.
ByteDance Seed Speech TTS 2.0 · без подсказки · 10 ₽ за 1000 символов
ByteDance Seed Speech TTS 2.0 · «Шёпотом, напряжённо и медленно, как страшную историю у костра» · 10 ₽ за 1000 символов
ByteDance Seed Speech TTS 2.0 · «Whisper, tense and slow, like telling a scary story by a campfire» · 10 ₽ за 1000 символов
It was 3:15 in the morning when Nora heard the knock. Three slow taps, then silence. Nobody had visited the lighthouse in 12 years. She picked up the lamp and whispered: "Who's there?" No answer. Only the wind, and somewhere below, the sound of a door she was sure she had locked.
Без подсказки история заняла 22 секунды. С русской подсказкой запись растянулась до 26,6 секунды, стала тише примерно на 6 дБ, а голос опустился чуть ниже. Выходит, русскую подсказку модель понимает. Но шёпота по замеру не вышло: доля звонкой речи почти та же, голос просто притих. С английской подсказкой запись ещё немного длиннее, громкость та же, а участков без звонкого голоса, то есть шёпота, заметно больше. Если нужна точная манера, мы бы писали подсказку по-английски. Во всех трёх записях распознавание нашло все 53 слова, время 3:15 и число 12 модель прочитала без запинки.
Второй сценарий связан с домашним заданием: рассказ школьника о себе, как в учебнике. Голос Софи, в блоке Дополнительно скорость речи 0,8, подсказки нет.
Hello! My name is Daniel, and I am from Manchester. I am 14 years old. Every morning I get up at seven o'clock, have breakfast with my family and take the bus to school. My favourite subjects are History and Biology. On Saturdays I play football with my friends, and on Sundays I usually read or watch films. What about you? What do you do at the weekend?
ByteDance Seed Speech TTS 2.0 · голос Софи, скорость речи 0,8 · 10 ₽ за 1000 символов
355 символов превратились в 28 секунд речи. Распознавание записало все 69 слов, а после «Manchester» и «Biology» голос держит паузу больше полсекунды, так что по записи удобно повторять за диктором. Если темп всё равно быстрый, ползунок можно опустить до 0,5.
Рядом с каждым голосом в форме есть кнопка прослушивания, и образец звучит на языке этого голоса: Свен представляется по-немецки, Миними по-японски, Стоки и Джесс по-английски. Среди китайских голосов есть персонаж: Король обезьян, герой старинного романа «Путешествие на Запад». Вот его образец из формы, это не наша генерация:
образец голоса «Король обезьян», китайский
Мы отправили короткий русский текст сначала с голосом Стоки, потом с Виви. Оба раза нейросеть вернула ошибку, а деньги сами вернулись на баланс. Подсказка у поля Язык озвучки предупреждает о том же: русский модель не поддерживает, и в списке языков его нет.
Сначала выберите в поле Язык озвучки язык своего текста: по умолчанию стоит английский. В поле Голос останутся только голоса, которые на нём говорят, у каждого есть образец. Текст до 5000 символов вставьте в поле Текст уже на нужном языке: модель его не переводит, а только читает. Если хотите другую подачу, опишите её словами в поле Как произнести до 500 символов, например «спокойно, чуть медленнее, с улыбкой»; в записи её не слышно. Переключатель Дополнительно открывает ползунки скорости, громкости и высоты голоса.
Цена зависит от длины текста и видна на кнопке Отправить до запуска. Готовая запись появится в ленте под формой. Там есть кнопки Скачать, Изменить (текст и настройки вернутся в форму, можно поправить) и Повторить (то же задание запустится ещё раз). В Моих результатах запись лежит 7 дней, удачную стоит сохранить в библиотеку.
| Поле | Зачем | Что ставить |
|---|---|---|
| Язык озвучки | язык текста, а не подсказки; от него зависит список голосов | язык своего текста; у английского 27 голосов, у китайского 28, у испанского 8, у японского и индонезийского по 4, у португальского 3, у корейского 2, у немецкого, французского и итальянского по одному |
| Голос | тембр и манера диктора | выбирайте по образцу, а не по имени; Джесс говорит на шести языках, Виви и Минди на пяти, и одним голосом можно сделать английскую и испанскую версии ролика |
| Как произнести | эмоция, темп, громкость словами | пусто для ровной дикторской начитки, описание для рекламы, сказки или персонажа |
| Скорость речи | от 0,5 до 2, обычная 1 | 0,8 для учебных текстов, как в нашем примере |
| Громкость | от 0,5 до 2, обычная 1 | 1; громкость удобнее поправить при монтаже |
| Высота голоса | от −12 до 12, родная высота 0 | небольшой сдвиг, если голос нравится, но звучит слишком высоко или низко |
Последние три поля спрятаны за переключателем Дополнительно. Пока он выключен, модель читает с обычной скоростью, громкостью и высотой.
В подсказке хорошо работают четыре части: эмоция, темп, громкость и образ, с которым её легко сравнить. По нашей пробе английская подсказка точнее передала манеру, чем русская, но и русская заметно изменила запись. Шаблоны:
Warm and calm, a little slower than usual, like a teacher explaining a new word
Energetic and confident, fast pace, like a radio ad for a summer sale
Тихо и ласково, медленно, как сказка перед сном
Сам текст пишите для уха. Короткие предложения и знаки препинания дают паузы там, где нужно, а сокращения вроде «approx.» лучше раскрыть. Частые ошибки:
Плата берётся за каждую начатую тысячу символов текста, пробелы тоже считаются. Наша страшилка на 280 символов стоила как полная тысяча, поэтому несколько коротких фраз выгоднее отправить одним текстом. Подсказка в поле Как произнести и ползунки на цену не влияют.
| Длина текста | Как считается | Цена |
|---|---|---|
| до 1000 символов | одна тысяча | 10 ₽ |
| 2500 символов | три тысячи | 30 ₽ |
| 5000 символов, максимум за раз | пять тысяч | 50 ₽ |
Другой версии этой модели на сайте нет, ближайшая родственница у неё Seed Audio 1.0. Как обе звучат рядом с другими моделями ByteDance, показано в обзоре нейросетей ByteDance, а все озвучки сайта с ценами собраны в разделе «Озвучка текста».
| Нейросеть | Цена | Русский | Чем отличается |
|---|---|---|---|
| ByteDance Seed Speech TTS 2.0 | 10 ₽ за 1000 символов | нет | 10 языков, 40 голосов, подача словами |
| ByteDance Seed Audio 1.0 | 50 ₽ | да | голос по описанию, по записи или по картинке, плата за запуск |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | да | 24 языка, подача словами и метки вроде [whispering], диалог двух голосов |
| Inworld TTS 1.5 | от 6 ₽ за 1000 символов | да | 15 языков, модели Max и Mini |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | да | 64 голоса, поле «Подача» |
Описание обновлено 2 октября 2026 г.