Озвучивает текст готовыми голосами на 15 языках, включая русский, и может менять подачу речи по текстовой подсказке. Цена - 10 ₽ за 1000 символов.
Inworld Realtime TTS 2 — нейросеть Inworld AI для озвучки текста на 15 языках, включая русский. Интонацию ей задают словами в квадратных скобках прямо в тексте: можно попросить шёпот, грусть или бодрый темп, сменить настроение посреди записи, а сама подсказка вслух не звучит.
Большинство нейросетей читают текст так, как решат сами: ровно и вежливо. Здесь озвучка текста с интонацией делается по заказу. Перед фразой пишут в скобках, как её прочитать, например [говори шёпотом] или [say sadly with deliberate pauses], и голос меняет манеру до следующей подсказки. Inworld AI показала модель в мае 2026 года. Слово Realtime в названии — про голосовых помощников: у разработчика модель начинает говорить почти без задержки. На сайте вы получаете готовый файл, поэтому для вас важнее подача.
Мы записали восемь реплик и ещё три коротких фразы с номером телефона. Каждая была готова за 8–13 секунд. Слова проверяли распознаванием речи, громкость и паузы мерили по самому файлу, а вот тембр и эмоцию лучше оценить на слух.
Одна и та же реплика голосом Дмитрий трижды: без подсказки, с подсказкой на русском и с той же просьбой на английском.
Inworld Realtime TTS 2 · без подсказки · 10 ₽ за 1000 символов
Inworld Realtime TTS 2 · [говори шёпотом, медленно и таинственно] · 10 ₽ за 1000 символов
Inworld Realtime TTS 2 · [whisper slowly in a hushed, mysterious style] · 10 ₽ за 1000 символов
Тише, все уже спят. Я нашёл ключ от чердака, он лежал под третьей ступенькой. Пойдём сейчас, пока никто не проснулся? Только не наступай на скрипучую доску.
Обе подсказки сработали. Средняя громкость записей с шёпотом примерно на 11 дБ ниже обычной, а слов из скобок распознавание в них не нашло. Разница в темпе: без подсказки реплика заняла 10 секунд, с русской просьбой 14, с английской почти 19, и паузы между фразами там доходят до секунды. Разработчик советует писать указания по-английски, даже если сам текст на другом языке. Наша русская подсказка тоже сработала, но если модель вас не послушала, переведите просьбу на английский: так надёжнее.
Подсказка действует с того места, где стоит, до следующей. Мы начали реплику радостно, а на середине попросили грусть. Голос Елена.
[say cheerfully with a fast pace] Ура, посылка пришла! Я так долго её ждала. [laugh] Сейчас открою… [say sadly with deliberate pauses in a low voice] Ой. Это не мой заказ. На коробке чужое имя. [sigh] Придётся завтра снова идти на почту.
Inworld Realtime TTS 2 · голос Елена, две подсказки в одном тексте · 10 ₽ за 1000 символов
Первые три фразы уложились в три с половиной секунды. После второй подсказки голос стал тише примерно на 10 дБ, а после «Ой» модель выдержала паузу больше секунды. Перед последней фразой в записи слышен короткий звук без слов: похоже на вздох из [sigh], проверьте сами.
Кроме манеры, в скобки можно поставить звук в нужном месте. Разработчик называет такие теги по-английски: [laugh], [sigh], [breathe], [cough], [yawn]. Мы сравнили их с русскими словами в тех же местах, голос Светлана.
Inworld Realtime TTS 2 · [смех] и [вздох] · 10 ₽ за 1000 символов
Inworld Realtime TTS 2 · [laugh] и [sigh] · 10 ₽ за 1000 символов
Ну ты даёшь! [laugh] Я такого от тебя не ожидала. [sigh] Ладно, рассказывай всё по порядку.
Слово «смех» вслух не прозвучало ни разу, «laugh» тоже. В обеих записях на месте тегов короткие звуки без слов, а русская версия вышла на секунду длиннее за счёт пауз. Похожи ли эти звуки на смех и вздох, распознавание речи не скажет, поэтому послушайте и выберите вариант на свой вкус.
Неудобную фразу с датой, отчеством и телефоном мы уже читали в соседней Inworld TTS 1.5. Здесь тот же текст и тот же голос Николай, без подсказок.
Inworld Realtime TTS 2 · Realtime TTS 2, голос Николай · 10 ₽ за 1000 символов
Inworld TTS 1.5 · TTS 1.5, модель Max, голос Николай · от 6 ₽ за 1000 символов
Сегодня, 14 октября, к нам в мастерскую придёт Марина Сергеевна. Она заказала три деревянных стула и стол на шесть персон. Успеем ли мы к пятнице? Честно, не уверен. Но если Пётр вернётся с лаком до обеда, всё получится! Звоните по номеру 8 800 555-35-35, если что-то изменится.
Дату Realtime TTS 2 склонила правильно: распознавание услышало «четырнадцатого октября», даже когда мы подсказали ему неверное «четырнадцать». Запись вышла на две секунды короче, чем у 1.5. С телефоном неясно: распознавание услышало «тридцать пять» один раз, а не два, но на повторах цифр оно и само ошибается. Номера и адреса в любой озвучке стоит проверять ухом.
Список голосов меняется вместе с языком: после выбора испанского в нём остаются Диего, Лупита, Мигель и Рафаэль. Подсказку мы оставили английской, как советует разработчик.
[say warmly and slowly, like a friendly host] ¡Bienvenidos a nuestra cafetería! Hoy tenemos tarta de manzana recién hecha y café de Colombia. La mesa junto a la ventana está libre. ¿Les traigo la carta?
Inworld Realtime TTS 2 · язык Испанский, голос Лупита · 10 ₽ за 1000 символов
Распознавание разобрало испанский текст слово в слово, слов из подсказки в записи нет.
Сначала в форме выбирают Язык и Голос (образец каждого голоса слушается кнопкой до запуска), потом в поле Текст пишут или вставляют то, что нужно прочитать. Если нужна особая подача, допишите в начале текста просьбу в квадратных скобках, например «[говори медленно и тепло]». Модель прочитает текст этим голосом и с этой манерой, а слова из скобок вслух не произнесёт. Чтобы сменить настроение посреди текста, поставьте новую подсказку перед нужной фразой. Платите за символы, считая скобки и пробелы, и сумма видна на кнопке Отправить заранее. Запись появляется в ленте под формой: её можно Скачать файлом MP3, нажать Изменить, чтобы вернуть текст и настройки в форму, или Повторить, чтобы прочитать тот же текст ещё раз. Через 7 дней записи из Моих результатов пропадают, поэтому удачную сохраните в библиотеку.
В подсказке пишут, как говорить. Чем подробнее, тем точнее: настроение, темп, громкость и манера в одной фразе работают лучше, чем одно слово «грустно». Разработчик предлагает такую схему:
Шаблоны, которые можно взять как есть:
[say calmly and slowly, like a teacher explaining a new topic] Сегодня разберём, как устроена дробь. Возьмём яблоко и разрежем его на четыре части.
[speak like an energetic radio host with a fast pace] Доброе утро, город! На часах восемь, на улице плюс двенадцать, и у нас для вас хорошая новость.
[say tiredly in a low voice] Опять дождь. [say excitedly with a high pitch] Стоп, это же радуга!
Частые ошибки. Подсказка спорит с текстом: «[грустно]» перед «Ура, мы выиграли!» запутает модель. Забыли, что подсказка продолжает действовать: если шёпот нужен на одну фразу, перед продолжением поставьте новую подсказку. По словам разработчиков, вернуть голосу обычную манеру можно тегом [reset], но его мы не проверяли. И не перегружайте текст звуками: [laugh] через фразу звучит нарочито.
Цена зависит только от длины текста. Голос, язык, ползунки и сами подсказки сумму не меняют, но символы в скобках оплачиваются, как и остальной текст.
| Объём | Примерно | Цена |
|---|---|---|
| 200 символов | одна-две фразы, проба голоса | 2 ₽ |
| 1000 символов | около минуты с четвертью речи в обычном темпе | 10 ₽ |
| 2000 символов | самая длинная запись за один запуск | 20 ₽ |
Подсказку для пробы удобно подбирать на одной фразе, а целый текст запускать, когда манера понравилась. Подписки нет, оплачивается каждая запись. Неудачный запуск не оплачивается: деньги сами возвращаются на баланс.
Набор из 65 голосов, 15 языков, лимит в 2000 символов и два ползунка у обеих моделей Inworld одинаковый. Inworld TTS 1.5 предлагает выбор модели Max или Mini, но подачу там задают только ползунками и знаками препинания. Realtime TTS 2 одна, зато слушает словесные подсказки и меняет настроение посреди текста. Для ровного чтения объявления или инструкции подойдёт любая: фразу с датой обе прочитали без ошибок. Если в тексте есть эмоция, шёпот или смена тона, берите Realtime TTS 2. Остальные голоса раздела сравнены на одной фразе в статье «Озвучка текста».
| Нейросеть | Цена | За раз | Чем отличается |
|---|---|---|---|
| Inworld Realtime TTS 2 | 10 ₽ за 1000 символов | 2000 | подсказки словами, смена настроения внутри текста |
| Inworld TTS 1.5 | от 6 ₽ за 1000 символов | 2000 | те же голоса, две модели, подача ползунками |
| xAI TTS v1 | 3 ₽ за 1000 символов | 15 000 | теги звуков и манеры на английском, длинные тексты |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 | 64 голоса, эмоции короткими тегами |
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | 10 000 | эмоция из списка, детские голоса, клон |
Описание обновлено 2 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.