Озвучивает текст готовыми голосами на 15 языках, включая русский, с выбором между более естественной и более быстрой моделью. Цена зависит от модели: Max - 10 ₽ за 1000 символов, Mini - 6 ₽ за 1000 символов.
Inworld TTS 1.5 — нейросеть Inworld AI для озвучки текста готовыми голосами на 15 языках, в том числе на русском. На выбор две модели, Max и более дешёвая Mini, а темп и выразительность голоса подстраивают ползунками.
Для статьи мы сделали пять записей: одна фраза в обеих моделях, один монолог с разной выразительностью и объявление на английском. Каждая запись была готова за 8–17 секунд. Слова мы проверяли распознаванием речи, тембр оцените на слух.
Текст специально неудобный: дата, имя с отчеством, вопрос, сомнение и телефон. Голос Николай, остальные настройки по умолчанию.
Inworld TTS 1.5 · модель Max, голос Николай · от 6 ₽ за 1000 символов
Inworld TTS 1.5 · модель Mini, голос Николай · от 6 ₽ за 1000 символов
Сегодня, 14 октября, к нам в мастерскую придёт Марина Сергеевна. Она заказала три деревянных стула и стол на шесть персон. Успеем ли мы к пятнице? Честно, не уверен. Но если Пётр вернётся с лаком до обеда, всё получится! Звоните по номеру 8 800 555-35-35, если что-то изменится.
По расшифровке обе модели прочитали «четырнадцатого октября», а не «четырнадцать», и отчество распозналось без искажений. Max прочитал текст за 23 секунды, Mini вышла на две секунды длиннее: по расшифровке паузы между фразами у неё больше. Одно место стоит послушать: распознавание речи оба раза услышало у Mini «стул на шесть персон» вместо «стол». Для длинной начитки, где каждое слово на виду, мы бы взяли Max, а Mini оставили для черновиков и служебных реплик.
Ползунок Выразительность прячется под переключателем Дополнительно. Мы прочитали один короткий монолог голосом Светлана на крайних значениях: 0,7 и 1,5.
Inworld TTS 1.5 · Выразительность 0,7 · от 6 ₽ за 1000 символов
Inworld TTS 1.5 · Выразительность 1,5 · от 6 ₽ за 1000 символов
Знаешь, я ведь чуть не уехала. Билет уже лежал в кармане, поезд в 21:40. А потом ты позвонил и сказал одно слово: «Останься». И я осталась. До сих пор не знаю, правильно ли сделала.
По длине записи почти не отличаются, 13,1 и 13,2 секунды, слова в них одни и те же, и время «21:40» распознавание нашло в обеих. Отличие в подаче: по замеру громкости на 1,5 голос сильнее то поднимается, то затихает. Насколько это заметно на слух, послушайте сами. Для инструкций и объявлений мы бы оставили единицу, а для рассказа от первого лица попробовали бы 1,2–1,3.
Голоса привязаны к языку. В поле Язык мы выбрали английский, и в списке стали доступны 25 английских голосов вместо четырёх русских. Объявление для гостей прочитала Эшли:
Welcome to our pottery studio! Classes start at 7 p.m. every Tuesday and Thursday. No experience needed: we will give you clay, an apron and a cup of tea. Ready to make your first bowl?
модель Max, язык Английский, голос Эшли
Распознавание разобрало запись слово в слово. Русским голосом английский текст здесь не прочитать, поэтому для ролика на двух языках понадобятся два разных голоса.
Наберите или вставьте текст в поле Текст, затем выберите Язык и Голос. Рядом с каждым голосом есть образец: его можно послушать до запуска. Модель по умолчанию Max, для экономии переключите на Mini. Цена считается по числу символов, включая пробелы, и сумму покажет кнопка Отправить ещё до запуска. Готовая запись встанет в ленту под формой, у неё три кнопки: Скачать (файл MP3), Изменить (форма снова заполнится этим текстом и настройками) и Повторить (тот же запуск ещё раз). В Моих результатах записи лежат неделю, удачную лучше сразу сохранить в библиотеку.
Отдельного поля для указаний, как читать, здесь нет, так что управлять подачей можно только самим текстом. В наших записях паузы стояли там, где в тексте точки и запятые, поэтому фразу на три строки без единой запятой лучше разбить на две-три.
Дату в наших пробах модель склонила правильно. Номер телефона пишите группами через дефис, как принято на письме, а сокращения вроде «г.» и «руб.» мы не проверяли, надёжнее их раскрыть. Если у слова два возможных ударения, прослушайте первую запись: задать ударение в форме нельзя.
Сумма зависит от двух вещей: модели и длины текста. Ниже цена за 1000 символов, в обычном темпе это чуть меньше полутора минут речи.
| Модель | Объём | Цена |
|---|---|---|
| Max | 1000 символов | 10 ₽ |
| Mini | 1000 символов | 6 ₽ |
Ползунки, язык и голос сумму не меняют, подписки нет. Если запуск не удался, деньги вернутся на баланс сами.
Ближайший родственник этой модели — Inworld Realtime TTS 2 от того же разработчика: те же голоса и языки, но без выбора модели, зато подачу можно описать словами в квадратных скобках в начале текста. Realtime TTS 2 можно послушать на одной фразе со Стандартом, MiniMax и Qwen в статье раздела «Озвучка текста».
| Нейросеть | Цена | За раз | Чем отличается |
|---|---|---|---|
| Inworld TTS 1.5 | от 6 ₽ за 1000 символов | 2000 | модели Max и Mini на выбор |
| Inworld Realtime TTS 2 | 10 ₽ за 1000 символов | 2000 | подача словами в скобках |
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | 10 000 | эмоции, детские голоса, смех и вздохи, клон |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 | 64 голоса и три варианта подачи |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | 2500 | диалог двух голосов |
Описание обновлено 1 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.