Озвучивает текст естественными голосами и клонирует голос по вашему аудиофайлу. Цена зависит от режима: озвучка - 0.01 ₽ за символ в Turbo или 0.015 ₽ за символ в HD, клонирование голоса - 250 ₽ за голос.
История про солёный торт со смехом и вздохом
Промпт: (laughs) Слушай, ты не поверишь! Я вчера перепутала сахар с солью и испекла самый солёный торт в мире. (chuckle) И что ты думаешь? Гости ели и хвалили. <#0.8#> А потом Лёша попросил рецепт. (sighs) Пришлось признаться.
Детский голос для малыша-подкастера
Раздел «Детские», голос «Саша».
Промпт: Всем привет, это подкаст «Мне полтора». Сегодня обсуждаем важное: почему кашу дают, а печенье нет.
Голос деда для говорящего фото
Голос «Иван», нейтральная эмоция, 8 секунд.
Промпт: Здравствуй, внучка. Это я, дед Коля, лето шестьдесят восьмого года. Береги эту фотокарточку, ладно?
MiniMax Speech 2.8 — нейросеть MiniMax для озвучки текста взрослыми и детскими голосами, с выбором эмоции и клоном своего голоса. Смех, вздох и паузу можно вписать прямо в текст, а модель HD или более быструю Turbo выбирают под задачу.
Для статьи мы озвучили в MiniMax Speech 2.8 семь текстов, ни одного не ждали дольше полуминуты. Все слова мы сверяли распознаванием речи, а подачу советуем послушать самим. Чем 2.8 отличается от версий 2.6 и 2.5, разобрано в обзоре нейросетей MiniMax.
Для проверки взяли сообщение службы доставки: номер заказа, дата, время, этаж и телефон, всё цифрами. Голос Иван, эмоция «Нейтральная».
MiniMax Speech 2.8 · модель HD · от 10 ₽ за 1000 символов
MiniMax Speech 2.8 · модель Turbo · от 10 ₽ за 1000 символов
Добрый вечер! Это служба доставки «Тёплый дом». Ваш заказ № 4512 — диван и два кресла — привезём завтра, 3 октября, с 10:00 до 14:00. Подъём на 7-й этаж уже оплачен. Удобно ли вам это время? Если нет, позвоните по номеру 8 800 200-14-07, и мы всё перенесём.
Обе модели ошиблись в одних и тех же местах. Распознавание услышало «три октября» вместо «третьего» и «десять ноль» вместо «десяти», а «7-й» записало как «семь», у HD ещё и с отдельным «е». HD читает медленнее, 27 секунд против 24,5 у Turbo, и делает паузы длиннее. По подсказке формы HD звучит естественнее, а Turbo быстрее и дешевле; сравните сами, нужна ли вам эта разница.
Потом мы переписали те же места словами и снова отправили в Turbo:
…привезём завтра, третьего октября, с десяти утра до двух часов дня. Подъём на седьмой этаж уже оплачен…
модель Turbo, числа словами
Теперь распознавание записало дату, время и этаж правильно. В телефоне «07» распознавание по-прежнему слышит просто «семь», так что ноль в номерах тоже лучше писать словом.
В отличие от версий 2.6 и 2.5, эта понимает теги звуков. Смех пишут как (laughs), смешок (chuckle), вздох (sighs), вдох (breath), кашель (coughs), а чтобы голос ахнул, нужен (gasps). Пауза записывается как <#1.0#>, где число означает секунды. Голос Валера, эмоция «Удивление», модель HD:
(sighs) Ну всё, я сдаюсь. Третий час ищу ключи от гаража. <#1.0#> (gasps) Подожди-ка… Они что, всё это время висели на гвозде у двери? (laughs) Ладно, никому не рассказывай.
модель HD, голос Валера, эмоция «Удивление»
Распознавание не нашло в записи ни одного тега, произнесённого словами. Между «гаража» и «Подожди-ка» почти две секунды без слов, там стоят пауза и (gasps), а перед последней фразой ещё полторы секунды без слов на месте смеха. Звуки без слов распознавание не записывает, поэтому вздох, «ах» и смех стоит послушать самим. Сами теги пишутся латиницей, текст вокруг может быть русским.
Поле Эмоция меняет подачу всей записи. Одна претензия, голос Марина:
MiniMax Speech 2.8 · эмоция «Грусть» · от 10 ₽ за 1000 символов
MiniMax Speech 2.8 · эмоция «Злость» · от 10 ₽ за 1000 символов
Ты опять взял мою зарядку и не вернул. Я же просила. Это уже третий раз за неделю.
Слова в обеих записях одни и те же, а «Злость» уложилась на 0,4 секунды быстрее «Грусти». Насколько различается интонация, решайте на слух. В переключателе Голоса есть вкладка Детские: семь голосов для сказок, обучающих роликов и мультиков. Вот Катя с эмоцией «Радость»:
Мама, смотри, я нарисовала кита! У него синий хвост и целых пять зубов. Можно я повешу его на холодильник?
Детские, голос Катя, эмоция «Радость»
В поле Режим два варианта. Озвучить превращает текст в запись: выберите модель HD или Turbo, группу голосов (взрослые, детские или свои), голос, эмоцию и язык текста, вставьте текст и нажмите Отправить. Стоимость зависит от длины текста и видна на кнопке заранее. Готовая запись появится в ленте под формой с кнопками Скачать, Изменить (текст с настройками снова окажется в форме, можно поправить) и Повторить (сразу запустить то же самое).
Клонировать голос создаёт ваш голос по записи: файл MP3, WAV или M4A на 10–300 секунд и до 5 МБ, плюс название до 12 символов и отметка о праве использовать этот голос. Клон оплачивается один раз и появляется во вкладке Мои голоса во всех трёх версиях Speech. Клон мы не делали: для него нужна запись своего голоса, а чужой без согласия использовать нельзя. По шагам он описан в инструкции про клон голоса. Через 7 дней записи из Моих результатов удаляются, поэтому удачные стоит перенести в библиотеку.
Главное правило по нашим пробам — даты, время, порядковые числа и нули писать словами: «третьего октября», «с десяти утра», «на седьмой этаж», «ноль семь». Знак № модель читает как «номер». Теги звуков ставьте там, где звук был бы у живого человека: вздох перед жалобой, смех после шутки. Пауза <#…#> должна стоять между словами, две паузы подряд разработчик не поддерживает. Для длинного текста до 10 000 символов полезно сначала озвучить первый абзац в Turbo и послушать, как звучат имена и термины.
Озвучка оплачивается по символам, клон — один раз за голос. Подписки нет.
| Режим | Модель | Объём | Цена |
|---|---|---|---|
| Озвучить | HD | 1000 символов | 15 ₽ |
| Озвучить | Turbo | 1000 символов | 10 ₽ |
| Клонировать голос | любая | один голос | 250 ₽ |
От эмоции и ползунков сумма не зависит, а теги и паузы считаются как обычные символы текста.
Голоса, эмоции, языки и клон у трёх версий общие, клон из одной работает в остальных. Рядом со Стандартом, Inworld и Qwen, на общей фразе про библиотеку, версию 2.8 можно послушать в обзоре «Озвучка текста», там же собраны все озвучки сайта.
| Нейросеть | Цена | За раз | Чем отличается |
|---|---|---|---|
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | 10 000 | теги смеха и вздохов |
| MiniMax Speech 2.6 | от 10 ₽ за 1000 символов | 10 000 | те же голоса и эмоции, без тегов |
| MiniMax Speech 2.5 | от 8 ₽ за 1000 символов | 10 000 | ранняя версия, без тегов |
| Inworld TTS 1.5 | от 6 ₽ за 1000 символов | 2000 | 15 языков, модели Max и Mini |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 | подача от творческой до стабильной, без клона |
Описание обновлено 1 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.