Озвучивает текст естественными голосами на разных языках и клонирует голос по аудиозаписи. Цена зависит от режима: озвучка - 0,008 ₽ или 0,015 ₽ за символ, клонирование голоса - 250 ₽ за один голос.
Опять ушёл автобус: живая речь с числами
Промпт: Автобус номер сорок два опять ушёл без меня. Ну вот скажите, Андрей Петрович, как можно приезжать на остановку в 7:15, если по расписанию он в 7:20? Ладно. Пойду пешком, тут всего три километра. Зато успею купить кофе.
Детский голос для малыша-подкастера
Раздел «Детские», голос «Саша».
Промпт: Всем привет, это подкаст «Мне полтора». Сегодня обсуждаем важное: почему кашу дают, а печенье нет.
Голос деда для говорящего фото
Голос «Иван», нейтральная эмоция, 8 секунд.
Промпт: Здравствуй, внучка. Это я, дед Коля, лето шестьдесят восьмого года. Береги эту фотокарточку, ладно?
MiniMax Speech 2.5 — нейросеть MiniMax для озвучки текста и клона голоса: 34 готовых голоса, семь эмоций и 40 языков в списке. Тегов смеха и вздохов у этой версии нет, зато она спокойно читает длинный ровный текст: аудиогид, урок, объявление.
Мы озвучили в этой версии восемь текстов, от реплики в пару фраз до аудиогида на 708 символов. Каждую запись прогнали через распознавание речи и сверили слова с исходным текстом. Интонацию распознавание не оценивает, поэтому её советуем послушать самим.
Первым взяли текст, на котором уже проверяли MiniMax Speech 2.8: звонок службы доставки с номером заказа, датой, временем, этажом и телефоном. Голос Иван, эмоция «Нейтральная», язык «Русский».
MiniMax Speech 2.5 · модель HD · от 8 ₽ за 1000 символов
MiniMax Speech 2.5 · модель Turbo · от 8 ₽ за 1000 символов
Добрый вечер! Это служба доставки «Тёплый дом». Ваш заказ № 4512 — диван и два кресла — привезём завтра, 3 октября, с 10:00 до 14:00. Подъём на 7-й этаж уже оплачен. Удобно ли вам это время? Если нет, позвоните по номеру 8 800 200-14-07, и мы всё перенесём.
Слова без цифр обе модели прочитали чисто, а на цифрах споткнулись. Распознавание услышало «три октября» и «с десять ноль до четырнадцать ноль». Вместо «седьмой» у HD вышло что-то вроде «семь и этаж», у Turbo — «семый». Ноль в телефоне обе модели проглотили. Ошибки почти те же, что у версии 2.8 на этом тексте, только читает 2.5 быстрее: запись HD длится 23 секунды, у 2.8 в той же модели — 27. Turbo в этот раз вышла даже на две секунды длиннее HD: «быстрее» из подсказки формы — не про темп речи.
Потом мы переписали все числа словами, вместе с нулём в телефоне, и отправили текст в Turbo:
…Ваш заказ номер четыре пятьсот двенадцать — диван и два кресла — привезём завтра, третьего октября, с десяти утра до двух часов дня. Подъём на седьмой этаж уже оплачен. Удобно ли вам это время? Если нет, позвоните по номеру восемь восемьсот двести четырнадцать ноль семь, и мы всё перенесём.
модель Turbo, числа словами
На этот раз распознавание записало дату, время, этаж и телефон слово в слово. Для версии 2.5 это главный совет: всё, что модель должна прочитать в нужном падеже, пишите буквами.
Теги вроде (laughs) и (sighs) появились только в 2.8, но нам было интересно, что 2.5 сделает с ними: прочитает вслух или выбросит. Голос Олеся, модель HD:
(sighs) Опять дождь. Я же говорила, что зонт надо взять. (laughs) Ну ладно, побежали до остановки.
модель HD, голос Олеся, теги в тексте
Английских слов в записи нет, но и звуков на их месте мы не нашли: речь начинается с первой доли секунды, а между «взять» и «Ну ладно» нет паузы длиннее полсекунды. Похоже, модель просто выкинула теги. Заплатите вы за них всё равно, это символы текста. Если персонаж должен смеяться или вздыхать, берите 2.8.
Для начитки побольше мы написали фрагмент аудиогида на 708 символов с четырьмя паузами и отдали его модели Turbo, голос Галина. Запись на 50 секунд была готова через 10 секунд после отправки.
Добро пожаловать в зал старинных часов. <#1.0#> Перед вами напольные часы мастера Фёдора Лаптева, их собрали в Туле почти двести лет назад. Корпус сделан из морёного дуба, а циферблат расписан вручную: присмотритесь, и вы увидите маленький парусник между цифрами. <#1.0#> Когда-то такие часы стояли в купеческих домах и отбивали каждые четверть часа. Хозяева по их бою садились обедать, отправляли детей спать и ждали гостей. <#1.0#> Механизм до сих пор работает. Раз в неделю смотритель музея заводит его длинным ключом, который хранится в ящике под маятником. Если вы задержитесь в зале до полудня, то услышите, как часы бьют двенадцать раз. <#1.5#> А теперь пройдите налево, к витрине с карманными часами.
модель Turbo, голос Галина, 708 символов
Распознавание разобрало все слова, включая «морёного» и «маятником». Паузы сработали, хоть и не по секундомеру: там, где стояло <#1.0#>, тишина длилась от одной до полутора секунд, на месте <#1.5#> — чуть больше полутора. Числа в этом тексте мы сразу написали словами, и сбоев с ними не было.
В списке Язык текста 40 языков. Мы проверили английский: голос Марина, подписанный русским именем, прочитал напоминание из стоматологии, и распознавание записало его без единой ошибки.
Hello! This is a reminder from Green Leaf dental clinic. Your appointment is on Friday at half past three. Please arrive ten minutes early and bring your insurance card.
модель HD, голос Марина, язык «Английский»
Во вкладке Детские семь голосов. Мальчику Артему мы дали обиду на приятеля и эмоцию «Злость»:
Это нечестно! Я первый занял качели, а Петька меня столкнул. Я больше с ним не играю, вот!
Детские, голос Артем, эмоция «Злость»
В поле Режим два варианта. В режиме Озвучить вы выбираете модель HD или Turbo, группу голосов (взрослые, детские или свои), сам голос, эмоцию и язык, вставляете текст до 10 000 символов и нажимаете Отправить. Цена зависит от числа символов и видна на кнопке до запуска. Запись в MP3 появится в ленте под формой. Там есть три кнопки: Скачать, Изменить (текст и настройки вернутся в форму) и Повторить (то же задание запустится ещё раз).
Режим Клонировать голос делает ваш голос по записи. Нужен один файл MP3, WAV или M4A длиной 10–300 секунд и до 5 МБ, название до 12 символов и галочка, что у вас есть право на этот голос. Клон оплачивается один раз и потом выбирается во вкладке Мои голоса в версиях 2.5, 2.6 и 2.8. Сами мы клон для статьи не делали: чужой голос без согласия брать нельзя, а свой в статье не нужен. По шагам клон разобран в инструкции про клонирование голоса.
Записи лежат в Моих результатах 7 дней, удачные лучше перенести в библиотеку или скачать.
Шаблон объявления по этим правилам, вместо «название» впишите своё:
Уважаемые покупатели! <#0.5#> Магазин «название» работает до девяти вечера. Сегодня, двенадцатого октября, на втором этаже открылась выставка детских рисунков. <#1.0#> Спасибо, что вы с нами!
Озвучка оплачивается по числу символов, паузы и пробелы считаются вместе с текстом. Клон голоса оплачивается один раз. Подписки нет.
| Режим | Модель | Объём | Цена |
|---|---|---|---|
| Озвучить | HD | 1000 символов | 15 ₽ |
| Озвучить | Turbo | 1000 символов | 8 ₽ |
| Озвучить | Turbo | 10 000 символов, предел за раз | 80 ₽ |
| Клонировать голос | любая | один голос | 250 ₽ |
От эмоции, языка и ползунков цена не зависит. Для первой пробы хватит одной фразы в Turbo.
Голоса, эмоции, 40 языков, предел в 10 000 символов и клон у трёх версий Speech на сайте одинаковые, формы различаются в двух местах. Версия 2.8 понимает теги смеха и вздохов, а у 2.5 своя цена модели Turbo: сравните версии в таблице ниже, цены в ней обновляются сами. По словам MiniMax, версия 2.6 (октябрь 2025 года) научилась сама читать телефоны, даты и суммы. В русских пробах это подтвердилось только на телефоне +7 (495)… в модели HD: дату, время и сумму 2.6 прочитала с ошибками, а в номере 8 800 200-14-07 потеряла ноль, как 2.5 и 2.8. Так что числа словами пишите в любой версии.
Когда брать 2.5: длинная ровная начитка без смеха и вздохов. Если текст большой, перед запуском сравните в таблице цены модели Turbo. Подробное сравнение трёх версий на одной фразе есть в обзоре нейросетей MiniMax, а сравнение с другими озвучками сайта — в разделе «Озвучка текста».
| Нейросеть | Цена | Чем отличается | Когда брать |
|---|---|---|---|
| MiniMax Speech 2.5 | от 8 ₽ за 1000 символов | без тегов звуков | длинная ровная начитка |
| MiniMax Speech 2.6 | от 10 ₽ за 1000 символов | без тегов; по словам разработчиков, лучше читает числа, у нас по-русски верно вышел только телефон в HD | сообщения с номерами, после пробы на своём тексте |
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | теги смеха, вздоха и кашля | реплики персонажей |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | два голоса в одной записи, метки в квадратных скобках | диалог |
Описание обновлено 2 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.