Озвучивает текст живыми голосами с паузами, шёпотом, смехом и другими интонационными вставками. Цена - 0,003 ₽ за символ.
Объявление ярмарки: пауза, смех и шёпот тегами
Промпт: Друзья, [pause] 12 октября в парке — Медовая ярмарка! [laugh] Липовый, гречишный, цветочный — пробуйте с каждой ложки. <whisper>А самый тягучий мёд мы припрятали до обеда.</whisper> [pause] Вход свободный, приходите всей семьёй!
Пауза, смех и шёпот тегами
Голос Eve, язык Русский. Теги [pause], [laugh], <whisper> и <emphasis> прямо в тексте.
Промпт: Знаете, каким был мой первый торт? [pause] Он провалился. Прямо в середину. [laugh] Но я всё равно подала его гостям. <whisper>И никто ничего не заметил.</whisper> С тех пор я точно знаю: <emphasis>крем спасает всё</emphasis>.
xAI TTS v1 — озвучка Grok: нейросеть xAI, создателей чат-бота Grok, читает текст одним из 28 голосов, а шёпот, смех, вздох, паузу и даже пение задают короткие теги прямо в тексте. Русский и ещё 15 языков, до 15 000 символов за раз — хватит и на объявление, и на главу рассказа.
Голос Grok для своего ролика или объявления здесь получают файлом: xAI выпустила озвучку отдельной моделью, без чат-бота. Для статьи мы озвучили в xAI TTS v1 тринадцать текстов, от фразы в полторы сотни символов до рассказа почти на девятьсот. Короткие приходили за 8–16 секунд, рассказ за 24. Нас интересовало, на что способна озвучка Grok по-русски: где модель шепчет, смеётся и замедляется по тегам, а заодно как она читает обычный текст с цифрами и английскими словами. Все записи мы прогнали через распознавание речи: оно показывает, все ли слова на месте и где модель держала паузу. Интонацию так не измерить, поэтому слушайте сами, плееры ниже. Все тринадцать проб вместе стоили дешевле одной полной записи на 15 000 символов.
У каждого голоса в форме есть русский образец, одна и та же фраза-приветствие. Мы дали четырём голосам свою фразу, с вопросом выбора и маленькой шуткой в конце: два женских голоса и два мужских.
xAI TTS v1 · голос Eve · 3 ₽ за 1000 символов
xAI TTS v1 · голос Ara · 3 ₽ за 1000 символов
xAI TTS v1 · голос Rex · 3 ₽ за 1000 символов
xAI TTS v1 · голос Sal · 3 ₽ за 1000 символов
Каждое утро я прохожу мимо этой булочной и каждый раз обещаю себе не заходить. Сегодня меня хватило ровно на четыре шага. Круассан того стоил, честно.
Все четыре прочитали фразу без пропусков и уложились в 9,5–10,5 секунды. Eve, голос по умолчанию, читает чуть медленнее остальных. Ara звучит выше всех, Rex ниже всех: средний тон у него вдвое ниже, чем у Ara. Sal тоже мужской, но заметно светлее Rex.
Здесь почти все приёмы детской сказки сразу. Голос Luna.
<slow>Жил-был ёжик, который боялся темноты.</slow> [sigh] Каждый вечер он брал фонарик и считал звёзды: одна, две, три… [giggle] А однажды звёзды начали считать его. <whisper>Тише, он уже засыпает.</whisper> [hum-tune]
xAI TTS v1 · голос Luna, язык «Русский», 218 символов · 3 ₽ за 1000 символов
Ни один тег не прозвучал словами. Первую фразу в <slow> модель прочитала примерно на пятую часть медленнее следующей. Вздох и смешок заняли по 0,7 секунды между словами, а напев после последней фразы длится почти две секунды. Шёпот слышно сразу: эта фраза тише остальных в несколько раз.
Манеры чтения задают парными тегами: начало перед куском текста, конец после него. Голос Rex.
<build-intensity>Мяч у десятого номера, он обходит одного, второго, выходит один на один и бьёт!</build-intensity> [pause] <loud>Го-о-ол!</loud> [laugh] <slow>Девяностая минута.</slow> <soft>Трибуны просто не верят своим глазам.</soft>
xAI TTS v1 · голос Rex, язык «Русский», 235 символов · 3 ₽ за 1000 символов
«Гол» вышел громче и выше остального, с протяжным «о», а распознавание записало его большими буквами. Дальше три секунды без слов на месте [laugh]: смех распознавание не записывает, его послушайте сами. Последняя фраза в <soft> тише и ниже. А вот <slow> на двух словах «Девяностая минута» мы почти не услышали: замедление заметнее на целом предложении, как в сказке выше.
Сценку на двоих можно озвучить одним голосом: реплики ребёнка обёрнуты в <higher-pitch>, а мамины стоят внутри <lower-pitch>. Голос Ara.
— <higher-pitch>Мам, а можно ещё пять минуточек?</higher-pitch> [pause] — <lower-pitch>Пять минут назад тоже было «ещё пять минуточек».</lower-pitch> [pause] — <higher-pitch>Ну ма-ам!</higher-pitch> [pause] — <lower-pitch><emphasis>Встаём.</emphasis></lower-pitch>
xAI TTS v1 · голос Ara, язык «Русский», 264 символа · 3 ₽ за 1000 символов
Разница большая: «ребёнок» говорит почти на октаву выше «мамы». Для настоящего диалога двух разных голосов удобнее Gemini 3.1 Flash TTS, а для шутки или короткой сценки хватит и этого приёма.
Тег <singing> просит спеть кусок текста, с <sing-song> он звучит нараспев, как детская считалка. Голос Celeste.
Утро понедельника. [sigh] <singing>Будильник прозвенел, а я опять проспал, и кофе убежал, и тапок не достал.</singing> [laugh] <sing-song>Ну и ладно, ну и ладно, всё равно сегодня пятница!</sing-song> [pause] Ой. Нет. Понедельник.
xAI TTS v1 · голос Celeste, язык «Русский», 230 символов · 3 ₽ за 1000 символов
Слова в поющих строчках распознавание разобрало целиком, а тянет их модель заметно дольше обычной речи. Это напев голосом без музыки, не песня. Готовый трек с мелодией и аккомпанементом делают музыкальные нейросети, например Suno.
Длинный текст с диалогом мы дали без единого тега, голосом Orion: 898 символов.
Поезд пришёл на станцию в половине шестого утра, когда над лесом только начинало светлеть. Андрей вышел на пустую платформу с одним рюкзаком и сразу пожалел, что не взял тёплую куртку… — Ну здравствуй, городской, — сказал он, тормозя ногой. — Чего стоишь? Самовар стынет.
xAI TTS v1 · голос Orion, язык «Русский», 898 символов · 3 ₽ за 1000 символов
Запись длится 59 секунд, все предложения на месте и идут по порядку. Распознавание споткнулось на двух словах, например услышало «лед» вместо «дед». Такие места стоит переслушать, прежде чем ставить запись в ролик. По этой пробе 1000 символов дают чуть больше минуты речи.
Вставьте текст в поле Текст, выберите голос и язык и нажмите Отправить: цена зависит от числа символов, теги считаются вместе с буквами, а сумма видна на кнопке ещё до запуска. Через несколько секунд запись появится в ленте под формой. Кнопка Скачать сохраняет MP3, Изменить возвращает текст и настройки в форму, чтобы поправить их, а Повторить сразу запускает то же задание ещё раз.
Подачу задают теги двух видов. Звук ставят в нужное место текста в квадратных скобках: [pause] делает паузу, [laugh] вставляет смех, [sigh] вздох. Манеру чтения задают парным тегом в угловых скобках вокруг куска текста: <whisper>…</whisper> читается шёпотом. Полный список открывается подсказкой у поля Текст. Записи хранятся в Моих результатах 7 дней, удачные стоит сохранить в библиотеку.
Удобный порядок: сначала текст с обычной пунктуацией, потом 2–4 звука там, где их издал бы живой человек, и одна-две манеры на целые фразы. По словам xAI, парные теги лучше работают вокруг законченной фразы, а не одного слова. Это совпало с нашим комментатором: два слова в <slow> почти не замедлились.
Шаблоны, в которые остаётся подставить свои слова:
Друзья, [pause] в эту субботу у нас открытие! [laugh] Первые сто гостей получат кофе бесплатно. <whisper>А кто придёт до десяти, получит ещё и круассан.</whisper> Ждём вас!
<soft>Закройте глаза и сделайте глубокий вдох.</soft> [inhale] [exhale] <slow>Почувствуйте, как расслабляются плечи.</slow> [long-pause] Ещё раз.
<build-intensity>До старта распродажи осталось три дня, два, один…</build-intensity> [pause] <loud>Начали!</loud>
Напоминание из салона мы написали цифрами: дата, время, цена и телефон. Голос Ara.
Здравствуйте! Это салон «Ножницы». Напоминаем: вы записаны на стрижку в субботу, 18 октября, в 11:30. Мастер — Ольга, стоимость — 1 800 рублей. Если не получается прийти, позвоните по номеру 8 912 405-07-33 или ответьте на это сообщение до 20:00 пятницы.
xAI TTS v1 · голос Ara, язык «Русский», 254 символа · 3 ₽ за 1000 символов
По распознаванию дата прозвучала в нужном падеже, «восемнадцатого октября», время как «одиннадцать тридцать», а ноль в телефоне модель назвала словом. Цену она прочитала как «одна тысяча восемьсот», а «20:00» как «двадцати ноль ноль». Ошибки тут нет, но живой человек сказал бы «тысяча восемьсот» и «до восьми вечера». Хотите так — напишите словами.
Английские слова внутри русского текста модель произносит по-английски и с выбранным языком «Русский»:
Созвон в Zoom перенесли на четверг: дедлайн по iPhone-версии сдвинулся, а фидбек от product manager мы так и не получили. Update пришлю в Slack, как только будет понятно с релизом.
xAI TTS v1 · голос Leo, язык «Русский», 180 символов · 3 ₽ за 1000 символов
Zoom, iPhone, Slack и product manager распознавание записало латиницей, так их и слышно. Тот же текст с «Определить автоматически» прозвучал почти так же и на секунду дольше, так что переключать язык ради пары слов не нужно.
Больше всего портит запись избыток тегов. Мы поставили десять тегов на две короткие фразы, и последние два слова растянулись почти на три секунды:
[cough] Простите. [yawn] Совсем не выспалась. [laugh] <whisper>Ладно,</whisper> [sigh] <emphasis>начинаем</emphasis> [pause] <fast>планёрку</fast> [giggle] <loud>прямо</loud> [breath] <slow>сейчас</slow>.
xAI TTS v1 · голос Eve, 10 тегов на две фразы · 3 ₽ за 1000 символов
В этом же тексте есть вторая ошибка: [cough] и [yawn] нет в подсказке формы. Вслух модель их не произнесла, но что она с ними сделала, мы не знаем, поэтому надёжнее брать теги из списка. И третья, частая при ручной разметке: забытый закрывающий тег. Без </whisper> непонятно, где шёпот кончается, так что перед запуском проверьте пары.
Платите за символы текста, теги тоже считаются. Голос и язык на цену не влияют, подписки нет.
| Объём | Примерно речи | Цена |
|---|---|---|
| 300 символов | 20 секунд, короткое объявление | 0,90 ₽ |
| 1000 символов | минута с небольшим | 3 ₽ |
| 15 000 символов, максимум за раз | около четверти часа | 45 ₽ |
Для первой пробы голоса хватит одной фразы: в наших сравнениях это было 150 символов, около десяти секунд речи.
Как выбрать озвучку под задачу и подготовить текст, по шагам разобрано в инструкции по озвучке текста.
У xAI на сайте одна озвучка, другие её нейросети рисуют картинки и снимают видео, о них рассказывает обзор нейросетей Grok. Если не подходят голоса или нужен клон, посмотрите эти озвучки, а одну фразу во всех озвучках сайта можно сравнить в разделе «Озвучка текста».
| Нейросеть | Цена | За раз | Чем отличается |
|---|---|---|---|
| xAI TTS v1 | 3 ₽ за 1000 символов | 15 000 | теги звуков и манер, 28 голосов |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 | 64 голоса, эмоции тегами в квадратных скобках |
| ElevenLabs Eleven v4 | 12 ₽ за 1000 символов | 5000 | теги эмоций и звуков окружения, 36 языков |
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | 10 000 | эмоция на всю запись, детские голоса, клон |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | 2500 | диалог двух голосов, манера словами |
| Премиум | 1 ₽ за 1000 символов | 10 000 | русские дикторы, ровное чтение |
Описание обновлено 2 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.