Озвучивает текст естественной речью одним голосом или как диалог двух собеседников с разными голосами. Цена - 0,008 ₽ за символ текста.
Gemini 3.1 Flash TTS — нейросеть Google для озвучки текста: читает его одним из 30 голосов или разыгрывает диалог двух собеседников. Тон, темп и настроение задают обычными словами, а вздох, смех и шёпот — метками прямо в тексте. Русский язык в форме выбран заранее.
Мы озвучили восемь текстов, от двух фраз до рассказа на две минуты, и каждую запись сверили с исходником через распознавание речи.
В объявлениях и напоминаниях сплошь цифры. Мы собрали в одну фразу номер заказа, дату, время и сумму с копейками.
Здравствуйте, Ирина Сергеевна! Напоминаем: ваш заказ № 4815 приедет в среду, 14 октября, с 9:30 до 12:00. Сумма к оплате — 2 390 рублей 50 копеек. Курьер позвонит за 20 минут до приезда. Если планы изменились, перенесите доставку в приложении до 23:59 вторника. Хорошего дня!
Один голос · Kore · Русский
По расшифровке знак № прочитан как «номер», «9:30» — как время, и ни одно число не потерялось. Окончания распознавание не проверит, их послушайте сами.
Поле Манера речи работает как ремарка режиссёра. Одну фразу мы озвучили голосом Sulafat дважды, поменяв только описание.
«Грустно и тихо, медленно, с паузами, будто говорит сама с собой»
«Весело и бодро, с улыбкой, быстро, как будто рассказывает подруге хорошую новость»
Ну вот и всё. Последняя коробка уехала, ключи сданы, а квартира, где мы прожили восемь лет, теперь чужая. Странно: я думала, что буду плакать, а мне почему-то смешно.
Разницу видно даже по длине. Грустная версия тянется 27 секунд, а весёлая укладывается в 12. В первой модель ещё и сама расставила паузы почти после каждой запятой. Самая длинная, в три секунды, стоит перед словом «Странно». Описание подачи не озвучивается и в цену не входит.
Чтобы настроение менялось посреди текста, в нужное место ставят английскую метку в квадратных скобках. Подсказка к полю Текст предлагает четыре: [sigh] — вздох, [laughing] — смех, [whispering] — шёпот, [short pause] — короткая пауза. Там же сказано, что метки понимаются по смыслу, так что подойдут и [sighs], [laughs] или [whispers].
Слушай, я тебе сейчас кое-что скажу, только никому. [whispering] Шеф уходит в пятницу. [short pause] Да-да, серьёзно. [laughing] Я сама сначала не поверила! [sigh] Теперь вся отчётность на мне.
Один голос · Despina · Русский, поле подачи пустое
Ни одна метка не прозвучала словом, в расшифровке только русский текст. Слышны ли на своих местах шёпот, смех и вздох, распознавание не скажет: это место стоит послушать самим. В счёт знаков метки входят.
В режиме Диалог реплики не нужно склеивать вручную: строки начинаются с имени, а голос каждому собеседнику выбирают в форме.
Марина: Это подкаст «Кухня без паники», выпуск двадцать третий. Со мной Глеб, и сегодня он признается, почему у него третий раз подряд сгорел пирог. Глеб: [sigh] Я не признаюсь, я жалуюсь. Духовка врёт на сорок градусов! Марина: А термометр ты купил? Глеб: Купил. За 790 рублей. И он показывает, что духовка права. [laughing] Марина: Значит, дело не в духовке. Глеб: Значит, дело в пироге.
Диалог · Марина (Achernar) и Глеб (Charon) · Русский
Подачу мы описали так: «Лёгкий разговорный подкаст, дружеская подача, без дикторской интонации». Голоса чередуются строго по строкам, все реплики распознались, файл на 26 секунд пришёл через 16.
Для смешанного текста в поле Язык озвучки есть вариант Определить автоматически. Мы вставили в рабочее сообщение английскую и немецкую фразы.
Коллеги, встреча в Берлине переносится на четверг. Please confirm by Friday, if you can join. Danke schön und bis bald! Презентацию я пришлю вечером.
Один голос · Charon · Определить автоматически
Английскую фразу распознавание записало слово в слово, а в немецкой вместо «und» услышало русское «и». Это место около седьмой секунды стоит послушать самим.
Последняя проба — рассказ о журнале смотрителя маяка.
Один голос · Iapetus · 1414 знаков · «Спокойно и тепло, как в аудиокниге, без спешки»
Рассказ прочитан без пропусков, между абзацами паузы около секунды. К концу модель немного разгоняется: последняя четверть звучит быстрее первой. А в слове «краеведческом» на 1:51 распознавание дважды услышало «краевическом», так что длинные редкие слова лучше переслушать.
Выберите Тип генерации: Один голос читает весь текст, Диалог делит его между двумя собеседниками. Вставьте в поле Текст до 2500 знаков. В диалоге каждая реплика начинается с имени и двоеточия («Анна: Привет!»), а имена совпадают с полями Имя первого собеседника и Имя второго собеседника.
Затем выберите язык и голос: образец каждого голоса играет прямо в форме, а переключатель Голоса оставит только женские или мужские. Подачу можно описать в поле Манера речи. Сколько спишется, написано на кнопке Отправить.
Через несколько секунд под формой появится плеер. Скачать сохраняет MP3, Изменить подставит текст и настройки обратно в форму, Повторить сразу запускает озвучку ещё раз, и дубль может прозвучать иначе. Запись лежит в Моих результатах 7 дней, и чтобы она не пропала, сохраните её в библиотеку. Об остальных разделах сайта — в инструкции по сайту.
Пишите под слух. Цифры, даты и время можно оставить цифрами, в нашем напоминании они прочитаны без потерь, а вот сокращения вроде «ул.» и «т. е.» мы не проверяли, поэтому надёжнее писать их полностью и разбивать длинные фразы на короткие предложения с ясной пунктуацией. Подачу описывайте как задачу актёру: настроение, темп, ситуация.
Устало и негромко, чуть медленнее обычного, как будто рассказывает соседу о долгом дне
Частые ошибки:
Платите за знаки в поле Текст, включая пробелы и метки. Голос, язык, режим и описание подачи на цену не влияют, подписки нет.
| Длина текста | Звучит примерно | Цена |
|---|---|---|
| 250 знаков, короткое объявление | 25 секунд | 2 ₽ |
| 1000 знаков, полстраницы | полторы минуты | 8 ₽ |
| 2500 знаков, максимум за запуск | 3,5 минуты | 20 ₽ |
Время звучания — по нашим пробам в спокойном темпе. С паузами запись выйдет длиннее, а цена останется той же.
На сайте есть и другие Gemini TTS, различия по форме собраны в таблице. Сравнение с остальными озвучками на одной фразе есть в разделе нейросетей для озвучки текста, все модели Google — в обзоре нейросетей Google.
| Нейросеть | Цена | За раз | Чем отличается |
|---|---|---|---|
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | 2500 знаков | метки в квадратных скобках, 24 языка и автоопределение |
| Gemini 2.5 Flash TTS | 4 ₽ за 1000 символов | 4000 знаков | те же 30 голосов, диалог и 24 языка, но без автоопределения |
| Gemini 3.8 Flash TTS | 7 ₽ за 1000 символов | 5000 знаков | реплики диалога вводятся по одной, звуки тегами <laugh> и <sigh>, языка в форме не выбрать |
| Gemini 3.8 Flash Lite TTS | 5 ₽ за 1000 символов | 5000 знаков | та же форма, что у 3.8, облегчённая версия |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 знаков | 64 голоса и выбор подачи, без режима диалога |
Описание обновлено 1 октября 2026 г.
Сценка на два голоса: бабушкины часы снова пошли
Промпт: Вера: Дима, иди сюда! Бабушкины часы снова пошли. Дима: [whispers] Не может быть. Они же стояли с две тысячи девятого года. Вера: Стояли. А сегодня в семь пятнадцать взяли и затикали! [laughs] Дима: [sighs] Ну всё. Теперь они будут будить нас каждый час.