Озвучивает текст естественной речью одним голосом или как диалог двух собеседников с разными голосами. Цена - 0,007 ₽ за символ текста.
Gemini 3.8 Flash TTS — нейросеть Google для озвучки текста: читает до 5000 символов одним из 30 голосов или собирает диалог двух собеседников из отдельных реплик, и у каждой реплики может быть своя манера. Смех и вздох ставятся тегами прямо в тексте, а язык модель определяет сама.
<laugh> и <sigh>Мы прогнали через Gemini 3.8 Flash TTS семь текстов, от пары фраз до рассказа на 1143 символа, а первый из них для сравнения озвучили ещё и в облегчённой версии Lite. Каждую запись сверили с исходником через распознавание речи. Искали две вещи: всё ли прочитано и не прозвучал ли какой-нибудь тег словом.
Текст с номером заказа, датой, временем и суммой уже звучит на странице версии 3.1, поэтому мы повторили его слово в слово. Голос везде один, Kore.
Gemini 3.8 Flash TTS · Kore
Gemini 3.8 Flash Lite TTS · Kore
Gemini 3.1 Flash TTS · Kore · Русский
Здравствуйте, Ирина Сергеевна! Напоминаем: ваш заказ № 4815 приедет в среду, 14 октября, с 9:30 до 12:00. Сумма к оплате — 2 390 рублей 50 копеек. Курьер позвонит за 20 минут до приезда. Если планы изменились, перенесите доставку в приложении до 23:59 вторника. Хорошего дня!
Все три версии прочитали каждое число, знак № превратился в «номер». Разница в мелочах: обе версии 3.8 произнесли «23:59» со словами «часов» и «минут», а 3.1 по расшифровке назвала просто два числа. По длине записи почти одинаковы, от 26 до 28 секунд. Чем отличаются тембр и интонация, распознавание не скажет, поэтому сравните на слух.
Поле Манера речи задаёт подачу всей записи, поэтому мы дважды озвучили одну и ту же фразу голосом Aoede и между дублями поменяли только это описание, а текст и голос не трогали.
«Шёпотом, взволнованно, будто боится разбудить соседей»
«Громко и восторженно, почти кричит от радости, быстро»
Я открыла письмо и сначала не поверила. Нас взяли на фестиваль, всех шестерых! Значит, в мае мы всё-таки едем в Казань, и репетировать придётся каждый вечер.
Шёпот вышел заметно тише: средняя громкость записи на 12 дБ ниже, чем у восторженной версии. Он и длиннее, 13 секунд против 10. Во втором дубле распознавание поставило восклицательные знаки после «фестиваль» и «шестерых», которых в первом нет, значит, голос там действительно поднимается. Описание подачи модель не произносит, и за него не платят.
Подсказка к полю Текст предлагает два тега на английском в угловых скобках, <sigh> для вздоха и <laugh> для смеха, и ставить их нужно прямо в то место фразы, где должен прозвучать звук.
Знаешь, что сказал мне мастер? <sigh> Что ремонт займёт ещё две недели. Две недели! <laugh> Я уже даже не злюсь, мне просто смешно. Ладно, <sigh> буду дальше готовить на плитке в коридоре.
Один голос · Charon · Манера речи пустая
Ни один тег не прочитан вслух: в расшифровке только русские слова. Зато на месте каждого тега запись растягивается на полторы-две секунды, словно там звучит что-то без слов. Вздох это или смех, проверьте сами, распознавание такие звуки не записывает. Квадратные скобки вроде [sigh], как у версии 3.1, здесь не подсказаны, поэтому мы их не пробовали.
В режиме Диалог текст не пишут одним полем. Реплики добавляют по одной кнопкой Добавить реплику, у каждой выбирают, кто говорит, и при желании заполняют Манеру реплики. Ниже в скобках стоит то, что мы вписали в это поле.
Собеседник 1 (растерянно): Алло, это служба доставки? Мне привезли торт, но на нём написано «С днём рождения, Валера». Собеседник 2 (вежливо и бодро, как оператор колл-центра): Да, всё верно. Заказ на имя Валерия? Собеседник 1 (возмущённо, но сквозь смех): Я Валерия! И мне сегодня сорок лет, а не пять, а на торте нарисован динозавр. Собеседник 2 (сдерживая смех, извиняясь): <laugh> Простите, похоже, торты перепутали. Сейчас заменим, курьер будет через сорок минут. Собеседник 1 (тепло, с улыбкой): Нет-нет, динозавра оставьте. Гостям он уже нравится.
Диалог · Собеседник 1 — Leda, Собеседник 2 — Orus
Пять реплик заняли 29 секунд, голоса чередуются строго по списку. Перед «Простите» полуторасекундная пауза, там стоит тег смеха. Две детали для прослушивания: «Заказ на имя Валерия?» распознавание записало с точкой, то есть вопроса в голосе может не быть, а в последней реплике услышало «динозавр» вместо «динозавра».
Длинный текст мы проверили на рассказе о дежурной по вокзалу в Кандалакше: 1143 символа, пять абзацев, голос Sadaltager.
Один голос · Sadaltager · «Спокойно и тепло, как в аудиокниге, с лёгкой улыбкой в смешных местах»
Файл на 82 секунды пришёл через 45 секунд после отправки. Пропусков нет, «6:40» прочитано как время, кличка хомяка Персик тоже на месте. Паузы между абзацами модель ставит не везде: после первых двух около полутора секунд, а последние два абзаца начинаются сразу за предыдущими. Если нужна тишина, добавьте её при монтаже.
Поля для выбора языка в форме нет, модель определяет его сама. Мы смешали в одном тексте русский, английский и французский.
Друзья, напоминаю: дедлайн по проекту в пятницу. The client wants the final version by noon, so please don't be late. Merci beaucoup, и до встречи в понедельник!
Один голос · Zephyr
Распознавание без подсказки языка записало все три части без ошибок, включая «Merci beaucoup». Акцент на переходах слышно только на слух, его мы оставляем вам.
Сначала выберите Тип генерации. В режиме Один голос весь текст вставляют в поле Текст, до 5000 символов, и выбирают Голос. В режиме Диалог выбирают Голос собеседника 1 и Голос собеседника 2, а затем заполняют Реплики: от двух до пятидесяти, у каждой отмечают, кто говорит. Имена в тексте писать не нужно. Переключатель Голоса сужает список до женских или мужских, а кнопка у каждого голоса проигрывает образец.
Поле Манера речи необязательное: в нём словами описывают тон, эмоцию или темп. Модель слушается описания, но не читает его вслух. Цена зависит только от числа символов, итоговую сумму кнопка Отправить показывает заранее.
Когда запись готова, под формой появится плеер. Скачать сохранит запись в WAV, Изменить вернёт текст и настройки в форму, Повторить сразу запустит то же задание ещё раз, и новый дубль может прозвучать по-другому. В Моих результатах запись хранится 7 дней. Чтобы она не пропала, сохраните её в библиотеку. Как устроены остальные разделы сайта, рассказано в инструкции по сайту.
<laugh> и <sigh> ставьте по одному в нужном месте. Они входят в счёт символов и в цену.Модель читает текст как сценарий, слово в слово, и ничего не пересказывает. Поэтому всё, что должно прозвучать, пишите так, как это скажет человек: числа, даты и время в наших пробах прочитаны верно и цифрами, а вот сокращения вроде «т. е.» или «ул.» мы не проверяли, их надёжнее раскрыть. Длинную фразу лучше разбить на две.
Манеру описывайте как задание актёру: кто говорит, в каком настроении, громко или тихо, быстро или медленно. Пара шаблонов:
Негромко и доверительно, медленнее обычного, как будто читает сказку ребёнку перед сном
Энергично и чётко, с улыбкой, как ведущая утреннего эфира, без лишних пауз
Что мешает чаще всего:
Оплата идёт за символы: в режиме Один голос считается поле Текст, в диалоге — тексты всех реплик вместе, с пробелами и тегами. Голос, режим и описание манеры на цену не влияют.
| Длина текста | Звучит примерно | Цена |
|---|---|---|
| 300 символов, объявление или сторис | 25–30 секунд | 2,10 ₽ |
| 1000 символов, страница доклада | минута с небольшим | 7 ₽ |
| 2500 символов, глава рассказа | около трёх минут | 17,50 ₽ |
| 5000 символов, максимум за запуск | около шести минут | 35 ₽ |
Время звучания мы посчитали по своим пробам: спокойное чтение вышло около 14 символов в секунду. Медленная манера или шёпот растянут запись, а цена останется той же.
У Gemini TTS на сайте четыре версии. Самая близкая к 3.8 — Gemini 3.8 Flash Lite TTS: форма у неё та же, с репликами и угловыми тегами. Google описывает Flash как модель для выразительной игры и длинного чтения, а Lite — для быстрой массовой озвучки. В нашем сравнении выше обе одинаково справились с цифрами, так что для серии однотипных объявлений хватит Lite, а для сценок и рассказов мы бы брали 3.8.
Версию 3.1 стоит выбрать ради ручного выбора языка и шёпота, который ставится меткой прямо в тексте. Если нужны реплики с отдельной манерой, текст длиннее 2500 символов и не хочется следить за именами собеседников в тексте, удобнее 3.8. Все озвучки сайта на одной и той же фразе сравнивает статья о нейросетях для озвучки текста, а остальные модели Google собраны в обзоре нейросетей Google.
| Нейросеть | Цена | За раз | Чем отличается |
|---|---|---|---|
| Gemini 3.8 Flash TTS | 7 ₽ за 1000 символов | 5000 символов | реплики диалога по одной со своей манерой, теги <laugh> и <sigh>, язык определяет сама |
| Gemini 3.8 Flash Lite TTS | 5 ₽ за 1000 символов | 5000 символов | та же форма, облегчённая версия для потока однотипной озвучки |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | 2500 символов | метки в квадратных скобках, выбор из 24 языков и автоопределение, вариативность |
| Gemini 2.5 Flash TTS | 4 ₽ за 1000 символов | 4000 символов | те же 30 голосов, выбор из 24 языков, диалог по именам в тексте, файл MP3 |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 символов | 64 голоса, теги в квадратных скобках, без режима диалога |
Описание обновлено 2 октября 2026 г.