Быстро озвучивает текст одним голосом или как диалог двух собеседников с разными голосами. Цена - 0,005 ₽ за символ текста.
Gemini 3.8 Flash Lite TTS — облегчённая модель озвучки от Google: читает текст одним из 30 голосов или разыгрывает диалог двух собеседников. Форма и голоса у неё те же, что у полной версии 3.8, а сама Lite рассчитана на поток однотипной озвучки: объявления, напоминания, уроки.
Все записи ниже сделаны в Gemini 3.8 Flash Lite TTS прямо в форме этой страницы. Каждую мы расшифровали распознаванием речи и сравнили с исходником, а длительность и паузы замерили по файлу.
Первая проба — автоматическое сообщение клиники. В нём есть всё, на чём озвучка обычно спотыкается: номер дома, дата, время через двоеточие, сумма с пробелом внутри и английское слово.
Добрый день! Это стоматология «Белый клык» на Садовой, 17. Алексей Петрович, напоминаем: вы записаны к доктору Смирновой на пятницу, 16 октября, в 18:45. Приём займёт около 40 минут, консультация стоит 1 250 рублей. Пароль от Wi-Fi в холле — на стойке администратора. Если не сможете прийти, ответьте на это сообщение цифрой 2 до 12:00 четверга. Спасибо!
Один голос · Schedar · Манера речи пустая
Распознавание нашло в записи все числа: «18:45» прозвучало как время, «12:00» как «12 часов», а слово Wi-Fi не исказилось. Между предложениями модель сама оставила паузы примерно по 0,7 секунды, так что 354 знака заняли 26 секунд. Падежи распознавание не проверяет, их стоит послушать.
Текст из поля Манера речи модель не произносит, а берёт как ремарку в сценарии. Эту ремарку мы проверили на вокзальном объявлении: озвучили его голосом Achird дважды, изменив только подсказку.
«Спокойно и чётко, как диктор на вокзале, ровный темп»
«Взволнованно и быстро, как будто сам опаздывает на этот поезд и говорит на бегу»
Поезд номер сто сорок два Москва — Казань прибывает на третий путь. Нумерация вагонов начинается с головы поезда. Стоянка поезда — пятнадцать минут.
Спокойный диктор говорил 12,8 секунды, торопливый уложился в 6,4. Слова в обеих записях одни и те же, ни одно не съедено. В нашей пробе подсказку о темпе Lite выполнила точно, так что для серии объявлений подсказку можно подобрать один раз и дальше не менять.
Звуки ставят английскими тегами в угловых скобках прямо в текст: подсказка формы предлагает <sigh> (вздох) и <laugh> (смех).
Представляешь, мне сегодня перезвонили из того самого издательства. <sigh> Я уже думала, что всё, забыли. А они говорят: рукопись берём, но просим сократить на треть. <laugh> На треть! Это же целых сто двадцать страниц. Ладно, вечером сяду и начну резать.
Один голос · Leda · Манера речи пустая
Теги словами не прозвучали: в расшифровке только русский текст. Восклицание «На треть!» распознавание записало с вопросительным знаком: похоже, модель прочитала его как переспрос, и для этой реплики так даже живее. Смех и вздох распознавание не ловит, поэтому места после «издательства» и перед «Ладно» лучше послушать самим. Теги входят в счёт знаков.
В режиме Диалог каждая реплика занимает отдельную строку формы: выбираете, кто говорит, пишете текст и при желании манеру именно этой реплики.
1 (удивлённо): Геннадий Иванович, это ваш кот опять сидит у меня на коврике? 2 (устало): Мой. <sigh> Третий раз за неделю сбегает, я уже и дверь не закрываю. 1 (с подозрением): Так он же у вас рыжий был, а этот серый! 2 (смущённо): <laugh> Он в подвале сидел. Отмоется — порыжеет. 1 (со смехом): Забирайте своего хамелеона. И миску мою верните, он из неё со вторника ест. 2 (тепло, примирительно): Верну, верну. Завтра в восемь занесу, вместе с пирогом.
Диалог · Собеседник 1: Aoede, Собеседник 2: Algenib · 6 реплик
Цифра в начале строки — собеседник, в скобках — Манера реплики, общую Манеру речи мы описали как «живой бытовой разговор двух соседей на лестничной клетке». Голоса чередуются строго по репликам: мы замерили высоту тона, и в каждой строке первого собеседника она выше, чем у второго. В последней реплике распознавание услышало «завтра восемь занесу» без «в», это место на 25-й секунде стоит переслушать.
Поля для языка в форме нет, Lite определяет его сама. Мы проверили это на уроке английского, где русские и английские предложения идут вперемешку.
Друзья, урок английского начинаем с повторения. Повторяйте за мной: Could you tell me the way to the station, please? А теперь вежливый ответ: Sure, go straight and turn left at the bank. Отлично, у вас получается!
Один голос · Puck · Манера речи пустая
Обе английские фразы распознаны слово в слово, русские тоже. Акцента при переходе с языка на язык мы по расшифровке оценить не можем, это вопрос к собственным ушам.
Последняя проба — семейная история про крыжовниковое варенье, около страницы обычного текста одним запуском.
Один голос · Vindemiatrix · «Тепло и спокойно, как в аудиокниге, с лёгкой улыбкой, без спешки»
Вышло 2 минуты 18 секунд, и файл пришёл примерно через 40 секунд после отправки. Пропусков нет: 34 фрагмента расшифровки совпали с текстом. Перед новым абзацем модель держит паузу около секунды, а короткие фразы вроде «Мы гадали годами» отделяет сама, хотя мы ничего не размечали.
На сайте у обеих одна и та же форма: те же 30 голосов, режим Диалог до 50 реплик, теги <laugh> и <sigh>, одинаковый предел длины. Различаются модели внутри. Google называет полную версию моделью для тонкой актёрской игры: аудиокниг, подкастов, сложных диалогов. Lite разработчик предлагает для больших объёмов: массовой озвучки, чтения вслух, голосовых помощников, обычной речи одним голосом.
Цены обеих видны в таблице в конце статьи.
Чтобы услышать разницу, мы отправили фразу про издательство тем же голосом Leda в полную версию.
Gemini 3.8 Flash Lite TTS · Gemini 3.8 Flash Lite TTS · Leda · 5 ₽ за 1000 символов
Gemini 3.8 Flash TTS · Gemini 3.8 Flash TTS · Leda · 7 ₽ за 1000 символов
Полная версия читала медленнее: 21,4 секунды против 18,7 у Lite. После «издательства», где стоит вздох, она держит паузу почти в секунду, у Lite там всего треть секунды. Текст обе прочитали целиком.
Для объявлений, уроков и спокойного чтения нам хватило Lite. Сценку, где важны оттенки игры, и длинный художественный текст мы бы сначала послушали в обеих: для таких задач Google сама советует полную версию.
Всё начинается с переключателя Тип генерации. В режиме Один голос модель читает всё, что вставлено в поле Текст. Диалог собирается из реплик: у каждой выбираете, кто говорит (Собеседник 1 или 2), и пишете её текст, а голоса собеседников задаются выше, в полях Голос собеседника 1 и Голос собеседника 2. Реплик от 2 до 50, в сумме до 5000 знаков, как и у одного голоса.
Голос выбирают на слух: у каждого из 30 вариантов есть кнопка воспроизведения образца. Переключатель Голоса оставит только женские или только мужские, а тон и темп можно описать в необязательном поле Манера речи. Цену покажет кнопка Отправить.
Когда запись готова, под формой появляется плеер и три кнопки. Скачать сохраняет WAV. Изменить подставляет в форму прежний текст с настройками, чтобы поправить реплику, а Повторить без правок отправляет то же задание заново, и дубли звучат немного по-разному. Запись лежит в Моих результатах 7 дней, нужную перенесите в библиотеку.
Пишите так, как текст должен звучать вслух. Цифры, даты и время модель в наших пробах прочитала верно, но если важно склонение («до двенадцати часов»), проще написать его словами. Длинные предложения разбейте точками: в наших записях заметные паузы стояли именно на них. Подсказку к подаче составляйте как ремарку для актёра:
Негромко и доверительно, чуть медленнее обычного, как будто рассказывает подруге секрет на кухне
Типичные промахи:
<laugh> и <sigh>.Оплачиваются знаки текста вместе с пробелами и тегами, а в диалоге считается сумма всех реплик. Голос, режим и подсказки к подаче цену не меняют.
| Длина текста | Звучит примерно | Цена |
|---|---|---|
| 300 знаков, короткое объявление | 20–25 секунд | 1,50 ₽ |
| 1000 знаков, полстраницы | 1 минута 15 секунд | 5 ₽ |
| 5000 знаков, предел одного запуска | около шести минут | 25 ₽ |
Длительность — по нашим записям в спокойном темпе. Если попросить говорить быстрее, запись станет короче, а цена останется прежней.
В таблице — все версии Gemini TTS на сайте и одна озвучка другого разработчика. Сравнение озвучек на одной фразе есть в статье о нейросетях для озвучки текста, остальные модели Google — в обзоре нейросетей Google.
| Нейросеть | Цена | Знаков за раз | Когда брать |
|---|---|---|---|
| Gemini 3.8 Flash Lite TTS | 5 ₽ за 1000 символов | 5000 | поток объявлений и напоминаний, уроки, диалоги без сложной игры |
| Gemini 3.8 Flash TTS | 7 ₽ за 1000 символов | 5000 | та же форма; сценки, рассказы и аудиокниги, где важны оттенки игры |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | 2500 | нужен выбор языка в форме и метки в квадратных скобках |
| Gemini 2.5 Flash TTS | 4 ₽ за 1000 символов | 4000 | выбор из 24 языков, диалог одним текстом с именами, файл MP3 |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 | другой набор голосов, без режима диалога |
Описание обновлено 2 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.