Озвучивает текст естественным голосом - одним диктором или как диалог двух собеседников с разными голосами. Цена - от 0,20 ₽ за озвучку, дальше 0,04 ₽ за каждые 10 символов.
Сценка на два голоса: «три тома»
Тип генерации «Диалог»: Анна (Kore) и Олег (Puck), язык Русский, манера речи описана словами.
Промпт: Анна: Олег, ты опять купил три книги? Мы же договаривались: одна в месяц! Олег: Это не три. Это одна книга… в трёх томах. Анна: Очень смешно. И куда мы их поставим? Полка уже гнётся. Олег: Я всё продумал. Под кровать! Там ещё полно места. Анна: Под кровать… Ладно. Но четвёртый том выбираю я. Олег: Договорились. Кстати, он выходит в пятницу.
Gemini 2.5 Flash TTS — нейросеть Google для озвучки текста: читает его одним из 30 голосов или разыгрывает диалог двух собеседников. За один запуск берёт до 4000 знаков, около пяти с половиной минут речи, а язык произношения выбирают из 24 вариантов.
Пять записей в Gemini 2.5 Flash TTS мы сделали сами, шестую взяли из готовых примеров на странице нейросети. Каждую прогнали через распознавание речи и сверили с исходным текстом, а темп посчитали по длительности файла.
Сначала мы проверили длинный текст. Написали аудиоэкскурсию по выдуманной набережной на 3512 знаков: восемь абзацев с годами, расстояниями и именами — и отправили её целиком.
Один голос · Gacrux · Русский · 3512 знаков
Манеру речи описали так: «Спокойно и дружелюбно, как экскурсовод на прогулке: без спешки, с небольшими паузами между абзацами». Файл на 4 минуты 51 секунду пришёл примерно через три минуты. Темп почти ровный: первые три четверти около 12 знаков в секунду, последняя — около 14. Между абзацами модель держит паузу 0,7–0,9 секунды, годы вроде «1898» и «4 метра 20 сантиметров» распознались без потерь.
Четыре слова распознавание записало с ошибкой: «летейщик» вместо «литейщик» на 0:26, «у спуску» на 2:20, «со сетрами» на 3:00 и «старей» на 3:12. Виновата модель или само распознавание, по тексту не понять. Если запись пойдёт в публикацию, переслушайте эти места.
На сокращениях озвучка спотыкается чаще всего. Мы набили ими приветствие мастерской: «ул.», «д.», «стр.», «сб.», «вс.», «мин.», «руб.» и «т. е.».
Добрый день! Вас приветствует мастерская «Добрый ключ». Мы находимся по адресу: ул. Садовая, д. 14, стр. 2, вход со двора. Работаем ежедневно с 10:00 до 20:00, в сб. и вс. — до 18:00. Изготовление ключа занимает 15–20 мин., т. е. можно подождать на месте. Заточка ножей — 350 руб. за штуку. Чтобы записаться, нажмите 1, чтобы поговорить с мастером — 2.
Один голос · Charon · Русский
«Улица», «дом», «минут», «рублей» и «то есть» модель развернула сама. А дни недели, судя по расшифровке, так и прочитала буквами: распознавание записало «в СБ и ВС». На месте «стр.» оно услышало «строй», это около восьмой секунды. Вывод простой: дни недели и редкие сокращения пишите полностью.
Поле Манера речи не озвучивается, это подсказка, как читать. Для сказки на ночь мы попросили голос Leda звучать «как ведущая детской радиопередачи перед сном: ласково, неторопливо, с улыбкой, на вопросах интонация вверх».
Жил-был ёжик по имени Тимофей, и больше всего на свете он боялся темноты. Каждый вечер он спрашивал маму: «А что там, за кустом?» А мама отвечала: «Там спят светлячки. Хочешь, разбудим одного?» И вот однажды Тимофей решился. Он подошёл к кусту, тихонько постучал по листику — и куст засветился сразу сотней маленьких фонариков.
Один голос · Leda · Русский · с манерой речи
Слово «неторопливо» сработало: 327 знаков растянулись на 34 секунды, около 9,5 знака в секунду. Автоответчик выше, где подсказки не было, читался заметно быстрее. Поднимается ли голос на вопросах, распознавание не покажет, это стоит послушать.
Этот пример уже лежит на странице нейросети. В режиме Диалог текст пишется одним куском, каждая строка начинается с имени: голоса здесь стоят по умолчанию, Kore у Анны и Puck у Олега.
Анна: Олег, ты опять купил три книги? Мы же договаривались: одна в месяц! Олег: Это не три. Это одна книга… в трёх томах. Анна: Очень смешно. И куда мы их поставим? Полка уже гнётся. Олег: Я всё продумал. Под кровать! Там ещё полно места. Анна: Под кровать… Ладно. Но четвёртый том выбираю я. Олег: Договорились. Кстати, он выходит в пятницу.
Диалог · Анна (Kore) и Олег (Puck) · Русский
Манера речи: «Живой бытовой разговор: Анна притворно сердится, Олег оправдывается с улыбкой». Все шесть реплик распознались, голоса ни разу не перепутались: высота голоса у строк Анны около 230–255 Гц, у Олега 125–145 Гц. Вся сценка — 26 секунд.
Тот же режим годится для учебных диалогов. Мы выбрали в Языке озвучки «Английский (США)», назвали собеседников Teacher и Student и дали им голоса Sulafat и Fenrir.
Teacher: Good morning! What did you do last weekend? Student: I... went to the park with my brother. Teacher: Great. And what did you do there? Student: We played football and ate ice cream. Teacher: Very good! Now ask me the same question. Student: What did you do last weekend? Teacher: I stayed at home and read a book.
Диалог · Teacher (Sulafat) и Student (Fenrir) · Английский (США)
Подсказку к подаче написали по-английски: учитель говорит медленно и чётко, ученик отвечает неуверенно. Распознавание записало все семь реплик слово в слово, а между большинством реплик модель оставила паузы около полусекунды.
Подсказка формы про метки в квадратных скобках молчит, но в документации Google они перечислены и для этой модели. Мы проверили четыре: [sigh], [laughing], [whispering] и [short pause].
Короче, захожу я вчера в лифт с коробкой торта. [sigh] Двери закрываются, и тут лифт встаёт между этажами. [laughing] Сорок минут, представляешь? [whispering] Я съел половину торта, пока ждал. [short pause] Только маме не говори.
Один голос · Puck · Русский, манера речи пустая
Вслух ни одна метка не прозвучала. А вот шёпот, судя по громкости, сдвинулся: фраза сразу после [whispering] звучит так же громко, как остальные, а заметно тише вышла последняя, «Только маме не говори». Так что метки здесь — эксперимент. Если вздох или шёпот нужен обязательно, попробуйте Gemini 3.1 Flash TTS: в её форме эти метки подсказаны.
Режим задаёт переключатель Тип генерации. В режиме Один голос весь текст звучит одним голосом. В режиме Диалог строки делятся между двумя собеседниками: каждая начинается с имени и двоеточия («Олег: Привет!»), а имена перед двоеточием должны совпадать с теми, что вписаны в поля Имя первого собеседника и Имя второго собеседника.
Вставьте текст, до 4000 знаков вместе с пробелами. Выберите голос и Язык озвучки: тот, на котором написан текст. У каждого голоса в форме есть кнопка с образцом, а переключатель Голоса прячет мужские или женские.
Пожелания к подаче, если они есть, пишутся в Манеру речи. Сумма к списанию видна на кнопке Отправить ещё до запуска.
Готовая запись появится под формой в виде плеера. Короткие тексты у нас приходили за 16–33 секунды. Кнопка Скачать сохраняет MP3, Изменить возвращает текст и настройки в форму, а Повторить сразу отправляет ту же озвучку заново, и интонации нового дубля могут отличаться. Запись хранится в Моих результатах 7 дней, а чтобы она осталась насовсем, сохраните её в библиотеку.
| Поле | Что ставить |
|---|---|
| Язык озвучки | По умолчанию Русский. Автоопределения нет, поэтому для английского урока или испанской фразы переключайте язык вручную, от него зависит произношение. |
| Голос | По умолчанию Kore, женский. Перед длинным текстом сравните на слух хотя бы три-четыре голоса: на пяти минутах тембр слышнее, чем на одной фразе. |
| Голос первого / второго собеседника | По умолчанию Kore и Puck. Для диалога берите женский и мужской или два голоса, далёких по тембру, иначе слушатель перестанет различать, кто говорит. |
| Имя первого / второго собеседника | До 30 знаков, по умолчанию Анна и Олег. Имя должно буква в букву совпадать с тем, что стоит перед двоеточием в тексте. |
| Манера речи | Необязательна, до 300 знаков, в цену не входит. Хватает двух-трёх признаков: настроение, темп, ситуация. |
Текст для озвучки пишут под слух. Цифры, годы и время модель читает уверенно, а сокращения разворачивает не все: дни недели, «стр.», единицы измерения надёжнее написать полностью. Длинные предложения разбейте на короткие, тогда паузы встанут на места точек.
Подсказку в Манеру речи удобно собирать из трёх частей: кто говорит, с каким настроением и в каком темпе. Два шаблона из наших проб:
Как диктор вокзала: чётко, ровно, без эмоций, с паузой после каждого числа
Как друг, который пересказывает смешной случай: живо, чуть быстрее обычного, с улыбкой в голосе
Частые ошибки:
Цена зависит только от длины текста: голос, язык, режим и подсказка к подаче её не меняют. Тексты до 500 знаков стоят одинаково, поэтому пару коротких объявлений выгоднее озвучить одним файлом и разрезать при монтаже.
| Длина текста | Звучит примерно | Цена |
|---|---|---|
| до 500 знаков, минимальная цена | 40 секунд | 2 ₽ |
| 1000 знаков, примерно полстраницы | около полутора минут | 4 ₽ |
| 2000 знаков | около трёх минут | 8 ₽ |
| 4000 знаков, максимум за запуск | около пяти с половиной минут | 16 ₽ |
Длительность мы прикинули по своим записям без спешки. С подсказкой «медленно» запись выйдет длиннее, а цена не изменится.
Как выбрать голос и собрать озвучку для ролика, разобрано в инструкции «Как озвучить текст с помощью нейросети».
На сайте четыре Gemini TTS с одинаковым набором из 30 голосов, а различаются они формой. Версия 2.5 берёт за раз больше текста, чем 3.1, и, в отличие от Gemini 3.8 Flash TTS, даёт выбрать язык озвучки; диалог в ней, как и в 3.1, вставляется одним куском с именами. Поэтому её стоит открыть, когда текст длинный, но в 4000 знаков укладывается, когда нужен конкретный язык или сценарий диалога уже написан целиком. Если у каждой реплики должна быть своя манера, а смех и вздох нужны тегами, удобнее 3.8. Если нужны метки в квадратных скобках с подсказкой в форме или настройка Вариативность, это Gemini 3.1 Flash TTS.
Цены всех версий собраны в таблице. Другие озвучки на одной и той же фразе можно послушать в подборке нейросетей для озвучки текста, а все модели Google описаны в статье о нейросетях Google.
| Нейросеть | Цена | За раз | Чем отличается |
|---|---|---|---|
| Gemini 2.5 Flash TTS | 4 ₽ за 1000 символов | 4000 знаков | 24 языка на выбор, диалог одним текстом |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | 2500 знаков | метки вздоха и смеха в подсказке, автоопределение языка, Вариативность |
| Gemini 3.8 Flash TTS | 7 ₽ за 1000 символов | 5000 знаков | реплики диалога добавляются по одной, у каждой своя манера, теги <laugh> и <sigh>, языка в форме нет, файл WAV |
| Gemini 3.8 Flash Lite TTS | 5 ₽ за 1000 символов | 5000 знаков | та же форма, что у 3.8, облегчённая модель для массовой озвучки |
| ElevenLabs Eleven v3 | 30 ₽ за 1000 символов | 5000 знаков | 64 голоса, переключатель Подача, только один диктор |
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | 10 000 знаков | клон своего голоса, скорость и высота голоса, эмоция |
Описание обновлено 2 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.