ББратуха
НейросетиСценарииГалереяПомощь
Войти
НейросетиСценарииГалереяПомощь
Братуха

Все нейросети в одном месте и по самым низким ценам.

Разделы

  • Нейросети
  • Чат с нейросетями
  • Сценарии
  • Галерея
  • Промпты

Популярное

  • GPT Image 2
  • Nano Banana Pro
  • Seedream 5.0 Pro
  • Nano Banana 2 Lite
  • Grok Video
  • Nano Banana 2

Помощь

  • Контакты
  • Как пользоваться
  • Инструкции
  • Новости
  • API
  • Для ИИ-агентов
  • Для бизнеса

Компания

  • О нас
  • Мы помогаем
  • Блог
  • Реферальная программа
  • Пользовательское соглашение
  • Политика конфиденциальности
  • Политика обработки в отношении файлов cookie
  • Согласие на обработку персональных данных
  • Согласие на отправку уведомлений рекламно-информационного характера

© 2026 Братуха.ру

257 нейросетей

Gemini 3.8 Flash TTS

Озвучивает текст естественной речью одним голосом или как диалог двух собеседников с разными голосами. Цена - 0,007 ₽ за символ текста.

API

0 / 5000

0 / 500

Описание

Gemini 3.8 Flash TTS — нейросеть Google для озвучки текста: читает до 5000 символов одним из 30 голосов или собирает диалог двух собеседников из отдельных реплик, и у каждой реплики может быть своя манера. Смех и вздох ставятся тегами прямо в тексте, а язык модель определяет сама.

Содержание

  1. Коротко
  2. Что умеет: восемь записей с расшифровкой
  3. Как это работает: голоса, реплики и манера
  4. Настройки: на что смотреть перед запуском
  5. Текст и подсказки к подаче: шаблоны
  6. Сколько стоит озвучка
  7. Для чего подойдёт: шесть задач
  8. Ограничения и как их обойти
  9. Версии Gemini TTS и другие озвучки
  10. Частые вопросы

Коротко

Разработчик
Google, модель вышла в сентябре 2026 года
На входе
текст до 5000 символов или диалог из 2–50 реплик двух собеседников
На выходе
аудиофайл WAV
Голоса
30 из списка: 14 женских, 16 мужских, у каждого в форме есть образец
Русский язык
говорит по-русски, язык определяет сам, выбирать его в форме не нужно
Подача
манера речи словами для всей записи и для каждой реплики, теги <laugh> и <sigh>
Цена
7 ₽ за 1000 символов
Обычно готово
≈ 15 с после отправки
API
есть, документация

Что умеет: восемь записей с расшифровкой

Мы прогнали через Gemini 3.8 Flash TTS семь текстов, от пары фраз до рассказа на 1143 символа, а первый из них для сравнения озвучили ещё и в облегчённой версии Lite. Каждую запись сверили с исходником через распознавание речи. Искали две вещи: всё ли прочитано и не прозвучал ли какой-нибудь тег словом.

Цифры в напоминании: три версии Gemini подряд

Текст с номером заказа, датой, временем и суммой уже звучит на странице версии 3.1, поэтому мы повторили его слово в слово. Голос везде один, Kore.

Gemini 3.8 Flash TTS · Kore

Gemini 3.8 Flash Lite TTS · Kore

Gemini 3.1 Flash TTS · Kore · Русский

Здравствуйте, Ирина Сергеевна! Напоминаем: ваш заказ № 4815 приедет в среду, 14 октября, с 9:30 до 12:00. Сумма к оплате — 2 390 рублей 50 копеек. Курьер позвонит за 20 минут до приезда. Если планы изменились, перенесите доставку в приложении до 23:59 вторника. Хорошего дня!

Все три версии прочитали каждое число, знак № превратился в «номер». Разница в мелочах: обе версии 3.8 произнесли «23:59» со словами «часов» и «минут», а 3.1 по расшифровке назвала просто два числа. По длине записи почти одинаковы, от 26 до 28 секунд. Чем отличаются тембр и интонация, распознавание не скажет, поэтому сравните на слух.

Одна фраза шёпотом и в полный голос

Поле Манера речи задаёт подачу всей записи, поэтому мы дважды озвучили одну и ту же фразу голосом Aoede и между дублями поменяли только это описание, а текст и голос не трогали.

«Шёпотом, взволнованно, будто боится разбудить соседей»

«Громко и восторженно, почти кричит от радости, быстро»

Я открыла письмо и сначала не поверила. Нас взяли на фестиваль, всех шестерых! Значит, в мае мы всё-таки едем в Казань, и репетировать придётся каждый вечер.

Шёпот вышел заметно тише: средняя громкость записи на 12 дБ ниже, чем у восторженной версии. Он и длиннее, 13 секунд против 10. Во втором дубле распознавание поставило восклицательные знаки после «фестиваль» и «шестерых», которых в первом нет, значит, голос там действительно поднимается. Описание подачи модель не произносит, и за него не платят.

Вздох и смех тегами

Подсказка к полю Текст предлагает два тега на английском в угловых скобках, <sigh> для вздоха и <laugh> для смеха, и ставить их нужно прямо в то место фразы, где должен прозвучать звук.

Знаешь, что сказал мне мастер? <sigh> Что ремонт займёт ещё две недели. Две недели! <laugh> Я уже даже не злюсь, мне просто смешно. Ладно, <sigh> буду дальше готовить на плитке в коридоре.

Один голос · Charon · Манера речи пустая

Ни один тег не прочитан вслух: в расшифровке только русские слова. Зато на месте каждого тега запись растягивается на полторы-две секунды, словно там звучит что-то без слов. Вздох это или смех, проверьте сами, распознавание такие звуки не записывает. Квадратные скобки вроде [sigh], как у версии 3.1, здесь не подсказаны, поэтому мы их не пробовали.

Сценка из реплик: у каждой своя манера

В режиме Диалог текст не пишут одним полем. Реплики добавляют по одной кнопкой Добавить реплику, у каждой выбирают, кто говорит, и при желании заполняют Манеру реплики. Ниже в скобках стоит то, что мы вписали в это поле.

Собеседник 1 (растерянно): Алло, это служба доставки? Мне привезли торт, но на нём написано «С днём рождения, Валера». Собеседник 2 (вежливо и бодро, как оператор колл-центра): Да, всё верно. Заказ на имя Валерия? Собеседник 1 (возмущённо, но сквозь смех): Я Валерия! И мне сегодня сорок лет, а не пять, а на торте нарисован динозавр. Собеседник 2 (сдерживая смех, извиняясь): <laugh> Простите, похоже, торты перепутали. Сейчас заменим, курьер будет через сорок минут. Собеседник 1 (тепло, с улыбкой): Нет-нет, динозавра оставьте. Гостям он уже нравится.

Диалог · Собеседник 1 — Leda, Собеседник 2 — Orus

Пять реплик заняли 29 секунд, голоса чередуются строго по списку. Перед «Простите» полуторасекундная пауза, там стоит тег смеха. Две детали для прослушивания: «Заказ на имя Валерия?» распознавание записало с точкой, то есть вопроса в голосе может не быть, а в последней реплике услышало «динозавр» вместо «динозавра».

Рассказ на полторы минуты

Длинный текст мы проверили на рассказе о дежурной по вокзалу в Кандалакше: 1143 символа, пять абзацев, голос Sadaltager.

Один голос · Sadaltager · «Спокойно и тепло, как в аудиокниге, с лёгкой улыбкой в смешных местах»

Файл на 82 секунды пришёл через 45 секунд после отправки. Пропусков нет, «6:40» прочитано как время, кличка хомяка Персик тоже на месте. Паузы между абзацами модель ставит не везде: после первых двух около полутора секунд, а последние два абзаца начинаются сразу за предыдущими. Если нужна тишина, добавьте её при монтаже.

Три языка в одном сообщении

Поля для выбора языка в форме нет, модель определяет его сама. Мы смешали в одном тексте русский, английский и французский.

Друзья, напоминаю: дедлайн по проекту в пятницу. The client wants the final version by noon, so please don't be late. Merci beaucoup, и до встречи в понедельник!

Один голос · Zephyr

Распознавание без подсказки языка записало все три части без ошибок, включая «Merci beaucoup». Акцент на переходах слышно только на слух, его мы оставляем вам.

Как это работает: голоса, реплики и манера

Сначала выберите Тип генерации. В режиме Один голос весь текст вставляют в поле Текст, до 5000 символов, и выбирают Голос. В режиме Диалог выбирают Голос собеседника 1 и Голос собеседника 2, а затем заполняют Реплики: от двух до пятидесяти, у каждой отмечают, кто говорит. Имена в тексте писать не нужно. Переключатель Голоса сужает список до женских или мужских, а кнопка у каждого голоса проигрывает образец.

Поле Манера речи необязательное: в нём словами описывают тон, эмоцию или темп. Модель слушается описания, но не читает его вслух. Цена зависит только от числа символов, итоговую сумму кнопка Отправить показывает заранее.

Когда запись готова, под формой появится плеер. Скачать сохранит запись в WAV, Изменить вернёт текст и настройки в форму, Повторить сразу запустит то же задание ещё раз, и новый дубль может прозвучать по-другому. В Моих результатах запись хранится 7 дней. Чтобы она не пропала, сохраните её в библиотеку. Как устроены остальные разделы сайта, рассказано в инструкции по сайту.

Настройки: на что смотреть перед запуском

  • Голос по умолчанию Kore, в диалоге Kore и Puck. Перед длинным текстом послушайте несколько образцов: тембры заметно разные, а дубль на всю длину стоит дороже пробы.
  • Манера речи до 500 символов. Нам хватало одной строки из трёх-четырёх признаков: настроение, громкость, темп, ситуация.
  • Манера реплики в диалоге до 300 символов на реплику и тоже необязательна. Её стоит заполнять там, где настроение меняется посреди разговора, а общий тон задаёт Манера речи.
  • Теги <laugh> и <sigh> ставьте по одному в нужном месте. Они входят в счёт символов и в цену.

Текст и подсказки к подаче: шаблоны

Модель читает текст как сценарий, слово в слово, и ничего не пересказывает. Поэтому всё, что должно прозвучать, пишите так, как это скажет человек: числа, даты и время в наших пробах прочитаны верно и цифрами, а вот сокращения вроде «т. е.» или «ул.» мы не проверяли, их надёжнее раскрыть. Длинную фразу лучше разбить на две.

Манеру описывайте как задание актёру: кто говорит, в каком настроении, громко или тихо, быстро или медленно. Пара шаблонов:

Негромко и доверительно, медленнее обычного, как будто читает сказку ребёнку перед сном

Энергично и чётко, с улыбкой, как ведущая утреннего эфира, без лишних пауз

Что мешает чаще всего:

  • пометки вроде «(грустно)» прямо в тексте: модель читает текст как сценарий, и надёжнее держать подачу в поле Манера речи или Манера реплики;
  • манера на несколько строк, да ещё с противоречиями вроде «тихо, но громко»: мы обходились тремя-четырьмя признаками и с них советуем начинать;
  • теги в квадратных скобках, перенесённые из текстов для версии 3.1, — здесь подсказаны угловые.

Сколько стоит озвучка

Оплата идёт за символы: в режиме Один голос считается поле Текст, в диалоге — тексты всех реплик вместе, с пробелами и тегами. Голос, режим и описание манеры на цену не влияют.

Длина текстаЗвучит примерноЦена
300 символов, объявление или сторис25–30 секунд2,10 ₽
1000 символов, страница докладаминута с небольшим7 ₽
2500 символов, глава рассказаоколо трёх минут17,50 ₽
5000 символов, максимум за запускоколо шести минут35 ₽

Время звучания мы посчитали по своим пробам: спокойное чтение вышло около 14 символов в секунду. Медленная манера или шёпот растянут запись, а цена останется той же.

Для чего подойдёт: шесть задач

  • Голосовые напоминания, объявления и автоответчики с датами, временем и суммами.
  • Озвучка роликов и сторис, где нужен шёпот, восторг или усталый вздох.
  • Сценки, учебные диалоги и короткие подкасты на два голоса, с настроением у каждой реплики, как в сценке с тортом выше.
  • Рассказы и главы аудиокниг частями до 5000 символов.
  • Черновая озвучка рекламы или игровых персонажей перед записью с диктором.
  • Рабочие сообщения со вставками на английском и других языках.

Ограничения и как их обойти

  • За раз — до 5000 символов. Длинный текст делите по абзацам и склеивайте файлы при монтаже.
  • В диалоге только два собеседника. Третьего персонажа озвучьте отдельным запуском в режиме Один голос.
  • Голоса только из списка формы. У Google у модели есть и подбор голоса по описанию, но здесь его нет, а свой голос клонируют в других нейросетях, например в MiniMax Speech 2.8.
  • Поля для ударений нет. Слово с неверным ударением замените синонимом или перестройте фразу.
  • Манеру и теги модель понимает как пожелание, а не как команду. Если вздоха или нужной интонации нет, нажмите Повторить или опишите подачу проще.
  • Файл приходит в WAV, он весит больше MP3. Для мессенджера или сайта его удобнее пережать в любом аудиоредакторе.

Версии Gemini TTS и другие озвучки

У Gemini TTS на сайте четыре версии. Самая близкая к 3.8 — Gemini 3.8 Flash Lite TTS: форма у неё та же, с репликами и угловыми тегами. Google описывает Flash как модель для выразительной игры и длинного чтения, а Lite — для быстрой массовой озвучки. В нашем сравнении выше обе одинаково справились с цифрами, так что для серии однотипных объявлений хватит Lite, а для сценок и рассказов мы бы брали 3.8.

Версию 3.1 стоит выбрать ради ручного выбора языка и шёпота, который ставится меткой прямо в тексте. Если нужны реплики с отдельной манерой, текст длиннее 2500 символов и не хочется следить за именами собеседников в тексте, удобнее 3.8. Все озвучки сайта на одной и той же фразе сравнивает статья о нейросетях для озвучки текста, а остальные модели Google собраны в обзоре нейросетей Google.

НейросетьЦенаЗа разЧем отличается
Gemini 3.8 Flash TTS7 ₽ за 1000 символов5000 символовреплики диалога по одной со своей манерой, теги <laugh> и <sigh>, язык определяет сама
Gemini 3.8 Flash Lite TTS5 ₽ за 1000 символов5000 символовта же форма, облегчённая версия для потока однотипной озвучки
Gemini 3.1 Flash TTS8 ₽ за 1000 символов2500 символовметки в квадратных скобках, выбор из 24 языков и автоопределение, вариативность
Gemini 2.5 Flash TTS4 ₽ за 1000 символов4000 символовте же 30 голосов, выбор из 24 языков, диалог по именам в тексте, файл MP3
ElevenLabs Eleven v330 ₽ за 1000 символов5000 символов64 голоса, теги в квадратных скобках, без режима диалога

Частые вопросы

Описание обновлено 2 октября 2026 г.

Похожие нейросети

Мега

Озвучивает текст реалистичными голосами и умеет клонировать голос по примеру аудио.

Gemini 3.1 Flash TTS

Озвучивает текст естественной речью одним голосом или как диалог двух собеседников с разными голосами.

Премиум

Озвучивает текст разными голосами - можно выбрать диктора и настроение, а также настроить темп и высоту речи.

ElevenLabs Eleven v3

Озвучивает текст живыми голосами и умеет передавать эмоции, интонации и манеру речи.

Ультра

Озвучивает текст реалистичными голосами и умеет клонировать голос по короткому аудиопримеру.

ElevenLabs Eleven v4

Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.

  1. Нейросети
  2. /
  3. Звук
  4. /
  5. Озвучка