Озвучивает текст готовым голосом, создаёт голос по словесному описанию или клонирует голос по короткой записи. Цена - 10 ₽ за 1000 символов текста.
Голос сказочника по описанию
Режим «Описание голоса», язык озвучки Русский. Описание по-английски: по-русски нейросеть дала высокий голос.
Промпт: Давным-давно, когда реки были шире, а леса гуще, жил на краю деревни старый мельник. Каждый вечер он садился у окна и рассказывал внукам, как однажды поймал в сети говорящую щуку.
Qwen3 TTS — нейросеть Alibaba для озвучки текста на русском и ещё девяти языках. Она читает одним из 9 готовых голосов, собирает новый голос по словесному описанию или повторяет голос по записи на несколько секунд, и всё это в одной форме.
Alibaba выложила эти модели в январе 2026 года, у них три режима, и все три есть в поле Тип генерации. Для статьи мы сделали четыре записи: две проверяли клон, две — поле Манера речи. Каждую мы ждали от 25 до 33 секунд. Русскую речь мы прогнали через распознавание, а высоту голоса и длину записей измерили программой; как звучит подача, лучше послушать самим.
Повторять можно себя или человека, который на это согласился. Для статьи мы взяли искусственный образец: мужскую речь экскурсовода, которую создала другая нейросеть. Подсказка формы советует запись на 5–15 секунд, и мы обрезали её до 11.
образец голоса, 11 секунд, создан нейросетью
Дальше новый текст тем же голосом, дважды. Первый раз в поле Текст образца мы дословно написали, что звучит в записи, второй раз оставили его пустым.
Qwen3 TTS · «Клон голоса», с текстом образца · 10 ₽ за 1000 символов
Qwen3 TTS · «Клон голоса», без текста образца · 10 ₽ за 1000 символов
Доброе утро! Через десять минут наш автобус отправится в Петергоф. Дорога займёт около часа, а фонтаны включат ровно в одиннадцать. Не забудьте билеты: без них в Нижний парк не пустят. Кто ещё не позавтракал, успеете взять кофе у входа. Вопросы есть? Тогда поехали!
Высоту голоса клон удержал точно: средний тон образца 96 Гц, у копий 97 и 96. Все слова распознавание разобрало в обеих записях. Заметной разницы от поля Текст образца замеры не показали: записи вышли длиной 19,8 и 20,5 секунды, тембр по замеру одинаковый. Подсказка формы обещает, что с дословным текстом голос повторится точнее, поэтому мы бы его заполняли, особенно если в образце есть редкие слова или запись шумная.
Клон здесь одноразовый: образец загружается в каждый запуск, в список голосов он не сохраняется.
У готового голоса есть необязательное поле Манера речи, до 500 символов. Сама подсказка не звучит, она меняет тон, темп и настроение. Ниже Uncle Fu читает одинаковый текст: сначала без подсказки, потом с ней.
Qwen3 TTS · голос Uncle Fu, без манеры речи · 10 ₽ за 1000 символов
Qwen3 TTS · голос Uncle Fu, манера «спортивный комментатор» · 10 ₽ за 1000 символов
Осталось десять секунд. Мяч у Петрова, он обходит одного защитника, второго... Удар! Вратарь тянется, но не достаёт. Три — два! И через мгновение звучит финальная сирена: «Сокол» впервые за двенадцать лет выигрывает кубок.
Манеру речи мы написали по-русски:
Взволнованно и быстро, как спортивный комментатор в последние секунды матча, на последней фразе почти кричит от радости
Подсказку модель поняла, но по-своему. Тон стал выше и подвижнее: разброс высоты вырос с 13 до 23 полутонов. А вот «быстро» не сработало, запись с манерой вышла длиннее, 20 секунд против 17,7, за счёт пауз и протяжных ударений. Если нужен именно темп, напишите его отдельно и проще: «быстро, без пауз».
Ещё одно наблюдение: разработчики описывают Uncle Fu как зрелый низкий мужской голос, но по-русски он у нас звучал высоко, по замеру почти как Serena, у которой женский тембр. Из девяти образцов ниже всех оказались Ryan и Dylan. Перед длинной начиткой послушайте образец: кнопка воспроизведения стоит рядом с каждым именем в форме.
В режиме Описание голоса выбирать не из чего: вы пишете, кто говорит, а модель придумывает тембр. Вот пример со страницы этой нейросети, рассказчик сказки:
Elderly male storyteller, deep warm voice with a slight rasp, speaks slowly and gently, like a grandfather telling a bedtime story.
Текст: «Давным-давно, когда реки были шире, а леса гуще, жил на краю деревни старый мельник. Каждый вечер он садился у окна и рассказывал внукам, как однажды поймал в сети говорящую щуку».
«Описание голоса», язык Русский, описание по-английски
Средний тон этой записи 117 Гц, низкий мужской, как и просили. То же описание по-русски дало около 240 Гц, это высота женской речи. Обе записи можно сравнить в обзоре «Озвучка текста». Пара проб — ещё не правило, но мы бы писали текст для озвучки по-русски, а описание — по-английски.
Сначала выберите Тип генерации. «Готовый голос» читает текст одним из 9 голосов, и к нему можно добавить манеру речи. «Описание голоса» создаёт новый голос по вашим словам: пол, возраст, тембр, настроение. «Клон голоса» повторяет тембр из загруженной записи: один файл MP3, WAV или M4A до 10 МБ, лучше 5–15 секунд чистой речи одного человека без музыки и шума.
Потом вставьте текст до 5000 символов и проверьте Язык озвучки: по умолчанию стоит «Русский», есть ещё девять языков и «Авто», когда модель определяет язык сама. Нажмите Отправить: цена видна на кнопке до запуска и зависит только от длины текста. Образцы девяти готовых голосов в форме слушают бесплатно, платная только озвучка своего текста. Готовая запись появится в ленте под формой. Скачать сохраняет MP3, Изменить возвращает текст и настройки в форму, Повторить сразу запускает то же задание ещё раз. В Моих результатах запись хранится 7 дней, удачную сохраните в библиотеку.
Описание голоса удобно собирать из пяти частей: кто говорит, возраст, тембр, темп и ситуация. Пишите по-английски: в пробах выше так тембр вышел ближе к описанию. Два шаблона:
Middle-aged female radio host, warm low voice, calm and friendly, measured pace, sounds like she is smiling.
Young male video game narrator, bright energetic voice, fast pace, slightly dramatic, short pauses before key words.
Манера речи короче, хватит тона и темпа:
Тихо и доверительно, чуть медленнее обычного, с паузой после каждого предложения
Чего не делать: просить тембр конкретной знаменитости, смешивать противоречия вроде «молодой, но старческий» и ждать от манеры речи точной скорости. И ещё о тексте: время вроде 11:00 надёжнее писать словами, «в одиннадцать утра», иначе модель может прочитать его по-разному.
Платите за каждую начатую тысячу символов текста, тип генерации и голос сумму не меняют. Текст на 300 знаков стоит как полная тысяча, поэтому несколько коротких реплик выгоднее отправить одним запуском.
| Длина текста | Цена |
|---|---|
| до 1000 символов | 10 ₽ |
| 2001–3000 символов | 30 ₽ |
| 4001–5000 символов, предел формы | 50 ₽ |
У Qwen на сайте две озвучки. Qwen3 TTS Flash умеет только готовые голоса, зато их 17, а эта нейросеть берёт текст длиннее и умеет описание и клон. Остальные нейросети Alibaba собраны в обзоре Qwen.
| Нейросеть | Цена | Чем отличается | Когда брать |
|---|---|---|---|
| Qwen3 TTS | 10 ₽ за 1000 символов | 9 голосов, описание, клон, до 5000 символов | нужен особый тембр или голос из записи |
| Qwen3 TTS Flash | 10 ₽ за 1000 символов | 17 готовых голосов, до 2000 символов | короткий текст готовым голосом |
| Zonos2 | 3 ₽ | клон по записи до 30 секунд в каждом запуске | голос из записи для короткого текста, до 700 символов (около минуты речи) |
| ByteDance Seed Audio 1.0 | 50 ₽ | клон по 1–3 образцам, голос по картинке | голос под портрет персонажа |
| MiniMax Speech 2.8 | от 10 ₽ за 1000 символов | клон сохраняется, эмоции, теги смеха | один голос для многих записей |
Описание обновлено 3 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.