Быстро озвучивает текст готовым голосом на русском и других языках. Цена - 10 ₽ за 1000 символов.
Qwen3 TTS Flash — нейросеть Alibaba для быстрой озвучки текста готовыми голосами. Выбираете один из 17 голосов, вставляете до 2000 символов на русском, английском или другом языке из списка и получаете запись WAV, без настройки тембра и загрузки образцов.
Alibaba показала Qwen3 TTS Flash в сентябре 2025 года как быструю озвучку: никаких описаний голоса и клонов, только выбор из готовых голосов. На пробы ушло три запуска. В каждом мы проверяли то, о чём обычно спрашивают перед покупкой: как модель читает числа и термины, сколько речи выходит из полного текста и что будет, если смешать в одном тексте два языка. Русскую речь мы прогнали через распознавание, а длину записей и высоту голоса измерили программой, которая, правда, ничего не скажет об интонации. Её стоит послушать.
Первым делом мы дали модели учебный абзац с цифрами, процентами, датой и латинской формулой. Голос Elias по описанию разработчиков задуман для лекций, и по образцу он самый неторопливый из семнадцати.
Сегодня у нас фотосинтез. Растение берёт из воздуха углекислый газ, CO2, из почвы — воду, а энергию получает от солнечного света. В листе всё это превращается в сахар и кислород. Звучит просто, но масштаб огромный: по оценкам учёных, наземные растения каждый год связывают около 120 миллиардов тонн углерода. А кислород, которым мы дышим, примерно на 50% выделяют морские водоросли, а вовсе не леса, как часто думают. Первым процесс подробно описал голландский врач Ян Ингенхауз в 1779 году: он заметил, что листья выделяют пузырьки газа только на свету. Вопрос для самопроверки: почему комнатные растения хуже растут зимой у северного окна? Подсказка: дело не в холоде. Запишите ответ в тетрадь, а на следующем уроке, 14 октября, разберём хлоропласты — что это такое и зачем им зелёный пигмент хлорофилл.
голос Elias, язык Русский, 805 символов
Из 805 символов вышла минута и 4 секунды речи, а запись была готова через 20 секунд после отправки. «120 миллиардов», «50%» и «14 октября» распознавание разобрало без ошибок. Споткнулась модель в двух местах. Внутри года 1779 она сделала паузу почти в полторы секунды, после «тысяча», будто число кончилось. А «CO2» распознаватель услышал как «ко-два»: латинские буквы в русском тексте модель читает по-своему. Годы и формулы надёжнее писать словами: «в тысяча семьсот семьдесят девятом году», «це-о-два».
Поля, где можно попросить «медленнее» или «веселее», в форме нет. Зато голоса сильно отличаются темпом. Образцы всех 17 голосов в форме читают одну и ту же русскую фразу, и мы измерили их длину: самый быстрый, Li, укладывается в 8,9 секунды, самый медленный, Elias, тянет ту же фразу 15,8. Почти вдвое.
Qwen3 TTS Flash · образец голоса Li, 8,9 с · 10 ₽ за 1000 символов
Qwen3 TTS Flash · образец голоса Elias, 15,8 с · 10 ₽ за 1000 символов
Это образцы из формы, а не наши запуски: их можно слушать бесплатно перед оплатой. По описанию разработчиков, десять голосов из семнадцати (Jada, Dylan, Sunny, Li, Marcus, Roy, Peter, Rocky, Kiki, Eric) задуманы под китайские диалекты, вроде шанхайского, кантонского или сычуаньского. Остальные семь, Cherry, Ethan, Nofish, Jennifer, Ryan, Katerina и Elias, разработчики описывают как обычные голоса без диалекта. По-русски читают все семнадцать, а какой характер вам ближе, подскажет образец.
Для приветствия в отеле мы написали абзац по-русски и сразу его английскую версию, выбрали в поле Язык озвучки вариант «Авто» и голос Jennifer, который разработчики описывают как американский английский.
Добро пожаловать в отель «Северный берег»! Завтрак накрывают с семи до десяти на втором этаже, пароль от Wi-Fi напечатан на ключ-карте. Если что-то понадобится, наберите ноль с телефона в номере. Welcome to the Northern Shore hotel! Breakfast is served from seven to ten on the second floor, and the Wi-Fi password is printed on your key card. If you need anything, just dial zero from your room phone. Have a pleasant stay!
голос Jennifer, язык Авто, 424 символа
Модель сама переключилась между языками посреди записи. Распознавание разобрало обе половины целиком, включая «Wi-Fi» в русской части. На стыке языков вышла пауза около 0,8 секунды, в объявлении она к месту. Двуязычное объявление вышло одним файлом, склеивать две записи не пришлось.
У Alibaba на сайте две озвучки, и выбирают между ними по задаче. Qwen3 TTS умеет больше: голос по словесному описанию, клон по записи, поле Манера речи, текст до 5000 символов. Во Flash ничего этого нет. Зато здесь 17 готовых голосов вместо девяти, в списке языков на один больше (тайский), а ответ приходит быстрее, это видно по строке «Обычно готово» на обеих страницах. Наши три записи были готовы за 15–21 секунду, дольше всех ждали длинную.
Чтобы сравнить звучание, мы дали Flash тот же спортивный репортаж, который на странице Qwen3 TTS читает голос Uncle Fu без манеры речи. Здесь читал Ryan, его разработчики описывают как ритмичный и драматичный.
Qwen3 TTS Flash · Qwen3 TTS Flash, голос Ryan · 10 ₽ за 1000 символов
Qwen3 TTS · Qwen3 TTS, голос Uncle Fu, без манеры речи · 10 ₽ за 1000 символов
Осталось десять секунд. Мяч у Петрова, он обходит одного защитника, второго... Удар! Вратарь тянется, но не достаёт. Три — два! И через мгновение звучит финальная сирена: «Сокол» впервые за двенадцать лет выигрывает кубок.
Ryan, судя по замеру, прочитал живее и без всяких подсказок: разброс высоты голоса у него почти 21 полутон против 13 у Uncle Fu, и запись на секунду короче, 16,7 секунды. Подачу, которую в Qwen3 TTS просят словами, здесь подбирают голосом. Одна неприятность: в последнем слове распознавание услышало «кубу» вместо «кубок». Файлы Flash кончаются сразу на последнем звуке, без паузы, и конец слова мог потеряться. Перед тем как отдавать запись, послушайте финал.
Если нужен свой голос, особый тембр или длинный текст за один запуск, берите Qwen3 TTS. Для быстрого закадра готовым голосом, когда хочется выбрать из голосов побольше, хватит Flash.
Вставьте текст в поле Текст. В поле Язык озвучки по умолчанию стоит «Русский»; если в тексте два языка, выберите «Авто», и модель определит язык сама. Затем выберите Голос: рядом с каждым из 17 имён есть кнопка воспроизведения, образец звучит по-русски и ничего не стоит.
Нажмите Отправить. Цена видна на кнопке до запуска и зависит только от длины текста: голос и язык её не меняют. Когда запись будет готова, под формой появится плеер. Файл WAV забирают кнопкой Скачать. Если фразу нужно переписать, жмите Изменить: текст, язык и голос вернутся в форму. Повторить без правок сразу отправит то же задание заново. Записи лежат в Моих результатах 7 дней, а то, что пригодится позже, переносите в библиотеку.
Промпта как такового здесь нет: модель читает ровно то, что вы вставили, поэтому всё управление сводится к тому, как написан текст. Помогает вот что.
Шаблон короткого объявления, который удобно переделывать под себя:
Уважаемые покупатели! Магазин закроется через пятнадцать минут. Пожалуйста, пройдите к кассам. Завтра мы открываемся в девять утра. Спасибо, что были с нами!
Сумма считается по тысячам знаков с округлением вверх, а голос и язык на неё не влияют. Короткое объявление в пару строк обойдётся как целая тысяча знаков. Если таких объявлений пять, соберите их в один текст, озвучьте за раз и разрежьте запись в любом аудиоредакторе.
| Длина текста | Цена |
|---|---|
| до 1000 символов | 10 ₽ |
| 1001–2000 символов, предел формы | 20 ₽ |
Все нейросети Alibaba на сайте собраны в обзоре Qwen, а озвучки разных разработчиков сравнивает статья «Озвучка текста».
| Нейросеть | Цена | Чем отличается | Когда брать |
|---|---|---|---|
| Qwen3 TTS Flash | 10 ₽ за 1000 символов | 17 готовых голосов, WAV | быстрый закадр готовым голосом |
| Qwen3 TTS | 10 ₽ за 1000 символов | 9 голосов, манера речи, описание, клон, до 5000 символов | особый тембр или голос из записи |
| Стандарт | 0.5 ₽ за 1000 символов | шесть русских голосов, выбор формата файла | простая озвучка по-русски |
| Gemini 3.1 Flash TTS | 8 ₽ за 1000 символов | два голоса в одной записи | диалог, подкаст |
| Inworld Realtime TTS 2 | 10 ₽ за 1000 символов | подача словами в скобках, до 2000 символов | нужна интонация по ремарке |
Описание обновлено 2 октября 2026 г.
Озвучивает текст живым голосом с эмоциями, шёпотом, смехом и звуками по тегам в тексте.