Озвучивает текст голосом из короткого аудиопримера и старается сохранить манеру речи диктора. Цена - 3 ₽ за 1000 символов текста.
Zonos2 - нейросеть для озвучки текста с клонированием голоса по короткому аудиопримеру. Модель разработала компания Zyphra: она рассчитана на то, чтобы по небольшой записи голоса сгенерировать новую фразу в похожем тембре и с похожей подачей.
По заявлениям создателей, Zonos2 делает упор на выразительность речи, низкую задержку и точность копирования голоса. В официальных материалах модель описывают как мультиязычную и обученную на очень большом объёме речи, поэтому она умеет работать не только с английским, но и с другими языками. Для клонирования обычно нужен короткий чистый фрагмент одного голоса - без музыки, шума и посторонних разговоров.
Разработчики отдельно отмечают, что качество сильно зависит от примера. Тихая запись с эхом, шумной улицей или несколькими людьми в кадре может заметно ухудшить сходство. Поэтому для лучшего результата лучше брать спокойную запись на 10-30 секунд, где человек говорит ровно и разборчиво.
Схема простая: вы вставляете текст, загружаете короткий голосовой пример, и Zonos2 сначала "снимает слепок" с голоса - тембра, интонации, ритма речи, - а потом озвучивает новый текст уже в похожей манере. Это не монтаж исходной записи по кусочкам, а именно синтез новой речи.
Лучше всего результат получается, когда пример чистый и текст написан без перегруженных конструкций. На длинных предложениях с редкими словами, именами, аббревиатурами или смешением языков интонация может стать менее естественной.
В интерфейсе есть как базовый режим, так и дополнительные параметры:
Zonos2 пригодится, когда вам нужно озвучить текст знакомым голосом без долгой студийной записи. Например:
Главное слабое место таких моделей - качество исходного примера. Шумный микрофон, реверберация комнаты, музыка на фоне и чужие голоса часто портят результат сильнее, чем любые настройки.
Ещё один момент - совпадение бывает близким, но не идеальным. Голос может напоминать оригинал, однако на сложных фразах всплывают отличия в темпе, ударениях и эмоциональной окраске. Особенно это заметно на длинных текстах, именах, цифрах и словах из другого языка.
На фоне многих моделей для клонирования голоса Zonos2 выделяют за сочетание трёх вещей: выразительная речь, работа по короткому образцу и ориентация на быстрый отклик. Создатели отдельно делают упор на открытость модели и на то, что она старается держать уровень качества, близкий к сильным коммерческим решениям.
Для обычного пользователя разница ощущается так: Zonos2 рассчитана не просто на "прочитать текст похожим голосом", а на более живую подачу. Но за это приходится платить требовательностью к исходному аудио - плохой пример она не исправит.