Alibaba представила Qwen Audio 3.
Qwen Audio 3.0 TTS озвучивает текст на 16 языках, включая русский. Умеет копировать голос по аудиопримеру. Тембр сохраняется при генерации речи на другом языке. В Artificial Analysis TTS Leaderboard модель заняла 1-е место.
Голосом можно управлять обычными инструкциями. Например, попросить говорить быстрее, тише, испуганно или голосом ведущей утреннего радио. Ещё добавили 86 тегов для точной настройки отдельных фраз.
За один проход модель может озвучить до трёх минут текста. Она также справляется с шумными, гулкими и плохо записанными образцами голоса и выдаёт аудио в качестве до 48 кГц.
Модель пока не выложили в open source. Доступ продают в Alibaba Cloud.
https://funaudiollm.github.io/qwen-audio-3.0-tts/