🎙 Xiaomi открыла исходники OmniVoice — AI для синтеза речи на сотнях языков Китайский гигант выпустил открытую модель и
Китайский гигант выпустил открытую модель искусственного интеллекта для преобразования текста в речь. OmniVoice умеет генерировать голос на нескольких сотнях языков, клонировать тембр по образцу и настраивать интонации под задачу — от официального тона до шёпота и смеха.
Главный прорыв — работа с языками, для которых почти нет данных. Модель выдаёт качественную речь даже если в обучающей выборке было меньше 10 часов аудио. По результатам тестов OmniVoice обошла коммерческие системы на 24 языках по разборчивости и сходству с живым голосом. На 102 языках её речь достигла человеческого уровня, а кое-где — превзошла. Это первая в индустрии модель клонирования голоса с охватом нескольких сотен языков.
Техническое преимущество — упрощённая архитектура. Вместо многомодульных конвейеров Xiaomi развернула единую трансформер-сеть, которая напрямую превращает текст в речь. Результат: обучение на 100 000 часов данных занимает один день, а инференс работает в 40 раз быстрее реального времени на обычном PyTorch. В модель встроили большую языковую модель для точности произношения и метод случайного скрытия акустических кодов для эффективности обучения.
Из практичного — генерация голоса по описанию (возраст, пол, высота тона, акцент, диалект), очистка шумов из образца для клонирования, управление интонацией, вздохи и смех для естественности, ручная коррекция сложных слов и имён. Модель развёртывается в потребительских сервисах без костылей.
Насколько быстро открытые многоязычные TTS вытеснят проприетарные решения вроде ElevenLabs?
🆓 Бесплатный доступ к нейросетям — chatru.net