🤖 NVIDIA выпустила Audio Flamingo Next Audio Flamingo Next (AF-Next) — открытая аудио-языковая модель, обученная на 1 м
Audio Flamingo Next (AF-Next) — открытая аудио-языковая модель, обученная на 1 млн часов аудио и 108 млн примеров. Модель генерирует детальные текстовые описания аудиозаписей длиной до 30 минут: перечисляет инструменты, звуковые события, спикеров и музыкальные характеристики с привязкой к таймкодам.
Архитектура состоит из 4 блоков: кодировщик AF-Whisper, двухслойный MLP-адаптер, Qwen-2.5-7B с контекстом 128K токенов и потоковый TTS-модуль. Ключевая инновация — Rotary Time Embeddings, которые привязывают токены к реальным временным меткам аудио.
Выпущены 3 версии модели:
- AF-Next-Captioner: для детального описания аудио (92,13 на распознавании инструментов Medley-Solos-DB)
- AF-Next-Instruct: универсальная инструктивная версия с WER 1,54 на LibriSpeech
- AF-Next-Think: ризонинг-версия с Temporal Audio Chain-of-Thought (75,01 на MMAU-v05.15.25)
Модель закрывает отставание мультимодальных систем в работе со звуком и устанавливает новые стандарты в аудиоанализе. Лицензия: NVIDIA OneWay Noncommercial License.
🧠 Нейросети и Технологии. Подписаться