ГигаЧат научился различать эмоции по голосу В ИИ-помощнике появилась обновлённая нейросеть GigaChat Audio. Большая язык
В ИИ-помощнике появилась обновлённая нейросеть GigaChat Audio. Большая языковая модель умеет обрабатывать аудиофайлы и голосовые сообщения.
Теперь искусственный интеллект определяет настроение пользователя по интонации, характеристикам голоса и нюансам произношения. Это позволяет ему давать более уместные ответы в зависимости от ситуации.
Модель способна анализировать аудиофайлы длиной до трёх часов, ориентируясь в любых временных отрезках. Она легко найдёт нужный момент разговора и перескажет конкретный фрагмент.
Другая удобная опция — распознавание речи разных спикеров. Пригодится для разбора записей совещаний и звонков, а ещё подготовки протоколов.
Новые возможности доступны бесплатно разработчикам по всему миру для создания собственных сервисов с распознаванием речи. Облегчённую версию GigaChat Audio уже выложили в открытый доступ по ссылке.
В релиз также вошло семейство моделей GigaAM для автоматического распознавания речи. Они поддерживают русский, английский, киргизский, казахский и узбекский языки. Нейросети можно быстро обучить под новые языки. Модель доступна на GitHub и Hugging Face.