👁🤖 Роботы научились понимать видео Обычный ИИ хорошо распознает объекты на фото, но путается в динамике видео. Ученые и
Обычный ИИ хорошо распознает объекты на фото, но путается в динамике видео. Ученые из МФТИ, AIRI и Университета Иннополис решили эту проблему, создав метод DyGEnc. Теперь языковые модели могут «смотреть» видео, отслеживать движения предметов и отвечать на сложные вопросы о сюжете.
Почему это прорыв?
📈 Рост точности: на сложном тесте AGQA, в котором 2 млн вопросов по видео, точность ответов ИИ взлетела с 54% до 93%
🛡 Устойчивость: даже если убрать треть описания видео, точность ответов остается выше 90%
🤖 Тест в реальности: алгоритм проверили на настоящем роботе-манипуляторе. Он успешно выполнял голосовые команды на русском, анализируя видео с камер на ходу
Технология сможет улучшить работу умных роботов в логистике и быту. Исходный код авторы уже выложили на GitHub, а статья опубликована в журнале Technologies.
#МФТИ #ИИ #робототехника #наукаМФТИ #Минобрнауки