Израильские учёные разработали искусственный интеллект, способный с высокой точностью восстанавливать изображения, которые видит человек, исключительн…
Часть первая.
Разработку представила группа исследователей Института Вейцмана под руководством профессора Михал Ирани. Технология анализирует данные функциональной магнитно-резонансной томографии (фМРТ), определяет, как мозг обрабатывает визуальную информацию, и передаёт эти сведения генеративной модели искусственного интеллекта, которая воссоздаёт увиденное человеком изображение.
В ходе экспериментов система смогла восстановить сложные сцены, включая бейсбольный матч, изображения животных, людей и различных предметов. В отличие от предыдущих моделей, которые нередко правильно определяли смысл увиденного, но ошибались в цветах, расположении объектов и композиции, Brain-IT значительно лучше воспроизводит как содержание изображения, так и его визуальные особенности.
«Существующие модели могут создавать впечатляющие реконструкции, которые достаточно хорошо сохраняют смысл изображения. Однако они часто допускают ошибки в основных характеристиках, таких как композиция и цвет. Наша модель превосходит их в восстановлении и содержания, и деталей», — рассказала Михал Ирани.
Главное преимущество разработки заключается в способности работать с мозговой активностью новых людей без продолжительного индивидуального обучения. По словам исследовательницы, другим подобным системам обычно требуются десятки часов фМРТ-записей одного человека, тогда как Brain-IT достаточно примерно часа.
Для создания технологии учёные использовали открытый набор данных Natural Scenes Dataset, содержащий результаты сканирования мозга восьми добровольцев. Каждому участнику показывали тысячи изображений во время нахождения в аппарате МРТ, а исследователи фиксировали изменения активности различных областей мозга.
Сбор исходных данных потребовал масштабной экспериментальной работы. Каждый доброволец прошёл от 30 до 40 сеансов, состоявших из шести сканирований продолжительностью примерно по десять минут. Во время каждого сканирования участникам демонстрировали около 40 изображений. В общей сложности исследователи получили примерно 73 тысячи пар изображений и соответствующих записей мозговой активности.
При этом даже такого массива оказалось недостаточно для полноценного обучения современной генеративной модели. Для искусственного интеллекта десятки тысяч примеров — сравнительно небольшой объём, а получение новых данных фМРТ требует длительной работы с добровольцами и дорогостоящим оборудованием.
Чтобы преодолеть это ограничение, команда разработала систему, способную работать одновременно в двух противоположных направлениях.
Первая модель, получившая название энкодер, предсказывает, каким будет результат сканирования мозга, если человек увидит определённое изображение. Вторая, декодер, выполняет обратную задачу — восстанавливает изображение по данным активности мозга.
Исследователи объединили эти модели в единую обучающую систему. Сначала искусственному интеллекту показывали изображение, которое ни один доброволец не рассматривал во время сканирования. Энкодер создавал предполагаемую картину мозговой активности, а декодер пытался восстановить по ней исходную картинку.
Затем результат сравнивали с оригиналом, после чего обе модели корректировали свои параметры. Многократное повторение этой процедуры позволило существенно повысить точность реконструкции без необходимости проводить новые сканирования людей.
Подписаться на канал · Поддержать канал