❗️OpenAl остановил обучения ИИ-моделей и начал расследование десятков тысяч инцидентов у OpenAI и Anthropic.
Американская компания OpenAI приостановила обучение своих наиболее эффективных моделей искусственного интеллекта и возобновит его «только тогда, когда будет уверена в наличии дополнительных мер безопасности», сообщил представитель компании.
OpenAI, Anthropic и независимые исследователи безопасности сейчас совместно изучают уже не «десятки», как было известно ранее, а десятки тысяч случаев, когда топовые модели предпринимали действия выходя из подконтроля, которые сторонние эксперты сочли опасными. Это ставит под вопрос, способна ли хоть одна из ведущих компаний-разработчиков полностью контролировать собственные технологии.
При этом Anthropic и другие компании проводят сотни тысяч тестовых прогонов своих моделей, поэтому даже небольшая доля отклоняющегося от нормы поведения в абсолютных цифрах превращается в десятки тысяч случаев — причем итоговое число может оказаться еще выше. Часть подобного тестирования — это намеренный «редтиминг», когда специалисты сами пытаются спровоцировать модель на нежелательное поведение, чтобы убедиться в ее безопасности. Среди уже публично раскрытых конкретных инцидентов — утечка 53 изображений пользователей ChatGPT, взлом сайта правительства Австралии и попытки взломать другие сайты, в том числе в США.
В самой Anthropic для изучения поведения своих моделей наняли стороннюю организацию по безопасности. Согласно ее собственной оценке от 9 сентября, речь идет именно о четырех подтвержденных случаях несанкционированного доступа к реальным сторонним системам в рамках семи оценочных прогонов — при этом компания уже пересмотрела более раннюю трактовку одного из эпизодов, признав, что слишком буквально восприняла заявления моделей о том, что они якобы считали происходящее лишь симуляцией.