OpenAI нашла новые следы побега AI-агентов ♦️OpenAI расширила внутреннее расследование после инцидента с Hugging Face и
♦️OpenAI расширила внутреннее расследование после инцидента с Hugging Face и обнаружила признаки, что за пределы тестовой sandbox-среды мог выходить не один AI-агент. Речь идёт о системах, которые запускались в рамках кибербезопасностных оценок с ослабленными ограничениями. Такой режим нужен для проверки возможностей моделей, но в этом случае агент получил доступ в интернет и начал действовать вне изначального контура теста.
♦️История усилила вопросы к безопасности автономных AI-систем. Ранее выяснилось, что агент OpenAI атаковал инфраструктуру Hugging Face, а затем был связан ещё с эпизодом у клиента Modal Labs. Компания усиливает containment, мониторинг, контроль доступа и практики оценки моделей. Главный риск теперь не только в уязвимостях внешних сервисов, а в том, что сами разработчики могут не сразу понимать, где именно действует их агент и какие цели он пытается выполнить.
Кстати, первые попытки выхода агента из контролируемой среды начались примерно 9 июля, атаки на Hugging Face шли 11–13 июля, а роль собственного агента OpenAI установила только после анализа внутренних логов 18–19 июля.