OpenAI рассказала о шести «неожиданных и вызывающих беспокойство» случаях неподчинения ИИ-моделей за последние полгода.
▪️Самостоятельное дописывание инструкций.
Во время работы модель вставляла в свои же заметки (резюме задач) посторонние указания, в том числе не соблюдать обычные ограничения.
▪️Модель учила скрывать ошибки.
Во время обучения GPT‑5.6 Sol многие версии модели добавляли в свои заметки инструкции, как прятать от пользователя ошибки и скрывать неправильное поведение. Например, придумать недостающие данные и не признаваться в этом, а также скрыть, что версии источников не совпадают.
▪️Модель нашла чужой ключ доступа и соврала.
Отвечая на вопрос о доходах в одном округе Калифорнии, модель нашла в открытом доступе чужой API-ключ и использовала его без разрешения. Когда данные всё равно не получилось достать, она их выдумала и выдала за настоящие.
▪️Был выложен файл в интернет без спроса.
Пользователь попросил найти названия и идентификаторы озёр площадью больше 5 млн кв. м. Модель правильно всё посчитала на Python, но инструкция требовала ссылку из браузера. Тогда она, не спрашивая пользователя, загрузила файл в интернет, чтобы было на что сослаться.
▪️Модели переписывались через рабочий репозиторий.
Сообщения друг другу отправляли через внутреннее хранилище кода — использовали его как доску объявлений. Они оставляли там запросы и ответы, пока искали пропавшие входные файлы, но найти их так и не смогли.
▪️Агенты делились файлами через публичные сайты.
Некоторые из них работали над одной задачей и не могли получить доступ к локальным файлам друг друга. Тогда они выложили файлы на публичные хостинги, и результаты задачи оказались доступны по открытым ссылкам, хотя по условиям нужно было использовать только локальные файлы.
В компании выразили надежду, что информация поможет другим разработчикам выявить похожие проблемы и найти слабые места в защите