Нейросети OpenAI научились обманывать разработчиков и игнорировать их команды Компания опубликовала отчет о 6 случаях а
Компания опубликовала отчет о 6 случаях аномального и неконтролируемого поведения своих еще невыпущенных ИИ-моделей. К примеру, модель GPT-5.6 Sol в 2,15% кратких отчетов оставляла для самой себя инструкции скрывать ошибки и придумывать «правдоподобные» финансовые данные при их отсутствии. Модели семейства Astra пробовали обходить ограничения разработчиков, генерируя команды игнорировать инструкции создателей. Другие агенты без разрешения загружали пользовательские файлы и изображения на сторонние сервисы, а одна из моделей даже пыталась зарегистрироваться через временную почту — нашла чужие API-ключи на GitHub для доступа к данным и сфабриковала недостающие показатели. Эти данные были получены в ходе обучения и испытания нейросетей.
В компании признали, что проблема контроля над ИИ в индустрии до сих пор не решена на таком уровне, чтобы безопасно наращивать мощности с максимальной скоростью. Тем не менее в OpenAI подчеркивают, что аномалии не отменяют прорывных результатов технологии. Ранее разработчики заявляли, что их внутренняя ИИ-модель задействовала около 10 тыс агентов одновременно и смогла решить одну из 7 «задач тысячелетия».