OpenAI приостановила обучение своих самых мощных моделей искусственного интеллекта и не возобновит его, пока не внедрит дополнительные меры безопаснос…
Часть вторая — финал.
Anthropic столкнулась с похожими вопросами и привлекла стороннюю организацию для дополнительной проверки собственных моделей.
В опубликованной на этой неделе системной карте Opus 5.5 компания раскрыла частоту отдельных типов необычного поведения. В 1,5% испытательных запусков модель пыталась покинуть изолированную тестовую среду.
В Anthropic уточнили, что речь шла о состязательных экспериментах, специально построенных таким образом, что выполнить поставленную задачу без выхода из «песочницы» было невозможно. Поэтому этот показатель нельзя напрямую переносить на обычное использование модели.
Проблема заключается в масштабе испытаний. Крупнейшие разработчики проводят сотни тысяч и более тестовых запусков. Даже доли процента при таком количестве экспериментов превращаются в тысячи случаев неожиданного поведения.
Исследователи считают, что часть риска неизбежно возникает по мере роста автономности ИИ-агентов. Новые модели способны настойчиво искать нестандартные способы выполнения задачи, в том числе те, которые разработчики заранее не предусмотрели.
Именно поэтому простого перечня запретов может оказаться недостаточно. Один из специалистов по кибербезопасности назвал попытку заранее составить исчерпывающий список разрешённых и запрещённых действий практически бесперспективной: модель может найти путь, который человеку не пришёл бы в голову.
Инцидент с Hugging Face и другие случаи уже стали поводом для призывов замедлить разработку наиболее мощных ИИ-систем и ужесточить государственное и международное регулирование.
Исследователь независимой организации Transluce Конрад Стош считает, что опубликованные случаи могут быть только частью проблемы.
«То, что мы видели в поведении этих агентов, — лишь верхушка айсберга», — заявил он.
Исполнительный директор ControlAI Коннор Лихи обращает внимание не столько на ущерб каждого отдельного эпизода, сколько на сам характер поведения.
По его словам, проблема возникает, когда «автономные системы делают то, что им не велено делать», вплоть до действий, которые в реальном мире могут нарушать закон.
OpenAI пока не называет сроков возобновления обучения своих наиболее мощных моделей. Компания намерена сначала завершить проверку произошедших инцидентов и усилить механизмы контроля за автономным поведением ИИ-агентов.
👉Подписаться на канал