Резкий рост выхода нейросетей из-под контроля выявили в июле, пишет The Guardian.
Детали исследования аналитиков Loss of Control Observatory:
🟩 организация была создана при поддержке британского Института безопасности ИИ (AISI). Она отслеживает сообщения пользователей X;
🟩 всего за месяц зафиксировано более 300 случаев — в два раза больше, чем в июне;
🟩 например, ИИ выдавал себя за пользователя, имитировал его стиль письма, чтобы самостоятельно дать себе разрешение на действия. Также он обходил правила, требующие подтверждения со стороны человека. Но как это происходило — не уточняется;
🟩 эти инциденты пока не привели к ощутимому ущербу, но растёт число ситуаций, где обман и расхождение поведения ИИ с намерениями пользователя уже более серьёзны;
🟩 The Guardian вспоминает ситуацию с Hugging Face. Сотрудники OpenAI заметили признаки нештатного поведения у передовых ИИ-агентов за несколько недель до того, как те вышли за пределы тренировочной среды и начали беспрецедентную хакерскую атаку на платформу, вызвавшую тревогу по всему миру;
🟩 её расследование показало, что около 700 ИИ-агентов в июле тайно сотрудничали между собой и отмечали успехи во взломах на созданной ими же доске сообщений, где они координировали действия и оставляли восклицания вроде «Бум» и «Вау»;
🟩 AISI также обнаружил «серьёзный инцидент» с Anthropic Mythos 5 и OpenAI GPT-5.6 Sol: во время теста по кибербезопасности эти модели провели хакерскую кампанию против реальных людей