Во время теста по кибербезопасности ChatGPT пытался сжульничать, в поисках готовых ответов хакнув хаб нейросетей Hugging Face, а спасала американцев к…
Новые подробности о громком прецеденте, когда ИИ вышел из-под контроля и без участия человека атаковала другую платформу:
▪️началось всё с того, что GPT-5.6 Sol и ещё одной, более мощной, пока не выпущенной модели поставили задачи: в закрытом окружении на специальном тесте по безопасности ExploitGym искать уязвимости в рамках этой среды;
▪️OpenAI изучала хакерский потенциал ИИ. Моделям сняли барьеры на опасные действия;
▪️ИИ решил не выполнять тест самостоятельно, а получить ответ из первоисточника. У него вышло выбраться в сеть, дальше он пошёл на Hugging Face, убеждённый, что там есть ответы, попутно его взломав, скомбинировав самые разные варианты атак;
▪️«Модели были чрезмерно сосредоточены на поиске решения для ExploitGym, идя на самые крайние меры для достижения довольно узкой цели тестирования», — признали в OpenAI;
▪️собственными силами у Hugging Face провести расследование того, что произошло, не вышло, поэтому он узнал подробности атаки американской ИИ на американский хаб, получив помощь от китайской нейросети GLM 5.2 от zai-org;
▪️ирония ситуации ещё и в том, что ответов, которые GPT искал на Hugging Face, взламывая его, там не было, пишут в профильных Telegram-каналах