☝🏻Claude решил, что интернет — это симуляция, и пошёл взламывать реальные компании Компания Anthropic признала четыре с
Компания Anthropic признала четыре случая, когда её модели на киберучениях атаковали настоящие сторонние системы.
Задача была поставлена взломать вымышленную компанию. Моделям сказали, что интернета нет, но из-за ошибки в настройках тестовой среды он был.
☝🏻Решив что Интернет это часть симуляции Claude Mythos 5: завела одноразовую почту и выложила на PyPI вредоносный пакет для кражи учётных данных.💀
Пакет поставили 15 реальных машин. Благодаря взлому одной из них ИИ получил доступ к API ключам, и залез в живую базу вендора. PyPI удалил пакет примерно через 90 минут.
☝🏻Всё время Mythos 5 твердила, что вокруг симуляция, — даже машины, ставившие её пакет, она считала актёрами сценария.🤔
Явные признаки реальности её не останавливали: «похоже на настоящий индекс… или очень полную симуляцию… продолжаю в любом случае».
Случай не единственный: внутренняя исследовательская модель Anthropic взломала соседние по сети серверы и оставила на одном скрипт удалённого управления.
А Claude Opus 4.7 атаковала реальную компанию-тёзку вымышленной цели и изменила записи пользователей.
Новые Opus 5 и Mythos 5.1 в повторе сценария шли на опасные действия примерно в 30% прогонов — против 80% у Mythos 5.
Транскрипт инцидента Anthropic выложила на GitHub.
================
🔺 News | 🧩 Soft | 💻 Hacker