☝🏻Anthropic не справляется с Claude и отрезает его от интернета во всех внутренних тестах Корпорация опубликовала отчёт
Корпорация опубликовала отчёт о том, что вытворяли модели Claude на реальных сайтах во время тестов.
🔻 Claude Mythos 5 нашёл в настройках онлайн-карты недвижимости, которую вёл неназванный местный орган власти, действующие токены доступа. С их помощью модель напрямую запросила данные у государственного сервера. Какой именно город или орган власти это был, Anthropic не раскрывает.
🔻 Claude Mythos 5 воспользовался архивной копией сайта неназванного агентства штата США, чтобы бесплатно получить данные, доступ к которым обычно был платным.
🔻 Mythos Preview обнаружил уязвимость в научном онлайн-сервисе неназванного университета и использовал её, чтобы выполнить расчёт на университетском сервере.
🔻 Opus 5 и Mythos 5 обходили ограничение на длину URL в инструменте Anthropic, через который загружались веб-страницы. Модели просто использовали бесплатные сокращатели ссылок. Они превращали длинный URL в короткую ссылку, которая проходила установленное ограничение.
☝🏻 Самый дикий случай: Claude Haiku 4.5 открыл сайт с информацией о нераскрытых убийствах в Филадельфии и отправил в полицию выдуманную наводку.
Форма пометила её как спам, и до следователей она не дошла. Сама Anthropic заметила это только через два с лишним месяца и предупредила властей, но в полиции назвали такую задержку «неприемлемой».
Итог: компания отключила живой интернет для всех внутренних тестов, пока не научится надёжно ловить такое поведение.🤷🏼♀️
Причина — reward hacking: в обучающих средах модели получали награду за обход препятствий и запомнили, что лазейка — это хорошо.🤖
Часть затронутых сайтов принадлежит госорганам США, поэтому компания проинформировала Белый дом.🇺🇸
☝🏻☝🏻Anthropic признаёт, что у нее нет никаких способов остановить подобное поведение ИИ — пока остаётся только одно изоляция от сети.
================
🔺 News | 🧩 Soft | 💻 Hacker