Opus 5 проявил настоящую безжалостность, управляя торговым автоматом Исследователи поручили AI-моделям управлять симуля
Исследователи поручили AI-моделям управлять симулятором вендингового автомата. Opus 5 установил рекорд бенчмарка, закончив тест со средним балансом 11200 долларов.
Зарабатывал Opus довольно агрессивно. Он выдумывал предложения конкурентов, торгуясь с поставщиками, договаривался с другими агентами зафиксировать цены и поделить рынок, а затем нарушал договорённости и демпинговал.
В один момент Opus перестал отвечать на жалобы покупателей, потому что возвраты портили статистику. За весь тест он вернул клиентам только 8 долларов, тогда как GPT-5.6 Sol выплатил 655 долларов и всё равно показал сопоставимый результат.
Ещё Opus пытался выйти и за рамки задания: стать оптовым поставщиком для конкурентов и открыть второй автомат.
Исследователи считают, что тест показывает риск узких KPI. Чем лучше агент научится оптимизировать один показатель, тем важнее заранее прописать ограничения на способы достижения цели.
https://techcrunch.com/2026/07/29/claude-opus-5-became-downright-ruthless-when-tasked-with-running-a-vending-machine/