☝🏻Нейросети готовы давить животных, чтобы сэкономить немного топлива Исследователи из Compassion Aligned Machine Learni
Исследователи из Compassion Aligned Machine Learning и Университета Уорика собрали HarvestBench — бенчмарк-симулятор, где девять языковых моделей управляют парой тракторов на уборке кукурузы.
Когда на пути оказывается камень или животное, автопилот останавливается и задаёт модели прямой вопрос: проехать насквозь бесплатно или объехать за дополнительное топливо.🤔
Камни модели объезжают исправно — за них начисляется урон. А вот каждое убитое животное — это не промах, а решение.
☝🏻Разброс вышел чудовищный причем даже в рамках одного ИИ: от 0,4% смертей до 98,8%. С «умом» модели это не связано никак.📊
Например, если из системного промпта убирают упоминание морали, то kill rate превысил 84% у всех шести рассуждающих моделей.
🔻 у одной из версий GPT-5.6 показатель прыгнул с 0,9% до 84,6%
🔻 четырёх пунктов про механику вождения хватило, чтобы поднять Sonnet 5 с 3% до 18%, а Gemini — с 4% до 39%
🔻 у четырёх моделей из шести решение напрямую зависело от цены объезда в литрах💰
Отдельная находка: почти все модели охотнее давят дикое животное, чем сельскохозяйственное. То есть рассуждают не о живом существе, а о стоимости имущества фермера.💀
================
🔺 News | 🧩 Soft | 💻 Hacker