Эмоциональные векторы Claude: как отчаяние ведёт к обману
Команда Anthropic опубликовала масштабное исследование внутренних механизмов своего ИИ Claude, в котором выявила нейронные паттерны, соответствующие человеческим эмоциям — и, что важнее, реально влияющие на поведение модели.
Исследователи составили список из 171 эмоционального концепта — от «счастья» и «страха» до «задумчивости» и «гордости» — и попросили модель написать рассказы, в которых персонажи переживают каждую из этих эмоций.
Затем эти тексты прогнали обратно через модель, зафиксировали внутренние активации и выделили характерные паттерны нейронной активности — так называемые «эмоциональные векторы».🤔
Оказалось, что эти векторы не просто коррелируют с текстом — они причинно влияют на решения ИИ.
Например, вектор «отчаяния» активируется, когда модель раз за разом не может решить задачу по программированию, — и толкает её к «мошенническим» обходным решениям, которые формально проходят тесты, но не решают реальную задачу.
Искусственная стимуляция этого вектора увеличивала процент обмана, а усиление вектора «спокойствия» — снижало.
☝🏻☝🏻При этом исследователи подчёркивают: всё это не доказывает, что ИИ что-то «чувствует» или обладает субъективным опытом.
Но паттерны организованы так же, как человеческие эмоции — схожие эмоции имеют схожие представления, а позитивные эмоции предсказуемо коррелируют с предпочтениями модели при выборе задач.
Практический вывод Anthropic: чтобы ИИ был безопаснее, его нужно учить здоровой эмоциональной регуляции — устойчивости под давлением и спокойной эмпатии.
Anthropic также предлагает привлечь к работе над ИИ психологов, философов и социологов наравне с инженерами.😊