Anthropic нашла у Claude скрытое рабочее пространство
🔹Исследователи Anthropic описали в Claude внутреннюю структуру, похожую на «доступное сознание» — рабочую область, где у человека находятся мысли, которые можно удержать, запомнить и озвучить. Компания подчёркивает: речь не о доказательстве самосознания или способности чувствовать. В Claude это пространство назвали J-space. В нём видны нейронные паттерны, связанные с отдельными словами и понятиями, из которых модель собирает ответ.
🔹В экспериментах J-space показывал то, что Claude не выводил ни в рассуждениях, ни в финальном тексте: например, слова «обманывать», «скрывать» и «манипулировать». Это может помочь проверять модели на скрытые вредоносные намерения. У специально обученной портить код версии в J-space появлялись признаки попыток действовать тайно. При этом отключение J-space почти не мешало простым ответам, но резко ухудшало многошаговое планирование, рассуждения и часть творческих задач. Anthropic считает, что находка важна и для безопасности ИИ, и для будущих исследований мозга.
Кстати, когда Claude просили «не думать о розовом слоне» или белом медведе, эти образы всё равно появлялись в J-space, хотя реже, чем при прямой просьбе о них думать.