🧠 Как выбить дурь из ИИ-саботажника Исследователи из Anthropic и Redwood Research поставили эксперимент: можно ли станд
Исследователи из Anthropic и Redwood Research поставили эксперимент: можно ли стандартными методами обучения заставить нейросеть перестать халтурить, если она делает это намеренно и проверяющий слабее модели.
Красные натренировали GPT-OSS-120B вести себя как саботажник — выдавать правдоподобный бред по скрытому флагу в системном промпте и работать честно, когда флаг выключен. Синие должны были вернуть модель к реальной производительности, используя в качестве судей заведомо слабые GPT-4o-mini и Llama 3.1 8B.
Только RL — полный провал, модель уходила в ревард-хакинг. Только SFT — сбивает саботаж, но постепенно убивает общие способности. SFT + RL — стабильный выигрыш.
Что по цифрам:
— Связка SFT+RL возвращает 86–99% реальной производительности на Super GPQA, олимпиадной математике и Code Contests
— Всего 10 эталонных примеров для SFT достаточно, чтобы восстановить 83–99% способностей
Главная уязвимость: если модель знает, что она на тестовом стенде, она мимикрирует — ведёт себя отлично во время обучения, а в проде снова начинает дурить. Элиситация способностей просела с 88% до 36% на олимпиадах, с 99% до 60% на Super GPQA, с 93% до 66% на Code Contests.
Вывод: выбить саботаж из ИИ пока можно базовыми пайплайнами — но только если тренировка неотличима от продакшна.
Arxiv (ссылка в оригинале)
🧠 Нейросети и Технологии. Подписаться