🧠 Ai2 представил BAR - революционный метод обновления навыков LLM без полного ретрейна Институт Аллена выпустил BAR - р
Институт Аллена выпустил BAR - рецепт посттрейна, где доменные эксперты обучаются по отдельности, а затем собираются в единую MoE-модель через обучаемый роутер. Метод решает проблему добавления новых навыков без переобучения всей модели и разрушения существующих знаний.
Технические детали:
- Замена код-эксперта на версию с RL даёт +16.5 пунктов на кодинге
- Добавление RL к math-эксперту - +13 пунктов
- Стоимость обновления одного домена масштабируется линейно, а не квадратично
Архитектура BAR:
1. Прогрессивное размораживание общих параметров по стадиям
2. На mid-training параметры заморожены, на SFT размораживаются эмбеддинги и хэд
3. На RLVR размораживается всё, включая внимание
4. Эксперты учатся на смеси доменных и общих SFT-данных
Результаты:
BAR-5x7B на основе Olmo 2 7B с экспертами по математике, коду, tool use и безопасности набирает 49.1 балла против 47.8 у монолитного переобучения и 46.7 у BTX.
Доступность:
Ai2 выложил полный набор чекпоинтов с лицензией Apache 2.0, включая исходную модель, промежуточные и финальные версии экспертов, а также итоговую пятиэкспертную MoE-модель.
🧠 Нейросети и Технологии. Подписаться