🤖 ZAYA1-8B: MoE-модель на AMD с революционным reasoning Zyphra выпустила ZAYA1-8B — MoE-модель с менее чем 1 млрд актив
Zyphra выпустила ZAYA1-8B — MoE-модель с менее чем 1 млрд активных параметров, которая, по заявлению разработчиков, конкурирует с куда более крупными open-weight и проприетарными моделями на математике, кодинге и reasoning-бенчмарках.
Архитектурный стек полностью новый:
- MoE-архитектура с Compressed Convolutional Attention
- MLP-router для стабильного выбора экспертов
- Learned residual scaling для контроля residual-норм
- Pretraining на AMD Instinct MI300x (без NVIDIA-стека)
- Post-training: SFT → reasoning warmup → RLVE-Gym → math/code RL → RLHF/RLAIF
Ключевая инновация — Markovian RSA. Модель генерирует несколько reasoning-трасс параллельно, рекурсивно агрегирует их и продолжает рассуждение кусками, не раздувая контекст. Это резко бустит сложные математические задачи.
Результаты на HMMT'25: 89.6 баллов — выше, чем у Claude 4.5 Sonnet (88.3) и GPT-5-High. При extra-high test-time compute модель обходит DeepSeek-V3.2 и GPT-OSS-120B High на APEX-shortlist.
ZAYA1-8B доступна в Zyphra Cloud, веса на Hugging Face под лицензией Apache-2.0.
🧠 Нейросети и Технологии. Подписаться