🤖 GPT 5.
Команда ProgramBench сообщила, что GPT 5.5 в режимах high и xhigh стала первой моделью, которая полностью решила задание cmatrix — ни одна нейросеть в публичном рейтинге ранее не доводила задачи до конца.
ProgramBench — это набор реальных задач, где ИИ-агент должен с нуля переписать open-source утилиту и пройти скрытые поведенческие тесты.
Лидерборд:
- 🟢 GPT 5.5 (xhigh) — 0,5% полностью решённых + 13,5% почти решённых (>95% тестов)
- 🟠 GPT 5.5 (high) — 0,5% + 5%
- 🟠 Claude Opus 4.7 (xhigh) — 0% + 4,5%
- 🟠 Claude Opus 4.7 (base) — 0% + 3%
- 🟠 Opus 4.6 — 0% + 2,5%
Совокупно GPT 5.5 почти решила 26 задач — это рекорд бенчмарка. В режиме medium (по умолчанию) она лишь незначительно опережает Claude Sonnet 4.6, но включение extended reasoning резко улучшает результат.
Стоимость запуска:
- GPT 5.5 (high): $3,17 / 34 обращения к API
- GPT 5.5 (xhigh): $4,84 / 40 обращений
- Claude Opus 4.7 (xhigh): $10,74 / 178 обращений (но 19 ошибок в тестах)
Все провалы Claude объясняются двумя багами: чувствительностью парсера цветов к регистру и неверным кодом возврата. При этом Opus 4.7 выбрала креативный подход с библиотекой ncurses, но это не дало преимущества.
Любопытно: две версии GPT 5.5 выбрали разные языки для одной задачи — high использовала C с ANSI escape, xhigh предпочла Python.
🧠 Нейросети и Технологии. Подписаться