TurboQuant: революция в сжатии памяти ИИ от Google Research
Google Research недавно опубликовали
алгоритм, который сжимает рабочую память языковых моделей в 6 раз и ускоряет их работу в 8 раз — причём без потери качества ответов
Работа принята на крупную научную конференцию и уже успела ощутимо качнуть рынок памяти
🔻Чтобы понять, в чём суть, нужно сказать пару слов про устройство ИИ
Когда ты ведёшь длинный диалог с ChatGPT, Claude или Gemini, модель не «помнит» предыдущие сообщения сама по себе — она держит весь разговор в специальной рабочей памяти на видеокарте
Чем длиннее контекст, тем больше эта память распухает
Для крупной модели на 70 миллиардов параметров и контексте в 32 тысячи токенов такая рабочая память съедает около 80 ГБ видеопамяти — нередко больше, чем весят сами «мозги» модели
Именно сюда упёрлась вся индустрия: видеопамять стоит дорого, фабрики строятся годами, а аппетит у моделей растёт экспоненциально📈
☝🏻☝🏻TurboQuant решает эту проблему чисто математически, без всякого нового железа
Алгоритм работает на любой современной модели сразу из коробки — его не нужно дообучать и не нужно подкручивать под конкретные данные
Под капотом два этапа:
▫️Первый этап — поворот данных.
Каждый кусочек информации в этой рабочей памяти — это длинный список чисел (вектор)
Обычно среди этих чисел есть «выскочки» — пара значений сильно больше остальных, и именно они мешают сжимать данные грубо
Алгоритм сначала математически «крутит» вектор так, что энергия равномерно размазывается по всем числам, выскочки исчезают, и распределение становится предсказуемым
После этого можно один раз посчитать оптимальные ступеньки округления и применять их ко всем моделям
▫️Второй этап — корректирующий бит
Округление неизбежно даёт ошибку, и в обычной нейросети такие крошки-ошибки накапливаются от слоя к слою и в итоге превращаются в бред
Здесь же добавляется всего один бит-поправка, который говорит модели, в какую сторону было округление — в плюс или в минус
Поскольку модель одновременно обрабатывает тысячи таких векторов, эти однобитовые поправки статистически гасят друг друга, и итоговая ошибка получается практически нулевая💡
☝🏻☝🏻☝🏻Что это даёт на практике
Рабочая память, которая раньше занимала 60 ГБ, теперь умещается примерно в 11 ГБ
Один топовый ускоритель H100 на 80 ГБ начинает обслуживать длинные контексты и большие очереди запросов, под которые раньше нужно было ставить несколько видеокарт
Стоимость одного токена при выдаче ответа падает кратно
На стандартных тестах вроде поиска одной фразы среди 100 тысяч токенов алгоритм выдаёт результат, неотличимый от полной точности
Реакция рынка была мгновенной: после публикации 25 марта акции производителей памяти посыпались
SK Hynix упал на 6.23%, Samsung на 4.8%, Micron около 5%, SanDisk до 8%, главный корейский фондовый индекс просел на 3%📉
Логика инвесторов простая — все последние годы производители памяти жили под лозунгом:
«ИИ всегда требует больше памяти, поэтому покупайте наши чипы»
Если же основной её пожиратель внезапно ужимается в шесть раз без потерь, схема «больше моделей → больше памяти → больше чипов» перестаёт работать в лоб📉
☝🏻☝🏻Подвох в реальном продакшене один — чтобы выжать обещанное восьмикратное ускорение, придётся переписывать низкоуровневые драйверы и ядра видеокарт под новый формат памяти
Само железо физически готово, но прошивка пока не понимает, что делать с освободившейся пропускной способностью
☝🏻☝🏻Официальная реализация от Google ожидается во втором квартале 2026, а на GitHub уже лежит сообщество-версия — пакет ставится одной командой и подключается к библиотеке HuggingFace как замена стандартной рабочей памяти
☝🏻☝🏻☝🏻И отдельный плюс — TurboQuant сжимает только рабочую память, а не сами веса модели, поэтому он спокойно работает поверх других методов сжатия и складывается с ними