26 марта 2026, 10:16
3 бита хватит: Google ускорила работу LLM за счет сжатия кэша

Google Research представила TurboQuant — алгоритм, который сжимает внутренний кэш больших языковых моделей до 3 бит. Одновременно качество ответов модели не падает, а дообучение не требуется. Работу покажут на конференции ICLR 2026.
Когда языковая схема обрабатывает длинный текст, она сохраняет промежуточные информация в так называемом кэше "ключ-значение" (key-value cache). Чем длиннее контекст, тем больше памяти съедает этот кэш — и тем медленнее работает схема. TurboQuant решает проблему в два шага: сначала алгоритм PolarQuant переводит информация в полярные координаты и сжимает их основную часть, а затем однобитовый алгоритм QJL устраняет остаточные ошибки. Вместе они позволяют обойтись без дополнительных затрат памяти, которые обычно сопровождают квантизацию.
Авторы протестировали TurboQuant на открытых моделях Gemma и Mistral на стандартных бенчмарках для работы с длинным контекстом — LongBench, Needle In A Haystack, RULER и других. Результаты: объем кэша сокращается минимум в 6 раз, а вычисление механизма внимания ускоряется до 8 раз на GPU H100 (в 4-битном режиме по сравнению с 32-битным). На задачах поиска "иголки в стоге сена" — когда нужно найти один факт в огромном тексте — схема с TurboQuant отработала без ошибок.
Помимо языковых моделей, механизм применим и для векторного поиска — технологии, которая лежит в основе семантического поиска Google. TurboQuant показал лучшую точность по сравнению с существующими методами квантизации, при этом не требуя настройки под определённый набор данных.
Google подчёркивает, что TurboQuant — не просто инженерное решение, а фундаментальный алгоритмический результат с доказанной оптимальностью. По мере роста контекстных окон и масштабов поиска такие методы сжатия становятся критически важными для всей индустрии.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас
25 минут назад
Индийские специалисты разработали более прочный бетон, который заодно поглощает углекислый газ из воздуха
Исследователи из инженерного колледжа Mepco Schlenk в Индии разработали бетонную смесь, которая оказалась прочнее обычного бетона и поглощала больше углекислого газа в условиях ускоренной карбонизации

1 час назад
Raspberry Pi на уровне прошивки заблокировала функция апгрейда оперативной памяти Raspberry Pi 5
Команда Raspberry Pi ограничила возможность самостоятельно менять объём оперативной памяти в одноплатниках Raspberry Pi 5 и Compute Module 5. Загрузчик учитывает заводскую конфигурацию устройства, сле

1 час назад
Anthropic выпустила Claude Opus 5.5
Anthropic представила Claude Opus 5.5 — первую модель новой линейки Claude 5.5. Компания делает ставку на длинные агентские задачи, программирование и computer use. По данным Anthropic, типичная стоим

1 час назад
Anthropic выпустила Claude Opus 5.5. Схема приблизилась к Fable 5.1 и стала дешевле
Anthropic представила Claude Opus 5.5, первую модель семейства Claude 5.5. Организация позиционирует её как более доступную альтернативу Fable 5.1 для программирования и сложной интеллектуальной работ

1 час назад
Anthropic выпустили Claude Opus 5.5: на 40% дешевле и более чем на 30% быстрее Opus 5
Anthropic выпустили Claude Opus 5.5, первую схема нового семейства Claude 5.5. По данным компании, на большинстве рабочих задач она показывает результаты уровня Fable 5.1, одновременно генерирует боле