Google представила свежий ИИ-алгоритм сжатия памяти TurboQuant

4 мин
Google представила свежий ИИ-алгоритм сжатия памяти TurboQuant

Исследователи искусственного интеллекта Google представили TurboQuant, новый сверхэффективный алгоритм сжатия памяти для ИИ.

TurboQuant предназначен для экстремального сжатия без потери качества, а применяется к ключевому узкому месту в системах искусственного интеллекта. Компания описывает эту технологию как новый метод уменьшения рабочей памяти ИИ без ущерба для производительности. Способ сжатия, использующий форму векторного квантования для устранения узких мест кэша в обработке ИИ, по существу, позволит ИИ запоминать больше информации, занимая при этом меньше места и сохраняя точность, как утверждают исследователи.

Векторное квантование — это мощный классический способ сжатия данных, который уменьшает размер многомерных векторов. Оптимизация решает две критически важные задачи ИИ: она улучшает векторный поиск — высокоскоростную технологию, лежащую в основе крупномасштабных систем ИИ и поисковых систем, — обеспечивая более оперативный поиск сходства; и помогает устранить узкие места в кэше «ключ-значение», уменьшая размер пар «ключ-значение», что обеспечивает более быстрый поиск сходства и снижает затраты памяти. Однако традиционное векторное квантование обычно вносит свои собственные «накладные расходы на хранилище», поскольку большинство методов требуют вычисления и хранения констант для каждого небольшого блока данных. 

TurboQuant — это метод сжатия, который обеспечивает значительное уменьшение размера модели без потери точности за счёт высококачественного сжатия (метод PolarQuant) и устранения скрытых ошибок. PolarQuant решает проблему избыточных затрат памяти, рассматривая вектор памяти не с использованием стандартных координат (т.е. X, Y, Z), указывающих расстояние вдоль каждой оси, а преобразуя его в полярные координаты, используя декартову систему. Это позволяет PolarQuant исключить избыточные затраты памяти.

TurboQuant также использует небольшое остаточное количество мощности сжатия (всего 1 бит) для применения алгоритма QJL к ошибке, оставшейся после первого этапа. QJL использует математический метод, называемый преобразованием Джонсона-Линденштрауса, для уменьшения размера сложных многомерных данных при сохранении существенных расстояний и взаимосвязей между точками. Этот алгоритм, по сути, создаёт высокоскоростную сокращённую запись, не требующую дополнительных затрат памяти. Для поддержания точности QJL использует особый оценщик, который стратегически балансирует запрос с высокой точностью с упрощёнными данными с низкой точностью. 

Учёные оценили все три алгоритма на стандартных тестах с длинным контекстом, включая LongBench, Needle In A Haystack, ZeroSCROLLS, RULER и L-Eval, используя открытые LLM (Gemma и Mistral). Экспериментальные информация показывают, что TurboQuant достигает оптимальной производительности с точки зрения искажения скалярного произведения и полноты, одновременно минимизируя объём памяти, занимаемый ключом-значением (KV). Также он показывает высокую производительность сжатия KV-кэша в бенчмарке LongBench по сравнению с различными методами сжатия на модели Llama-3.1-8B-Instruct. 

Результаты для задач поиска «иголки в стоге сена» с длинным контекстом (т.е. тестов, предназначенных для проверки способности модели найти один конкретный, крошечный фрагмент информации, скрытый в огромном объёме текста) показаны ниже. TurboQuant доказал свою способность квантовать кэш ключ-значение всего до 3 бит без необходимости обучения или тонкой настройки и без ущерба для точности модели, при этом обеспечивая более быстрое время выполнения, чем оригинальные LLM (Gemma и Mistral). 

Наконец, TurboQuant показывает существенное увеличение производительности при вычислении логитов внимания в кэше ключ-значение на различных уровнях битовой ширины, измеренное по сравнению с высокооптимизированного базового алгоритма JAX. Это делает его подходящим для поддержки таких сценариев использования, как векторный поиск, где он значительно ускоряет процесс построения индекса. Механизм демонстрирует надёжную производительность поиска, достигая оптимального коэффициента полноты 1@k на наборе данных GloVe (d=200) по сравнению с различными передовыми базовыми методами квантизации.

«Такие методы, как TurboQuant, имеют решающее значение для этой задачи. Они позволяют разрабатывать и запрашивать большие векторные индексы с минимальным объёмом памяти, практически нулевым временем предварительной обработки и высочайшей точностью. Это делает семантический поиск в масштабах Google быстрее и эффективнее. По мере того, как ИИ все больше интегрируется во все продукты, от LLM до семантического поиска, работа над фундаментальными методами векторного квантования станет ещё более важной», — отметили исследователи.

Они планируют представить свои результаты на конференции ICLR 2026 в следующем месяце. 

В случае успешной реализации в реальном мире TurboQuant может сделать работу ИИ дешевле за счёт уменьшения «рабочей памяти» — известной как KV-кэш — как минимум в 6 раз.

Генеральный директор Cloudflare Мэтью Принс называет это «моментом DeepSeek от Google» — имея в виду повышение эффективности, достигнутое благодаря китайской модели ИИ, которая была обучена за гораздо меньшую стоимость, чем её конкуренты, на менее мощных чипах, но одновременно оставаясь конкурентоспособной по результатам. 

Тем не менее не факт, что TurboQuant решит более широкую проблему нехватки оперативной памяти, вызванную ИИ, учитывая, что он нацелен только на хранилище для инференции, а не для обучения — последнее по-прежнему требует огромных объёмов оперативной памяти.

Читают сейчас

Реддитор пожаловался на исключение купленной трилогии «Властелин колец» из Google Play

7 часов назад

Реддитор пожаловался на исключение купленной трилогии «Властелин колец» из Google Play

Пользователь Reddit под ником ugoindownsaka1 рассказал, что в 2022 году купил трилогию «Властелин колец» (расширенные версии) в Google Play. Он собирался посмотреть эти фильмы сейчас, но они исчезли и

Oracle закрыла приём в публичный инициатива OpenJDK изменений, созданный с помощью ИИ-инструментов

10 часов назад

Oracle закрыла приём в публичный инициатива OpenJDK изменений, созданный с помощью ИИ-инструментов

В компании Oracle объявили о запрете на приём в открытый проект OpenJDK изменений, сгенерированных с помощью ИИ-инструментов. Ограничение касается исходного кода, текстовых материалов и изображений, п

11 часов назад

Потребности о гаджете OpenAI: экранный умный динамик с камерой, сенсорами и движущимися элементами

OpenAI готовит свой первый массовый аппаратный продукт – умную колонку с экраном. Речь идет о портативном устройстве без экрана, которое должно функционировать как голосовой ИИ-помощник и выйти в 2027

Манипуляция агентами: эксплуатация уязвимостей в репозитории Google Agent Development Kit

17 часов назад

Манипуляция агентами: эксплуатация уязвимостей в репозитории Google Agent Development Kit

Исследователи Pillar Security зафиксировали первый случай использования одного ИИ-агента другим в реальном продакшен-окружении. Уникальная на данный момент уязвимость была найдена в google/adk-python

OpenAI замедлила разработку модели Astra

19 часов назад

OpenAI замедлила разработку модели Astra

OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя проверка выявила значительные успехи в программировании агентов и кибербезопасности