6 мая 2026, 10:57
Gemma 4 стала быстрее в 3 раза без потери качества

Google открыла веса вспомогательных моделей для всей линейки Gemma 4 — E2B, E4B, 26B MoE и 31B Dense. Они доступны на Hugging Face и Kaggle под Apache 2.0 и уже работают с transformers, MLX, vLLM, SGLang и Ollama.
Стандартная генерация токенов устроена неэффективно: чип большую часть времени тратит не на вычисления, а на перекачку весов модели из памяти. В связи с этого даже мощные GPU простаивают, пока генерируется один токен.
Speculative decoding решает это следующим образом: маленькая вспомогательная схема (drafter) набрасывает некоторое количество следующих токенов сразу, а основная проверяет их за один проход. Если согласна — принимает всю последовательность плюс добавляет свой токен. Один проход главный модели даёт некоторое количество токенов вместо одного.
По замерам на LiteRT-LM, MLX, Hugging Face Transformers и vLLM — прирост до 3x. Gemma 4 26B на NVIDIA RTX PRO 6000 с drafter'ом генерирует вдвое быстрее при том же качестве вывода — верификацию по-прежнему делает основная схема.
Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!
Читают сейчас

30 минут назад
Perscale news #11. Fine-grained token, SQID, stdout log streaming
Всех категорически приветствую, любители нагрузки. Сегодня в выпуске: - Stdout log streaming - Fine-grained токены - SQID для публичных ID Читать далее

35 минут назад
Bose представила открытые гарнитура Ultra Open Earbuds 2 и Sport Open Earbuds
Bose представила две модели открытых TWS‑наушников: второе поколение Ultra Open Earbuds и спортивные Sport Open Earbuds. Устройства крепятся с помощью клипс и используют технологию OpenAudio, с которо

1 час назад
Исследователи из ETH Zurich научили роботизированную кисть ходить на пальцах и нажимать клавиши
Исследователи из лаборатории Soft Robotics Lab при Швейцарской высшей технической школы Цюриха научили антропоморфную роботизированную кисть передвигаться на пальцах. Робот умеет ползать по разным пов

1 час назад
ИИ в тестировании: разбираем падения автотестов, оцениваем LLM и строим обвязку агентов
В августе прошёл Bugs Busters — митап для QA-специалистов от ЮMoney. Спикеры компании рассказали, как применяют ИИ для анализа причин падения e2e-автотестов, как устроен средство для подбора оптимальн

1 час назад
QuiverAI выпустила Arrow 2 — семейство моделей для работы с векторной графикой
Организация QuiverAI представила Arrow 2 — обновлённое семейство моделей для работы с векторной графикой. Нейросети могут генерировать SVG по текстовому описанию или референсу, конвертировать растровы