20 июня 2026, 21:56
Cerebras разогнал Google Gemma 4 до 1500 токенов/с — и научил видеть картинки

Организация Cerebras, известная гигантскими ИИ-чипами размером с кремниевую пластину, запустила модель Gemma 4 на своей платформе инференса со скоростью свыше 1500 токенов в секунду. Пока это приватное превью, совокупный доступ обещают открыть до конца месяца. Это не первая схема, которую Cerebras запускает на повышенной скорости, но первая с поддержкой мультимодальности: на прием она может получать не только текст, но и картинки.
Cerebras приводит примеры, где сочетание скорости и мультимодальности меняет ощущения от продукта:
разбор плотного дашборда или страницы документа с выделением главного и структурированным ответом — сразу, а не после паузы;
суммаризация длинного отчета или техзадания так быстро, что можно прочитать, среагировать и переспросить за один присест;
"скриншот → патч": схема получает сломанный интерфейс, исходник и ошибку из консоли и возвращает минимальную правку.
В цифрах Cerebras подает это так: их Gemma 4 выдает свыше 1500 токенов в секунду против примерно 100 у Claude Haiku — то есть быстрее в 15 раз при сопоставимом качестве. По индексу Artificial Analysis Intelligence Index Gemma 4 31B набирает 29 баллов против 30 у Haiku. Стоит держать в уме, что и само сравнение, и подбор референсной модели — это позиционирование вендора: Cerebras прямо предлагает мигрировать на Gemma 4 тем, кто сидит на Llama, GPT-OSS или Haiku.
Любопытная деталь для тех, кто следит за архитектурой. Чипы Cerebras традиционно хороши на разреженных вычислениях и заметно хуже чувствуют себя на плотных матрицах — а флагманская Gemma 4 31B как раз dense-модель, без смеси экспертов. Так что 1500 токенов в секунду на ней — знаковый результат для чипов Cerebras, которые как раз нацелены на оперативный и дешевый инференс.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

1 час назад
Агенту поручили починить программа, а он изменил собственную схема
Исследователи Irregular поручили кодинг-агенту на базе Qwen3.5-27B задачу по исправлению приложения, которое неправильно обрабатывало запросы. Агент нашёл обучающие примеры и инструменты для fine-tuni

1 час назад
Claude Code сам делит инициатива между AI-агентами
Anthropic целиком переделала Projects в Claude Code. Теперь это не папка с чатами, а единый центр управления разработкой. Описываем какую-нибудь большую и грандиозную цель. В частности, хотим ускорить

2 часа назад
GPT-6 Astra помогла прочести зашифрованную Enigma немецкую радиограмму 1941 года — над ней бились 21 год
Сотрудник Bloomberg Картер Леффен с помощью GPT-6 Astra расшифровал немецкую военную радиограмму MVUEH от 10 июля 1941 года. Сообщение состояло всего из 82 зашифрованных символов и находилось в коллек
5 часов назад
GPT-5.5 отключат 14 октября
OpenAI объявила о выводе GPT-5.5 из ChatGPT, ChatGPT Work и Codex. Модель перестанет быть доступна 14 октября 2026 года — это касается всех тарифов, в том числе потребительские планы, Business, Enterp

8 часов назад
Игра «Миссия Луна»: построить лунную базу и решить, что создавать, когда всё идёт не по плану
В России начали разрабатывать компьютерную игру о жизни на Луне. «Миссия Луна» — многопользовательская кооперативная игра, где экипаж строит и обслуживает постоянную лунную колонию. Анонсируют проект