17 марта 2026, 00:11
Тысячи токенов в секунду: Nvidia добавила чипы Groq в стойки Vera Rubin

На конференции GTC 2026 Nvidia показала новый тип серверных стоек — LPX, в которых 256 чипов Groq 3 LPU работают в связке со стойками Vera Rubin NVL72. Это начальный случай, когда Nvidia интегрирует сторонний процессор в свою платформу. Технологию Groq организация получила в конце 2025 года в контексте сделки на $20 млрд, вместе с основателем Groq Джонатаном Россом и президентом Санни Мадрой.
Идея в разделении труда: GPU Rubin обрабатывают входящие промпты (этап prefill), а LPU от Groq берут на себя генерацию токенов (этап decode). Пропускная способность SRAM-памяти у Groq 3 достигает 150 TB/s на процессор — это почти в 7 раз больше, чем 22 TB/s у HBM4-памяти в GPU Rubin. Каждый LPU выдает 1,2 петафлопса в FP8, но вмещает всего 500 МБ памяти — около в 500 раз меньше, чем у Rubin GPU. Следовательно их и нужно 256 штук в одной стойке, а для моделей с триллионом параметров — некоторое количество стоек.
Стойки LPX подключаются к NVL72 через интерконнект Spectrum-X. Согласно заявлению Яна Бака, вице-президента Nvidia по гиперскейлу, связка даёт возможность обслуживать модели с триллионом параметров на скорости в тысячи токенов в секунду на пользователя. При этом LPU пока не поддерживают CUDA нативно — они работают как ускоритель к платформе Vera NVL72.
Интеграция LPU практически заменила собственный инициатива Nvidia — чип Rubin CPX, анонсированный на Computex в прошлом году. От него отказались в пользу подхода Groq. Nvidia рассчитывает, что провайдеры инференса смогут брать за «премиальные токены» до $45 за миллион — втрое больше, чем нынешние $15 у OpenAI за модель GPT-5.4.
Nvidia — не единственная, кто идет этим путем. В пятницу AWS объявила о похожей связке: ускорители Trainium 3 для prefill и SRAM-чипы Cerebras WSE-3 для генерации токенов. Разделение инференса на две стадии с разным железом может превратиться из эксперимента в индустриальный тренд.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас
2 часа назад
Anthropic начнут проектировать чипы для Claude
Anthropic начала формировать собственное направление по проектированию процессоров для Claude. В свежей вакансии Research Engineer, Chip Design RL организация прямо пишет, что ищет инженера, который н

3 часа назад
37 процентов машиностроителей фокусируются на ERP и ИБ
К2Тех провел комплексное исследование цифровизации машиностроительной отрасли. Оно объединило результаты опроса 150 респондентов и 15 глубинных интервью с представителями ключевых сегментов отрасли: а

4 часа назад
Хакатоны августа 2026
Августовский версия: собрали для вас 8 крутых соревнований — от ML-баттлов с 7,2 млн ₽ до офлайн-CTF без интернета и инженерных хакатонов по CFD-моделированию. Успейте зарегистрироваться — дедлайны ск

5 часов назад
C 4 сентября Google Assistant перестанет функционировать на смартфонах и планшетах Android, его заменит Gemini
Голосовой помощник Google Assistant перестанет функционировать на смартфонах и планшетах под управлением Android с 4 сентября 2026 года, пишет 9to5Google со ссылкой на сообщение от Google. Американска

5 часов назад
«Сбер» расширит программу амбассадоров в вузах до 50 университетов в 24 городах России
«Сбер» расширит программу амбассадоров в вузах. В новом сезоне к проекту присоединятся 50 университетов из 24 городов России. Старт программы запланирован на октябрь. Как сообщили в компании, от каждо