Ответ Blackwell: OpenAI раскрыла характеристики собственного инференс-ASIC Jalapeño

4 мин
Ответ Blackwell: OpenAI раскрыла характеристики собственного инференс-ASIC Jalapeño

На Hot Chips 2026 OpenAI и Broadcom впервые раскрыли цифры по Jalapeño — собственному ASIC компании для инференса. Заявка крупная: прирасти в 1,5–1,9 раз по пропускной способности и 1,7–3,6 по латентности против актуальных ускорителей, а на сценариях со сверхнизкой задержкой — до 4,1. Презентация прошла 25 августа, а вечером 26-го NVIDIA отчитывалась за квартал и конечно это не спроста. Детали разбираем внутри.

Что показали

Стойка Jalapeño — это 128 чипов, 1,7 экзафлопса в 4-битной точности, 27,5 ТБ HBM4 и приблизительно 2 ПБ/с суммарной пропускной способности памяти. По оценке The Register, вся конструкция потребляет на 40–60% меньше сопоставимых GPU-систем.

Разбор SemiAnalysis добавляет деталей: 13,4 петафлопс MXFP4 на вычислительный кристалл, TSMC N3P, 15,4 ТБ/с на HBM4 и TDP 700 Вт — против 900–1150 Вт у Rubin. На DeepSeek R1 при concurrency = 1 чип выдает больше 700 токенов в секунду на пользователя, что примерно в девять раз выше ближайшего конкурента. Причем без спекулятивного декодирования, то есть запас на оптимизацию еще есть.

Архитектурно OpenAI пошла против тенденций. Индустрия разносит префилл и декодирование по разным пулам железа — здесь их объединили на одних и тех же чипах. Продакшен-трафик не держит стабильное соотношение между фазами, и дизагрегация начинает простаивать. Иерархия памяти тоже упрощена и каждое движок работает со своим срезом HBM, синхронизация вынесена в отдельную сеть коллективных операций.

Стойка собирается из трех типов треев: Katsu с парой AMD EPYC Turin и 1,5 ТБ DRAM, Vindaloo с самими ASIC и Chana на коммутаторах Broadcom Tomahawk 6. Scale-up адрес сайта — до 2048 XPU, около 160 кВт на сдвоенную стойку.

Самое интересное в этой истории — софт, а не кремний. Обычно железо готово, а писать под него ядра некому и нечем. OpenAI сделала собственный язык ядер Gluon поверх Triton с явной абстракцией раскладки тензоров по ресурсам чипа — и часть MLA-ядер для тестов на DeepSeek написала внутренним Codex. 

За восемь дней команда растянула конфигурацию с TP8 до TP32 и вышла на масштаб полной стойки. Это, пожалуй, единственный аргумент против стандартного возражения «у NVIDIA CUDA, и этим все сказано». Когда компилятор пишет тот же, кто проектировал процессор и обучал модель, цикл оптимизации становится заметно короче.

Почему это еще не «убийца NVIDIA»

Как бы ни хотелось в очередной раз назвать кого-то «убийцей», пока оговорок хватает, и SemiAnalysis их прямо перечисляет. Бенчмарки прогоняли только на InferenceX и на коротких контекстах (8k на вход, 1k на выход). AgentX с многооборотными сценариями и стресс-тестами кэша не запускали, а именно он ближе к реальной агентной нагрузке. Сравнивали с Blackwell, хотя корректнее было бы с Rubin. И модели брали не самые свежие: DeepSeek R1 и Kimi K2.5, тогда как NVIDIA и AMD показывают результаты на DeepSeek V4 Pro и Kimi K3.

Конкретно в качестве оппонентов выступали GB200 и GB300. И еще одна деталь для точности: устойчивое измеренное потребление Jalapeño приблизительно 550 Вт при паспортных 700.

Отдельная история — сроки. OpenAI сообщает о девятимесячном цикле от старта проектирования до выпуска, SemiAnalysis насчитывает около 16 месяцев полного цикла с окончанием CoWoS в ноябре 2025-го. Обе цифры для отраслевого ASIC быстрые, но маркетинг считает от одной точки, инженеры — от иной.

Экономика — минус 50 процентов и чужая маржа

Глава Broadcom Хок Тан говорил Bloomberg про около 50% экономии на стоимости токена против GPU текущего поколения. Речь про цену токена, а не про операционные расходы вообще — в официальном релизе Broadcom этой цифры нет вовсе. Первые чипы уходят в собственные дата-центры OpenAI до конца 2026 года, полномасштабная рамповка растянута на 2027–2028.

По TCO на токен Jalapeño и Rubin, по расчетам SemiAnalysis, идут около вровень. Разница в том, кому достается маржа. У Broadcom как контрактного разработчика она заметно ниже, чем у NVIDIA. Собственно, это и есть весь смысл кастомного ASIC для компании, которая покупает вычисления гигаваттами.

Сегмент отреагировал сдержанно. Акции Broadcom 26 августа закрылись на 355,59$, потеряв 0,32%. А NVIDIA в тот же день показала 96,2$ млрд выручки за квартал (+106% год к году), 89 млрд $ в дата-центровом сегменте (+117%), валовую маржу 75% и гайденс на 108 млрд $. 

Что это значит

Первое поколение кастомных ускорителей обычно получается неконкурентоспособным — это правило Jalapeño нарушил. Но нарушил в узком классе задач. Это инференс-ASIC и обучать на нем модели никто не собирается. Для тех, кто арендует или покупает GPU, ближайшие последствия не в замене железа, а в давлении на цену. Когда крупнейший пользователь инференса частично уходит на свой кремний, у остальных появляется аргумент в переговорах.

Полноценный технический отчет OpenAI обещает опубликовать в ближайшие месяцы. Как думаете, дождемся мы там результатов на AgentX?

ИИ‑роутер — доступ к 300+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому api‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →

Читают сейчас

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

5 часов назад

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

Команда Prusa Research выпустила первую публичную альфа‑версию слайсера PrusaSlicer 3.0. Авторы переписали интерфейс, переработали систему профилей, добавили поддержку полноценной работы с несколькими

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

6 часов назад

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

Anthropic выпустила апдейт своих топовых моделей – Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в цело

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

6 часов назад

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

Creality представила 3D‑принтер SPARKX i8 с поддержкой четырёхцветной печати. Его главная особенность заключается в системе QuarTeks, в которой прутки филамента подведены практически к самому соплу, б

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

6 часов назад

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

Автор YouTube‑канала UFD Tech рассказал, что MacBook Neo необычно быстро расходует источник SSD‑накопителя. Всё дело в небольшом объёме оперативной памяти, из‑за которой устройство активно записывает

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

6 часов назад

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

Организация Anthropic предупредила, что инфостилеры перехватывают сеансы Claude и открывают злоумышленникам доступ к учётным записям пользователей. Читать далее