OpenAI показала результаты своего inference-чипа Jalapeño: он обошел системы на NVIDIA

3 мин
OpenAI показала результаты своего inference-чипа Jalapeño: он обошел системы на NVIDIA

OpenAI опубликовала первые результаты тестирования Jalapeño — собственного ASIC для инференса языковых моделей. На публичном бенчмарке InferenceX процессор представил более высокую производительность на ватт и меньшую задержку по сравнению с коммерческими системами на NVIDIA GB200 и GB300.

Тесты проводили на трех open-weight моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Во всех трех случаях OpenAI заявляет преимущество Jalapeño по совокупности ключевых метрик.

GPT-OSS 120B
GPT-OSS 120B

На пиковых нагрузках процессор представил в 1,5–1,9 раза больше полезной ИИ-работы на ватт, а end-to-end latency оказалась ниже в 1,7–3,6 раза. В интерактивных сценариях преимущество по производительности составило 2,1–4,1 раза.

Для GPT-OSS 120B OpenAI приводит показатель около 1459 токенов в секунду на пользователя против 535 у системы конкурента. Для DeepSeek R1 670B — приблизительно 700 токенов в секунду на пользователя против 169. На Kimi K2.5 1T результат составил приблизительно 694 токенов в секунду против 182.

Kimi K2.5
Kimi K2.5

Откуда у OpenAI такие результаты

Jalapeño проектировали именно под современные LLM и агентные нагрузки. OpenAI одновременно оптимизировала вычислительные блоки, хранилище, сетевое взаимодействие и программный стек, чтобы уменьшить лишнее перемещение данных.

Это особенно важно для инференса LLM: на этапе prefill основным ограничением часто становятся вычисления, а во время decode, когда схема генерирует ответ токен за токеном, существенную роль играет пропускная способность памяти. Дополнительную задержку может разрабатывать обмен данными между чипами.

В Jalapeño OpenAI старается держать состояние модели, в том числе KV-cache, максимально близко к вычислительным блокам. Сеть одновременно является частью общей архитектуры, а не отдельным уровнем инфраструктуры.

Процессор имеет заявленный TDP 700 Вт, но во время проведенных тестов фактическое устойчивое потребление не превышало 550 Вт. Для сравнения OpenAI нормализовала результаты с учетом опубликованного энергопотребления сопоставляемых ускорителей.

Есть и более интересный эксперимент. С помощью Codex и GPT-Astra инженеры перенесли на Jalapeño три open-weight модели, которые изначально не входили в производственный план, менее чем за два месяца. Для отдельных attention- и MoE-блоков реализации, сгенерированные ИИ, оказались в 1,5–1,8 раза быстрее написанных экспертами вручную. Отмечу, речь идет только об отдельных блоках, а не о полной модели.

Что дальше будет с чипом OpenAI

OpenAI планирует начать развертывание Jalapeño в собственной вычислительной инфраструктуре до конца этого года. Компания уже работает над вторым поколением, а архитектура третьего поколения находится на стадии формирования.

Одновременно OpenAI не собирается отказываться от сторонних ускорителей. Компания прямо заявляет, что продолжит применять NVIDIA и других поставщиков для training и inference. Jalapeño рассматривается не как полная замена GPU, а как собственный специализированный слой инфраструктуры для тех нагрузок, где оптимизация под реальные модели OpenAI дает максимальный эффект.

По существу, OpenAI постепенно движется к фулл-стек подходу: собственные модели, серверное ПО, сеть, хранилище и специализированный кремний проектируются как единая система. Если результаты InferenceX сохранятся на production-нагрузках, Jalapeño может стать одним из ключевых инструментов для снижения стоимости и задержки инференса по мере роста числа AI-агентов.

Читают сейчас

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

5 часов назад

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

Команда Prusa Research выпустила первую публичную альфа‑версию слайсера PrusaSlicer 3.0. Авторы переписали интерфейс, переработали систему профилей, добавили поддержку полноценной работы с несколькими

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

6 часов назад

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

Anthropic выпустила апдейт своих топовых моделей – Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в цело

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

6 часов назад

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

Creality представила 3D‑принтер SPARKX i8 с поддержкой четырёхцветной печати. Его главная особенность заключается в системе QuarTeks, в которой прутки филамента подведены практически к самому соплу, б

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

6 часов назад

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

Автор YouTube‑канала UFD Tech рассказал, что MacBook Neo необычно быстро расходует источник SSD‑накопителя. Всё дело в небольшом объёме оперативной памяти, из‑за которой устройство активно записывает

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

6 часов назад

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

Организация Anthropic предупредила, что инфостилеры перехватывают сеансы Claude и открывают злоумышленникам доступ к учётным записям пользователей. Читать далее