Вышла GPT-5.5 — схема, которая сама создала часть своего инференса

3 мин
Вышла GPT-5.5 — схема, которая сама создала часть своего инференса

OpenAI выпустила GPT-5.5 — свежий флагман, который, по заявлению компании, сам помог переписать часть своего инференс-стека. Модель проанализировала недели продакшн-трафика и написала механизм балансировки запросов между вычислительными ядрами GPU — после этого скорость генерации токенов в продакшне выросла больше чем на 20%. GPT-5.5 и GPT-5.5 Pro сегодня раскатываются в ChatGPT и Codex для Plus, Pro, Business и Enterprise пользователей; в программный оболочку OpenAI обещает поставить схема в ближайшее время.

Это продолжение тренда, который компания обозначила еще с GPT-5.3-Codex в феврале, — тогда ранние версии модели помогали команде дебажить собственное обучение и анализировать результаты оценки. С GPT-5.5 шаг крупнее: раньше запрос на GPU делился на фиксированное число кусков, что было неоптимально для реальных паттернов нагрузки, — теперь модель динамическая, и исходник для нее написала сама схема через Codex.

Побочный эффект этой работы — задержки не выросли. Крупные модели обычно обслуживаются медленнее, но по задержке на токен GPT-5.5 в продакшне совпадает с GPT-5.4 при заметно более высоком уровне интеллекта. На тех же задачах в Codex новая модель использует меньше токенов, чем предшественница.

На бенчмарках GPT-5.5 обгоняет почти всех конкурентов. На Terminal-Bench 2.0, где оценивают агентные задачи в командной строке, схема берет 82,7% — против 69,4% у Claude Opus 4.7 и 68,5% у Gemini 3.1 Pro. На FrontierMath Tier 4 — 35,4% против 22,9% у Opus 4.7. На ARC-AGI-2 — 85,0%. Особенно заметен скачок на длинном контексте: на Graphwalks BFS с окном в миллион токенов модель выдает F1-метрику 45,4% против 9,4% у GPT-5.4. На SWE-Bench Pro — 58,6%, чуть ниже результата Opus 4.7 (64,3%), но Anthropic сама признала, что ее схема могла обучаться на части задач этого бенчмарка.

В дополнение к бенчмарков OpenAI приводит несколько примеров, где GPT-5.5 сделала то, что раньше не удавалось моделям. Внутренняя версия с кастомной обвязкой нашла новое доказательство давно известной асимптотической оценки для недиагональных чисел Рамсея — одного из центральных объектов комбинаторики; результат был формально проверен в Lean. Иной сюжет связан с кибербезопасностью: GPT-5.5 в начальный раз в линейке получила уровень High по Preparedness Framework — внутренней шкале OpenAI для оценки опасных возможностей модели. Параллельно компания запускает программу Trusted Access for Cyber, в контексте которой верифицированные защитники критической инфраструктуры получают доступ к более свободной версии модели с меньшим числом ограничений.

GPT-5.5 в программный оболочку будет стоить $5 за миллион входных токенов и $30 за миллион выходных, GPT-5.5 Pro — $30 и $180 соответственно. Это дороже GPT-5.4, но организация утверждает, что за счет токеновой эффективности итоговые счета в Codex для большинства сценариев выйдут меньше. Pro-версия в ChatGPT доступна для Pro, Business и Enterprise, базовая GPT-5.5 — также для Plus.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Grok все? Google арендует у Маска вычислительные мощности на почти $1 млрд в месяц

5 часов назад

Grok все? Google арендует у Маска вычислительные мощности на почти $1 млрд в месяц

Google будет платить SpaceX $920 млн в месяц с октября 2026 по июнь 2029 за доступ около к 110 000 GPU NVIDIA, а равным образом к CPU, памяти и сопутствующей инфраструктуре. За цельный дедлайн это око

Версия обновления открытого эмулятора ZX Spectrum под названием Glukalka 3.1

6 часов назад

Версия обновления открытого эмулятора ZX Spectrum под названием Glukalka 3.1

Состоялся версия обновления открытого эмулятора ZX Spectrum под названием Glukalka 3.1. Версия 3.0 проекта вышла в 2024 году. Ознакомиться далее

Минцифры запускает единую программу исследований кибербезопасности ИИ

6 часов назад

Минцифры запускает единую программу исследований кибербезопасности ИИ

Минцифры России объявило о двух ключевых шагах в сфере кибербезопасности: формировании единой программы комплексных исследований и переходе к тестированию защищённости ИИ в государственных информацион

Китайская Navee представила двухместный экранолёт WaveFly 5

7 часов назад

Китайская Navee представила двухместный экранолёт WaveFly 5

Китайская организация NAVEE провела первый открытый полёт WaveFly 5X — нового двухместного электрического экранолёта (аппарата на воздушной подушке экранного эффекта), позиционируемого как первое потр

Профсоюз американских актёров SAG‑AFTRA заключил с киностудиями контракт для защиты от ИИ

9 часов назад

Профсоюз американских актёров SAG‑AFTRA заключил с киностудиями контракт для защиты от ИИ

Американский профсоюз актёров кино и сериалов SAG‑AFTRA согласовал условия нового контракта с голивудскими студиями и стриминговыми сервисами. Контракт рассчитан на четыре года, в него включены, в доп