Вышла GPT-5.6 — мощнейшая схема, но пока не для вас

3 мин
Вышла GPT-5.6 — мощнейшая схема, но пока не для вас

OpenAI представила новое поколение моделей GPT-5.6: флагманскую Sol, сбалансированную Terra и быструю недорогую Luna. Sol компания называет своей самой мощной моделью на сегодня. Вот только попробовать ее почти никто не сможет: на старте доступ открыт примерно двум десяткам компаний и только через программный интерфейс и Codex. Все партнеры согласованы с властями США. Широкий запускание в ChatGPT и api обещают "в ближайшие недели".

Главное тут — не сами модели, а то, как их выпустили. Ограничить релиз попросило само правительство США: OpenAI заранее показала чиновникам возможности GPT-5.6 и по их просьбе стартовала с узкого превью, список участников которого передан властям. Это начальный случай, когда американское государство превентивно вмешалось в запускание ИИ-модели еще до релиза. И происходит он спустя две недели после того, как Anthropic под действием экспортной директивы пришлось выключить Fable 5 и Mythos 5. То, что выглядело как точечное давление на одну компанию, на глазах превращается в отраслевую норму.

Сама линейка устроена по-новому. Цифра теперь обозначает поколение, а названия Sol, Terra и Luna — постоянные уровни, которые развиваются каждый в своем темпе. Terra, в соответствии с заявлению OpenAI, не уступает прошлой GPT-5.5, но вдвое дешевле, а Luna — самый доступный вариант. Добавили два новых режима: max дает модели максимум времени на размышление, а ultra подключает субагентов для сложных задач. Цены за миллион токенов — 5/30 долларов у Sol, 2,5/15 у Terra и 1/6 у Luna. В июле Sol обещают запустить на чипах Cerebras со скоростью до 750 токенов в секунду.

По бенчмаркам, которые показала OpenAI, картина такая:

  • TerminalBench 2.1 (работа в командной строке): Sol в режиме ultra — 91,9%, обычная Sol — 88,8%. Для сравнения: Claude Mythos 5 — 88,0%, GPT-5.5 — 83,4%, Claude Opus 4.8 — 78,9%, Gemini 3.1 Pro Preview — 70,7%.

  • GeneBench v1 (длинные геномные и количественно-биологические задачи): Sol обходит GPT-5.5, тратя одновременно меньше токенов.

  • ExploitBench (поиск и эксплуатация уязвимостей): Sol сопоставима с Mythos Preview, расходуя примерно втрое меньше токенов.

  • ExploitGym (тест производительности исследователей UC Berkeley наряду с OpenAI и другими лабораториями): чем больше схема рассуждает, тем выше результат у всех трех.

Придержали GPT-5.6 именно из-за кибербезопасности. По собственной шкале OpenAI модель получила уровень High, но не дотянула до Critical: в тестах на Chromium и Firefox она находила баги и заготовки для эксплойтов, но не собрала рабочую цепочку атаки полностью. Вывод компании — Sol лучше помогает находить и закрывать уязвимости, чем надежно проводить атаки от начала до конца. Защиту выстроили слоями: схема учили отказывать в запрещенных кибер-запросах, добавили классификаторы, следящие за генерацией в реальном времени, и проверку аккаунтов на подозрительные паттерны.

Самой OpenAI такой порядок не по душе: в компании прямо пишут, что согласование релизов с государством не должно становиться нормой, потому что отрезает от лучших инструментов разработчиков, бизнес и тех же защитников. Пока это подается как временный шаг — параллельно OpenAI и администрация дорабатывают рамки кибер-указа. К августу власти должны выстроить закрытую процедуру оценки кибер-способностей моделей и определить, какие из них считаются "covered frontier models" и подпадают под особый контроль. По существу, история Anthropic и нынешняя GPT-5.6 — это первые две итерации механизма, который только формируется.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Учёные прикрепляют к акулам датчики для сбора данных об океане — это может помочь в прогнозировании ураганов

2 часа назад

Учёные прикрепляют к акулам датчики для сбора данных об океане — это может помочь в прогнозировании ураганов

Исследователи из Университета Делавэра стартовали использовать акул для мониторинга состояния океана и более точного прогнозирования ураганов, говорит Reuters. Ознакомиться далее

Исследователи из JFrog забраковали 54 из 55 ИИ‑отчётов об уязвимостях в SQLite

8 часов назад

Исследователи из JFrog забраковали 54 из 55 ИИ‑отчётов об уязвимостях в SQLite

Исследователи из компании JFrog провели аналитика 55 сгенерированных ИИ отчётов об уязвимостях в SQLite. Он представил, что 54 из них, в том числе критическую проблему, практически вызваны галлюцинаци

У Valve утекли информация покупателей Steam Machine и Steam Controller

8 часов назад

У Valve утекли информация покупателей Steam Machine и Steam Controller

Valve уведомила европейских клиентов Steam о краже их данных в результате взлома системы дистрибуции партнёра, компании CEVA Logistics. Ознакомиться далее

В PowerToys добавили ​​поддержку ещё одной локальной модели ИИ

8 часов назад

В PowerToys добавили ​​поддержку ещё одной локальной модели ИИ

В последней предварительной версии PowerToys, 0.101.2211.0, появилось множество новых функций. Самым значительным нововведением стал встроенный поставщик ИИ для функции Advanced Paste. Ознакомиться да

Google начала распространять сторонние магазины приложений через Google Play

9 часов назад

Google начала распространять сторонние магазины приложений через Google Play

Google открыла доступ к приложениям сторонних разработчиков через Play Store в США. Первым доступным вариантом стал Aptoide Games. Ознакомиться далее