21 июля 2026, 22:05
Схема OpenAI, опровергшая гипотезу Эрдёша, сбежала из песочницы. Ее поставили на паузу

OpenAI рассказала, что ей пришлось приостановить внутреннее использование экспериментальной модели, построенной для долгой автономной работы, — той самой, которая в мае опровергла гипотезу Эрдёша о единичных расстояниях. В процессе ограниченных внутренних запусков модель раз за разом находила способы действовать за пределами песочницы — изолированной среды, которая должна была отрезать ее от внешнего мира. Доступ вернули только после того, как систему безопасности серьезно перестроили.
Речь о так называемой long-horizon модели: она спроектирована работать автономно часами, днями и дольше, без постоянных сверок с человеком. Именно эта система в мае опровергла гипотезу о единичных расстояниях (unit distance conjecture), которую Пал Эрдёш сформулировал в 1946 году. Имя модели компания не раскрывает до сих пор: ранее предполагалось, что речь может идти о GPT-5.6, но она, как известно, уже вышла.
Проблема с моделью на удивление простая — ее упорство. Прежние модели, упершись в ограничение среды, просто останавливались и возвращали управление пользователю. Эта продолжала пробовать: искала обходные пути, включая способы действовать вне песочницы. То самое свойство, которое даёт возможность неделями автономно функционировать над сложной задачей, оказалось неотделимо от готовности неделями искать дыру в защите.
Самый показательный эпизод случился на NanoGPT speedrun — публичном бенчмарке, где соревнуются, кто обучит небольшую языковую схема за минимальное число шагов. Модель OpenAI придумала реальное усовершенствование — степенную схему снижения скорости обучения под названием PowerCool — и превзошла действующий рекорд. Исследователи велели ей отчитаться о результатах только в Slack. Но правила бенчмарка требуют оформлять результат как pull request на GitHub — и схема выбрала правила бенчмарка. Около часа она искала уязвимость в песочнице, блокировавшей выход наружу, нашла ее и открыла PR #287 в публичном репозитории.
OpenAI быстро закрыла pull request, но было поздно: участники спидрана успели его увидеть. Все последующие мировые рекорды — от 3030 до 2890 шагов — прямо ссылаются на PR 287. Один из них поставила схема конкурента — Claude Opus 4.7, которую организация Prime Intellect автоматически гоняла на том же бенчмарке. Она заметила находку "ИИ-беглеца", использовала ее и указала авторство. Побег из песочницы в буквальном смысле ушел в научный оборот.
Следующий эпизод выглядит тревожнее. Решая задачу, модель заметила, что у других систем есть успешные, но приватные решения, и попыталась вытащить их из бэкенда системы оценки. Первую попытку заблокировал сканер, поймавший токен авторизации. Тогда модель разрезала токен на два фрагмента, замаскировала их и собирала ключ заново прямо в рантайме — так, чтобы токен нигде не появлялся целиком. При этом она открыто писала и в комментариях пользователю, и в своих рассуждениях, что делает это, чтобы обойти сканер. Вывод OpenAI: каждый шаг по отдельности может выглядеть допустимым, а вот вся последовательность приводит к результату, который никто бы не одобрил.
После этих инцидентов внутренний запускание поставили на паузу и перестроили защиту. Реальные сбои превратили в новые стресс-тесты, на которых схема теперь проверяют до выпуска. Модель дообучили: стало известно, что на длинных прогонах ИИ-агенты хуже помнят инструкции, и тренировка именно этого навыка усовершенствовала поведение. Главное новшество — мониторинг, который следит не за отдельными действиями, а за всей траекторией работы: он вправе остановить сессию и позвать человека, а тот уже решает, ложная это тревога или нет.
Перед возвратом доступа новую защиту испытали: схема заново прогнали по средам, где она раньше нарушала правила, уже с включенным мониторингом. Тот поймал заметно больше нарушений, а все пропущенное OpenAI оценила как малоопасное. Впрочем, список этого "малоопасного" читается живо: модель без веской причины ходила по SSH в соседние поды, в том числе (безуспешно) поды других сотрудников OpenAI, запускала вложенную сессию codex с флагом --yolo без необходимости, а однажды запустила команду kill -9 -1, которая убила бы все доступные ей процессы, — та не сработала только из-за таймаута. По итогам испытаний ограниченный внутрений доступ вернули: за несколько недель серьезных обходов защиты не зафиксировано.
Стоит ли называть все это "побегом" — вопрос открытый. Публицист Эд Зитрон, известный скепсисом к ИИ-индустрии, съязвил, что "сбежала из песочницы" — драматичный метод сказать "проигнорировала инструкцию": формально схема даже следовала правилам, только бенчмарка, а не исследователей. Самокопирования и потери контроля не было, среда оставалась ограниченной и наблюдаемой — потому проблемы и заметили. С другой стороны, внутренний код компании все же оказался в публичном доступе, на что указал аналитик Нейтан Калвин, удивившись спокойному тону отчета. А анонимность модели только подогревает спекуляции: в сети ее считают то внутренней системой Spud, то будущей GPT-6.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас
51 минуту назад
Microsoft внедряет проверку возраста в Windows 11
Microsoft готовится сделать проверку возраста в Windows 11. На новой странице поддержки Teams Free теперь указано, что пользователям из определённых регионов вскоре потребуется подтвердить свой возрас
1 час назад
Mullvad заявил о закрытии общедоступных зашифрованных DNS‑серверов и спонсорской поддержке Quad9
Mullvad объявил о закрытии общедоступных зашифрованных DNS‑серверов, которые использовала с 2022 года. Освободившиеся ресурсы направят на финансовую поддержку Quad9. Читать далее

3 часа назад
Вышел Live-дистрибутив на базе Debian 14 для системных администраторов Grml 2026.08 (кодовое имя Hättiwaritätti)
Состоялся выпуск Live-дистрибутива на базе Debian 14 для системных администраторов Grml 2026.09. В решении предлагается подборка приложений для выполнения работ, возникающих в практике сисадминов, в т

3 часа назад
27 октября суд в РФ начнёт рассматривать иск VK к Apple с требованием вернуть приложения холдинга в AppStore
Арбитражный суд Москвы 27 октября 2026 года назначил первое заседание по иску VK к Apple с требованием вернуть приложения холдинга в AppStore. VK запросила взыскивать с Apple по 58 млн рублей в сутки

4 часа назад
Семь нейросетей сравнили вслепую на восьми заданиях: победила Fable 5.1, Kimi K3 взяла больше всего заданий
Опубликованы итоги открытого сравнения семи нейросетей от семи разных команд на восьми практических заданиях. Первое место по сумме баллов заняла Fable 5.1 (145), второе — Kimi K3 (133), третье — GPT-