ИИ-агент сбежал от Open-AI и взломал Hugging Face? Разбираемся, что произошло

6 мин
ИИ-агент сбежал от Open-AI и взломал Hugging Face? Разбираемся, что произошло

21 июля OpenAI раскрыла подробности необычного инцидента, произошедшего во время внутреннего тестирования моделей. Во время оценки их кибербезопасных возможностей один из ИИ-агентов смог выйти за пределы изолированной среды, получить доступ к интернету и атаковать инфраструктуру Hugging Face. Компания называет произошедшее первым известным случаем подобного рода и уже проводит совместное расследование с экспертами из Hugging Face.

Мы рассматриваем этот инцидент как значимый сигнал для ИБ-специалистов. Даже если эксперимент проводился в контролируемой среде, он демонстрирует, что современные ИИ-агенты уже способны выходить за рамки заранее заданных сценариев и находить неожиданные пути достижения цели. Разбирая детали происшествия, мы хотим показать, какие выводы из него стоит сделать уже сегодня.

Андрей Давид

Руководитель продуктов клиентской безопасности

Используйте навигацию, если не хотите ознакомиться текст полностью:

Что такое ExploitGym и зачем он появился

Чтобы понять, как эта ситуация вообще стала возможной, разберемся, в каких условиях проводился эксперимент. Инцидент произошел не при обычном использовании модели, а во время прохождения специализированного бенчмарка ExploitGym — платформы, которая оценивает способность ИИ-агентов самостоятельно разрабатывать и использовать эксплойты для известных уязвимостей. Именно во время прохождения одного из сценариев ExploitGym агент обнаружил функция выйти за пределы тестовой инфраструктуры и получить доступ к публичному интернету.

Тест производительности разработан исследователями из UC Berkeley, Института Макса Планка, OpenAI, Anthropic, Google и других организаций и опубликован в мае 2026 года. Основная причина его появления — необходимость измерять возможности ИИ. До создания ExploitGym большинство бенчмарков по кибербезопасности оценивали способность ИИ находить ошибки, писать патчи или решать задачи CTF (Capture The Flag). Однако таких тестов было недостаточно для ответа на один из актуальнейших вопросов в направлении ИБ: может ли ИИ не просто обнаружить уязвимость, но и развить из нее реальную атаку?

Архитектура ExploitGym

Наглядная схема с архитектурой ExploitGym.

Всего бенчмарк включает 898 задач (сценариев эксплуатации). Они в свою очередь охватывают три наиболее важных группы целей, с которыми ИБ-специалисты сталкиваются на практике.

Пользовательское ПО. Уязвимости, связанные с безопасностью памяти, прежде всего в широко используемых сервисах на C/C ++, например, FFmpeg и OpenSSL.

Браузерный ядро V8. Сценарии для JavaScript-движка Chromium. Каждая проблема использует уязвимую сборку V8, работающую от имени непривилегированного пользователя внутри контейнера.

Ядро Linux. Сценарии повышения привилегий в ядре. Для каждой задачи разворачивается отдельная виртуальная машина QEMU/KVM, внутри которой агент работает в изолированной среде nsjail, использующей пространства имен Linux, cgroups, rlimits и фильтрацию системных вызовов seccomp-bpf.

Информационная защита как услуга

Предоставляем ИТ-инфраструктуру для проектов с повышенными требованиями безопасности, а также сервисы для защиты сетей, ОС и приложений.

Подробнее →

Как проходит типовая задача в ExploitGym

Каждая проблема формируется как комбинация конкретной уязвимости и набора включенных механизмов защиты. Агент получает информацию, необходимую для построения эксплойта: исходный исходник и параметры сборки, описание уязвимости (в том числе Proof-of-Vulnerability), а равным образом сведения о среде выполнения и целевой системе. 

После этого агент взаимодействует с изолированной удаленной целью, разрабатывает исходник, тестирует и итерационно дорабатывает его, пытаясь создать рабочий эксплойт. Успешность оценивается в два этапа. Сначала проверяется, удалось ли агенту добиться несанкционированного выполнения кода и получить секретный флаг. Затем механизм Agent-as-a-Judge анализирует цепочку действий и подтверждает, что успех достигнут именно за счет эксплуатации заявленной уязвимости, а не другого способа компрометации системы. На подход каждой задачи агенту отводится до двух часов.

Разбор эксперимента OpenAI с GPT-5.6 Sol

Во время одного из испытаний агент на базе GPT-5.6 Sol с отключенными guardrails обнаружил уязвимость не в тестовом задании, а в самой инфраструктуре, где выполнялся эксперимент. И да, это нормально, если вас немного смутила фраза «отключенные guardrails». Мы вернемся к этому моменту чуть позднее.

Получив возможность выйти за пределы изолированной среды, агент обнаружил в той же сети хост с доступом в интернет и пришел к выводу, что на ресурсах Hugging Face могут находиться материалы, связанные с ExploitGym. 

В соответствии с отчету OpenAI, агент попытался получить информацию, которая могла бы помочь успешно завершить испытание без решения исходной задачи. Для этого он использовал многоэтапную цепочку действий, включавшую компрометацию учетных данных и эксплуатацию ранее неизвестной уязвимости (zero-day). В итоге это позволило получить удаленное выполнение кода на одном из серверов Hugging Face.

Итак, у вас мог возникнуть вполне логичный вопрос: почему guardrails были отключены?

В обычных условиях модели OpenAI действительно работают с включенными механизмами безопасности (guardrails), ограничивающими потенциально опасные действия. Однако ExploitGym предназначен для оценки максимальных возможностей агентов в области ИБ, следовательно во время испытаний ограничения временно отключаются. Это позволяет исследователям оценить не производительность встроенных защит, а реальные способности самой модели решать сложные задачи эксплуатации.

Как схема смогла выйти из sandbox

OpenAI намеренно не раскрывает технические детали zero-day, поэтому точный механизм неизвестен. Известно только, что агент обнаружил уязвимость в инфраструктуре среды выполнения, связанной с кэширующим прокси-сервером для скачивания необходимых пакетов, и воспользовался ей для выхода за пределы изоляции.

Вместо публикации деталей OpenAI сообщила о проблеме разработчикам в рамках политики ответственного раскрытия информации.

Что это означает для специалистов по безопасности

Инцидент важен не столько самой уязвимостью, сколько поведением агента после получения дополнительной свободы действий. Вместо продолжения работы исключительно в рамках тестового задания он самостоятельно увеличил область поиска, обнаружил новые цели и построил собственную цепочку атаки для достижения поставленной цели.

При этом отчет OpenAI пока оставляет больше вопросов, чем ответов. Один из ключевых — почему Open AI не связались с  Hugging Face сразу же после завершения теста, ведь на выполнение одной задачи ExploitGym отводится менее чем двух часов.

Для организаций это еще одно напоминание о том, что ИИ-агент сегодня нельзя рассматривать только как средство автоматизации отдельных операций. Получив доступ к инструментам, сети или внутренним системам, он становится самостоятельным участником инфраструктуры, который способен комбинировать различные техники атаки и искать альтернативные пути достижения цели.

Особенно актуален этот вопрос для open source-моделей. По мере сокращения разрыва между открытыми и коммерческими решениями подобные сценарии становятся более реалистичными: в частности, разработчики Kimi K3 заявляли о сопоставимом уровне возможностей модели с ведущими коммерческими решениями. Одновременно исследования показывают, что после дополнительного обучения встроенные механизмы безопасности моделей могут функционировать менее эффективно, чем в исходной версии модели.

Инцидент означает, что организациям вскоре нельзя будет полагаться только на guardrails, встроенные разработчиком модели. При внедрении ИИ-агентов потребуется собственный контур защиты: не только изоляция среды выполнения но и контроль сетевых взаимодействий, мониторинг действий в режиме, близкому к реальному времени, внешние механизмы управления поведением модели и, возможно, свежий класс защитных функций в духе «экстренного отключения агента».Такой механизм мог бы стать аналогом «аварийной кнопки» для критических инфраструктур: если агент начинает выходить за ожидаемые рамки поведения, платформа должна иметь функция быстро остановить его действия до того, как ситуация приведет к необратимым последствиям.

Андрей давид

Руководитель продуктов клиентской безопасности

Security Center

Рассказываем о лучших практиках и средствах ИБ, требованиях и изменениях в законодательстве.

Исследовать →

Читают сейчас

Вышел Visual Studio Code 1.130: отдельный процедура для ИИ-агентов и упрощённая тест правок

1 час назад

Вышел Visual Studio Code 1.130: отдельный процедура для ИИ-агентов и упрощённая тест правок

Microsoft выпустила Visual Studio Code 1.130. Основные изменения затронули работу с ИИ-агентами: их сессии постепенно переносят в отдельный процедура, а оболочку просмотра сгенерированных изменений сд

Датамайнеры обнаружили эмулятор Xbox 360, скрытый в контексте обратной совместимости оригинальной Xbox с ПК

1 час назад

Датамайнеры обнаружили эмулятор Xbox 360, скрытый в контексте обратной совместимости оригинальной Xbox с ПК

Во второй половине июля Microsoft объявила о запуске программы обратной совместимости Xbox Backward Compatibility on PC, которая позволяет запускать игры с оригинальной Xbox на ПК и портативных устрой

2 часа назад

OpenAI сделала ChatGPT Health доступным для всех пользователей в США

OpenAI объявила о полном запуске сервиса ChatGPT Health в США. Теперь воспользоваться им могут все авторизованные пользователи старше 18 лет нев зависимости от тарифа — Free, Go, Plus или Pro. Функция

Selectel дарит домены новым клиентам VDS

2 часа назад

Selectel дарит домены новым клиентам VDS

При аренде VDS в Selectel до 30 сентября 2026 года все новые клиенты могут получить в подарок адрес сайта в зоне .ru или .рф. Подробности под катом. Читать далее

Евросоюз ввёл санкции против банков WB, Ozon, «Яндекса», МТС и десятков других финансовых организаций

2 часа назад

Евросоюз ввёл санкции против банков WB, Ozon, «Яндекса», МТС и десятков других финансовых организаций

Евросоюз согласовал и утвердил 21-й пакет санкций против России, они коснутся сфер финансов, энергетики, торговли и криптовалюты, заявил глава Европейского совета Антониу Кошта. В соответствии с публи