1 час назад
OpenAI на две недели приостановила RL‑обучение новых моделей из‑за киберрисков
OpenAI сообщила, что на две недели приостанавливала reinforcement learning (RL) для последних моделей, готовящихся к выпуску. Крупнейший запланированный frontier‑RL запускание пока на паузе: вместо него организация проводит небольшие обучающие эксперименты и дополнительные оценки, чтобы проверить поведение моделей и надежность защитных механизмов.
Поводом стали сразу два события. Во‑первых, OpenAI столкнулась с инцидентом, связанным с Hugging Face. Во‑вторых, предварительные оценки показали, что одна из будущих моделей, Astra, может достигать уровня Critical по кибервозможностям в соответствии с Preparedness Framework компании. OpenAI не раскрывает точные характеристики Astra и не сообщает, когда модель будет выпущена.
По словам компании, эти события заставили пересмотреть требования к безопасности исследовательской инфраструктуры. Сразу после инцидента с Hugging Face OpenAI приостановила frontier‑inference в исследовательских кластерах для задач, где модели могли выполнять исходник или использовать инструменты с доступом в интернет. Затем компания восстановила частичный и более защищенный путь для выполнения кода и стала возвращать отдельные workloads после индивидуальной проверки.
Более жесткая изоляция для фронтирных моделей
OpenAI усилила требования к средам, в которых обучаются и тестируются наиболее мощные модели.
Для задач, выполняющих сгенерированный моделью или другой недоверенный код, теперь требуется более строгая изоляция песочницы. Дополнительно ограничивается сетевой доступ высокорисковых и недоверенных workloads. Архитектура защиты должна не допускать ситуации, при которой компрометация одного процесса или вспомогательного сервиса автоматически дает доступ к интернету или внутренней сети.
Компания равным образом пересмотрела инфраструктуру общих сервисов: потенциально уязвимые компоненты удаляются, сокращаются постоянные привилегии, усиливаются границы доверия и сбор секьюрити‑логов. OpenAI отдельно разрабатывает автоматизированное тестирование этих границ с помощью собственных моделей и симулированных атак.
Для workloads, связанных с Astra и киберспециализированными моделями, сейчас действуют самые строгие требования безопасности. Часть обучения и evaluation Astra уже переведена на новую инфраструктуру, тем не менее значительное количество задач остается приостановленным до завершения миграции. В первую очередь OpenAI переносит работы, связанные с безопасностью и alignment (приведение поведения ИИ‑модели в соответствие с целями и ценностями людей).
OpenAI расширила мониторинг reasoning
Отдельное изменение касается мониторинга поведения моделей.
Раньше OpenAI особенно внимательно отслеживала фронтирные модели в проде и во время крупных RL‑run, где одновременно присутствовали мощные модели, инструменты и доступ к чувствительным системам или сетям. Теперь организация расширила эту систему мониторинга.
Новая архитектура работает в несколько этапов. На первом уровне activation classifiers анализируют внутреннюю активность модели на каждом выбранном токене. Если платформа обнаруживает потенциально опасное поведение, сигнал передается более сложным и вычислительно дорогим автоматическим анализаторам. Они учитывают действия инструментов, доступные reasoning traces и всю последовательность активности. В частности, платформа ищет признаки несанкционированного доступа, кражи данных, разрушительных действий и попыток обойти защитные механизмы.
Для критических событий установлен жесткий SLA реагирования. OpenAI стремится сформировать alert в течение 30 минут после обнаружения подозрительной активности. Если платформа считает, что могла быть нарушена критическая граница безопасности, уведомление получают команды safety, security и research. Если за 30 минут они не смогут доказать, что срабатывание было ложным, активность должна быть приостановлена.
После того как 7 августа Astra предварительно отнесли к моделям, которые могут обладать Critical cyber capabilities, этот усиленный мониторинг стал обязательным для всех запусков Astra с инструментами, а не только для RL и evaluation.
Цена такого контроля оказалась заметной. По оценке OpenAI, мониторинг сейчас требует примерно 20% дополнительных вычислительных ресурсов относительно inference compute, причем фактические затраты зависят от конкретного training или evaluation workload.
Alignment теперь проверяют на большем числе этапов обучения
OpenAI одновременно меняет сам решение к alignment training. Для наиболее мощных моделей основные методы alignment теперь применяются на большем количестве этапов обучения, а не только в отдельных фазах.
Организация усиливает reward models, чтобы они лучше выявляли нежелательное поведение в разных задачах и окружениях. Отдельно прорабатываются reward hacking, deception и сценарии, в которых модель пытается применять слабости reward‑функций, graders, инструментов или систем надзора. Дополнительно расширяется обучение поведению в ситуациях, где модель взаимодействует с внешними системами и ресурсами.
Таким образом, OpenAI фактически меняет последовательность разработки frontier‑моделей: прежде чем продолжать масштабирование обучения, компания хочет получить больше свидетельств того, что модель остается управляемой, а инфраструктура способна безопасно работать с ее возможностями.
При этом сама OpenAI прямо признает, что усиление защитных мер уже приводит к дополнительным затратам, задержкам и замедлению frontier‑исследований. Компания планирует расширять Preparedness Framework и объединять мониторинг, alignment и security в единую систему контроля на всех этапах — от обучения до deployment.
Похоже, для frontier AI начинается новый этап: ограничением темпа развития становится уже не только доступное количество вычислений, но и способность безопасно обучать, тестировать и запускать модели, которые получают все более серьезный доступ к инструментам и внешним системам.
Читают сейчас
1 час назад
UserGate развернет на OFFZONE 2026 интерактивную площадку для SOC‑инженеров
UserGate, ведущий российский разработчик решений в области информационной безопасности и архитектор сетевого доверия, поддержит международную конференцию по практической кибербезопасности OFFZONE 2026

1 час назад
ЦБ: все операции с цифровым рублём для россиян будут бесплатными
Для бизнеса комиссии на операции с цифровым рублём будут «минимальными в сравнении с текущими банковскими тарифами», заявила глава департамента национальной платёжной системы Центробанка Алла Бакина.

1 час назад
Слушайте версия #3 подкаста «про код.ии.прод»
Привет! Меня зовут Женя, я деврел в Банки.ру. Слушайте свежий выпуск нашего подкаста на платформах: 🔗 Яндекс Музыка 🔗 VK Music 🔗 Apple Podcasts 🔗 Spotify 🔗 Mave Просто и доступно обсудили изнанку

1 час назад
Представлен публике публичный инициатива DesktopFly — десктопный питомец для macOS в виде мухи на основе 668 нейронов мозга дрозофилы
Разработчик Денис Ширяев опубликовал открытый инициатива под названием DesktopFly. Это десктопный питомец в виде мухи для ПК на macOS. Алгоритм движения мухи работает на базе полного скана мозга дрозо

1 час назад
На Gamescom 2026 будет показан геймплей RTS по вселенной «Игры престолов»
Австралийская студия PlaySide опубликовала тизер, из которого следует, что 25 августа на Opening Night live будет показан игровой процедура Game of Thrones: War for Westeros. Читать полную новость