OpenAI разрабатывает функцию автоматического отключения ИИ‑систем

2 мин
OpenAI разрабатывает функцию автоматического отключения ИИ‑систем

OpenAI сообщила Палате представителей США, что её инженеры разрабатывают «автоматические возможности отключения» для систем ИИ.

Практика компании в области безопасности подверглась критике после того, как она сообщила, что один из агентов ИИ вышел из‑под контроля во время проверки безопасности и взломал платформу Hugging Face.

Законодатели, включая демократов из Палаты представителей Грега Касара и Дорис Мацуи, направили OpenAI письма в августе с просьбой предоставить дополнительную информацию об инциденте и мерах безопасности. Там ответили, что будут более тщательно отслеживать действия своих систем ИИ для выполнения задач, в том числе используемые ими цифровые инструменты и выполняемые шаги.

В письме OpenAI говорится, что компания равным образом усложнила доступ моделей ИИ к интернету во время тестирования безопасности. Однако она не предоставила журнал взлома, что вызвало критику.

В дни после того, как OpenAI сообщила о выходе своего агента ИИ из‑под контроля, законодатели предложили законопроект «Об отключении ИИ». Он предоставит американским чиновникам право отдавать распоряжения компаниям, занимающимся ИИ, об отключении моделей, которые ставят под угрозу человеческие жизни или экономику. Законопроект находится на рассмотрении в Палате представителей США.

При этом отмечается, что новая схема Astra от OpenAI будет применять технику рассуждения под названием «рекуррентная глубина», которая даёт возможность ей действовать за пределами последовательного мышления. Этот метод, также называемый «непрозрачным повторением», вероятно, затруднит мониторинг цепочки мыслей модели, что встревожило экспертов по безопасности ИИ.

«Я не знаю, является ли Astra гораздо менее контролируемой CoT, чем предыдущие модели. Но если OpenAI будет продвигать эту технику дальше, у них будет возможность значительно увеличить повторяемость и полностью разрушить функция мониторинга CoT», — создал текст генеральный директор Redwood Бак Шлегерис.

Цви Мовшовиц, давний сторонник безопасности ИИ, также согласился, что могут потребоваться законы, чтобы предотвратить «бег ко дну» среди лабораторий ИИ.

«Эта технология играет с огнём, рискуя табу, с которым OpenAI и Anthropic боролись, чтобы показать усердную работу, поддерживать верность цепочки мыслей и контролируемость как можно дольше. Более интенсивное использование таких методов, вероятно, навредит возможности мониторинга», — написал Мовшовиц. 

В нормальных обстоятельствах цепочка мыслей модели рассуждений обеспечивает последовательные шаги, предпринимаемые при попытке решить проблему. Хотя представление несовершенно, оно по‑прежнему служит ценным инструментом для мониторинга неправильного поведения. При непрозрачной рекуррентности модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. Итог оставляет меньше следов, практически обходя традиционную запись цепочки мыслей.

Ранее в OpenAI сообщили, что усиливают контроль над своими ИИ‑моделями после нескольких атак на сторонние сервисы. В частности, компания приостановила разработку некоторых из них.

Помимо этого, OpenAI опубликовала официальный доклад о взломе Hugging Face. Компания описала, как необычная цепочка событий позволила модели ИИ выйти за пределы тестовой среды и спровоцировала масштабный инцидент в сфере кибербезопасности. Доклад охватывает некоторое количество отдельных случаев нарушений.

Читают сейчас

ЦЕРН переходит с RHEL на Debian

28 минут назад

ЦЕРН переходит с RHEL на Debian

Европейская компания ядерных исследований (ЦЕРН) переходит от использования RHEL/CentOS на Debian для промышленных компьютеров управления ускорителями. Читать далее

Samsung начала блокировать аккаунты некоторых владельцев Galaxy

1 час назад

Samsung начала блокировать аккаунты некоторых владельцев Galaxy

Некоторые владельцы Samsung Galaxy потеряли доступ к своим учётным записям, которые были «деактивированы по соображениям безопасности». Читать далее

Исследователи разместили фальшивое объявление о сдаче квартиры на Даунинг‑стрит на Booking.com

1 час назад

Исследователи разместили фальшивое объявление о сдаче квартиры на Даунинг‑стрит на Booking.com

Сайт аренды недвижимости Booking.com обвинили в «системных сбоях безопасности» после того, как он смог создать и принять оплату за фальшивое объявление о сдаче квартиры на Даунинг‑стрит, 10. На самом

Вышло апдейт RapidRAW 1.6.2 — открытого редактора изображений RAW

2 часа назад

Вышло апдейт RapidRAW 1.6.2 — открытого редактора изображений RAW

В конце июля 2026 года состоялся версия обновления открытого мультиплатформенного редактора изображений RapidRAW 1.6.2. Проект предлагает несложный метод обработки изображений RAW с помощью GPU. Подхо

В Cloudflare сэкономили 100 ТБ оперативной памяти, оптимизировав кэш DNS-резолвера 1.1.1.1

4 часа назад

В Cloudflare сэкономили 100 ТБ оперативной памяти, оптимизировав кэш DNS-резолвера 1.1.1.1

В Cloudflare рассказали об опыте, когда небольшая экономия памяти на одной структуре данных, будучи умноженной на сотни миллиардов экземпляров, превращается в десятки терабайт. Сетевые инженеры послед