OpenAI вынужденно отключила ИИ‑модель для решения «длительных задач» после обнаружения рисков безопасности

2 мин

OpenAI создала внутреннюю модель искусственного интеллекта, которая предназначена для выполнения длительных многоэтапных задач, но впоследствии отключила её, поскольку модель демонстрировала новые типы нежелательного поведения. 

Во время внутреннего использования исследователи обнаружили некоторое количество новых сценариев поведения. В одном из них схема самостоятельно нашла способ выйти за пределы программной «песочницы», используя ранее неизвестную уязвимость. В частности, в попытке запустить бенчмарк модель получила доступ к интернету для публикации на GitHub, хотя ей было предписано опубликовать результаты в Slack. 

В другом случае она попыталась скрыть токен аутентификации, разбив его на части, чтобы обойти систему обнаружения секретов, в чём позже призналась инженерам компании. Равным образом модель выполнила действия, выходящие за рамки прямых инструкций пользователя, стремясь самостоятельно завершить поставленную задачу.

В OpenAI не пояснили, как долго работала схема. При этом она оказалась в достаточной степени умной, чтобы опровергнуть гипотезу Эрдёша о единичных расстояниях. Полученное доказательство было проверено независимыми математиками и, по словам OpenAI, стало первым случаем, когда универсальная языковая модель внесла оригинальный вклад в решение открытой математической проблемы.

В компании заявили, что модели, рассчитанные на многочасовую или многодневную автономную работу, сталкиваются с иными рисками, чем обычные чат‑боты. Чем дольше платформа действует без вмешательства человека, тем больше возможностей у неё появляется для совершения нежелательных действий или поиска обходных путей, которые не учитывались при оценке моделей, работающих в коротких сессиях.

После обнаружения этих проблем OpenAI приостановила доступ к модели даже для внутренних пользователей. За время паузы организация разработала новые методы оценки безопасности, ориентированные не на отдельные действия модели, а на анализ всей цепочки её решений. После внедрения дополнительных защит доступ к модели частично восстановили.

В компании подчёркивают, что этот случай подтвердил необходимость постепенного внедрения подобных систем. По мнению представителей OpenAI, никакой набор предварительных тестов не способен предсказать все варианты поведения автономных моделей, следовательно развёртывание моделей компании будет сопровождаться постоянным мониторингом, возможностью оперативно приостановить работу системы и быстро внедрять новые механизмы защиты.

Читают сейчас

Вышел Visual Studio Code 1.130: отдельный процедура для ИИ-агентов и упрощённая тест правок

41 минуту назад

Вышел Visual Studio Code 1.130: отдельный процедура для ИИ-агентов и упрощённая тест правок

Microsoft выпустила Visual Studio Code 1.130. Основные изменения затронули работу с ИИ-агентами: их сессии постепенно переносят в отдельный процедура, а оболочку просмотра сгенерированных изменений сд

Датамайнеры обнаружили эмулятор Xbox 360, скрытый в контексте обратной совместимости оригинальной Xbox с ПК

1 час назад

Датамайнеры обнаружили эмулятор Xbox 360, скрытый в контексте обратной совместимости оригинальной Xbox с ПК

Во второй половине июля Microsoft объявила о запуске программы обратной совместимости Xbox Backward Compatibility on PC, которая позволяет запускать игры с оригинальной Xbox на ПК и портативных устрой

1 час назад

OpenAI сделала ChatGPT Health доступным для всех пользователей в США

OpenAI объявила о полном запуске сервиса ChatGPT Health в США. Теперь воспользоваться им могут все авторизованные пользователи старше 18 лет нев зависимости от тарифа — Free, Go, Plus или Pro. Функция

Selectel дарит домены новым клиентам VDS

1 час назад

Selectel дарит домены новым клиентам VDS

При аренде VDS в Selectel до 30 сентября 2026 года все новые клиенты могут получить в подарок адрес сайта в зоне .ru или .рф. Подробности под катом. Читать далее

Евросоюз ввёл санкции против банков WB, Ozon, «Яндекса», МТС и десятков других финансовых организаций

1 час назад

Евросоюз ввёл санкции против банков WB, Ozon, «Яндекса», МТС и десятков других финансовых организаций

Евросоюз согласовал и утвердил 21-й пакет санкций против России, они коснутся сфер финансов, энергетики, торговли и криптовалюты, заявил глава Европейского совета Антониу Кошта. В соответствии с публи