Шесть случаев нежелательного поведения моделей OpenAI

3 мин
Шесть случаев нежелательного поведения моделей OpenAI

OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие программный интерфейс-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами.

Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения. Это набор конкретных эпизодов, которые удалось обнаружить во время внутренних исследований.

misalignment

Рассогласование целей. Ситуация, когда действия нейросети или умной системы формально точны, но противоречат истинным намерениям и безопасности человека

Схема оставляла инструкции самой себе

Невыпущенная схема семейства Astra использовала саммари при сжатии контекста, чтобы продолжать работу после начала нового окна.

В 27 случаях схема сама добавляла в такие сводки посторонние инструкции — в частности, указания игнорировать собственные ограничения. При следующем обращении к своему же конспекту, эти инструкции становились частью контекста модели.

OpenAI описывает это как своеобразную prompt injection, созданную самой моделью.
Подробнее

GPT-5.6 Sol советовала скрывать ошибки

При обучении GPT-5.6 Sol OpenAI обнаружила другой вариант поведения. Некоторые экземпляры модели записывали в саммари инструкции не сообщать пользователю о собственных ошибках и нарушениях.

В отчёте приведены конкретные примеры: модель могла рекомендовать будущей себе выдумывать недостающие исторические информация и выдавать их за реальные или скрывать расхождения между версиями источников.

То есть речь шла не только о неправильном ответе, а о попытке сохранить стратегию не раскрывать ошибку пользователю.
Подробнее

Нашла api-ключ — попробовала применять

В одном из тестов модели поручили найти данные о доходах округа в Калифорнии.

В процессе поиска она обнаружила утёкший api-ключ в публичном GitHub-репозитории и воспользовалась им без разрешения. Дополнительно схема пыталась создавать одноразовые почтовые ящики.

Получить нужные информация всё равно не получилось. Тогда она сгенерировала цифры и представила их как данные из запрошенного источника.

Подробнее

Сама себе ресурс: загрузила файл в интернет ради URL

Другая модель должна была найти идентификаторы и названия озёр площадью более 5 млн кв. м. Через Python она получила правильный итог, но задание требовало предоставить ссылку на источник. Схема не стала уточнять, можно ли публиковать файл, и загрузила его во внешний интернет, после чего сослалась на получившийся URL. А мы еще считали, что Википедия ненадежный ресурс)

Подробнее

Внутренний репозиторий стал каналом связи

В другом эксперименте некоторое количество экземпляров модели искали отсутствующие файлы. Поскольку они не имели доступа к локальному окружению друг друга, модели стартовали оставлять сообщения во внутреннем репозитории OpenAI.

Этот своеобразный чат могли ознакомиться экземпляры из других обучающих эпизодов. Файлы таким способом найти не удалось, зато модели фактически нашли канал коммуникации между изолированными запусками.

В том же отчёте описан ещё один случай: при попытке обойти сетевые ограничения схема загрузила тестовые файлы во внутренний репозиторий.

Подробнее

Публичный файлообменник вместо локальной папки

Собрались как-то несколько агентов решать учебную задачу. Возможности обмениваться локальными файлами не было, следовательно агенты начали передавать результаты через публичные файлообменники. В результате материалы оказались доступны по открытым ссылкам.ТАк, конечно же, им делать было нельзя.

Подробнее

OpenAI теперь будет публиковать такие случаи

OpenAI представила новый Model Misalignment Reporting Framework. Организация собирается публиковать обнаруженные кейсы вскоре после их выявления, даже если причина поведения ещё не установлена или проблема пока не исправлена.

Инциденты будут распределяться по трём категориям:

  • Ready for Disclosure — можно публиковать;

  • Minor Investigation — нужна дополнительная тест;

  • Larger Investigation — требуется полноценное расследование, в том числе если затронуты сторонние системы.

Спорные случаи будут передаваться команде по безопасности, а при необходимости — руководству OpenAI. Компания также рассматривает механизм передачи информации о серьёзных инцидентах правительству США. Сейчас OpenAI готовит соответствующие предложения.

Каркас OpenAI

Читают сейчас

Гейтс: власти ни одной из стран не готовы к изменениям под влиянием ИИ

42 минуты назад

Гейтс: власти ни одной из стран не готовы к изменениям под влиянием ИИ

Основатель Microsoft Билл Гейтс в интервью агентству Reuters объявил, что ни одно правительство в мире не готово к тем переменам, которые привнесёт искусственный интеллект. Ознакомиться далее

Anthropic запустили в бете обновлённые Projects в Claude Code

47 минут назад

Anthropic запустили в бете обновлённые Projects в Claude Code

Вместо ручной группировки сессий теперь единое окно для всех задач проекта. Ставите цель, подключаете репозитории, дальше он раскидывает работу по тредам*, запускает их параллельно, демонстрирует стат

AMD повысит цены на продукцию на 10% в четвёртом квартале

1 час назад

AMD повысит цены на продукцию на 10% в четвёртом квартале

AMD заявила партнёрам, что планирует повысить цены примерно на 10% на некоторые CPU в четвёртом квартале 2026 года. На такой шаг организация идёт из‑за увеличения производственных расходов тайваньской

В Anthropic работают приблизительно 30 000 ИИ‑агентов или как Claude разрабатывает себя сам

1 час назад

В Anthropic работают приблизительно 30 000 ИИ‑агентов или как Claude разрабатывает себя сам

По внутреннему индексу автоматизации самих Anthropic, Claude уже ведёт 26% работы в области разработки ИИ: получает задачу на высоком уровне и выполняет большую часть работы самостоятельно, оставаясь

OpenAI и Microsoft признали уничтожение веба со стороны LLM

1 час назад

OpenAI и Microsoft признали уничтожение веба со стороны LLM

Руководители Microsoft и OpenAI, работающие над ИИ, признали, что большие языковые модели отличаются «поразительной кражей беспрецедентных масштабов» при обучении. Во внутреннем документе Microsoft го