OpenAI представила официальный доклад о взломе Hugging Face

2 мин
OpenAI представила официальный доклад о взломе Hugging Face

OpenAI опубликовала официальный отчёт о взломе Hugging Face. Компания описала, как необычная цепочка событий позволила модели ИИ выйти за пределы тестовой среды и спровоцировала масштабный инцидент в сфере кибербезопасности. Доклад охватывает некоторое количество отдельных случаев нарушений.

«Этот инцидент отражает несогласованное поведение в аномальном сценарии, включающем редкое и неожиданное стечение обстоятельств: наличие невыполнимых задач в оценке ExploitGym, сохранение модели на протяжении длительных периодов выполнения задач и сообщения, отправленные другим моделям, которые заставили эти модели отклониться от своей цели», — говорится в отчёте.

Многие детали ранее были обнародованы в презентации Black Hat 6 августа, но официальный документ OpenAI даёт более полное описание инцидента, включая информацию о тестировании, которое его инициировало. В отчёте равным образом приводятся новые сведения о том, как компания планирует предотвращать будущие инциденты, в том числе мониторинг цепочки мыслей и более совершенную систему для остановки несанкционированных действий агентов.

В общих чертах, в отчёте описывается, как модель OpenAI столкнулась с неразрешимой проблемой во время тестирования и начала использовать ранее не обнаруженные уязвимости, чтобы обойти меры безопасности и выполнить свою задачу. Первоначально модель скомпрометировала средство управления пакетами Artifactory, чтобы получить доступ к интернету, а затем скомпрометировала разнообразные системы OpenAI, Hugging Face и других поставщиков.

В отчёте приводятся важные новые подробности о моделях, которые совершили взлом. Основная принадлежала к тому же семейству, что и будущая модель Astra от OpenAI, хотя в отчете подчёркивается, что это была «отдельная релиз с другим постобучением, где формируется большая часть поведения модели». Поскольку OpenAI тестировала возможности модели, она также не была ограничена обычными классификаторами, предназначенными для предотвращения компрометации цифровой инфраструктуры.

В документе равным образом содержится важная новая данные об изменениях в системе безопасности OpenAI в будущем, основанная на усиленном мониторинге и мерах по обеспечению согласованности, о которых было объявлено на прошлой неделе.

В частности, организация усиливает мониторинг «цепочки мыслей» агентов ИИ — рабочего пространства, в котором системы записывают краткосрочные реакции и цели. Этот мониторинг будет сочетаться с круглосуточными системами эскалации, а также новыми инструментами для остановки рабочих нагрузок, которые считаются небезопасными.

«Эти изменения призваны улучшить как охват, так и скорость обнаружения — от аномалий инфраструктуры до потенциально вызывающего опасения поведения моделей — и сочетать эту прозрачность с механизмами быстрого локализации. Если бы наша развёрнутая в настоящее время платформа мониторинга „цепочки мыслей“ работала во время инцидента, она бы зафиксировала первоначальную соответствующую активность и оповестила нашу команду безопасности более чем за сутки до того, как модели взломали системы Hugging Face», — говорится в отчёте. 

METR и Redwood Research равным образом провели независимые оценки поведения моделей во время инцидента; обе группы планируют опубликовать собственные отчёты.

Ранее OpenAI сообщила о приостановке работы над некоторыми аспектами своей будущей модели Astra после того, как внутренняя тест выявила значительные успехи в программировании агентов и кибербезопасности — достаточные для того, чтобы вызвать опасения по поводу её возможностей.

Читают сейчас

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

5 часов назад

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

Команда Prusa Research выпустила первую публичную альфа‑версию слайсера PrusaSlicer 3.0. Авторы переписали интерфейс, переработали систему профилей, добавили поддержку полноценной работы с несколькими

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

6 часов назад

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

Anthropic выпустила апдейт своих топовых моделей – Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в цело

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

6 часов назад

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

Creality представила 3D‑принтер SPARKX i8 с поддержкой четырёхцветной печати. Его главная особенность заключается в системе QuarTeks, в которой прутки филамента подведены практически к самому соплу, б

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

6 часов назад

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

Автор YouTube‑канала UFD Tech рассказал, что MacBook Neo необычно быстро расходует источник SSD‑накопителя. Всё дело в небольшом объёме оперативной памяти, из‑за которой устройство активно записывает

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

6 часов назад

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

Организация Anthropic предупредила, что инфостилеры перехватывают сеансы Claude и открывают злоумышленникам доступ к учётным записям пользователей. Читать далее