OpenAI связала Moonshot AI с попытками извлечь скрытые рассуждения моделей

2 мин

OpenAI сообщила о масштабной кампании по извлечению защищённых рассуждений своих моделей. Компания связывает ключевую группу активности с людьми, связанными с Moonshot AI (разработчик Kimi). Одновременно OpenAI отдельно отмечает, что не может утверждать, будто все участники кампании работали на одного оператора.

Активность началась 1 июля и поначалу оставалась маленький. 24 и 25 июля произошёл резкий всплеск: OpenAI зафиксировала 16 000 запросов от свыше 4 000 пользователей, использовавших характерный для извлечения рассуждений паттерн. Дальнейшее расследование выявило похожую активность уже у кластера из более чем 15 000 пользователей. К 28 июля OpenAI заявила, что кампанию удалось целиком пресечь.

Интересен сам метод. Операторы копировали зашифрованные рассуждения из одного диалога, переносили их в другой и просили модель расшифровать и воспроизвести скрытое содержимое в открытом виде.

Одновременно взлома шифрования не было. OpenAI утверждает, что злоумышленники не получили доступ к базе данных или сохранённым пользовательским чатам. Пишут о манипуляциях с взаимодействием между моделями, которые позволяли выводить защищённые информация в доступной пользователю форме.

OpenAI называет такой подход adversarial distillation — попыткой использовать ответы или внутренние рассуждения одной модели для обучения, воспроизведения или улучшения иной. В компании считают, что масштабное извлечение reasoning может позволить переносить возможности продвинутых моделей в другие системы без сопоставимых затрат на их разработку и защита.

После обнаружения кампании OpenAI заблокировала связанные аккаунты и усилила защиту от подобных атак. Организация также сообщила об обнаруженной независимыми исследователями уязвимости, связанной с переносом защищённых рассуждений между разговорами, и заявила, что поделилась информацией о классе атак с партнёрами через Frontier Model Forum.

Отмучу, 16 000 запросов — это не 16 000 успешно украденных рассуждений. В общем, история получилась довольно характерная для гонки моделей: вместо попытки взломать шифрование напрямую операторы пытались убедить сами модели раскрыть то, что им раскрывать не положено.

Читают сейчас

Учёные обнаружили, что есть (и быть) в одиночестве вредно для здоровья

20 минут назад

Учёные обнаружили, что есть (и быть) в одиночестве вредно для здоровья

Новое исследование, опубликованное в Science Advances, обнаружило свидетельства того, что приём пищи вместе с другими людьми может помогать организму регулировать уровень сахара в крови. В эксперимент

В Steam началась масштабная Осенняя распродажа

48 минут назад

В Steam началась масштабная Осенняя распродажа

Отличные новости от дядюшки Габена: в Steam началась масштабная Осенняя распродажа! Она продлится ровно неделю — до 8 октября. Распродажа охватывает большую часть каталога площадки: от высокобюджетных

Figure Helix 2.5: гуманоид выполнил бытовые задачи в 30 незнакомых домах

3 часа назад

Figure Helix 2.5: гуманоид выполнил бытовые задачи в 30 незнакомых домах

Американская робототехническая компания Figure представила Helix 2.5 — новую нейросеть для управления гуманоидным роботом. Она позволяет ему выполнять освоенные бытовые задачи в незнакомых домах без д

Дайджест GetAClass: сентябрь 2026

3 часа назад

Дайджест GetAClass: сентябрь 2026

Первый месяц нового учебного года позади, время подвести его итоги – в нашем традиционном дайджесте. Ознакомиться далее

Xbox и IKEA запустили совместную коллекцию игровой мебели YXSTABY, доступную с 1 октября в США, Европе и Японии

3 часа назад

Xbox и IKEA запустили совместную коллекцию игровой мебели YXSTABY, доступную с 1 октября в США, Европе и Японии

IKEA запустила совместную коллекцию игровой мебели YXSTABY совместно с Xbox. Дебютная для Xbox линейка игровой мебели включает девять предметов, разработанных командами дизайнеров из обеих компаний. Ч