1 час назад
OpenAI связала Moonshot AI с попытками извлечь скрытые рассуждения моделей
OpenAI сообщила о масштабной кампании по извлечению защищённых рассуждений своих моделей. Компания связывает ключевую группу активности с людьми, связанными с Moonshot AI (разработчик Kimi). Одновременно OpenAI отдельно отмечает, что не может утверждать, будто все участники кампании работали на одного оператора.
Активность началась 1 июля и поначалу оставалась маленький. 24 и 25 июля произошёл резкий всплеск: OpenAI зафиксировала 16 000 запросов от свыше 4 000 пользователей, использовавших характерный для извлечения рассуждений паттерн. Дальнейшее расследование выявило похожую активность уже у кластера из более чем 15 000 пользователей. К 28 июля OpenAI заявила, что кампанию удалось целиком пресечь.
Интересен сам метод. Операторы копировали зашифрованные рассуждения из одного диалога, переносили их в другой и просили модель расшифровать и воспроизвести скрытое содержимое в открытом виде.
Одновременно взлома шифрования не было. OpenAI утверждает, что злоумышленники не получили доступ к базе данных или сохранённым пользовательским чатам. Пишут о манипуляциях с взаимодействием между моделями, которые позволяли выводить защищённые информация в доступной пользователю форме.
OpenAI называет такой подход adversarial distillation — попыткой использовать ответы или внутренние рассуждения одной модели для обучения, воспроизведения или улучшения иной. В компании считают, что масштабное извлечение reasoning может позволить переносить возможности продвинутых моделей в другие системы без сопоставимых затрат на их разработку и защита.
После обнаружения кампании OpenAI заблокировала связанные аккаунты и усилила защиту от подобных атак. Организация также сообщила об обнаруженной независимыми исследователями уязвимости, связанной с переносом защищённых рассуждений между разговорами, и заявила, что поделилась информацией о классе атак с партнёрами через Frontier Model Forum.
Отмучу, 16 000 запросов — это не 16 000 успешно украденных рассуждений. В общем, история получилась довольно характерная для гонки моделей: вместо попытки взломать шифрование напрямую операторы пытались убедить сами модели раскрыть то, что им раскрывать не положено.
Читают сейчас

20 минут назад
Учёные обнаружили, что есть (и быть) в одиночестве вредно для здоровья
Новое исследование, опубликованное в Science Advances, обнаружило свидетельства того, что приём пищи вместе с другими людьми может помогать организму регулировать уровень сахара в крови. В эксперимент

48 минут назад
В Steam началась масштабная Осенняя распродажа
Отличные новости от дядюшки Габена: в Steam началась масштабная Осенняя распродажа! Она продлится ровно неделю — до 8 октября. Распродажа охватывает большую часть каталога площадки: от высокобюджетных

3 часа назад
Figure Helix 2.5: гуманоид выполнил бытовые задачи в 30 незнакомых домах
Американская робототехническая компания Figure представила Helix 2.5 — новую нейросеть для управления гуманоидным роботом. Она позволяет ему выполнять освоенные бытовые задачи в незнакомых домах без д

3 часа назад
Дайджест GetAClass: сентябрь 2026
Первый месяц нового учебного года позади, время подвести его итоги – в нашем традиционном дайджесте. Ознакомиться далее

3 часа назад
Xbox и IKEA запустили совместную коллекцию игровой мебели YXSTABY, доступную с 1 октября в США, Европе и Японии
IKEA запустила совместную коллекцию игровой мебели YXSTABY совместно с Xbox. Дебютная для Xbox линейка игровой мебели включает девять предметов, разработанных командами дизайнеров из обеих компаний. Ч