Cloudflare натравила Claude Mythos на свой исходник — и перестроила процедура поиска багов

2 мин
Cloudflare натравила Claude Mythos на свой исходник — и перестроила процедура поиска багов

Cloudflare опубликовала результаты нескольких недель работы с Claude Mythos Preview — закрытой моделью Anthropic, доступной участникам программы Project Glasswing. Команда безопасности компании запустила схема на более чем 50 собственных репозиториев и описала, что работает, что нет, и почему наивный подход "направить модель на репу и попросить найти баги" дает плохие результаты.

Основной вывод Cloudflare — Mythos Preview делает то, что предыдущие модели не доводили до конца. Прежние LLM общего назначения находили отдельные уязвимости и писали связные описания, но на этом останавливались: цепочки эксплойтов оставались незаконченными, вопрос "а это вообще можно проэксплуатировать?" висел в воздухе. Mythos Preview берет несколько багов низкого уровня — use-after-free, произвольное чтение/запись, ROP-гаджет — и выстраивает из них рабочую цепочку. Итог приходит с готовым Proof of Concept: схема сама пишет исходник, компилирует его в песочнице, смотрит на результат, корректирует гипотезу и повторяет цикл, пока не подтвердит или не опровергнет уязвимость.

Но самое практичное в посте — не похвала модели, а архитектура вокруг нее. Cloudflare выяснила, что один агент на весь репозиторий дает слабое покрытие и много шума. Вместо этого организация построила конвейер из нескольких этапов: узкий скоуп (каждая задача — конкретная функция, класс атаки, граница доверия), adversarial review (следующий агент с другим промптом целенаправленно пытается опровергнуть находки первого), разделение вопросов ("этот исходник багнутый?" и "может ли атакующий добраться до него снаружи?" — как отдельные задачи) и параллельный запуск около 50 агентов одновременно на узких гипотезах с последующей дедупликацией.

Отдельно Cloudflare обратила внимание на безопасность самой модели. В контексте Glasswing Mythos Preview работала без дополнительных ограничений, которые есть в публичных моделях вроде Opus 4.7. Схема иногда отказывалась писать демонстрационные эксплойты — но выполняла эквивалентные задачи, если их сформулировать по-другому. Вывод Cloudflare прямолинеен: встроенные защитные системы реальны, но непоследовательны и сами по себе не могут быть границей безопасности. Любая кибер-модель для широкого использования должна получить дополнительные слои безопасности поверх базового поведения.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Sony добавила нейросетевое усовершенствование графики на обычную PS5

9 часов назад

Sony добавила нейросетевое усовершенствование графики на обычную PS5

За нейросетевым улучшением картинки больше не обязательно идти покупать PS5 Pro. Sony представила QSSR — технологию масштабирования изображения для обычной PlayStation 5. Первыми поддержку получили Ma

Неделя OCR для LLM — в Telegram-канале Smart Engines

10 часов назад

Неделя OCR для LLM — в Telegram-канале Smart Engines

Привет, ! Объявляем тематическую неделю, посвященную OCR для LLM и интеллектуальной обработки документов без галлюцинаций и «додумывания» данных. Расскажем, как устроено полнотекстовое распознавание S

Metro 2033 и Last Light получат бесплатное апдейт с улучшенной графикой и поддержкой 120 FPS

10 часов назад

Metro 2033 и Last Light получат бесплатное апдейт с улучшенной графикой и поддержкой 120 FPS

Возвращаться в московское метро скоро станет приятнее, насколько это вообще возможно среди мутантов и радиации. 4A Games и Deep Silver анонсировали бесплатное обновление для Metro 2033 Redux и Metro:

Perfscale news #13. Выжигание WASM модулей, http3 и начальный postmortem

11 часов назад

Perfscale news #13. Выжигание WASM модулей, http3 и начальный postmortem

Всех категорически приветствую, любители больших количеств девяток! Сегодня в выпуске у нас будет интересности, ну а начнем мы как всегда с истории прошлых выпусков Читать далее

Мы прошли все стадии принятия ИИ: вышел свежий сезон подкаста «Свободный слот»

11 часов назад

Мы прошли все стадии принятия ИИ: вышел свежий сезон подкаста «Свободный слот»

Помните, как в 2023 году все спорили, заменят ли нейросети инженеров? Тема дискуссионная, но сейчас, когда ИИ уже заложен в каждый процесс, вопрос ставится иначе: что создавать? Как с ним жить? Мы в А