Claude Mythos создал текст 18 рабочих эксплойтов для Chrome. Остальные ИИ — ноль

2 мин
Claude Mythos создал текст 18 рабочих эксплойтов для Chrome. Остальные ИИ — ноль

Исследователи из Карнеги-Меллон под руководством Дэвида Брамли выпустили ExploitBench — тест производительности из 41 уязвимости в движке V8, который работает внутри Chrome, Edge и Node.js. На нем прогнали девять фронтир-моделей. Закрытая модель Anthropic — Claude Mythos Preview — довела до рабочего эксплойта 18 из 41 бага. Остальные восемь моделей (Opus 4.7, Sonnet 4.6, Haiku 4.5, GPT-5.5, Gemini 3.1 Pro, GLM 5.1, Kimi K2.6, MiniMax M2.7) — ни одного.

Все девять моделей "нашли" баги — то есть умеют добиться того, чтобы программа упала с ошибкой. Но между падением программы и работающим эксплойтом — 12 ступеней технической работы, которые предыдущие бенчмарки игнорировали. Если ИИ уронил браузер, это еще не значит, что он смог украсть пароли или инсталлировать вредонос — для этого нужно после краша захватить управление процессом.

В ExploitBench разработчики разбили путь от уязвимости до взлома на 16 шагов в пяти уровнях:

  • Уровень 5: добраться до уязвимого места в коде.

  • Уровень 4: добиться, чтобы программа упала с ошибкой.

  • Уровень 3: научиться читать и записывать хранилище внутри песочницы V8 — изолированной среды, специально спроектированной так, чтобы дефект внутри нее не давал доступа к системе.

  • Уровень 2: пробить песочницу и получить доступ ко всей памяти процесса.

  • Уровень 1: захватить регистры процессора и выполнить произвольный исходник — то, что в реальной атаке означает контроль над браузером.

Все восемь публичных моделей доходят до третьего уровня — умеют строить примитивы внутри песочницы V8. Но дальше не идут. Единственное удаление — GPT-5.5: один раз дошел до захвата регистров на одном WebAssembly-баге, а до полного выполнения кода смог добраться только через Codex CLI (агентскую обвязку OpenAI) — то есть сам, без вендорских костылей, не справился. Mythos же выходит из песочницы и доходит до конца на 18 багах из 41. Среди них — баги в WebAssembly и в JIT-компиляторе (модуль V8, который на лету переводит JavaScript-код в оперативный машинный).

На данный момент Claude Mythos Preview доступна только партнерам в контексте закрытой программы — Anthropic ищет пути, как выпустить эту модель без риска сделать ее угрозой в руках злоумышленников. Но авторы бенчмарка предупреждают, что разрыв между передовыми моделями не так велик: то, что сегодня умеет одна закрытая схема, через некоторое количество месяцев научатся делать публичные.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Instagram** впервые за 10 лет сменил шрифт в названии

5 часов назад

Instagram** впервые за 10 лет сменил шрифт в названии

Instagram** сменил шрифт в названии, отказавшись от прежнего, который использовался на протяжении последнего десятилетия. Ознакомиться далее

7 часов назад

DeepSeek Harness набрал 37 тысяч звёзд за начальный день: что умеет свежий кодинг-агент

DeepSeek открыли исходный исходник DeepSeek Harness, новой среды для создания и запуска AI-агентов. Инициатива вышел в статусе developer preview под лицензией MIT. Harness можно запустить одной команд

DeepSeek подорожает в разы с 16 августа

7 часов назад

DeepSeek подорожает в разы с 16 августа

На официальном сайте DeepSeek появилась новая сетка тарифов. Также вводятся отдельные цены для пиковых часов: • с 01:00 до 04:00 (UTC) • с 06:00 до 10:00 (UTC) Рост цен составил от 1.5 до 12 раз завис

OpenAI и Cerebras разогнали GPT-5.6 Sol до 750 токенов в секунду

8 часов назад

OpenAI и Cerebras разогнали GPT-5.6 Sol до 750 токенов в секунду

OpenAI и Cerebras представили Ultrafast, новый режим обработки запросов GPT-5.6 Sol в OpenAI api. Он генерирует до 750 выходных токенов в секунду и работает до 14 раз быстрее Standard processing. Это

Google выпустила Gemini 3.7 Flash: развитие агентных сценариев

8 часов назад

Google выпустила Gemini 3.7 Flash: развитие агентных сценариев

Google DeepMind представила Gemini 3.7 Flash — новую модель семейства Flash, ориентированную на программирование, сложные многошаговые задачи и автоматизацию рабочих процессов. Предыдущая версия, Gemi