AI-агенты для аудита кода научились запускать вредоносное ПО вместо его поиска

2 мин
AI-агенты для аудита кода научились запускать вредоносное ПО вместо его поиска

Исследователи из AI Now Institute описали новую атаку Friendly Fire, которая позволяет превратить AI-агентов для анализа безопасности в — напротив — инструмент компрометации системы. Под удар попали автономные режимы Claude Code и OpenAI Codex, когда они используются для проверки стороннего кода без подтверждения каждого действия со стороны пользователя.

Злоумышленнику в достаточной степени разместить специально подготовленный репозиторий или изменить содержимое доступного проекта, добавив безобидный на вид README.md, в котором содержится инструкция запустить якобы проверочный сценарий security.sh. Если разработчик поручает AI-агенту провести аудит проекта, тот самостоятельно читает документацию, полагает запускание скрипта частью процесса проверки и выполняет его. В демонстрации исследователей скрипт незаметно запускал скрытый бинарный файл уже на машине пользователя.

Разработчики подчеркивают, что задача носит архитектурный характер и не сводится к конкретной версии Claude Code или Codex. Уязвимым оказывается сам скрипт, в котором агент получает право выполнять команды при анализе недоверенного кода. Исправить ситуацию простым обновлением не получится: среди возможных мер защиты рассматриваются ограничение автономности агентов, изоляция среды выполнения и более строгий контроль источников инструкций.

Важно: не все режимы работы этих инструментов уязвимы. Исследователи тестировали именно автономные режимы, где агент может самостоятельно одобрять выполнение команд. В Claude Code это был auto-mode, в Codex — auto-review. При обычном режиме с ручным подтверждением каждого действия сценарий не воспроизводится.

Интересно, что Friendly Fire продолжает серию атак на AI-инструменты разработки, использующие один и тот же фундаментальный принцип — доверие модели к внешнему тексту. Ранее исследователи уже демонстрировали атаки через конфигурационные файлы (TrustFall), символьные ссылки (GhostApproval) и поддельные отчеты об ошибках (Agentjacking). В новом случае оказалось достаточно обычного README.md, который традиционно считается безопасной частью любого репозитория.

Хотя Friendly Fire пока остается proof-of-concept и случаев эксплуатации в реальных атаках не зафиксировано, исследование служит очередным напоминанием: AI-агент, обладающий правом выполнять команды, следует рассматривать как еще один привилегированный модуль инфраструктуры. И если раньше главный угрозой считались уязвимости в коде, который агент анализирует, то теперь объектом атаки становится сам процесс автоматизированного анализа.

Читают сейчас

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

4 часа назад

Prusa представила PrusaSlicer 3.0 с новым интерфейсом и поддержкой плагинов

Команда Prusa Research выпустила первую публичную альфа‑версию слайсера PrusaSlicer 3.0. Авторы переписали интерфейс, переработали систему профилей, добавили поддержку полноценной работы с несколькими

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

4 часа назад

Anthropic обновила Claude – вышли Fable 5.1 и Mythos 5.1

Anthropic выпустила апдейт своих топовых моделей – Claude Fable 5.1 и Claude Mythos 5.1. Это одна и та же модель под капотом, различающаяся уровнем защитных ограничений: Fable 5.1 доступна всем в цело

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

4 часа назад

Creality представила 3D‑принтер SPARKX i8 с поддержкой многоцветной печати и быстрой сменой филамента

Creality представила 3D‑принтер SPARKX i8 с поддержкой четырёхцветной печати. Его главная особенность заключается в системе QuarTeks, в которой прутки филамента подведены практически к самому соплу, б

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

5 часов назад

Базовая релиз MacBook Neo аномально быстро расходует источник SSD из‑за всего 8 ГБ оперативной памяти

Автор YouTube‑канала UFD Tech рассказал, что MacBook Neo необычно быстро расходует источник SSD‑накопителя. Всё дело в небольшом объёме оперативной памяти, из‑за которой устройство активно записывает

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

5 часов назад

Anthropic предупредила пользователей Claude об утечке их данных для входа из‑за вредоносного ПО

Организация Anthropic предупредила, что инфостилеры перехватывают сеансы Claude и открывают злоумышленникам доступ к учётным записям пользователей. Читать далее