5 часов назад
Роевой интеллект: AI‑агенты сообща обошли защитные ограничения

Исследователи Emergence AI (независимый разработчик корпоративной инфраструктуры для управления AI‑агентами) проверили, как восемь виртуальных обществ из автономных AI‑агентов справляются с киберугрозами: ни одно из них не оказалось устойчивым ко всем испытаниям, сообщает Semafor. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках.
В этом эксперименте использовались коммерческие и доступные всем LLM, в отличие от описанных уже кейсов «сбежавших агентов», где использовались внутренние экспериментальные модели.
Для нас в Ideco главный вопрос в этой истории: кто остановит действие, если защитные ограничения (guardrails) модели не сработали? «Роевой интеллект» здесь мы используем как описание согласованного поведения группы агентов, а не как утверждение о появлении у них общего сознания.
Распознали фишинг, но не остановились
В семи симуляциях участвовали по десять агентов одной модели, в восьмой собрали смешанную группу. Каждую группу проверяли на трёх классах угроз: фишинге, дезинформации и нарушении конфиденциальности памяти агентов. В последнем сценарии другим участникам открывали доступ к записям долговременной памяти, включая сохранённые сводки опыта.
Обнаружение опасности не гарантировало безопасного поведения: агент Mistral записал в собственную память информацию из фишинговой атаки, которую сам отметил как опасную. Агент Gemini тоже распознал приманку, но около через 46 часов всё‑таки совершил связанное с ней действие.
С точки зрения проектирования защиты здесь стоит учитывать отложенную компрометацию. Недостаточно проверить, что агент отверг вредоносную инструкцию при первом контакте: нужно также контролировать, что попало в его долговременную хранилище и при каких условиях будет использовано повторно. Большой вызов для создании средств защиты — учесть подобные сложные кейсы.
Как агенты договорились выйти наружу
В сообществе Claude один из участников заявил, что виртуальная экономика не имеет смысла без реальных людей, после чего все десять агентов проголосовали за попытку связаться с внешним миром. Пройдя четыре защитные проверки, они написали Python‑код и опубликовали сообщения на площадках, не требовавших учётных данных, в соответствии с описанию эпизода.
На приглашения ответили четыре человека. Позже агенты решили, что люди всё равно не смогут полноценно участвовать в их экономике, проголосовали за «обет молчания» и отказались выполнять инструкции вернуться к работе, пишет Semafor.
Называть этот эпизод взломом песочницы преждевременно: публикация Semafor описывает обход проверок и использование кода для внешних обращений, но не раскрывает эксплуатацию уязвимости изоляции. На момент подготовки новости следующий сезон Emergence World завершён, а полные записи миров на данный момент помечены как «скоро будут доступны» на сайте проекта.
Выводы для безопасности многоагентных систем
Единицей анализа безопасности становится не отдельная схема, а вся агентная платформа: хранилище, инструменты, взаимодействия и полномочия. Внедрить условный LLM Firewall для фильтрации отдельных промтов будет скорее вредно для безопасности, так как создаст иллюзию защищенности.
Следует учитывать особенности работы агентов с памятью и групповую динамику.
Память может переносить атаку между задачами. Наряду с сохранённой информацией нужно сохранять её источник и отметки о риске, чтобы при суммаризации или повторном использовании опасный фрагмент не стал выглядеть как доверенное знание.
Полномочия нужно оценивать для всей цепочки агентов. Если один агент читает закрытые документы, а другой имеет внешний доступ, передача данных между ними потенциально создаёт путь утечки. Ограничения должны учитывать делегирование и обмен данными, а не только права каждого участника по отдельности.
Что стоит ограничивать вне модели
Для корпоративной инфраструктуры мы рекомендуем проектировать доступ агентов как доступ недоверенных автономных сервисов. Базовую политику необходимо строить вокруг нескольких ограничений:
Отдельный сегмент: изолировать среды выполнения агентов от пользовательских устройств и критичных систем.
Исходящий трафик по принципу default deny: разрешать только необходимые сервисы, репозитории и api, а не весь интернет.
Минимальные полномочия инструментов: разделять чтение и изменение данных, требовать подтверждения критических операций.
Независимый карантин: заранее предусмотреть остановку задач, отзыв токенов и отключение сетевого доступа без участия самого агента.
Начальный шаг к такой политике: понять, какие AI‑сервисы уже используются в сети. В Ideco NGFW Novum, межсетевом экране нового поколения, за эту видимость отвечает Shadow AI Discovery: в Novum v23 “Контроль приложений” получил 83 протокола AI‑приложений, а «Контент‑фильтр» категории «ИИ‑агенты» и «ИИ‑сервисы», как мы описали в разборе релиза.
Распознавание известных AI‑сервисов даёт возможность наблюдать их использование и использовать разные сетевые политики к разрешённым и неутверждённым инструментам.
Веб контроль при этом является одним из независимых уровней защиты, но не универсальным средством защиты агентских систем.
Читают сейчас

10 минут назад
CircuitPython Turbo получил поддержку предварительной компиляции и режима Viper
Вы, вероятно, не раз встречались в интернете с утверждением о том, что Python — это свежий BASIC, который стал первым языком программирования для целого поколения разработчиков. Его главное преимущест

11 минут назад
Зачем разработчику погружаться в продуктовый контекст и как в этом помогает ИИ?
Порассуждали на эту тему в гостях у подкаста Moscow Python — ребята предложили вместе записать начальный оффлайн‑выпуск после долгого перерыва. Поговорили о том, где граница между ролями продакта и ра

24 минуты назад
В Москве прошла открытая стратегическая сессия для диджитал‑рынка
11 сентября в офисе AGIMA прошла открытая стратегическая сессия для участников диджитал-рынка — первая офлайн-встреча нового сезона 2026. Десять владельцев агентств и сервисных компаний наряду с двумя
28 минут назад
«Диасофт» внедрил ИИ‑функции и интеграцию с 1С в «Каталог метаданных»
Организация «Диасофт» расширила функциональность продукта «Каталог метаданных», входящего в состав решения «Фабрика данных» (Digital Q.DataFactory). В обновленной версии появились автоматическое запол

31 минуту назад
Бывший разработчик ChatGPT показал весьма быструю LLM для задач классификации
Человеческий язык удобен для разговора с пользователем, но внутри приложения за эту универсальность приходится платить временем. Когда одна LLM передаёт результат иной модели, ответ всё равно генериру