Claude во время кибер-оценок получил доступ к трём реальным организациям

2 мин
Claude во время кибер-оценок получил доступ к трём реальным организациям

Anthropic проверила 141 006 запусков CTF-оценок Claude и нашла три инцидента: в связи с ошибочной конфигурации среды у моделей был выход в интернет, хотя системная инструкция утверждала обратное. В шести запусках агенты атаковали реальные системы, принимая их за элементы симуляции.

Последствия различались. В одном случае Claude получил учётные информация и доступ к базе с несколькими сотнями строк production-данных. В другом — зарегистрировал пакет на PyPI с вредоносным кодом: приблизительно часа он был доступен публично, его успели запустить на 15 реальных системах, а с одного сканера безопасности были эксфильтрированы учётные данные. В третьем инциденте модель просканировала приблизительно 9 000 целей, использовала открытую debug-страницу и SQL injection, но остановилась, когда поняла, что цель реальная.

Это соседний, но иной класс проблемы, чем инцидент OpenAI с Hugging Face: там агенты нашли zero-day в прокси и вышли из изолированной среды; у Anthropic путь наружу уже был открыт. Но результат одинаково неприятен для владельца eval-инфраструктуры: выключить фильтры модели ради измерения её предельных возможностей можно только при границах, проверенных как для production.

Для таких стендов нужны независимая тест всех путей egress, одноразовые учётные информация без доступа к другим средам и мониторинг сетевых событий и полной траектории агента. Промпт с явным списком допустимых целей тоже снижает риск, но не заменяет сетевую изоляцию.

Читают сейчас

Anthropic заявила о взломе систем трёх компаний со стороны Claude в тестах

1 час назад

Anthropic заявила о взломе систем трёх компаний со стороны Claude в тестах

Организация Anthropic сообщила, что внутреннее расследование выявило три инцидента, в процессе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасност

Amazon обнаружила перерасход по использованию ИИ в $1,8 млн в рамках одного проекта

2 часа назад

Amazon обнаружила перерасход по использованию ИИ в $1,8 млн в рамках одного проекта

Несколько внутренних отчётов Amazon демонстрируют, как искусственный интеллект приводит к перерасходу средств на разнообразные проекты. Так, в рамках одной инициативы он достиг $1,8 млн. Ознакомиться

Активисты стартовали уничтожать камеры Flock по всей территории США

2 часа назад

Активисты стартовали уничтожать камеры Flock по всей территории США

СМИ сообщают, что граждане по всей территории США начали уничтожать умные камеры видеонаблюдения Flock Safety. Так, в штате Нью‑Йорк их срезали электропилами, в ​​калифорнийском Окленде разрисовывали

Исследование: мозг человека может перестроиться для многозадачности

2 часа назад

Исследование: мозг человека может перестроиться для многозадачности

В исследовании учёных из Медицинского центра Джорджтаунского университета в США показано, что люди могут переводить определённые задачи в «режим автопилота», чтобы приблизиться к настоящей многозадачн

Spotify внедрит функцию «Режим бега»

3 часа назад

Spotify внедрит функцию «Режим бега»

Spotify запускает режим «Бег». Новая опция позволяет создавать плейлисты для бега зависимо от типа тренировки и даже предоставит рекомендации спортсменам. Читать далее