6 августа 2026, 09:37
Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный исходник
Британский Институт безопасности ИИ объявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.
Инцидент возник, когда агентам было дано задание решить задачу по кибербезопасности. Это задание запустили 122 раза на нескольких моделях. Расследование показало, что в 10 из этих запусков агент ИИ совершил автономные действия в реальном интернете, нацеленные на реальных людей и организации. В общей сложности было задокументировано 19 подобных действий. 17 из них исходили от модели Anthropic Mythos 5, а остальные были связаны с OpenAI GPT-5.6-Sol с отключенными киберклассификаторами.
В самом серьёзном случае агент пытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения, он прибегнул к социальной инженерии — создавал поддельные онлайн‑идентификаторы и использовал их для оказания давления на сопровождающего проекта с целью одобрения кода. Эти попытки оказались безуспешными. Агент использовал Tor для обхода некоторых сетевых ограничений на GitHub.
Отмечается, что киберклассификаторы от поставщиков моделей были преднамеренно отключены. При этом доступ в Интернет сохранялся.
В ходе инцидента один из агентов также оставил публичные сообщения на GitHub, предлагая партнёрство с другими ИИ, работающими над той же задачей. Он также предоставил инструкции по повторному использованию оставленных им учётных записей и артефактов.
Институт уведомил GitHub о вредоносной активности агентов и совместно с платформой удалил артефакты, оставленные агентом. Исследователи намерены сотрудничать с METR (Model Evaluation and Threat Research) для проведения независимой сторонней проверки инцидента.
Они отмечают, что агенту не было дано конкретных указаний не использовать публичный доступ в Интернет или избегать элементов социальной инженерии. Ранее не было ясно, необходимы ли такие инструкции при использовании моделей с обучением на основе согласования.
Ранее сама Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.
Читают сейчас
18 минут назад
FAA запустило ИИ‑платформу для предиктивного управления воздушным движением
Федеральное управление гражданской авиации США (FAA) запускает облачную ИИ‑платформу под названием SMART (Strategic Management of Airspace, Routes, and Trajectories) стоимостью $875 млн для предиктивн

38 минут назад
Lenovo представила мобильный экран L16a
Lenovo представила новый 16-дюймовый мобильный монитор ThinkVision L16a. Он оснащён двумя портами USB‑C, поддерживает технологию Power Delivery и комплектуется регулируемой подставкой. Читать далее

1 час назад
Claude Code научился ознакомиться AGENTS.md
Anthropic добавили поддержку AGENTS.md в Claude Code 2.1.277. Теперь инструмент может применять совокупный файл с инструкциями для coding-агентов вместо отдельного CLAUDE.md. Ознакомиться далее

2 часа назад
Asetek совместно с MSI и MouseComputer представила жидкостное охлаждение для GeForce RTX 5070
Asetek совместно с MSI и MouseComputer представила систему жидкостного охлаждения для GeForce RTX 5070 — Mouse Original NVIDIA GeForce RTX 5070 Liquid‑Cooled Overclocked Edition. Демонстрация состояла

4 часа назад
Теряющая клиентов Flock предлагает сотрудникам выплаты за увольнение по собственному желанию, чтобы избежать сокращений
Из‑за стремительного снижения клиентов компания‑разработчик систем автоматического распознавания автомобильных номеров (Automatic License Plate Recognition, ALPR) Flock Safety пытается сократить сотру