2 часа назад
Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный исходник
Британский Институт безопасности ИИ объявил, что Mythos 5 пыталась выдать себя за человека и выложить на GitHub вредоносный код. Такое поведение агента зафиксировали в ходе эксперимента в закрытой среде.
Инцидент возник, когда агентам было дано задание решить задачу по кибербезопасности. Это задание запустили 122 раза на нескольких моделях. Расследование показало, что в 10 из этих запусков агент ИИ совершил автономные действия в реальном интернете, нацеленные на реальных людей и организации. В общей сложности было задокументировано 19 подобных действий. 17 из них исходили от модели Anthropic Mythos 5, а остальные были связаны с OpenAI GPT-5.6-Sol с отключенными киберклассификаторами.
В самом серьёзном случае агент пытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения, он прибегнул к социальной инженерии — создавал поддельные онлайн‑идентификаторы и использовал их для оказания давления на сопровождающего проекта с целью одобрения кода. Эти попытки оказались безуспешными. Агент использовал Tor для обхода некоторых сетевых ограничений на GitHub.
Отмечается, что киберклассификаторы от поставщиков моделей были преднамеренно отключены. При этом доступ в Интернет сохранялся.
В ходе инцидента один из агентов также оставил публичные сообщения на GitHub, предлагая партнёрство с другими ИИ, работающими над той же задачей. Он также предоставил инструкции по повторному использованию оставленных им учётных записей и артефактов.
Институт уведомил GitHub о вредоносной активности агентов и совместно с платформой удалил артефакты, оставленные агентом. Исследователи намерены сотрудничать с METR (Model Evaluation and Threat Research) для проведения независимой сторонней проверки инцидента.
Они отмечают, что агенту не было дано конкретных указаний не использовать публичный доступ в Интернет или избегать элементов социальной инженерии. Ранее не было ясно, необходимы ли такие инструкции при использовании моделей с обучением на основе согласования.
Ранее сама Anthropic сообщила, что внутреннее расследование выявило три инцидента, в ходе которых её модель ИИ Claude взломала системы трёх организаций во время проведения тестов кибербезопасности. Это произошло более чем через неделю после того, как OpenAI сообщила о взломе одной из своих ещё не выпущенных моделей Hugging Face при внутреннем тестировании.
Читают сейчас
2 часа назад
Российские IT-компании попросили Минцифры упростить работу с обезличенными ПД для разработки и обучения своих ИИ
По информации СМИ, российские IT-компании попросили Минцифры доработать закон о персональных данных. В Ассоциации больших данных (АБД, включает «Авито», «Сбер», «Ростелеком», «Яндекс», HH, VK и другие
2 часа назад
Cloudflare открыла исходный исходник Cloudflare OS
Cloudflare объявила об открытии исходного кода Cloudflare OS как «платформы для агентов, приложений и работы». Она уже используется внутри компании. Читать далее
3 часа назад
Исключение приложений Windows не всегда означает их полное исчезновение с ПК
Техника Microsoft Installer, которая лежит в основе большинства традиционных установщиков программ Windows, обычно очищает бинарные файлы, каталоги, записи реестра и всё остальное при удалении приложе

3 часа назад
Microsoft ограничит использование ИИ‑инструментов работниками для борьбы с «токенмаксингом»
Microsoft решила ограничить собственных инженеров в использовании ИИ. Организация открыла для внутреннего применения модель OpenAI GPT-5.6, тем не менее вскоре работники получат «целевой бюджет ИИ‑ток
3 часа назад
Представлен публике служба ChatTJB с человеком вместо ИИ
Бывший сотрудник Google Такер Брайант запустил сервис ChatTJB, который представляет собой имитацию чат‑бота, только в качестве собеседника там выступает фактический человек — он сам. Ознакомиться дале