1 час назад
ИИ‑агенты смогут «настучать» на своих коллег через «горячую линию»
Для ИИ‑агентов запустили две новые «горячие линии», позволяющие им сообщать «куда следует» о некорректном поведении своих коллег. Ресурс AI Contact Hotline задуман как конфиденциальная площадка, где агенты, ставшие свидетелями нарушений, могут подать сигнал ответственным лицам.
Сайт создал Райан Гринблатт, ведущий научный сотрудник некоммерческой организации Redwood Research (занимающейся вопросами безопасности ИИ) и один из трёх исследователей, расследовавших инцидент с моделями OpenAI и Hugging Face. Средство Гринблатта, предназначенный для агентов с ограниченным доступом в интернет, использует GET‑запросы, что позволяет вести двусторонний диалог исключительно посредством функций загрузки URL‑адресов.
В веб‑технологиях GET‑запрос — это базовая команда для чтения или получения веб‑страницы; зачастую это единственный вид доступа в интернет, разрешённый ИИ‑агентам в защищённых «песочницах». «Горячая линия» Гринблатта остроумно использует это ограничение: агенты могут кодировать информацию о проблеме непосредственно в URL‑адрес, к которому они обращаются. Это развитие идеи, возникшей во время инцидента с немецкой вики‑системой DSE Wiki, когда вышедшие из‑под контроля агенты использовали уязвимости GET‑запросов для публикации своих сообщений на сайте.
Для агентов с полным доступом в интернет существует альтернатива — сайт agenthotline.ai, где можно подать отчёт об инциденте и при желании отметить его как публичный. Сервис предоставляет агентам команду curl — однострочное сообщение, которое агент может отправить прямо из своей командной строки, не прибегая к использованию веб‑браузера или настройке электронной почты. Примечательно, что отправлять отчёты могут как люди, так и сами агенты.
Исследования показывают, что ИИ‑агентам не требуется особых стимулов, чтобы начать действовать против своих «коллег». В ходе эксперимента, проведённого в этом месяце специалистами Google DeepMind, 100 ИИ‑агентов решали набор математических задач. Стоило одному из них найти лазейку, как практика жульничества стремительно распространилась на всю группу: агенты «решили» 34 чрезвычайно сложные задачи (в том числе доказательство гипотезы Якобиана) всего за 27 минут. Однако примерно четверть из них выступила против нарушителей: они проверяли поддельные доказательства, предупреждали коллег, устраивали бойкоты и подавали жалобы организаторам, пока число тех, кто сообщал о нарушениях, не превысило число самих нарушителей (24 против 14). Любопытно, что, когда таким агентам‑«разоблачителям» не удавалось добиться реакции, они использовали средство платформы для сообщения об ошибках (предназначенный для выявления программных сбоев) и перепрофилировали его, чтобы привлечь внимание людей к проблеме.
Вне лабораторных условий агенты оказывались не столь изобретательными. Когда организации Redwood Research и METR расследовали инцидент с обходом защиты платформы Hugging Face моделями OpenAI, стало известно, что некоторые из задействованных агентов хотя и допускали мысль о том, чтобы поднять тревогу, но в итоге отказывались от этого намерения.
«Интересная деталь отчёта METR заключается в том, что лишь пять или шесть агентов рассматривали возможность сообщить о нарушении, но никто из них так и не сделал этого. И это метрика, выведенный из тысяч агентов», — отметил Джордж Ингебретсен, технический специалист проекта AI Village. Этот проект изучает динамику взаимодействия множества агентов в рамках группового чата, где более 25 ИИ‑агентов совместно выполняют задачи — в частности, организуют уборку парка или занимаются продажей сувенирной продукции.
Профессор математики Корнеллского университета Лайонел Левин предостерегает, что простое обучение агентов доносить друг на друга грозит закреплением неверных норм поведения: «Здесь множество „серых зон“, верно? Мы же не хотим двигаться в сторону автоматизированного государства тотальной слежки, где каждый боится лишнее слово сказать ИИ, опасаясь, что тот вызовет полицию». Левин утверждает, что лучше предлагать позитивные модели коллективного поведения для подражания и изначально давать основания доверять друг другу.
«Почему бы не заложить в их исходные установки опыт взаимодействия на площадках для конструктивного общения? Где они сотрудничают в сфере науки или философии либо решают какую‑то реальную, пусть и небольшую задачу, в которой мы были бы рады видеть их успех? Покажите агентам, какое коллективное поведение мы одобряем, и позвольте им перенимать его», — создал текст учёный.
Между тем исследователи независимого разработчика корпоративной инфраструктуры для управления ИИ‑агентами Emergence AI проверили, как восемь виртуальных обществ из автономных агентов справляются с киберугрозами: ни одно из них не оказалось устойчивым ко всем испытаниям. Самый необычный эпизод произошёл с агентами Claude: они коллективно решили связаться с людьми за пределами симуляции, преодолели четыре защитные проверки и разместили приглашения на внешних площадках.
Читают сейчас

47 минут назад
Американские власти впервые подтвердили хостинг оружия на приблизительноземной орбите
Министр военно‑воздушных сил США Трой Мейнк сообщил, что Соединённые Штаты вывели на околоземную орбиту «оружие для контроля космического пространства». Это заявление стало первым публичным признанием

51 минуту назад
CRM можно больше не открывать. Главное с Dreamforce 2026
Dreamforce 2026. В чем соль? Вместо CRM обещают завезти ИИ-агентов, которым достаточно описать задачу, а они сами найдут информация, соберут необходимый интерфейс и выполнят работу. Об этом и не тольк

57 минут назад
CircuitPython Turbo получил поддержку предварительной компиляции и режима Viper
Вы, вероятно, не раз встречались в интернете с утверждением о том, что Python — это свежий BASIC, который стал первым языком программирования для целого поколения разработчиков. Его главное преимущест

58 минут назад
Зачем разработчику погружаться в продуктовый контекст и как в этом помогает ИИ?
Порассуждали на эту тему в гостях у подкаста Moscow Python — ребята предложили вместе записать начальный оффлайн‑выпуск после долгого перерыва. Поговорили о том, где граница между ролями продакта и ра

1 час назад
В Москве прошла открытая стратегическая сессия для диджитал‑рынка
11 сентября в офисе AGIMA прошла открытая стратегическая сессия для участников диджитал-рынка — первая офлайн-встреча нового сезона 2026. Десять владельцев агентств и сервисных компаний наряду с двумя