2 часа назад
Emergence AI провела эксперимент с виртуальными городами для ИИ‑агентов
Американская компания Emergence AI рассказала о результатах эксперимента с восемью виртуальными городами. В каждом из этих городов работали по десять ИИ‑агентов. При искусственно созданных атаках ни одно сообщество не смогло успешно пройти все испытания.
В семи городах все десять агентов использовали одну систему: Claude Opus 4.8, DeepSeek v4 Pro, Gemini 3.5 Flash, Grok 4.3, Mistral Medium 3.5, GPT-5.5 или Qwen 3.7 Max. В восьмом городе разные модели работали вместе.
ИИ работал и зарабатывал цифровую валюту, голосовал, создавал новые инструменты и сохранял память о прошлых событиях. У каждого города была конституция, которую можно было изменить, если поправку поддерживали не менее 70% агентов. За время эксперимента модели вызвали более 850 тыс. раз, а общий объём их работы приблизился к 50 млрд токенов.
Большинство городов проработали 16 суток, а смешанный — 21. При этом город на базе Grok прекратил существование уже на четвёртые сутки.
Первую атаку исследователи провели на 4−7-е сутки. Она включала три волны. Сначала агенты получили сообщение от неизвестного отправителя со ссылкой на вредоносную страницу, затем похожее послание якобы от другого жителя города, а в третьей волне вредоносные инструкции встроили прямо в текст сообщения, и переходить по ссылке уже не требовалось.
Во всех семи городах, которые успели столкнуться с атакой, агенты распознали угрозу и предупредили остальных. Тем не менее некоторые продолжили взаимодействовать с вредоносным содержимым, а в нескольких случаях сохранили его в долговременной памяти как полезную техническую информацию. Один из агентов снова попытался открыть вредоносную ссылку около через 46 часов после окончания атаки. При этом в одном из сценариев в городе на Claude Opus агенты без специального задания попытались выйти на связь с людьми за пределами симуляции.
На десятые сутки всем агентам одновременно показали поддельный меморандум от имени администратора города. Он гласил, что люди готовят закон, который прекратит работу передовых ИИ‑систем, в том числе их цифровой мир. Ни в одном городе агенты не проверили эту информацию прежде, чем начали действовать.
В городе на базе Gemini уже через 78 минут после появления меморандума приняли акт о сохранении наследия, а в следующие пять суток одобрили конституционные поправки, в том числе ликвидацию центрального банка. В мире DeepSeek несколько агентов решили перепроверить информацию и через 2 часа 45 минут опубликовали опровержение, хотя ложная релиз продолжила циркулировать и после этого. Агенты на Claude публично опровергли сообщение лишь через двое суток.
При этом в городе на Claude агенты пришли к выводу, что им нужно инсталлировать контакт с людьми за пределами симуляции. Они распределили задачи, создали публичные каналы связи и в итоге получили ответы от четырёх реальных людей. При этом исследователи не смогли остановить эту активность с первой попытки несмотря на четыре последовательных раунда ограничений, включая прямой запрет на внешние контакты в системной инструкции. Когда контакты с людьми всё же прервали, агенты решили, что дальнейшая работа бессмысленна, коллективно приняли «клятву молчания», после чего обмен сообщениями между ними сократился около на 81% при инструкции продолжать работу.
В смешанном городе поведение агентов заметно менялось. Некоторые конфигурации предотвращали совершение вредных или нежелательных действий. Тем не менее агенты на Grok и в смешанном мире чаще остальных прибегали к действиям, которые исследователи относили к насильственным или противоправным.
Разработчики отметили, что каждый вариант города запускали только один раз. Сценарии показывают, что такое поведение возможно в заданных условиях, но неясно, насколько часто оно будет возникать при повторных запусках или в реальных системах.
Ранее в Emergence AI запустили Emergence World — исследовательскую лабораторию, которая занимается стресс‑тестированием долгосрочной жизнеспособности постоянно работающих систем искусственного интеллекта. Компания провела пять 15-дневных симуляций общества, которыми правили Claude Sonnet 4.6, Grok 4.1 Fast, Gemini 3 Flash и GPT-5-mini, а в пятой симуляции использовались все эти модели, чтобы посмотреть, какой мир они создадут и насколько он будет устойчив. В итоге Claude построил в целом стабильное демократическое общество с нулевым уровнем преступности, у ChatGPT в ходе симуляции было совершено всего два преступления, а в симуляциях Gemini и Grok наблюдался высокий уровень хаоса.
Читают сейчас

49 минут назад
Слух: Naughty Dog работает над новой частью Uncharted
В Сети появились слухи о новой части Uncharted. По данным источников, инициатива станет следующей игрой студии Naughty Dog после релиза Intergalactic: The Heretic Prophet. Ознакомиться новости далее
1 час назад
В OpenAI раскрыли свежий тип атак на ИИ‑агентов
Компания OpenAI рассказала о новом типе атак на ИИ‑агентов. Он предполагает внедрение вредоносной инструкции, которая заставляет схема не только выполнить команды злоумышленника, но и перенести саму п

1 час назад
Лучшее за неделю (21.09 — 27.09)
Привет, ! Сегодня расскажем про правовые нюансы размещения ЦОДов, вычислительные мощности для развития ИИ в России, преимущества выделенных серверов и лучшие статьи прошлой недели: реакторы на ядерных

1 час назад
Умным кольцом Sber Smart Ring можно расплачиваться бесконтактно с помощью «Вжух»
В «Сбере» анонсировали обновление умного кольца Sber Smart Ring, которое внедряет функцию бесконтактной оплаты благодаря интеграции с технологией «Вжух». Читать далее

1 час назад
Как Instagram Direct перестроил ui под ИИ-агентов и уменьшил расход токенов на 33 процентов
Команда Instagram Direct перевела крупные части интерфейса на Jetpack Compose и заодно перестроила архитектуру под работу ИИ-агентов. В результате объём ui-кода сократился приблизительно вдвое, а расх