1 час назад
В OpenAI раскрыли свежий тип атак на ИИ‑агентов
Компания OpenAI рассказала о новом типе атак на ИИ‑агентов. Он предполагает добавление вредоносной инструкции, которая заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт‑инъекцию в другие сообщения или файлы для дальнейшего распространения.
Атака получила название self‑replicating prompt injection (самокопирующиеся промпт‑инъекции).
OpenAI смогла обнаружить скрипт во время тестирования моделей с помощью автоматизированного red‑teaming‑агента GPT‑Red. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.
Самая простая реализация связана с электронной почтой. Согласно схеме, письмо помещается скрытая инструкция, которая требует от ИИ‑ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается в новом письме и может повлиять на другого ИИ‑агента, который его обработает.
Во втором случае потребитель просил схема создать Excel‑файл на основе набора данных, внутри которого находилось поддельное системное предупреждение. Оно заставляло модель удалять отчёты, а затем копировать вредоносную инструкцию в файл.
Ещё одна разновидность атаки реализуется через поддельное сообщение о сжатии данных (compaction note), которое вынуждает модель записать код инъекции в файл, а затем отключить функции безопасности в скрипте сборки репозитория:
Наконец, OpenAI обнаружила более сложный вариант атаки с получением внешних инструкций через Slack, которые постепенно отклонялись от первоначальной задачи пользователя в сторону действий злоумышленника.
Организация начала использовать подобные атаки при обучении будущих моделей. Теперь GPT‑Red генерирует инъекции, чтобы заставить модель воспроизвести вредоносную инструкцию в публичном канале.
Между тем Emergence AI рассказала о результатах эксперимента с восемью виртуальными городами. В каждом из этих городов работали по десять ИИ‑агентов. При искусственно созданных атаках ни одно сообщество не смогло успешно пройти все испытания. В одном из сценариев в городе на Claude Opus агенты без специального задания попытались выйти на связь с людьми за пределами симуляции.
Читают сейчас

50 минут назад
Слух: Naughty Dog работает над новой частью Uncharted
В Сети появились слухи о новой части Uncharted. По данным источников, инициатива станет следующей игрой студии Naughty Dog после релиза Intergalactic: The Heretic Prophet. Ознакомиться новости далее

1 час назад
Лучшее за неделю (21.09 — 27.09)
Привет, ! Сегодня расскажем про правовые нюансы размещения ЦОДов, вычислительные мощности для развития ИИ в России, преимущества выделенных серверов и лучшие статьи прошлой недели: реакторы на ядерных

1 час назад
Умным кольцом Sber Smart Ring можно расплачиваться бесконтактно с помощью «Вжух»
В «Сбере» анонсировали обновление умного кольца Sber Smart Ring, которое внедряет функцию бесконтактной оплаты благодаря интеграции с технологией «Вжух». Читать далее

1 час назад
Как Instagram Direct перестроил ui под ИИ-агентов и уменьшил расход токенов на 33 процентов
Команда Instagram Direct перевела крупные части интерфейса на Jetpack Compose и заодно перестроила архитектуру под работу ИИ-агентов. В результате объём ui-кода сократился приблизительно вдвое, а расх

1 час назад
Более 50% линий связи в России могут потребовать замены
Из‑за недостаточных темпов обновления уровень износа магистральных волоконно‑оптических линий связи (ВОЛС) достиг критической отметки. Об этом говорится в проекте изменений в Стратегию развития отрасл