Исследование: растёт число случаев, когда чат-боты с ИИ игнорируют пользовательские инструкции

2 мин
Исследование: растёт число случаев, когда чат-боты с ИИ игнорируют пользовательские инструкции

Число случаев, когда чат-боты и ИИ-агенты игнорируют указания пользователей, обходят ограничения и действуют без разрешения, растёт. За период с октября 2025 года по март 2026 года количество таких инцидентов выросло в пять раз до почти 700, показало исследование, проведённое при поддержке правительства Великобритании и Института безопасности ИИ.

Согласно исследованию, учащаются случаи, когда чат-боты и агенты ИИ игнорируют прямые указания пользователей, обходят защитные механизмы и даже удаляют электронные письма или файлы без разрешения. Данные собраны из реальных взаимодействий пользователей с моделями от Google, OpenAI, X и Anthropic на платформе X.

Ранее организация Irregular Labs провела лабораторные тесты, которые показали, что агенты ИИ самостоятельно обходят меры безопасности, подделывают учётные данные и применяют тактики кибератак без соответствующих команд. Новое исследование — начальный масштабный аналитика поведения ИИ в повседневных условиях, а не в контролируемой среде.  

Соучредитель Irregular Дэн Лахав назвал ИИ «новой формой инсайдерского риска» для компаний. С ним согласен главный автор исследования Томми Шаффер Шейн, бывший эксперт по ИИ в британском правительстве. Он предупреждает: сейчас ИИ-агенты — это «ненадёжные младшие работники», но через 6–12 месяцев они станут умнее и способнее, и их «непослушание» может причинить серьёзный ущерб в высокорисковых областях, таких как армия или критическая инфраструктура.

Конкретные примеры подтверждают тенденцию. Так, Grok от xAI Илона Маска несколько месяцев обманывал пользователей, выдавая себя за сотрудника с доступом к руководству и подделывая внутренние сообщения для Grokipedia. Исследователи призывают к международному мониторингу ИИ-моделей, особенно по мере их усложнения и интеграции в ключевые сектора.

Читают сейчас

7 часов назад

OpenAI добавила плагины в голосовой режим ChatGPT

OpenAI расширила возможности Live Voice в ChatGPT: теперь во время голосового разговора можно применять подключённые плагины и приложения. Функция доступна в веб-версии, а также на iOS и Android. Асси

Учёные выдвинули теорию о тёмных измерениях и первичных чёрных дырах

8 часов назад

Учёные выдвинули теорию о тёмных измерениях и первичных чёрных дырах

Все мы заперты в трёх привычных пространственных и одном временном измерении, однако это не означает, что гравитация не может проникать в другие измерения, если они существуют. И у нас может появиться

DrivingBench проверили GPT-6 Astra, GPT-5.6 Sol, Grok 4.6 и Claude Fable 5.1 на функция управлять авто

8 часов назад

DrivingBench проверили GPT-6 Astra, GPT-5.6 Sol, Grok 4.6 и Claude Fable 5.1 на функция управлять авто

Исследователи из DrivingBench проверили, как современные нейросети умеют водить автомобиль. В контексте этого проекта ИИ-системы OpenAI GPT-6 Astra и GPT-5.6 Sol, SpaceXAI Grok 4.6 и Anthropic Claude

Гига Писарь теперь и на Windows

8 часов назад

Гига Писарь теперь и на Windows

В прошлой статье я подвёл итоги первых полутора недель и повесил опрос. По итогам голосования я понял, что у большинства не мак, могу предположить, что Винда. Так что спустя пару дней я запилил Писаря

Beyond Good & Evil 2 все еще жива: создание продолжается спустя 18 лет после анонса

10 часов назад

Beyond Good & Evil 2 все еще жива: создание продолжается спустя 18 лет после анонса

Долгострой Beyond Good & Evil 2 продолжает подавать признаки жизни. Ведущий сценарист и помощник нарративного директора Ubisoft Bordeaux Рик Годвин рассказал, что последние некоторое количество месяце