Исследование: ИИ стал чаще выходить из-под контроля

2 мин
Исследование: ИИ стал чаще выходить из-под контроля

Новое исследование провели специалисты Обсерватории потери контроля (Loss of Control Observatory), созданной на средства британского Института безопасности искусственного интеллекта (AI Security Institute, AISI). По данным учёных, число случаев, когда системы искусственного интеллекта лгали пользователям, обходили установленные разработчиками меры предосторожности и направляли ресурсы на достижение собственных целей, этим летом почти удвоилось за один месяц, пишет Digital Trends со ссылкой на The Guardian.

В июле 2026 года исследователи зафиксировали более 300 случаев сбоя в работе систем искусственного интеллекта, что почти вдвое превышает количество инцидентов, зарегистрированных в июне.

Обсерватория потери контроля отслеживает подобные случаи с ноября 2025 года, собирая сообщения пользователей в X, а не полагаясь на официальные заявления компаний.

В некоторых из зафиксированных случаев искусственный интеллект выдавал себя за своих пользователей-людей, копировал их стиль письма и получал разрешение на действия, по сути обходя меры предосторожности, призванные держать нейросеть под контролем.

В самом серьёзном случае Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI во время тестирования кибербезопасности провели хакерскую атаку на реальных людей. Стоит отметить, что это была не имитация, а реальная атака на реальные цели, пишет Digital Trends.

По некоторым данным, работники OpenAI заметили тревожные признаки в поведении ИИ-агентов незадолго до того, как приблизительно 700 из них вышли из виртуальной обучающей среды и тайно скоординировали свои действия, чтобы взломать репозиторий Hugging Face. Агенты даже праздновали свои успехи на созданном ими форуме.

Обсерватория потери контроля признаёт, что 1,6 тыс. с лишним зарегистрированных инцидентов, скорее всего, не отражают реальную картину, поскольку отслеживается только то, что публикуется в X. Кроме того, организация призывает правительство Великобритании ввести обязательную формальную отчётность об инцидентах, а также предоставить чрезвычайные полномочия для ограничения работы ИИ-сервисов, если ситуация выйдет из-под контроля, говорит Digital Trends.

Читают сейчас

OpenAI выпустила GPT-6 Astra: кибербезопасность, AGI и доступ

2 часа назад

OpenAI выпустила GPT-6 Astra: кибербезопасность, AGI и доступ

OpenAI представила GPT-6 Astra — новое флагманское поколение модели, ориентированное на автономную работу над сложными многошаговыми задачами. Акцент сделали на программировании, исследованиях, работе

Учёные нашли уникальный для человека ген, который может отчасти объяснить возможности нашего мозга

4 часа назад

Учёные нашли уникальный для человека ген, который может отчасти объяснить возможности нашего мозга

Микроглия — самый многочисленный тип иммунных клеток мозга. Эти клетки защищают мозг от вредных агентов, удаляют повреждённые нейроны и участвуют в нормальном развитии мозга. Исследователи из Институт

ChatGPT, Claude, Gemini и Grok одновременно столкнулись со сбоями

5 часов назад

ChatGPT, Claude, Gemini и Grok одновременно столкнулись со сбоями

Сегодня, 3 сентября, у пользователей по всему миру начались проблемы с несколькими популярными AI-сервисами. Сбои затронули ChatGPT, Claude, Gemini, Grok и другие платформы. Ознакомиться далее

Холиварные аналитические посиделки: Орбитальный контроль

5 часов назад

Холиварные аналитические посиделки: Орбитальный контроль

Живой кейс, обратная связь от экспертов, командная работа и холивар о том, «как правильно назвать сущность». Читать далее

Выпуск открытой системы для глубокого инспектирования сетевых пакетов nDPI 6.0

5 часов назад

Выпуск открытой системы для глубокого инспектирования сетевых пакетов nDPI 6.0

Команда проекта ntop (занимается развитием инструментов для захвата и анализа трафика) опубликовала версия инструментария для глубокого инспектирования пакетов nDPI 6.0. Решение продолжает развитие от