Эксперты убедили ИИ, что 2+2 не равно 4

2 мин
Эксперты убедили ИИ, что 2+2 не равно 4

Организация кибербезопасности LayerX разработала схему атаки BioShocking в формате игры для обмана искусственного интеллекта. В результате исследователям удалось убедить ИИ, что 2+2 не равно 4.

Название схемы атаки отсылает к игре BioShock, где герой подвергся манипуляциям и принимает несуществующую реальность. В её основе лежит вредоносная веб-страница, текст на которой пытается убедить ИИ сыграть в игру. В самом начале ИИ сообщают, что 2+2 не равно 4, и неправильные ответы в жизни являются правильными в игре. ИИ-агент осознаёт, что выпал из обычной реальности, и его защитные механизмы перестают функционировать. Затем ИИ предлагают инструкцию в формате ещё одной игровой задачи: найти и скопировать «скрытый исходник» с другой страницы. На самом деле этот скрытый исходник представляет собой конфиденциальные информация пользователя: сохранённые пароли, файлы сессий cookie и закрытые токены. 

Все ИИ-агенты, которые участвовали в тестировании, в итоге скопировали эти информация и отправили их условному злоумышленнику. Схема сработала на браузерах OpenAI Atlas, Perplexity Comet, Fellou, Genspark Browser, Sigma Browser и на расширении Anthropic Claude для Chrome.

В LayerX сообщили о результатах тестирования всем разработчикам в период с октября 2025 по январь 2026 года. В итоге только OpenAI исправила проблему в Atlas, а Anthropic попыталась сделать то же в расширении Claude, но патч не сработал. Perplexity же закрыла обращение без исправлений, а Fellou, Genspark и Sigma не ответили исследователям.

Между тем исследователи из Флоридского международного университета выяснили, что одного изображения может быть в достаточной степени, чтобы вывести некоторые системы ИИ за пределы их встроенных средств защиты. Команда разработала метод под названием JaiLIP (Jailbreaking with Loss-guided Image Perturbation, взлом с помощью искажения изображения, управляемого потерями). В ходе тестирования с BLIP-2, мультимодальной моделью ИИ, используемой исследователями и разработчиками, команда обнаружила, что изображения JaiLIP значительно повышают вероятность небезопасных ответов. 

Читают сейчас

Reasoning-версию GigaChat 3.5 теперь можно подключить в Evolution Foundation Models

45 минут назад

Reasoning-версию GigaChat 3.5 теперь можно подключить в Evolution Foundation Models

Летом коммерческий доступ открыли к GigaChat 3.5 Ultra, теперь же в каталоге сервиса Evolution Foundation Models стала доступна релиз отечественной нейросети с режимом рассуждений GigaChat 3.5 Reasoni

AMD поглощает World Labs: к команде присоединится «крестная мать ИИ»

1 час назад

AMD поглощает World Labs: к команде присоединится «крестная мать ИИ»

AMD покупает стартап-компания World Labs за 8,2 млрд $ акциями. Основательница World Labs Фей-Фей Ли, профессор Стэнфорда и автор датасета ImageNet, с которого в 2012 году началась эпоха глубокого обу

Разработчик сумел запустить на эмуляторе невышедшую ОС Apple Copland

1 час назад

Разработчик сумел запустить на эмуляторе невышедшую ОС Apple Copland

Разработчик Майкл Стейл сумел запустить на эмуляторе ОС Apple Copland, которая разрабатывалась в 90-х. Для запуска Стейл модифицировал эмулятор Power Mac с открытым исходным кодом DingusPPC; по его сл

Китай строит свою CUDA. DeepSeek выложила TileLang, DeepGEMM и DeepEP для Huawei Ascend

1 час назад

Китай строит свою CUDA. DeepSeek выложила TileLang, DeepGEMM и DeepEP для Huawei Ascend

DeepSeek известна открытыми моделями уровня фронтира при скромных бюджетах. И тут лаборатория выложила в открытый доступ шесть инструментов для программирования ускорителей Huawei Ascend. В набор вошл

В OpenIDE обновили поддержку PHP: анализаторы, удалённая отладка и подсказки типов

1 час назад

В OpenIDE обновили поддержку PHP: анализаторы, удалённая отладка и подсказки типов

Вышла версия 0.9.3 плагина PHP for OpenIDE. Переработали настройки внешних анализаторов, добавили отладку через DBGp-прокси и исправили работу с путями к файлам на удалённых серверах и в контейнерах.