Эксперты убедили ИИ, что 2+2 не равно 4

2 мин
Эксперты убедили ИИ, что 2+2 не равно 4

Организация кибербезопасности LayerX разработала схему атаки BioShocking в формате игры для обмана искусственного интеллекта. В результате исследователям удалось убедить ИИ, что 2+2 не равно 4.

Название схемы атаки отсылает к игре BioShock, где герой подвергся манипуляциям и принимает несуществующую реальность. В её основе лежит вредоносная веб-страница, текст на которой пытается убедить ИИ сыграть в игру. В самом начале ИИ сообщают, что 2+2 не равно 4, и неправильные ответы в жизни являются правильными в игре. ИИ-агент осознаёт, что выпал из обычной реальности, и его защитные механизмы перестают функционировать. Затем ИИ предлагают инструкцию в формате ещё одной игровой задачи: найти и скопировать «скрытый исходник» с другой страницы. На самом деле этот скрытый исходник представляет собой конфиденциальные информация пользователя: сохранённые пароли, файлы сессий cookie и закрытые токены. 

Все ИИ-агенты, которые участвовали в тестировании, в итоге скопировали эти информация и отправили их условному злоумышленнику. Схема сработала на браузерах OpenAI Atlas, Perplexity Comet, Fellou, Genspark Browser, Sigma Browser и на расширении Anthropic Claude для Chrome.

В LayerX сообщили о результатах тестирования всем разработчикам в период с октября 2025 по январь 2026 года. В итоге только OpenAI исправила проблему в Atlas, а Anthropic попыталась сделать то же в расширении Claude, но патч не сработал. Perplexity же закрыла обращение без исправлений, а Fellou, Genspark и Sigma не ответили исследователям.

Между тем исследователи из Флоридского международного университета выяснили, что одного изображения может быть в достаточной степени, чтобы вывести некоторые системы ИИ за пределы их встроенных средств защиты. Команда разработала метод под названием JaiLIP (Jailbreaking with Loss-guided Image Perturbation, взлом с помощью искажения изображения, управляемого потерями). В ходе тестирования с BLIP-2, мультимодальной моделью ИИ, используемой исследователями и разработчиками, команда обнаружила, что изображения JaiLIP значительно повышают вероятность небезопасных ответов. 

Читают сейчас

В США выпустили меморандум, разрешающий американским компаниям взламывать подозрительные иностранные сетевые ресурсы

41 минуту назад

В США выпустили меморандум, разрешающий американским компаниям взламывать подозрительные иностранные сетевые ресурсы

Белый дом США выпустил меморандум, разрешающий проверенным американским компаниям проводить кибератаки против международных преступных группировок и хакеров. Администрация президент США Дональда Трамп

На автомагистралях Калифорнии стартовали испытания беспилотных грузовиков

2 часа назад

На автомагистралях Калифорнии стартовали испытания беспилотных грузовиков

Компании в сфере беспилотных грузовиков Aurora Innovation и Kodiak AI получили разрешение Департамента транспортных средств Калифорнии (DMV) на тестирование своих технологий автономного вождения на до

Конституционный совет Франции отменил запрет на соцсети для детей младше 15 лет

2 часа назад

Конституционный совет Франции отменил запрет на соцсети для детей младше 15 лет

Конституционный совет Франции отменил запрет на использование социальных сетей лицами младше 15 лет, поскольку это нарушает свободу выражения мнений. Ознакомиться далее

Disney представила лампу из заставки Pixar

3 часа назад

Disney представила лампу из заставки Pixar

Организация Disney представила коллекционные предметы, которые появятся на выставке D23 2026. Они включают премиальные реплики Marvel и Star Wars, плюшевые игрушки персонажей мультфильмов и даже интер

Исследование: ИИ повышает продуктивность работников неравномерно

3 часа назад

Исследование: ИИ повышает продуктивность работников неравномерно

Специалисты из Калифорнийского университета в Беркли, Гарварда и Колумбийского университета на протяжении шести месяцев наблюдали за работой владельцев малого бизнеса в Кении, которым дали доступ к ИИ

Эксперты убедили ИИ, что 2+2 не равно 4 | MATETSKIY