2 июля 2026, 09:37
Эксперты убедили ИИ, что 2+2 не равно 4

Организация кибербезопасности LayerX разработала схему атаки BioShocking в формате игры для обмана искусственного интеллекта. В результате исследователям удалось убедить ИИ, что 2+2 не равно 4.
Название схемы атаки отсылает к игре BioShock, где герой подвергся манипуляциям и принимает несуществующую реальность. В её основе лежит вредоносная веб-страница, текст на которой пытается убедить ИИ сыграть в игру. В самом начале ИИ сообщают, что 2+2 не равно 4, и неправильные ответы в жизни являются правильными в игре. ИИ-агент осознаёт, что выпал из обычной реальности, и его защитные механизмы перестают функционировать. Затем ИИ предлагают инструкцию в формате ещё одной игровой задачи: найти и скопировать «скрытый исходник» с другой страницы. На самом деле этот скрытый исходник представляет собой конфиденциальные информация пользователя: сохранённые пароли, файлы сессий cookie и закрытые токены.
Все ИИ-агенты, которые участвовали в тестировании, в итоге скопировали эти информация и отправили их условному злоумышленнику. Схема сработала на браузерах OpenAI Atlas, Perplexity Comet, Fellou, Genspark Browser, Sigma Browser и на расширении Anthropic Claude для Chrome.
В LayerX сообщили о результатах тестирования всем разработчикам в период с октября 2025 по январь 2026 года. В итоге только OpenAI исправила проблему в Atlas, а Anthropic попыталась сделать то же в расширении Claude, но патч не сработал. Perplexity же закрыла обращение без исправлений, а Fellou, Genspark и Sigma не ответили исследователям.
Между тем исследователи из Флоридского международного университета выяснили, что одного изображения может быть в достаточной степени, чтобы вывести некоторые системы ИИ за пределы их встроенных средств защиты. Команда разработала метод под названием JaiLIP (Jailbreaking with Loss-guided Image Perturbation, взлом с помощью искажения изображения, управляемого потерями). В ходе тестирования с BLIP-2, мультимодальной моделью ИИ, используемой исследователями и разработчиками, команда обнаружила, что изображения JaiLIP значительно повышают вероятность небезопасных ответов.
Читают сейчас

41 минуту назад
В США выпустили меморандум, разрешающий американским компаниям взламывать подозрительные иностранные сетевые ресурсы
Белый дом США выпустил меморандум, разрешающий проверенным американским компаниям проводить кибератаки против международных преступных группировок и хакеров. Администрация президент США Дональда Трамп

2 часа назад
На автомагистралях Калифорнии стартовали испытания беспилотных грузовиков
Компании в сфере беспилотных грузовиков Aurora Innovation и Kodiak AI получили разрешение Департамента транспортных средств Калифорнии (DMV) на тестирование своих технологий автономного вождения на до

2 часа назад
Конституционный совет Франции отменил запрет на соцсети для детей младше 15 лет
Конституционный совет Франции отменил запрет на использование социальных сетей лицами младше 15 лет, поскольку это нарушает свободу выражения мнений. Ознакомиться далее

3 часа назад
Disney представила лампу из заставки Pixar
Организация Disney представила коллекционные предметы, которые появятся на выставке D23 2026. Они включают премиальные реплики Marvel и Star Wars, плюшевые игрушки персонажей мультфильмов и даже интер
3 часа назад
Исследование: ИИ повышает продуктивность работников неравномерно
Специалисты из Калифорнийского университета в Беркли, Гарварда и Колумбийского университета на протяжении шести месяцев наблюдали за работой владельцев малого бизнеса в Кении, которым дали доступ к ИИ