Изображение оказалось способно взломать модели ИИ с визуальным и языковым анализом

2 мин
Изображение оказалось способно взломать модели ИИ с визуальным и языковым анализом

Исследователи из Флоридского международного университета выяснили, что одного изображения может быть в достаточной степени, чтобы вывести некоторые системы ИИ за пределы их встроенных средств защиты.

Они изучили, как тонкие изменения изображений могут быть использованы для манипулирования моделями ИИ. При этом для человеческого глаза такие картинки выглядят нормально. Однако для системы ИИ эти крошечные изменения на уровне пикселей могут резко изменить то, как они интерпретируются.

Команда разработала способ под названием JaiLIP (Jailbreaking with Loss-guided Image Perturbation, взлом с помощью искажения изображения, управляемого потерями). Метод вносит тщательно рассчитанные изменения в изображение, сохраняя одновременно его внешний вид для глаза. Цель состоит в том, чтобы повлиять на то, как модель обработки изображений и языка реагирует на запросы пользователя.

Это различие важно, потому что системы ИИ видят изображения не так, как люди. В то время как мы распознаём объекты, цвета и сцены, ИИ обрабатывает математические представления пикселей и узоров. 

В процессе тестирования с BLIP-2, мультимодальной моделью ИИ, используемой исследователями и разработчиками, команда обнаружила, что изображения JaiLIP значительно повышают вероятность небезопасных ответов. По словам исследователей, этот метод превзошёл предыдущие и почти вдвое расширил количество вредоносных результатов, сгенерированных во время тестирования.

В качестве примера команда привела модифицированное изображение светофора. Хотя изображение казалось обычным для человека, оно, как сообщается, повлияло на модель, заставив её дать инструкции по проезду на красный свет, чтобы избежать штрафа за нарушение правил дорожного движения — информацию, которую система обычно отказывается предоставлять.

Особый интерес к этому исследованию вызывает то, что оно выявляет новую уязвимую поверхность. По ходу того, как компании внедряют агентов обслуживания клиентов на основе ИИ, автоматизированные рабочие процессы и мультимодальные системы, принимающие как текстовые, так и графические данные, злоумышленникам может больше не понадобиться полагаться исключительно на подсказки для манипулирования поведением модели.

Результаты особенно актуальны для небольших организаций, которые могут применять модели ИИ с открытым исходным кодом или развёртывать инструменты без тщательного тестирования безопасности. Изменённое изображение, загруженное через чат-бот, сайт поддержки или автоматизированный рабочий процедура, потенциально может повлиять на то, как платформа ИИ реагирует в фоновом режиме.

Исследование равным образом служит напоминанием о том, что модели ИИ по-прежнему воспринимают мир совсем иначе.

Читают сейчас

Microsoft повысила лицензионные сборы на OEM сборки ПК с Windows

5 часов назад

Microsoft повысила лицензионные сборы на OEM сборки ПК с Windows

По данным United Daily News, Microsoft повышает лицензионные сборы за операционные системы Windows для OEM‑производителей. Это ещё больше усилит давление на производителей ПК и, как ожидается, приведё

Nubes упростил защищенное подключение бизнеса к ГИС ЕРНИС и АИС «Таксомотор»

5 часов назад

Nubes упростил защищенное подключение бизнеса к ГИС ЕРНИС и АИС «Таксомотор»

Подход на базе аттестованного облака «ТУЧА» помогает курьерским, логистическим и транспортным компаниям выполнить требования к защите информации без создания всей инфраструктуры с нуля. Читать далее

С 2020 года доля иностранных патентных заявок в РФ сократилась почти в 2,5 раза

5 часов назад

С 2020 года доля иностранных патентных заявок в РФ сократилась почти в 2,5 раза

С 2020 года по 2025 год доля патентных заявок, поданных нерезидентами в России, сократилась с 32,1 до 17,7%, сообщил Институт статистических исследований и экономики знаний (ИСИЭЗ) НИУ ВШЭ со ссылкой

Глава Replit: ИИ освободил инженерам время для изобретательских задач

5 часов назад

Глава Replit: ИИ освободил инженерам время для изобретательских задач

Генеральный директор Replit Амджад Масад утверждает, что ИИ делает разработку программного обеспечения в его компании более интеллектуальной и увлекательной. По его словам, теперь инженеры могут выпол

NVIDIA представили Nemotron 3.5 Lightning, быструю локальную схема

5 часов назад

NVIDIA представили Nemotron 3.5 Lightning, быструю локальную схема

NVIDIA выпустили Nemotron 3.5 Lightning, новую открытую схема для локальных AI-агентов. Её можно скачать с Hugging Face и файлы модели занимают приблизительно 20 ГБ. Nemotron 3.5 Lightning создавали в