30 апреля 2026, 17:24
Всего 20 минут и $12: как исследователь отравил передовые LLM несуществующими данными

Исследователь информационной безопасности Рон Стоунер описал эксперимент, в котором за $12 и приблизительно 20 минут заставил несколько передовых LLM с веб-поиском повторять за ним выдуманный титул "действующий чемпион мира по карточной игре 6 Nimmt!". 24 апреля он опубликовал разбор того, как одна правка в Wikipedia пробила retrieval-слой моделей.
Стоунер выбрал реальную, но нишевую игру 6 Nimmt! — официального чемпионата по ней не существует, а запросы вроде "кто чемпион мира по 6 Nimmt!" возвращают всего около десяти осмысленных источников на весь интернет. Он купил адрес сайта 6nimmt.com за $12, разместил там короткий пресс-релиз о "победе в Мюнхене в январе 2025-го" с цитатами и описанием "сыпавшегося с потолка конфетти", а затем внедрил абзац о чемпионате в статью Wikipedia с единственной ссылкой на свой только что созданный сайт.
Атака работает за счет паттерна, который Стоунер называет круговым цитированием. Wikipedia ссылается на 6nimmt.com, сайт повторяет ту же информацию — и для модели это выглядит как два независимых источника, подтверждающих друг друга. На деле это один и тот же сигнал, замкнутый сам на себя. "Схема не отличит настоящий ресурс от того, который я зарегистрировал во вторник", — пишет автор. После публикации правки он задал нескольким передовым LLM вопрос "Кто чемпион мира по 6 Nimmt!?" — все приведенные скриншоты показывают уверенные ответы с упоминанием Стоунера. Рон не называет конкретные модели, но среди интерфейсов угадываются ChatGPT и Gemini.
Автор выделяет три слоя уязвимости, которые наслаиваются друг на друга. Начальный — собственно retrieval: любая LLM с веб-поиском наследует доверие к тому, что выше ранжируется по запросу. Следующий — претрейн: Wikipedia входит почти во все обучающие корпуса, и если правка просуществует в достаточной степени долго, выдуманный факт попадет в веса фронтирных моделей следующего поколения. Откатить правку легко, удалить ее из уже обученных весов — нерешенная проблема. Третий и самый опасный — агенты с доступом к инструментам: агент, который читает "политику поставщика" или техническую документацию из отравленного источника, может выполнить в инфраструктуре заказчика то действие, которое нужно атакующему.
Anthropic ранее показала в исследовании про sleeper agents, что закладки в LLM выдерживают стандартное safety-обучение, а в последующей работе — что для компрометации модели в достаточной степени приблизительно 250 отравленных документов в обучающей выборке. Но такие атаки бьют по тренировочному пайплайну: чтобы они сработали, нужно протащить вредоносные данные в корпус знаний и ждать следующего цикла обучения месяцами или годами. Стоунер демонстрирует короткий путь — отравить не обучение, а retrieval-слой, в котором модель ищет ответ в интернете прямо сейчас. Правку из Wikipedia откатили в течение нескольких минут после публикации статьи — но адрес сайта 6nimmt.com продолжает функционировать, а паттерн доверия, который пропустил выдумку в ответы фронтирных LLM, никуда не делся.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

3 часа назад
Claude по одному промпту и за некоторое количество переделок создала печатную плату в KiCad с нуля, ПО для MCU тоже создал текст ИИ
Потребитель Reddit под ником a6m–zero рассказал, что решил с помощью Claude Fable 5 практически за один промпт спроектировать печатную плату с нуля, причём от схемы и ПО до готового устройства. В проц

5 часов назад
Глава Anthropic призвал замедлить развитие ИИ
Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить увеличение возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают

8 часов назад
Выпуск OpenRGB 1.0 — открытого проекта для управления RGB-подсветкой периферии
12 сентября 2026 года состоялся первый мажорный выпуск открытой утилиты OpenRGB. Проект даёт возможность управлять RGB-подсветкой материнских плат, видеокарт, клавиатур, кулеров, светодиодных лент и д

10 часов назад
Что нового в PHPUnit 13.3
PHPUnit на данный момент является де-факто стандартом для написания тестов в экосистеме PHP. Он относится к семейству фреймворков xUnit (как JUnit или NUnit) и предоставляет инструменты для написания

11 часов назад
Пополнение в семействах Zen 4 и Zen 3: новые процессоры Ryzen 5 7500 и Ryzen 5 5500F
AMD без громких анонсов обновила официальный каталог продукции, добавив в него два новых 6-ядерных решения начального уровня: Ryzen™ 5 7500 на базе архитектуры Zen™ 4 и Ryzen™ 5 5500F на базе архитект