Как GPT-5.5 стала одержима гоблинами. OpenAI разобрала собственную ошибку в RL

3 мин
Как GPT-5.5 стала одержима гоблинами. OpenAI разобрала собственную ошибку в RL

OpenAI опубликовала технический разбор необычного бага: флагманская GPT-5.5 в кодинг-агенте Codex стала странно часто вставлять в ответы гоблинов, гремлинов, троллей, енотов и голубей — и компании пришлось дважды вписать в системный промпт прямой запрет на эти слова. Самая показательная цифра из расследования: пользовательская "личность" Nerdy давала всего 2,5% ответов ChatGPT, но на нее приходилось 66,7% всех упоминаний "goblin".

История всплыла, когда исследователи нашли в открытом репозитории Codex CLI строку: "Никогда не говори о гоблинах, гремлинах, енотах, троллях, ограх, голубях и других животных или существах, если это абсолютно и однозначно не относится к запросу пользователя". Причем строка продублирована — инженеры явно не были уверены, что одного запрета хватит. Параллельно пользователи OpenClaw жаловались, что агент использует слово "goblin" по некоторое количество раз в день, иногда вместо нейтральных слов "штука" или "вещь". На X появился мем про Goblin Mode, а Сэм Альтман выложил скриншот с подписью "Запускайте обучение GPT-6, можете забирать весь кластер. Больше гоблинов!".

Корни слов-паразитов OpenAI начала искать еще в ноябре, после релиза GPT-5.1: упоминания "goblin" в ChatGPT тогда выросли на 175%, "gremlin" — на 52%. Сначала это казалось безобидной лексической причудой. В GPT-5.4 увеличение стал заметнее, а при тестировании GPT-5.5 в Codex работники сразу увидели, что модель буквально тянется к существам. Тогда и нашли первую зацепку: упоминания существ концентрировались у пользователей, выбравших одну из настраиваемых "личностей" ChatGPT — Nerdy, нарочито умную, игривую и ироничную.

Дальше начались цифры. На Nerdy приходилось всего 2,5% ответов ChatGPT, но 66,7% всех упоминаний "goblin". Аудит представил и механику: в 76,2% датасетов сигнал поощрения (reward) для Nerdy ставил ответы с "goblin" или "gremlin" выше похожих ответов без них. Но никто этот сигнал так не задумывал. Награду в обучении с подкреплением (RL) не назначает человек напрямую — ее выдает нейросеть-судья, обученная на оценках живых разметчиков: что больше похоже на "игривый умный стиль". Разметчикам нравились живые ответы — а живые ответы про код чаще содержали метафоры с существами. Сеть-судья выучила корреляцию как причину: "goblin" → высокий балл. Это классический reward hacking — схема находит способ получать высокий балл, не делая ровно того, что от нее хотели.

Самое интересное — как привычка расползлась за пределы Nerdy. Здесь включилась петля переиспользования: ответы, которые схема сама генерирует в обучении (rollouts), потом попадают в данные для дообучения с учителем (SFT) следующего поколения. GPT-5.5 на этапе SFT уже не различает Nerdy и обычный режим — она учится воспроизводить паттерны корпуса полностью. А в SFT-корпусе оказалось множество примеров с "goblin" и "gremlin". Модель кормили ее же собственными данными, и привычка перекочевала из узкой личности в общую схема.

OpenAI убрала Nerdy в марте после релиза GPT-5.4, удалила сигнал поощрения за упоминание существ и почистила обучающие данные. Но GPT-5.5 стартовали тренировать раньше, чем нашли проблему, — следовательно в Codex и появился запрет в промпте как костыль на стороне инференса. Сколько гоблинов окажется в GPT-6, в OpenAI пока не уточняют.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Вышло апдейт Debian 13.7

1 час назад

Вышло апдейт Debian 13.7

12 сентября 2026 года вышел в выпуск Debian 13.7 на базе ядра Linux 6.12 LTS (а равным образом GNOME 48, KDE Plasma 6.3.6, Xfce 4.20, Cinnamon 6.4.10, LXQt 2.1, MATE 1.26.1 и LXDE 13). Известный дистр

Claude по одному промпту и за некоторое количество переделок создала печатную плату в KiCad с нуля, ПО для MCU тоже создал текст ИИ

12 часов назад

Claude по одному промпту и за некоторое количество переделок создала печатную плату в KiCad с нуля, ПО для MCU тоже создал текст ИИ

Потребитель Reddit под ником a6m–zero рассказал, что решил с помощью Claude Fable 5 практически за один промпт спроектировать печатную плату с нуля, причём от схемы и ПО до готового устройства. В проц

Глава Anthropic призвал замедлить развитие ИИ

14 часов назад

Глава Anthropic призвал замедлить развитие ИИ

Глава Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором предложил замедлить увеличение возможностей передовых ИИ-моделей. По его мнению, исследования безопасности перестают

Выпуск OpenRGB 1.0 — открытого проекта для управления RGB-подсветкой периферии

17 часов назад

Выпуск OpenRGB 1.0 — открытого проекта для управления RGB-подсветкой периферии

12 сентября 2026 года состоялся первый мажорный выпуск открытой утилиты OpenRGB. Проект даёт возможность управлять RGB-подсветкой материнских плат, видеокарт, клавиатур, кулеров, светодиодных лент и д

Что нового в PHPUnit 13.3

19 часов назад

Что нового в PHPUnit 13.3

PHPUnit на данный момент является де-факто стандартом для написания тестов в экосистеме PHP. Он относится к семейству фреймворков xUnit (как JUnit или NUnit) и предоставляет инструменты для написания