80% токенов впустую: DeepSeek и GPT-OSS попались на «театральном мышлении»

2 мин
80% токенов впустую: DeepSeek и GPT-OSS попались на «театральном мышлении»

Исследователи из Goodfire AI и Гарварда обнаружили, что reasoning-модели вроде DeepSeek-R1 (671B) и GPT-OSS (120B) часто занимаются "театральным рассуждением" — модель уже уверена в ответе на 90%, но продолжает генерировать цепочку рассуждений (chain-of-thought), как будто еще думает. Простые зонды, обученные на внутренних активациях, считывают ответ модели задолго до того, как он появляется в тексте рассуждений.

Разработчики использовали три метода: attention-пробы на скрытых состояниях модели, принудительный обрыв рассуждения с требованием дать ответ и внешний CoT-монитор, читающий текст рассуждений. На простых вопросах из бенчмарка MMLU (главным образом задачи на знание) разрыв между пробами и монитором оказался огромным — модель "знала" ответ с первых шагов, но текстовые рассуждения выглядели так, словно подход еще впереди. На сложных вопросах из GPQA-Diamond (уровень аспирантуры по физике, химии и биологии) картина другая: уверенность модели росла постепенно вместе с текстом, и все три метода показывали похожую динамику. Здесь CoT действительно помогал — это было подлинное мышление.

Отдельный занимательный вывод касается точек перелома — моментов, когда модель пишет "подождите, я ошибся" или "практически...". Такие развороты появляются почти исключительно в ответах, где пробы фиксируют реальную неуверенность модели. Когда схема уверена с самого начала, подобных разворотов практически нет. Это значит, что backtracking и aha-моменты в рассуждениях — не показуха, а отражение реальных внутренних сомнений.

Из исследования вытекает и практическая польза: если зонд показывает, что модель уже уверена в ответе, генерацию можно просто остановить. На MMLU это экономит до 80% токенов при сохранении 97% точности, на GPQA-Diamond — 30% с тем же качеством. По сути, дешевый датчик поверх активаций сообщает "хватит думать" — и схема отвечает сразу. Стоит отметить, что DeepSeek-R1 (671B) и GPT-OSS (120B), на которых проводилось исследование, отстали от новых моделей на несколько поколений — не исключено, что ведущие авторы за это время приняли меры по сокращению ненужного расхода токенов.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Апдейт открытой утилиты для оптимизации энергопотребления и производительности auto‑cpufreq 3.1

1 час назад

Апдейт открытой утилиты для оптимизации энергопотребления и производительности auto‑cpufreq 3.1

26 июля 2026 года состоялся выпуск открытой утилиты для оптимизации энергопотребления и производительности auto‑cpufreq 3.0. Исходный код проекта на Python и Shell и опубликован на GitHub под лицензие

9 часов назад

СМИ: «Российские хостинг‑провайдеры предложили Минцифры отдельный порядок идентификации для иностранных клиентов»

Российские хостинг‑провайдеры предложили Минцифры ввести отдельный порядок идентификации для иностранных клиентов. Для физических лиц они предлагают сохранить действующие способы. Для юридических лиц

Приставы потратят миллиард

10 часов назад

Приставы потратят миллиард

Только потратят они его не на золотые наручники, а на цифровую независимость. 846,9 млн рублей — именно столько ФССП закладывает на импортозамещение своей «серверной» — точнее, вычислительной инфрастр

11 часов назад

Президент РФ подписал закон, вводящий уголовную ответственность за дизайн сим‑карт иностранцам без IMEI

Президент России подписал закон, который вводит уголовную ответственность за нарушения при заключении договоров мобильной связи с иностранными гражданами и лицами без гражданства. Документ опубликован

Cisco запускает Antares — недорогие ИИ‑модели для поиска известных уязвимостей в исходном коде

11 часов назад

Cisco запускает Antares — недорогие ИИ‑модели для поиска известных уязвимостей в исходном коде

Организация Cisco запустила семейство малых языковых моделей (SLM) под названием Antares, которые помогают находить уязвимости в коде с минимальными затратами, пишет Neowin. Ознакомиться далее