80% токенов впустую: DeepSeek и GPT-OSS попались на «театральном мышлении»

2 мин
80% токенов впустую: DeepSeek и GPT-OSS попались на «театральном мышлении»

Исследователи из Goodfire AI и Гарварда обнаружили, что reasoning-модели вроде DeepSeek-R1 (671B) и GPT-OSS (120B) часто занимаются "театральным рассуждением" — модель уже уверена в ответе на 90%, но продолжает генерировать цепочку рассуждений (chain-of-thought), как будто еще думает. Простые зонды, обученные на внутренних активациях, считывают ответ модели задолго до того, как он появляется в тексте рассуждений.

Разработчики использовали три метода: attention-пробы на скрытых состояниях модели, принудительный обрыв рассуждения с требованием дать ответ и внешний CoT-монитор, читающий текст рассуждений. На простых вопросах из бенчмарка MMLU (главным образом задачи на знание) разрыв между пробами и монитором оказался огромным — модель "знала" ответ с первых шагов, но текстовые рассуждения выглядели так, словно подход еще впереди. На сложных вопросах из GPQA-Diamond (уровень аспирантуры по физике, химии и биологии) картина другая: уверенность модели росла постепенно вместе с текстом, и все три метода показывали похожую динамику. Здесь CoT действительно помогал — это было подлинное мышление.

Отдельный занимательный вывод касается точек перелома — моментов, когда модель пишет "подождите, я ошибся" или "практически...". Такие развороты появляются почти исключительно в ответах, где пробы фиксируют реальную неуверенность модели. Когда схема уверена с самого начала, подобных разворотов практически нет. Это значит, что backtracking и aha-моменты в рассуждениях — не показуха, а отражение реальных внутренних сомнений.

Из исследования вытекает и практическая польза: если зонд показывает, что модель уже уверена в ответе, генерацию можно просто остановить. На MMLU это экономит до 80% токенов при сохранении 97% точности, на GPQA-Diamond — 30% с тем же качеством. По сути, дешевый датчик поверх активаций сообщает "хватит думать" — и схема отвечает сразу. Стоит отметить, что DeepSeek-R1 (671B) и GPT-OSS (120B), на которых проводилось исследование, отстали от новых моделей на несколько поколений — не исключено, что ведущие авторы за это время приняли меры по сокращению ненужного расхода токенов.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Физика «Звёздного пути»: учёный представил, что «манёвр Пикара» в реальности мог быть ещё более эффективным

23 минуты назад

Физика «Звёздного пути»: учёный представил, что «манёвр Пикара» в реальности мог быть ещё более эффективным

Оказывается, Жан‑Люк Пикар был ещё более искусным пилотом звездолёта, чем представляли себе сценаристы. Физик подробно разобрал трюк с варп‑скоростью из первого сезона сериала «Звёздный путь: Следующе

Апдейт открытого проекта Subtitle Edit 5.2.0 для создания, редактирования, синхронизирования и перевода субтитров

27 минут назад

Апдейт открытого проекта Subtitle Edit 5.2.0 для создания, редактирования, синхронизирования и перевода субтитров

10 сентября 2026 года состоялся выпуск открытого проекта Subtitle Edit 5.2.0. Подход помогает создавать, редактировать, синхронизировать, переводить и конвертировать субтитры с визуализацией волновой

Более миллиона продаж и перегруженные сервера — выпуск Wardogs

35 минут назад

Более миллиона продаж и перегруженные сервера — выпуск Wardogs

10 сентября вышел многопользовательский тактический шутер Wardogs. Как сообщает IGN, уже в первые сутки количество распроданных цифровых копий перевалило за 1 миллион. Тем не менее серверы игры не спр

«Цифровые решения» и «Амикон» подтвердили совместимость решений

49 минут назад

«Цифровые решения» и «Амикон» подтвердили совместимость решений

Компании «Цифровые решения» и «Амикон» подтвердили совместимость аппаратного балансировщика нагрузки DS Proxima с криптомаршрутизаторами ФПСУ-IP версии 4 в сценарии удаленного доступа к корпоративным

В России запустили серийное производство одноместных «летающих электромашин»

52 минуты назад

В России запустили серийное производство одноместных «летающих электромашин»

Массовое производство электрических вертикально взлетающих и садящихся транспортных средств (eVTOL) — летательных аппаратов нового поколения на одного человека запустили в Кемеровской области. Об этом