Математики потратили $550 000 на проверка, который ИИ не может решить

2 мин
Математики потратили $550 000 на проверка, который ИИ не может решить

Группа из 64 математиков — профессора, постдоки, аспиранты и медалисты международных олимпиад — создала тест производительности SOOHAK из 439 задач исследовательского уровня. Каждая проблема написана с нуля, без использования ИИ, и прошла пятиступенчатую проверку: от автоматического скрининга до ручного аудита. Бюджет проекта — $550 000 из средств Министерства науки Южной Кореи. Лучшая схема, Gemini 3 Pro, решает лишь 30% задач основного подмножества Challenge.

GPT-5 набрала 26,4%, Claude Opus 4.5 — 10,4%. Открытые модели отстают еще сильнее: лучший итог среди них — 13,9% у Kimi-2.5, а Qwen3-235B и GPT-OSS-120B не дотягивают до 12%. Одновременно на более легком подмножестве SOOHAK-Mini, где собраны олимпиадные задачи и задачи уровня бакалавриата, разрыв между закрытыми и открытыми моделями куда меньше — GPT-5 набирает 72%, Kimi-2.5 — 66%. Провал начинается именно там, где математика выходит за пределы опубликованных учебников и статей.

Но, пожалуй, самая интересная часть бенчмарка — подмножество Refusal из 99 задач. Это задачи-ловушки: некорректно поставленные, с противоречивыми условиями или без единственного ответа. Правильная реакция модели — отказаться решать и объяснить, в чем проблема. Ни одна модель не преодолела порог в 50%. Лучший итог показала открытая GLM-5 (49,5%), обогнав все закрытые системы. А семейство Qwen3 оказалось аутсайдером — модели упорно пытались решить нерешаемое, выдавая уверенные, но бессмысленные ответы.

Для калибровки результатов разработчики собрали пять команд из 25 человек — от золотых медалистов IMO до PhD-исследователей — и дали им 4,5 часа на 79 задач. Суммарное покрытие всех команд — 50,6%. Единственная модель, которая превысила этот порог, — Gemini-3-Pro с 60,8%. Любопытно, что олимпиадники с математическим образованием решали лучше PhD-исследователей: формат бенчмарка с жестким дедлайном награждает скорость, а не глубину специализации.

Для индустрии это сигнал: олимпиадная математика для топовых моделей уже почти решена, а вот задачи исследовательского уровня — и особенно умение отказываться решать то, что решить нельзя, — остаются за горизонтом.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Sony добавила нейросетевое усовершенствование графики на обычную PS5

11 часов назад

Sony добавила нейросетевое усовершенствование графики на обычную PS5

За нейросетевым улучшением картинки больше не обязательно идти покупать PS5 Pro. Sony представила QSSR — технологию масштабирования изображения для обычной PlayStation 5. Первыми поддержку получили Ma

Неделя OCR для LLM — в Telegram-канале Smart Engines

12 часов назад

Неделя OCR для LLM — в Telegram-канале Smart Engines

Привет, ! Объявляем тематическую неделю, посвященную OCR для LLM и интеллектуальной обработки документов без галлюцинаций и «додумывания» данных. Расскажем, как устроено полнотекстовое распознавание S

Metro 2033 и Last Light получат бесплатное апдейт с улучшенной графикой и поддержкой 120 FPS

12 часов назад

Metro 2033 и Last Light получат бесплатное апдейт с улучшенной графикой и поддержкой 120 FPS

Возвращаться в московское метро скоро станет приятнее, насколько это вообще возможно среди мутантов и радиации. 4A Games и Deep Silver анонсировали бесплатное обновление для Metro 2033 Redux и Metro:

Perfscale news #13. Выжигание WASM модулей, http3 и начальный postmortem

12 часов назад

Perfscale news #13. Выжигание WASM модулей, http3 и начальный postmortem

Всех категорически приветствую, любители больших количеств девяток! Сегодня в выпуске у нас будет интересности, ну а начнем мы как всегда с истории прошлых выпусков Читать далее

Мы прошли все стадии принятия ИИ: вышел свежий сезон подкаста «Свободный слот»

13 часов назад

Мы прошли все стадии принятия ИИ: вышел свежий сезон подкаста «Свободный слот»

Помните, как в 2023 году все спорили, заменят ли нейросети инженеров? Тема дискуссионная, но сейчас, когда ИИ уже заложен в каждый процесс, вопрос ставится иначе: что создавать? Как с ним жить? Мы в А