18 мая 2026, 10:07
Математики потратили $550 000 на проверка, который ИИ не может решить

Группа из 64 математиков — профессора, постдоки, аспиранты и медалисты международных олимпиад — создала тест производительности SOOHAK из 439 задач исследовательского уровня. Каждая проблема написана с нуля, без использования ИИ, и прошла пятиступенчатую проверку: от автоматического скрининга до ручного аудита. Бюджет проекта — $550 000 из средств Министерства науки Южной Кореи. Лучшая схема, Gemini 3 Pro, решает лишь 30% задач основного подмножества Challenge.
GPT-5 набрала 26,4%, Claude Opus 4.5 — 10,4%. Открытые модели отстают еще сильнее: лучший итог среди них — 13,9% у Kimi-2.5, а Qwen3-235B и GPT-OSS-120B не дотягивают до 12%. Одновременно на более легком подмножестве SOOHAK-Mini, где собраны олимпиадные задачи и задачи уровня бакалавриата, разрыв между закрытыми и открытыми моделями куда меньше — GPT-5 набирает 72%, Kimi-2.5 — 66%. Провал начинается именно там, где математика выходит за пределы опубликованных учебников и статей.
Но, пожалуй, самая интересная часть бенчмарка — подмножество Refusal из 99 задач. Это задачи-ловушки: некорректно поставленные, с противоречивыми условиями или без единственного ответа. Правильная реакция модели — отказаться решать и объяснить, в чем проблема. Ни одна модель не преодолела порог в 50%. Лучший итог показала открытая GLM-5 (49,5%), обогнав все закрытые системы. А семейство Qwen3 оказалось аутсайдером — модели упорно пытались решить нерешаемое, выдавая уверенные, но бессмысленные ответы.
Для калибровки результатов разработчики собрали пять команд из 25 человек — от золотых медалистов IMO до PhD-исследователей — и дали им 4,5 часа на 79 задач. Суммарное покрытие всех команд — 50,6%. Единственная модель, которая превысила этот порог, — Gemini-3-Pro с 60,8%. Любопытно, что олимпиадники с математическим образованием решали лучше PhD-исследователей: формат бенчмарка с жестким дедлайном награждает скорость, а не глубину специализации.
Для индустрии это сигнал: олимпиадная математика для топовых моделей уже почти решена, а вот задачи исследовательского уровня — и особенно умение отказываться решать то, что решить нельзя, — остаются за горизонтом.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

5 часов назад
Система Neoflex Reporting подтвердила совместимость с РЕД ОС 8
Neoflex и «РЕД СОФТ» подтвердили совместимость и корректность работы российской платформы для автоматизации отчетности Neoflex Reporting с операционной системой РЕД ОС 8. Сертификат совместимости выда

7 часов назад
Ошибка в работе Reg.ru и проблемы с сервисами Рунета
17 августа 2026 года произошёл сбой в работе сервисов хостинг-провайдера и регистратора доменов Reg.ru. Проблемы затронули не только главную страницу сервиса и ЛК, но и работу сайтов, домены которых д

9 часов назад
Представлен публике публичный драйвер для HP Laser 1003/1006/1008 (a/w) для macOS, созданный с помощью Claude
Разработчик под ником Kuberwastaken показал публичный драйвер для лазерных принтеров HP Laser 1003/1006/1008 (a/w) для macOS. Проект создан с помощью Claude. Читать далее

9 часов назад
Учёные сделали энергоэффективный накопитель на основе ДНК
ДНК — генетический план развития любого живого организма, а ещё и крайне плотный способ хранения информации. Всего один грамм может вместить приблизительно 215 миллионов гигабайт данных. Применение эт

9 часов назад
OpenAI представила режим для подростков с инструментами для учёбы и родительским контролем
OpenAI представила ChatGPT for Teens — режим для подростков, который предусматривает строгие ограничения в работе и предназначен в первую очередь для обучения. Новый режим работает с 18 августа во все