7 июля 2026, 09:15
Открытая GLM-5.2 почти догнала фронтир: новые отраслевые индексы Artificial Analysis

Artificial Analysis запустила шесть отраслевых индексов, которые сравнивают ИИ-модели не по абстрактным тестам, а по задачам конкретных профессий: финансы и бухгалтерия (Finance & Accounting), юриспруденция (Legal), здравоохранение и медицина (Healthcare & Medical), стратегия и операционное управление (Strategy & Ops), инженерия (Engineering) и экономика (Economics). Первые места ожидаемо заняли закрытые флагманы, но главная интрига — в том, как близко подобрался опенсорс: GLM-5.2 (max) от Z AI лидирует среди открытых моделей в пяти из шести индексов.
Самый показательный итог GLM-5.2 — в инженерном индексе: 53 балла и пятое место в общем зачете, всего в двух пунктах от Claude Sonnet 5 (max) и GPT-5.5 (xhigh), у которых по 55. Единственный индекс, где опенсорс-лидерство ушло к другой модели, — Strategy & Ops: там лучшей открытой моделью стала DeepSeek V4 Pro (max) с 38 баллами.
Методология индексов построена на классификаторе профессий O*NET: аналитики берут типовые задачи каждой отрасли — от финансового моделирования до анализа договоров и поддержки клинических решений, — выводят из них требуемые способности, подбирают под каждую подходящие бенчмарки и взвешивают их по тому, как часто способность встречается в работе. Все замеры Artificial Analysis проводит самостоятельно.
Если просматривать на вершину таблиц, картина одинаковая везде: Claude Fable 5 (с фолбэком на Opus 4.8) занял первое место во всех восьми индексах, Claude Opus 4.8 (max) — следующий в шести из восьми, GPT-5.5 (xhigh) — в двух оставшихся. А вот ниже второго места рейтинги заметно перетасовываются от отрасли к отрасли: за места борются Gemini 3.5 Flash, Gemini 3.1 Pro Preview, GPT-5.5, Claude Sonnet 5 (max) и та самая GLM-5.2.
За лидерство фронтира приходится платить в прямом смысле. В индексе Strategy & Ops проблема для Claude Fable 5 стоит в среднем $3,48 — более чем в 100 раз дороже, чем у DeepSeek V4 Pro ($0,03), при разнице всего в 12 баллов. DeepSeek V4 Flash (max) и вовсе укладывается не более в $0,04 за задачу во всех шести индексах, показывая при этом средние по таблице результаты. GLM-5.2 со стоимостью задачи от $0,26 до $0,58 остается самым выгодным способом получить почти фронтирное качество.
Отраслевые индексы появились не на пустом месте: общие бенчмарки стремительно насыщаются, и в начале года Artificial Analysis уже пересобирала свой главный Intelligence Index, заменяя академические тесты оценками на "реальных" рабочих задачах вроде GDPval-AA. Новые индексы продолжают тот же сдвиг — от вопроса "насколько модель умная" к вопросу "насколько она полезна конкретному специалисту", и именно в этой системе координат разрыв между открытыми и закрытыми моделями выглядит все менее драматичным.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

1 час назад
Учёные нашли корреляцию между людским счастьем и любовью к кошкам
В новом исследовании, опубликованном в PLOS One, международная группа учёных проанализировала общедоступные данные из 93 стран, чтобы изучить связь между показателями счастья, числом домашних кошек и

1 час назад
Руководитель ИТ-блока ПСБ вошёл в топ-50 директоров по информационным технологиям
Никита Шамрай, старший вице-президент, руководитель блока информационных технологий ПСБ, занял четвёртое место в номинации «Топ-50 директоров по информационным технологиям» XXVII рейтинга «Топ-1000 ро

1 час назад
WIRED: молодые женщины начинают воспринимать работу в IT у партнёров как «красный флаг»
Если раньше работа в сфере IT ассоциировалась с высоким интеллектом и амбициями и была плюсом при поиске партнёра, то в последние годы ситуация начала меняться. Как пишет издание Wired, многие молодые

1 час назад
Создатели Silent Hill, Alone in the Dark и Fatal Frame рассказали, как рождались их главные хорроры
На фестивале The Tenth Mosaic в Токио прошла митап, которую давно ждали фанаты хорроров. На одной сцене собрались Кэйитиро Тояма (Silent Hill), Фредерик Рейналь (Alone in the Dark), Хифуми Коно (Clock

1 час назад
Вебинар «Запускаем ваш скрипт в облаке: от идеи до результата»
22 октября приглашаем вас на вебинар, где мы на практике разберем, как эффективно функционировать с облачной платформой. В прямом эфире мы создадим профиль компании в личном кабинете и на реальных при