9 июня 2026, 23:49
Выпущен тест производительности FrontierCode для оценки ИИ-моделей по «качеству пулл-реквестов»


Организация Cognition выпустила новый бенчмарк FrontierCode для измерения «способности ИИ-моделей выдерживать стандарты качества реальных кодовых баз». Согласно заявлению его создателей, обычно кодинговые бенчмарки для LLM оценивают лишь формальное выполнение задач, а теперь пора задаваться более сложным вопросом: «могут ли модели писать качественный исходник?»
Чтобы оценить это, они оттолкнулись от другого вопроса: «Если бы действия модели были реальным пулл-реквестом, то смерджил бы мейнтейнер его или нет?»
Как признают создатели, здесь существуют как объективные критерии (возможно выделить «блокеры», с которыми точно не будет смерджен), так и более сложная субъективная составляющая. Для создания тестовых заданий и критериев оценки они обратились к мейнтейнерам ряда реальных репозиториев.
Получившаяся система оценки результатов учитывает ряд критериев:
Behavioural correctness: решает ли код от машины поставленную задачу?
Regression safety: не ломает ли он при этом что-то другое в кодовой базе?
Mechanical cleanliness: проходит ли он проверки проекта вроде lint check?
Test correctness: будут ли тесты, созданные LLM для проверки своего решения, падать без него?
Scope: затрагивает ли решение «лишние» места в коде, не требующиеся для этой задачи?
Code quality: соответствует ли решение конвенциям кодовой базы, следует ли паттернам проектирования, остаётся ли читабельным?
Там, где для оценки этого возможно использовать стандартные бинарные средства вроде юнит-тестов, бенчмарк обращается к ним. Но в более сложных вопросах (вроде идиоматичности и читаемости кода) для оценки прибегают к LLM.
Всего в бенчмарке 150 задач, и 50 наиболее сложных из них выделены в отдельную подгруппу «Diamond». При выходе бенчмарка даже лидирующая в нём модель Opus 4.8 набирала лишь 13.8%, что куда ниже, чем у известных бенчмарков вроде SWE-bench. Но почти сразу за ним последовал выпуск модели Fable 5 (вероятно, события были заранее согласованы), и в его анонсе приводится новый рекордный результат в 29.3%.
Точные задачи публично не раскрываются, чтобы избежать проблемы contamination, когда модели уже знают из обучающего датасета, как проходить проверка. Среди доступной информации сообщается, что разделение задач между языками программирования разнообразнее, чем у бенчмарков SWE-bench Pro и DeepSWE:

В IT-сообществе многие поддержали основную идею «оценивать качество кода от LLM», соглашаясь, что в 2026 году это насущный вопрос. Тем не менее к конкретной реализации возникают и уточнения: например, «Насколько вопроизводимы результаты, не получаются ли при перезапуске бенчмарка значимо отличающиеся числа?»
Читают сейчас
1 час назад
Google DeepMind представила Gemini Robotics ER 2 — схема для физического ИИ
Google DeepMind выпустила Gemini Robotics ER 2 — новую схема для робототехники, которую компания называет своим самым продвинутым embodied reasoning-решением. ER 2 предназначена для высокоуровневого п

1 час назад
Буст задержек DDR5: MSI заявляет, что High-Efficiency Mode нивелирует разницу с EXPO ULL
Компания MSI анонсировала внедрение фирменной технологии High-Efficiency Mode для материнских плат с AM5. Опция предназначена для автоматической оптимизации субтаймингов на DDR5 с поддержкой профилей

5 часов назад
Представлен публике публичный инициатива Decimen Optical Transfer для передачи файлов между смартфонами через QR-коды
Разработчик Bash Alarmist представил публичный инициатива под названием Decimen Optical Transfer. Это решение для передачи файлов между двумя устройствами с использованием только экрана и камеры через

6 часов назад
Версия открытой платформы для самостоятельного хранения и управления фото и видео Immich 3.1
В конце июля 2026 года состоялся версия обновления открытой платформы для самостоятельного хранения и управления фото и видео Immich 3.1. Инициатива находится в разработке с начала 2022 года и опублик

6 часов назад
Выпуск гипервизора Xen 4.22
30 июля 2026 года состоялся выпуск гипервизора Xen 4.22. Исходный код проекта написан на языке С и опубликован под лицензией GPLv2+. Создание решения ведётся в составе организации Linux Foundation при