5 мая 2026, 22:05
Выпущен тест производительности, проверяющий способность ИИ воссоздать FFmpeg

Новый бенчмарк ProgramBench использует нестандартный подход к измерению способностей LLM. В его случае схема получает бинарные файлы и документацию ряда приложений (включая FFmpeg), а затем должна с нуля создать приложения с аналогичной функциональностью. Одновременно условия сделаны намеренно жёсткими: например, моделям не дают доступ в интернет (хотя живому разработчику без возможности погуглить было бы сложно справиться с подобным).
Разработчики ProgramBench обращают внимание, что обычно известные бенчмарки проверяют способности LLM к программированию на маленьких изолированных задачах: например, «исправить определённый баг». Тем не менее в реальности люди применяют ИИ и для полного создания проекта с нуля, порой почти безнадзорного, когда архитектурные решения оказываются за моделью. И способности в подобной всесторонней деятельности ранее почти не измерялись систематически.
Сейчас результаты оказались такими. Ни одна текущая схема не справляется с задачами полностью (так, чтобы получившееся программа проходило 100% тестов). Во многих случаях проходит часть тестов, этот итог выше при воссоздании простых CLI-приложений вроде утилиты fzf, но низкий у сложных вроде FFmpeg:

В бенчмарке решили ввести отдельную оценку «почти получилось» для случаев, когда проходят 95% тестов. И сейчас у лидера, Opus 4.7, получилось набрать это в 3% из всех заданий. А общий лидерборд выглядит так:
# | Model | Agent | Resolved help_outline | Almost resolved help_outline | |
|---|---|---|---|---|---|
1 | Anthropic | Claude Opus 4.7 Anthropic | mini-SWE-agent | 0% | 3.0% |
2 | Anthropic | Claude Opus 4.6 Anthropic | mini-SWE-agent | 0% | 2.5% |
3 | Anthropic | Claude Sonnet 4.6 Anthropic | mini-SWE-agent | 0% | 1.0% |
4 | OpenAI | GPT 5.4 OpenAI | mini-SWE-agent | 0% | 0.0% |
5 | Gemini 3.1 Pro Google | mini-SWE-agent | 0% | 0.0% | |
6 | Gemini 3 Flash Google | mini-SWE-agent | 0% | 0.0% | |
7 | Anthropic | Claude Haiku 4.5 Anthropic | mini-SWE-agent | 0% | 0.0% |
8 | OpenAI | GPT 5.4 mini OpenAI | mini-SWE-agent | 0% | 0.0% |
9 | OpenAI | GPT 5 mini OpenAI | mini-SWE-agent | 0% | 0.0% |
Комментаторы зачастую отмечают, что и у живых разработчиков без интернета результаты получились бы околонулевыми. И порой возникает вопрос, считать ли такой тест производительности решаемым в целом. Авторы отвечают, что он намеренно сделан очень сложным, однако решаемым.
В этом контексте полезно вспомнить, что с рядом других бенчмарков ранее происходила сатурация. При их создании модели показывали невысокие результаты, но позже новые модели начинали справляться с задачами, которые ранее считались сложными. Когда это происходило массово, тест производительности переставал отражать различия моделей. Из-за сатурацию периодически создаются более сложные бенчмарки, поднимающие планку выше, и ProgramBench — один из подобных шагов.
Читают сейчас

31 минуту назад
Perscale news #11. Fine-grained token, SQID, stdout log streaming
Всех категорически приветствую, любители нагрузки. Сегодня в выпуске: - Stdout log streaming - Fine-grained токены - SQID для публичных ID Читать далее

36 минут назад
Bose представила открытые гарнитура Ultra Open Earbuds 2 и Sport Open Earbuds
Bose представила две модели открытых TWS‑наушников: второе поколение Ultra Open Earbuds и спортивные Sport Open Earbuds. Устройства крепятся с помощью клипс и используют технологию OpenAudio, с которо

1 час назад
Исследователи из ETH Zurich научили роботизированную кисть ходить на пальцах и нажимать клавиши
Исследователи из лаборатории Soft Robotics Lab при Швейцарской высшей технической школы Цюриха научили антропоморфную роботизированную кисть передвигаться на пальцах. Робот умеет ползать по разным пов

1 час назад
ИИ в тестировании: разбираем падения автотестов, оцениваем LLM и строим обвязку агентов
В августе прошёл Bugs Busters — митап для QA-специалистов от ЮMoney. Спикеры компании рассказали, как применяют ИИ для анализа причин падения e2e-автотестов, как устроен средство для подбора оптимальн

1 час назад
QuiverAI выпустила Arrow 2 — семейство моделей для работы с векторной графикой
Организация QuiverAI представила Arrow 2 — обновлённое семейство моделей для работы с векторной графикой. Нейросети могут генерировать SVG по текстовому описанию или референсу, конвертировать растровы