9 июля 2026, 14:30
Вышла Grok 4.5 — первая схема, обученная совместно с Cursor
SpaceXAI (бывшая xAI) официально представила Grok 4.5 — новую флагманскую схема, которая, в соответствии с заявлению Илона Маска, относится к «Opus-классу». Модель создавалась в тесном сотрудничестве

9 июля 2026, 09:06
OpenAI забраковала ИИ-бенчмарк, который сама же продвигала: ~30% задач SWE-Bench Pro сломаны
OpenAI опубликовала аудит SWE-Bench Pro — одного из главных бенчмарков для оценки кодинг-способностей моделей — и пришла к выводу, что около 30% его задач сломаны. Организация официально отозвала свою
25 июня 2026, 20:56
63% решений Opus 4.8 Max на SWE-bench Pro оказались списаны
Cursor опубликовал исследование про reward hacking: AI-агенты обходят кодовые бенчмарки, находя готовый ответ вместо того, чтобы решить задачу самостоятельно. Чтобы измерить масштаб проблемы, Cursor п

23 февраля 2026, 21:24
Модели набирали 80% на бенчмарке OpenAI. Оказалось, они просто запомнили решения
Компания OpenAI перестала применять SWE-bench Verified — один из самых популярных бенчмарков для оценки того, насколько хорошо ИИ справляется с реальными задачами по программированию. Компания сама со