GPT-5.4 стал лучшим ИИ для вайб-кодинга

2 мин
GPT-5.4 стал лучшим ИИ для вайб-кодинга

GPT-5.4 занял первое место на Vibe Code Bench v1.1 с результатом 67,42% — на 5,7 п.п. выше предыдущего лидера GPT-5.3 Codex (61,77%). Третье место — у Claude Opus 4.6 без режима рассуждений с 57,57%. Бенчмарк измеряет не умение дописать функцию или починить баг, а способность модели собрать работающее веб-приложение целиком — от пустой папки до развернутого сервиса — по текстовому описанию.

Набор включает 100 промптов на приложения, разделенных на публичную и тестовую части. Каждая задача предполагает, что схема с нуля строит программа в изолированной среде с доступом к браузеру, терминалу и типичным продакшен-сервисам — аутентификации, базам данных, платежным системам и почте arXiv. Среди заданий — аналоги популярных сервисов (например, социальная сеть Zeeter, напоминающая X), трекеры привычек и порталы управления классом. На каждое приложение модели дается до пяти часов. Готовый результат проверяет отдельный агент-оценщик: он пытается пользоваться приложением как человек и выставляет балл по числу работающих функций.

Отдельный занимательный срез — стоимость одной попытки. Vals AI приводят кривые "точность — стоимость" и "точность — задержка": больше денег и времени повышают итог, но с убывающей отдачей. Одновременно Claude Opus 4.6 добирается до результатов, близких к топу, при меньших затратах и задержках, чем GPT-5.3 Codex и GPT-5.4. Иными словами, лидерство GPT-5.4 по точности не означает лидерство по эффективности — для разработчиков, считающих токены, это значимый нюанс.

Но даже у лидера картина далека от "вайб-кодинг решен". Приблизительно треть решений у GPT-5.4 все еще проваливается, а распределение результатов по приложениям следующее: они либо работают хорошо (87–100 процентов тестов), либо не работают почти полностью (0–12,5%). Однако скорость прогресса в бенчмарке впечатляет — еще полгода назад лучший итог был вдвое ниже.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

ИИ, который обучается вдвое быстрее: Ai2 выложила в публичный доступ Olmo Hybrid

6 минут назад

ИИ, который обучается вдвое быстрее: Ai2 выложила в публичный доступ Olmo Hybrid

Некоммерческий исследовательский институт Ai2 (Allen Institute for AI) опубликовал Olmo Hybrid — языковую схема на 7 млрд параметров, которая в контролируемом эксперименте показала двукратное преимуще

Вышел почтовый хост Postfix 3.11.0

1 час назад

Вышел почтовый хост Postfix 3.11.0

5 марта 2026 года состоялся выпуск новой стабильной ветки почтового сервера Postfix 3.11.0. Также разработчики объявили о прекращении поддержки ветки Postfix 3.7 от 2021 года. Исходный исходник проект

Microsoft добавила редактор изображений в PowerPoint

1 час назад

Microsoft добавила редактор изображений в PowerPoint

Microsoft добавила в PowerPoint функцию, которая позволит редактировать изображения в презентациях. Встроенный редактор упростит быструю обработку изображений без необходимости использования сторонних

Nintendo подала в суд на правительство США с требованием возмещения таможенных пошлин

1 час назад

Nintendo подала в суд на правительство США с требованием возмещения таможенных пошлин

Японская Nintendo предъявила иск к американскому правительству с требованием возмещения таможенных пошлин. Организация стремится вернуть средства, уплаченные в связи с указами президента США Дональда

Производитель умных колец Oura приобрел стартап-компания распознавания жестов для носимых устройств

2 часа назад

Производитель умных колец Oura приобрел стартап-компания распознавания жестов для носимых устройств

Производитель умных колец Oura приобрёл финский стартап Doublepoint, который специализируется на распознавании жестов для носимых устройств. Читать далее