GPT-5.4 стал лучшим ИИ для вайб-кодинга

2 мин
GPT-5.4 стал лучшим ИИ для вайб-кодинга

GPT-5.4 занял первое место на Vibe Code Bench v1.1 с результатом 67,42% — на 5,7 п.п. выше предыдущего лидера GPT-5.3 Codex (61,77%). Третье место — у Claude Opus 4.6 без режима рассуждений с 57,57%. Бенчмарк измеряет не умение дописать функцию или починить баг, а способность модели собрать работающее веб-приложение целиком — от пустой папки до развернутого сервиса — по текстовому описанию.

Набор включает 100 промптов на приложения, разделенных на публичную и тестовую части. Каждая задача предполагает, что схема с нуля строит программа в изолированной среде с доступом к браузеру, терминалу и типичным продакшен-сервисам — аутентификации, базам данных, платежным системам и почте arXiv. Среди заданий — аналоги популярных сервисов (например, социальная сеть Zeeter, напоминающая X), трекеры привычек и порталы управления классом. На каждое приложение модели дается до пяти часов. Готовый результат проверяет отдельный агент-оценщик: он пытается пользоваться приложением как человек и выставляет балл по числу работающих функций.

Отдельный занимательный срез — стоимость одной попытки. Vals AI приводят кривые "точность — стоимость" и "точность — задержка": больше денег и времени повышают итог, но с убывающей отдачей. Одновременно Claude Opus 4.6 добирается до результатов, близких к топу, при меньших затратах и задержках, чем GPT-5.3 Codex и GPT-5.4. Иными словами, лидерство GPT-5.4 по точности не означает лидерство по эффективности — для разработчиков, считающих токены, это значимый нюанс.

Но даже у лидера картина далека от "вайб-кодинг решен". Приблизительно треть решений у GPT-5.4 все еще проваливается, а распределение результатов по приложениям следующее: они либо работают хорошо (87–100 процентов тестов), либо не работают почти полностью (0–12,5%). Однако скорость прогресса в бенчмарке впечатляет — еще полгода назад лучший итог был вдвое ниже.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

Глава «Ростелекома»: из-за удаления MAX из App Store российские пользователи откажутся от iPhone и перейдут на Android

1 час назад

Глава «Ростелекома»: из-за удаления MAX из App Store российские пользователи откажутся от iPhone и перейдут на Android

Глава «Ростелекома» Михаил Осеевский объявил, что из‑за удаления MAX из App Store российские пользователи откажутся от iPhone и перейдут на Android или «Аврору». Читать далее

В SELECTOS устранили критическую уязвимость CVE-2026-49975

2 часа назад

В SELECTOS устранили критическую уязвимость CVE-2026-49975

В SELECTOS устранили критическую DoS-уязвимость CVE-2026-49975 в веб-серверах nginx и Apache. Она позволяла удаленно исчерпать всю память сервера за секунды — без аутентификации, в дефолтной конфигура

2 часа назад

На МКС астронавтам приказали перейти на корабль эвакуации в связи с утечки воздуха

Астронавтам на МКС приказано перейти в корабль и подготовиться к эвакуации в связи с ростом утечки воздуха в российском сегменте, говорит в пятницу агентство Рейтер со ссылкой на НАСА. «Астронавтам на

Вебинар «Переход с Microsoft Exchange на Почту VK WorkSpace: пошаговый план»

2 часа назад

Вебинар «Переход с Microsoft Exchange на Почту VK WorkSpace: пошаговый план»

16 июня в 11:00 К2Тех совместно с VK Tech проведет вебинар о переходе с Microsoft Exchange на почту VK WorkSpace. Поговорим о том, как подойти к миграции без лишнего стресса, что важно учесть на старт

2 часа назад

Производители браузеров написали открытое письмо Microsoft с призывом: «Хватит!»

Коалиция разработчиков браузеров Browser Choice Alliance (BCA) опубликовала открытое письмо на имя генерального директора Microsoft Сатьи Наделлы, призвав компанию прекратить применять доминирующее по