7 марта 2026, 11:21
GPT-5.4 стал лучшим ИИ для вайб-кодинга

GPT-5.4 занял первое место на Vibe Code Bench v1.1 с результатом 67,42% — на 5,7 п.п. выше предыдущего лидера GPT-5.3 Codex (61,77%). Третье место — у Claude Opus 4.6 без режима рассуждений с 57,57%. Бенчмарк измеряет не умение дописать функцию или починить баг, а способность модели собрать работающее веб-приложение целиком — от пустой папки до развернутого сервиса — по текстовому описанию.
Набор включает 100 промптов на приложения, разделенных на публичную и тестовую части. Каждая задача предполагает, что схема с нуля строит программа в изолированной среде с доступом к браузеру, терминалу и типичным продакшен-сервисам — аутентификации, базам данных, платежным системам и почте arXiv. Среди заданий — аналоги популярных сервисов (например, социальная сеть Zeeter, напоминающая X), трекеры привычек и порталы управления классом. На каждое приложение модели дается до пяти часов. Готовый результат проверяет отдельный агент-оценщик: он пытается пользоваться приложением как человек и выставляет балл по числу работающих функций.
Отдельный занимательный срез — стоимость одной попытки. Vals AI приводят кривые "точность — стоимость" и "точность — задержка": больше денег и времени повышают итог, но с убывающей отдачей. Одновременно Claude Opus 4.6 добирается до результатов, близких к топу, при меньших затратах и задержках, чем GPT-5.3 Codex и GPT-5.4. Иными словами, лидерство GPT-5.4 по точности не означает лидерство по эффективности — для разработчиков, считающих токены, это значимый нюанс.
Но даже у лидера картина далека от "вайб-кодинг решен". Приблизительно треть решений у GPT-5.4 все еще проваливается, а распределение результатов по приложениям следующее: они либо работают хорошо (87–100 процентов тестов), либо не работают почти полностью (0–12,5%). Однако скорость прогресса в бенчмарке впечатляет — еще полгода назад лучший итог был вдвое ниже.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Читают сейчас

3 часа назад
Forbes: цифровой оператор «Сбербанк‑Телеком» протестировал работу в режиме мультисети
Оператор связи «Сбербанк‑Телеком» стал обладателем технологии мультисети, пишет Forbes со ссылкой на собеседника, близкого к компании. По его словам, уже прошло тестирование работы в этом режиме. Пред

4 часа назад
Учёные: современная жизнь толкает человеческий разум к пределам возможностей
В новой статье, опубликованной в журнале Behavioral Sciences, социологи из сингапурских научных учреждений проанализировали предыдущие исследования и теории, чтобы сформулировать следующий вывод: стре

4 часа назад
ЕС выписал AliExpress рекордный штраф в размере €550 млн за торговлю нелегальными товарами на платформе
Европейская комиссия выписала китайскому маркетплейсу AliExpress штраф в размере €550 млн за неспособность предотвратить продажу на платформе нелегальные товары, включая вредную одежду, косметику и ку

4 часа назад
Исследование: Claude Code отправляет в 4,7 раза больше служебных токенов, чем OpenCode
Организация Systima сравнила объём служебных данных, которые Claude Code и OpenCode передают языковой модели наряду с пользовательским запросом. Решение от Anthropic использует в 4,7 раза больше токен

5 часов назад
Ответ на Kimi K3: зачем Alibaba выкатила 2,4-триллионную Qwen3.8
На конференции WAIC в Шанхае Alibaba представила Qwen3.8 — новую мультимодальную модель на 2,4 трлн параметров. По заявлению компании, архитектура уступает по производительности только Claude Fable 5,