JetBrains протестировали скилл Ponytail: объём кода сократился на 15%, а расходы на 10%

4 мин
JetBrains протестировали скилл Ponytail: объём кода сократился на 15%, а расходы на 10%

JetBrains опубликовали результаты тестирования Ponytail — скилла для coding-агентов, который должен бороться с оверинжинирингом. Он предлагает агенту сначала поискать самое простое подход и только после этого писать новый исходник.

Разработчики Ponytail заявляют о сокращении объёма генерируемого кода на 54 процентов, количества токенов — на 22%, расходов — на 20%, а времени выполнения задач — на 27 процентов. В независимом тесте JetBrains показатели оказались скромнее, но скилл действительно сработал.

Как работает Ponytail

Перед реализацией задачи Ponytail заставляет агента пройти своеобразную «лестницу минимализма»:

  • нужна ли эта реализация вообще;

  • нет ли подходящего решения уже в проекте;

  • можно ли применять стандартную библиотеку;

  • поддерживает ли это сама система;

  • есть ли нужная возможность в уже установленной зависимости;

  • можно ли решить задачу одной строкой;

  • какой минимальный объём нового кода действительно необходим.

При этом правила скилла не должны сокращать валидацию, обработку ошибок, безопасность и доступность интерфейсов.

В частности, вместо установки отдельной библиотеки и создания компонента для выбора даты агент может применять типовой HTML-элемент <input type="date">, если его возможностей достаточно для задачи.

Как проходило тестирование

JetBrains сравнили обычный Claude Code и Claude Code с Ponytail на 80 парных задачах из SkillsBench. В обоих случаях использовалась модель Claude Sonnet 5.

Правила Ponytail принудительно добавлялись в контекст агента. Это важная деталь: когда исследователи просто установили SKILL.md и оставили подход об активации модели, Claude Code не воспользовался скиллом ни в одной из десяти тестовых сессий.

Полноценная версия Ponytail решает эту проблему с помощью плагина и хука SessionStart, который автоматически добавляет инструкции в начало каждой сессии.

Обещания и результаты

В тестах JetBrains Ponytail сократил объём написанного агентом кода примерно на 15% вместо заявленных 54%.

Общее потребление токенов снизилось около на 8%, стоимость выполнения задач — на 10%, а время работы — около на 11%. Сильнее всего сократился именно текст, который генерирует модель.

Итак, все показатели изменились в заявленную сторону, но фактическая экономия составила приблизительно от четверти до половины от обещанной.

Заявленные показатели Ponytail и результаты тестирования JetBrains.
Заявленные показатели Ponytail и результаты тестирования JetBrains.

Итог зависит от размера задачи

Наибольший эффект Ponytail показал в задачах, где у агента было пространство для оверинжиниринга.

В крупных задачах объём кода сокращался приблизительно на 31%. В реализациях среднего размера — приблизительно на 21%, в небольших — на 12%. Если обычный агент и без скилла писал минимальное количество кода, Ponytail почти ничего не менял.

JetBrains отмечает, что заявленные разработчиками Ponytail 54% были получены на 12 специально выбранных задачах с характерными ловушками для coding-агентов. В таких сценариях модель могла устанавливать лишние зависимости, создавать дополнительные абстракции или писать собственную реализацию вместо использования возможностей платформы.

Чем больше кода писал обычный агент, тем заметнее был эффект Ponytail
Чем больше кода писал обычный агент, тем заметнее был эффект Ponytail

Качество выполнения задач не изменилось

Из 80 парных задач 65 получили одинаковую оценку с Ponytail и без него. В шести случаях релиз со скиллом показала лучший итог, в девяти — худший. JetBrains не обнаружила заметного влияния на итоговое качество выполнения задач.

Одновременно тесты SkillsBench проверяли, справился ли агент с заданием, но не проводили отдельный аудит безопасности, валидации или доступности. Поэтому результаты не подтверждают заявление разработчиков Ponytail о полном сохранении защитных механизмов.

В большинстве задач оценка с Ponytail и без него совпала
В большинстве задач оценка с Ponytail и без него совпала

Вывод

Ponytail не обеспечил заявленного сокращения кода на 54%, но всё же показал измеримый итог: около на 15% меньше кода и на 10% ниже расходы без заметного ухудшения качества.

Польза скилла зависит от поведения самого агента. Если схема уже предлагает компактные решения, разница будет маленький. Если она склонна разрабатывать лишние абстракции, подключать библиотеки и превращать небольшие задачи в отдельные подсистемы, эффект Ponytail становится заметнее.

Это третье исследование JetBrains в серии тестов инструментов для экономии ресурсов coding-агентов. Ранее организация проверила Caveman, сокращающий текстовые ответы, и RTK, сжимающий вывод командной строки. Ponytail стал первым инструментом серии, который представил убедительное падение расходов на полном наборе задач.

Источник: JetBrains AI Blog.

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

Читают сейчас

Почта, чаты, звонки, файлы: сколько для компании стоит виртуальный зоопарк

9 часов назад

Почта, чаты, звонки, файлы: сколько для компании стоит виртуальный зоопарк

Когда рабочие коммуникации распределены между пятью–семью сервисами, бизнес платит не только за лицензии. Растут затраты на администрирование, управление доступами и интеграции, а сотрудники тратят вр

Назад в Арктику: обеспечим связь для возвращаемой стратосферной платформы в контексте арктической экспедиции «Росатома»

9 часов назад

Назад в Арктику: обеспечим связь для возвращаемой стратосферной платформы в контексте арктической экспедиции «Росатома»

Помните наш стратосферный прыжок и запускание сервера на льдине в Арктике? А мы не просто помним, а решили, что пора вернуться. Потому официально объявляем, что RUVDS выступит технологическим партнёро

Веб‑версия WhatsApp** получила поддержку голосовых и видеозвонков

9 часов назад

Веб‑версия WhatsApp** получила поддержку голосовых и видеозвонков

Веб‑версия мессенджера WhatsApp** получила поддержку аудио‑ и видеозвонков. Ранее эти функции были доступны только в десктопном и мобильных приложениях. Читать далее

1 224 сотрудника западных AI-лабораторий попросили США придумать, как притормозить AI

10 часов назад

1 224 сотрудника западных AI-лабораторий попросили США придумать, как притормозить AI

1 224 сотрудника OpenAI, Anthropic, Google, Meta и других компаний подписали заявление Pacing the Frontier. Они просят правительство США поддержать международную разработку механизмов, которые позволя

Книга Fortune представило ежегодный рейтинг Global 500

10 часов назад

Книга Fortune представило ежегодный рейтинг Global 500

Книга Fortune представило ежегодный рейтинг Global 500. Среди российских компаний самое высокое место занял Сбер: за два года банк поднялся со 216-й на 64-ю строчку. За ним следуют «Газпром», занявший