JetBrains протестировали скилл Caveman: обещанные 65% экономии токенов превратились в 8.5%

2 мин
JetBrains протестировали скилл Caveman: обещанные 65% экономии токенов превратились в 8.5%

Caveman — скилл для агентов вроде Claude Code, который переводит текстовые ответы в рубленый «пещерный» стиль без служебных слов. Исходник и вызовы инструментов не трогает. Целых 85 тысяч звёзд на GitHub.

Тест прогнали на бенчмарке SkillsBench, 86 из 87 задач, Claude Sonnet 5 с низким reasoning effort. Сравнивали одни и те же задачи без скилла и с принудительно включённым. Результат по 82 парным задачам:

  1. Экономия output-токенов: 8.5% (592k против 542k), далеко от обещанных 65%. Разработчики считали экономию на чатовой прозе, а в агентной работе основную массу токенов занимают код, диффы и тексты ошибок, которые скилл не сжимает.

  2. Качество не пострадало: средний скор 0.326 против 0.311, статистически неразличимо (p = 0.82).

  3. Экономия $ отсутствует. По логике 8.5% экономии токенов должны были дать скидку приблизительно 10% по деньгам. Но один вырожденный случай всё нивелировал: одна задача перешла порог в 200k токенов контекста и попала под дорогой тариф api, её цена выросла с $0.33 до $8.29. В связи с этого прогон со скиллом вышел на 11.6% дороже ($40.60 против $36.39).

Ресурс: https://blog.jetbrains.com/ai/2026/07/speak-to-ai-agents-like-cavemen-tosave-tokens/

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-агентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

Читают сейчас

35 минут назад

GPT-5.6 Sol подешевел на три месяца

OpenAI снизила стоимость флагманской GPT-5.6 Sol для api и токеновых кредитов в ChatGPT Work и Codex. Скидка — более 20% и действует в течение следующих трех месяцев. Для стандартных запросов с контек

Против Oura подали в суд из‑за введения в заблуждение по сравнению с точности отслеживания сна с помощью умных колец

1 час назад

Против Oura подали в суд из‑за введения в заблуждение по сравнению с точности отслеживания сна с помощью умных колец

Против Oura подали коллективный иск из‑за введения в заблуждение потребителей относительно точности функционала умных колец по отслеживанию сна. Истцы указывают, что гаджеты финской компании не способ

Версия пакетного менеджера RPM 6.1

1 час назад

Версия пакетного менеджера RPM 6.1

20 августа 2026 года состоялся выпуск пакетного менеджера RPM 6.1. Проект развивается компанией Red Hat и используется в таких дистрибутивах, как RHEL, Fedora, SUSE, openSUSE, ALT Linux, Rosa Linux, O

«Уэбб» получил самое чёткое сегодня изображение туманности Лев

4 часа назад

«Уэбб» получил самое чёткое сегодня изображение туманности Лев

Космический телескоп «Джеймс Уэбб» (NASA/ESA/CSA) недавно сделал снимок объекта NGC 2392, также известного как туманность Лев, получившего такое название из‑за своего характерного вида. Знаменитый кос

Почти в 90 процентов статей в PubMed Central нашли признаки работы с ИИ

5 часов назад

Почти в 90 процентов статей в PubMed Central нашли признаки работы с ИИ

Использование искусственного интеллекта для написания научных статей может быть гораздо более масштабным, чем считалось ранее. К такому выводу пришли авторы исследования, в соответствии с которому дев