Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 6 июля 2026 г.

Обновлено 21 июля 2026

Новости

Caveman обещает 65% токенов, на агентах JetBrains насчитали 8,5%

График сравнения расхода токенов агента со скиллом Caveman и без него на бенчмарке SkillsBench.

Скилл Caveman заставляет агента говорить «как пещерный человек» и обещает минус 65% токенов — JetBrains прогнала парное сравнение на SkillsBench с принудительным включением в каждом ответе. На агентных задачах вышло 8,5%: код, диффы и вызовы инструментов скилл не трогает, сжимается только комментарий между шагами.

Как мерили

Стенд — Harbor 0.17 в Docker-песочнице, агент Claude Code 2.1.200, модель claude-sonnet-5 с низким reasoning. SkillsBench: 86 из 87 задач, три прогона, около 240 trials и USD 106 на весь замер.

В одной ветке — штатный Claude Code, в другой Caveman включали принудительно. Это потолок: в обычной работе агент сам решает, активировать скилл или нет, и экономия только меньше.

Токены и качество

На полном прогоне экономия сошлась к −8,5% — с 592k до 542k output tokens на 82 парах. Первые 10 задач показывали −29,5%, но это не повторилось: малая выборка шумит.

Заявленные −65% относятся к чатовым ответам. В агентной сессии основной объём — код и вызовы инструментов, их Caveman сохраняет без изменений.

По качеству ветки неотличимы: 64 задачи с одинаковым счётом, 8 в плюс у скилла, 10 в минус, sign test p = 0,82. Средний балл 0,326 против 0,311 на шкале 0–1. На задачу стоимость падает примерно на 10%, но один выброс на аудите зависимостей легко съедает выгоду по всей ветке.

Источник: Does Speaking to Agents Like Cavemen Really Save 65% of Tokens? We Test.