rtk обещал −90% токенов, JetBrains намерили +7,6% к счёту

JetBrains сверили rtk — прокси для Claude Code, который через хук PreToolUse сжимает вывод shell-команд перед отправкой в модель. README обещает 60–90% меньше токенов; на 86 задачах SkillsBench счёт вырос на 7,6% при low reasoning effort и почти не изменился при high. Это вторая часть серии: в первой caveman skill рекламировали −65%, намерили −8,5%.
Где rtk реально работает
После rtk init -g прокси подменяет вывод git status, pytest и других команд короткой строкой — агенту не нужно ничего настраивать. Одиннадцать строк статуса превращаются в * master / M a.txt / ?? b.txt, длинный лог тестов — в итог с ошибками.
Охват узкий: Claude Code читает файлы через Read и Grep, хук bash их не трогает. По реплею 83 транскриптов rtk мог бы сжать лишь ~20% символов tool-result, а потолок экономии на входе — около 3%.
Цифры бенчмарка
Сравнение: Claude Code 2.1.201 и claude-sonnet-5, 425 парных прогонов (~$320). Arm A — stock Claude Code, arm B — rtk v0.43.0 как из коробки.
- Low effort: +7,6% к стоимости задачи (p=0,004), +13,8% ходов, качество на уровне базы.
- High effort: +0,1% (p=0,99) — штраф не воспроизводится, экономии тоже нет.
- Чем чаще срабатывал хук, тем дороже пара: до ~24% против ~5% там, где команд почти не переписывали.
Почему дашборд rtk завышает экономию
На полном прогоне low effort аналитика rtk gain показала 96,2 млн «сэкономленных» токенов — 99,8% сжатого объёма. Invoice за те же trials при этом вырос: rtk считает counterfactual по полному сырому выводу, хотя Claude Code обрезает огромные ответы; оценивает токены как chars÷4, а большая часть стоимости — кэшированные перечитывания по десятой цены.
Механизм хука рабочий, качество не просело — но заявленным 60–90% в реальной сессии просто не за что зацепиться. Для любого компрессора контекста смотреть нужно на парный счёт, а не на внутренний diff инструмента.
Источник: Does “rtk” skill really cut agent tokens by 60–90%? We tested it.