Перейти к содержимому
Экосистема AI Vibe

Разборы

Экономика токенов в Claude Code: три рычага, которые решают цену сессии

Редакция 22 сентября 2026 г.

Экономика токенов в Claude Code: три рычага, которые решают цену сессии

Соло-разработчик в агентном CLI платит не за «красивый ответ», а за каждый повтор префикса в контексте: кэш, точность промпта и то, не переключили ли вы модель посередине разговора. В лонгриде Ted Liang разбирает тарифы Anthropic, арифметику хода и привычки вокруг prompt cache; схема простая: не сжечь бюджет на MCP-схемах и лишних /model в одной сессии.

Счёт за ход: кэш, а не магия «урезать токены»

Claude Code, агентный coding CLI: история диалога, system prompt, схемы подключённых MCP и вывод инструментов снова и снова попадают в input. Автор исходит из опубликованных цен Anthropic (листовые ставки за миллион токенов: Haiku 4.5, $1/$5 input/output; Sonnet 5, $2/$10; Opus 5, $5/$25; Fable 5.1, $10/$50) и подчёркивает: в примерах сессий цифры помечены как иллюстративные, важны соотношения.

Prompt caching меняет множитель на уже отправленный префикс: cache read для большинства моделей даёт 0,1× от input, для Fable 5.1, 0,025×; запись в кэш, 1,25× (TTL 5 минут) или 2× (TTL 1 час). В подписке Claude Code по умолчанию запрашивается часовой TTL; на API-ключе, пять минут, с опцией ENABLE_PROMPT_CACHING_1H=1.

У Liang упрощённая «формула счёта за ход» такая: история × 0,1 × цена input + новые токены × 2 × цена input + output × цена output. После поломки кэша множитель на историю с 0,1 скачет к 2; на этой строке штраф порядка двадцатикратный, для Fable в примере автор показывает до восьмидесятикратного на penalty-строке. Иллюстративный кейс «five-request fix»: около 126k отправленных токенов, ~78% уходит в cache reads; на Sonnet с кэшем ~$0,15 против ~$0,27 без, на Opus ~$0,37 против ~$0,67 при тех же объёмах.

Как ориентир «здорового» цикла агента Liang приводит цифры из документации Anthropic: медиана, 84% input из кэша; лучшие 10% по контуру тестов, больше 94%. Thinking tokens в Claude Code считаются как output (в линейке, с коэффициентом 5× к input по описанию автора). Проверить расход в сессии можно встроенными /cost, /usage, /context.

Что ломает prompt cache в середине агентной сессии

Кэш сопоставляется с первого байта префикса: любое изменение «в начале» пересчитывает хвост по полной цене input. Включить или выключить кэш вручную в Claude Code нельзя, остаётся не ломать его.

Действие Эффект на кэш
/model У каждой модели свой кэш; смена mid-conversation = полный prefill (включая режим opusplan)
/effort Уровень effort в ключе; эффект как у смены модели, с подтверждением
Fast mode Часть ключа; включение = re-prefill по fast-mode ценам
/compact История заменяется summary; system prompt впереди сохраняется
Истечение TTL 1 ч на subscription; 5 мин на API key по умолчанию
/rewind Хвост отрезается; префикс до точки отката остаётся byte-identical, для кэша «дешёвая» операция

Практический вывод для агента в терминале: выбор модели и effort на старте сессии или после осознанного /clear, а не «попробуем Opus на середине фикса». Смену Fable → Sonnet mid-session в гайде сравнивают с паттерном compact-then-model и выносом плана в файл, а не с голым /model в переполненном контексте.

Соло-workflow: план на большой модели, исполнение в чистых сессиях

Liang пишет для одного разработчика, не под командный процесс. Паттерн Plan Big, Execute Small, Never Switch Mid-Session: крупный план (в т.ч. в PLAN.md), отдельная сессия; подзадачи, новые сессии после коммита и обновления плана. Рядом document-and-clear: состояние на диске (PROGRESS.md, git), чтобы не тащить весь шум в один бесконечный контекст.

Точность промпта напрямую бьёт по стоимости: в эксперименте с тремя формулировками одной задачи («the tests are failing» vs указание файла vs @-mention) автор показывает разную «цену» одного и того же diff. Переполненный контекст ухудшает качество (context rot); compaction lossy, в тексте советуют «зелёную точку» для /compact, verify-after-compact и не полагаться на summary как на полную правду.

Subagents изолируют шумный output, но anti-pattern, «флот subagents» как оркестратор вместо plan file. Frontmatter субагентов в .claude/agents/ может задавать description, tools, model, effort, maxTurns, skills, memory; workflow-специфику Liang советует выносить из тяжёлого CLAUDE.md в skills, подгружая по использованию. Вывод команд длиннее 30 000 символов (BASH_MAX_OUTPUT_LENGTH) уходит в файл, в контекст попадает preview, ещё один рычаг против раздувания input.

MCP, hooks и «экономайзеры»: что автор считает доказанным

Подключённые MCP добавляют схемы в baseline контекста на каждый ход; /mcp отключает лишнее. Отдельный класс, codebase-index MCP (поиск вместо полного чтения файлов); overhead схем автор предупреждает явно.

Обзор сторонних инструментов в §12 с рамкой той же формулы (history reads / fresh writes / output / price):

  • rtk (PreToolUse hook на bash): заявление 60–90% bytes вывода; A/B JetBrains в пересказе автора: при high effort разницы по cost нет, при low effort +7,6% cost (p=0,004), качество без изменений.
  • caveman (skill, сжатие prose output): заявление ~65% output tokens; JetBrains: −8,5% output в agentic, в chat Q&A около −50% median, overhead skill ~1250 input tokens/turn.
  • caveman-compress / caveman-shrink: сжатие CLAUDE.md и MCP schemas (~46% на файлах в заявлении); независимого бенчмарка в статье нет.
  • Роутеры (claude-code-router, LiteLLM, 9Router), codebase-index MCP: «varies» / до 90%+ в claim, сравнимого independent benchmark нет.
  • ccusage: не saver, baseline для учёта.

Рекомендация автора: сначала встроенные рычаги (quiet flags в CLAUDE.md, @-mentions, отключение лишнего MCP, subagents, модель на старте, переменная CLAUDE_CODE_SUBAGENT_MODEL), и только потом сторонние «savers». Enterprise-ориентиры (~$13 / dev / active day, ~$150–250 / month, 90% users under $30 / day) Liang атрибутирует Anthropic; воспринимайте их как вендорский ориентир, не как личный замер в вашей среде.

Источники

  • Ted Liang (@ted_ai_frontend), «Claude Code Token Economics: A Developer's Guide to Session Cost», Dev.to (дата публикации поста: 2026-09-21; полный текст: доступ 2026-09-22 UTC).
  • Dev.to, карточка поста в ленте: анонс про session cost, prompt cache и token-saving tools; метка времени чтения площадки, 33 мин.