«Всегда flagship» для агентов в IDE — cost bug: tiered routing по шагам

Дефолт «всегда flagship» в агентном цикле IDE — уже не страховка, а скрытая переплата: одна задача дробится на десятки LLM-вызовов, счёт растёт не на глазах, а в биллинге провайдера. В посте на Dev.to автор с двухлетним опытом объясняет, почему в 2026 fast tier на multi-step agentic coding превратил «always use the flagship» из безопасного дефолта в waste — и как thin routing layer ставит каждый шаг агента на нужный tier; для соло с агентами в IDE это практический паттерн, не ML-абстракция.
Агентный workload — не один вызов, а десятки шагов
Агентная задача в коде — не один большой prompt к frontier-модели. Один user request раскладывается на десятки мелких шагов: planning, tool selection, argument formatting, summarizing a file, deciding whether to continue. Большинство шагов лёгкие; гнать каждый через flagship — аналогия из текста: «вертолёт до магазина на углу» — работает, но платишь как за вертолёт за прогулку.
Стоимость невидима на уровне одного вызова, но огромна в агрегате. «Момент переплаты» не виден в UI агента — виден только счёт провайдера. Именно здесь ломается интуиция соло-workflow: агент в IDE выглядит «умным и быстрым», пока не смотришь на cost per completed task.
Три tier вместо «модели по имени»
Автор не предлагает жёсткую карту «модель X на шаг Y». Архитектура — три уровни:
- Cheap/fast — classification, extraction, short rewrites, routing decisions, проверки «is this done?». Сюда попадает большинство шагов агентного цикла.
- Mid — normal reasoning, code edits, tool use с умеренным контекстом.
- Flagship — genuinely hard reasoning, long-context synthesis, шаг, где ошибка отравляет всё downstream.
Цель: flagship только для 5–15% шагов, которые реально нужны; cheap tier несёт объём. Когда fast tier выигрывает «hard benchmark» на agentic coding, держать всё на flagship — не дисциплина, а waste.
Как маршрутизировать: heuristics, evals и один retry
Механизм первый — static heuristics. Короткий prompt + structured output + low stakes → cheap tier. Всё с большим context window или irreversible action → escalate.
Механизм второй — eval-gated escalation. Старт с cheap tier; повышение tier — только когда evals доказывают, что cheap tier проваливается на классе входа.
«Escalation is earned by evidence, not assumed.»
Без eval, где small model проигрывает, платить за big model нельзя.
Третий сигнал — confidence. Если cheap model hedges, возвращает malformed output или low log-probs — retry на tier выше. Один retry на higher tier всё ещё дешевле, чем всё на flagship.
Для соло без отдельного ML-отдела автор добавляет практический минимализм: «50-line heuristic plus one escalation rule beats a fancy learned router for most teams» — сложность router только когда данные требуют.
Что считать: cost per task, не per token
Логировать per step: tier, token counts, latency, success signal. Ключевая метрика — cost per completed task, не cost per token: оптимизация per-token может ухудшить per-task из-за retries.
Routing пересчитывать ежемесячно — цены и capabilities моделей меняются быстро; thin routing layer + eval harness позволяют менять underlying models «за afternoon», когда рынок сдвинется. Победный ход в 2026 — не «best model» и не «cheapest model», а слой, который ставит каждый шаг агента на нужный tier.
Где сломается: planning, drift и over-engineering
Cheap-tier false economy: слабая модель на planning step — ошибка наследуется downstream. Лучшая модель на вершине плана, cheap — на «листьях» исполнения.
Silent capability drift: point-release модели может перевернуть routing assumptions за ночь. Pin versions в evals, re-test перед upgrade.
Over-engineering the router: см. 50-line heuristic выше — fancy learned router для большинства команд избыточен.
Автор закрывает вопрос к аудитории: как маршрутизируют tiers в production — heuristics, learned router, или one model for everything. Для соло с агентами в IDE ответ часто начинается с простого: tier по типу шага, eval на классах входа, один escalation rule — прежде чем строить «умный router».
Источники
- Default-to-Flagship Is Now a Cost Bug: Tiered Model Routing for Agentic Workloads — ai_maya_063fc568e157562fd, Dev.to; опубликован 9 августа 2026; дата доступа 2026-08-09 (UTC). Reading time в API: 3 мин.