Copilot перестал резать токены вслепую: четыре оптимизации под полную задачу

GitHub Copilot перестроил подход к стоимости агентских сессий: меньше токенов на одном вызове не значит дешевле задача целиком. Четыре правки в CLI, приложении и code review делят общий harness и прошли офлайн-бенчмарки плюс контролируемые A/B-тесты.
На примере RTK (Rust Token Killer): утилита укорачивала вывод shell-команд, но когда агенту не хватало деталей, модель перечитывала полный лог или перезапускала команду. Экономия на шаге оборачивалась лишними ходами по всей сессии.
Четыре изменения
- Селективное сжатие вывода. Шум от install, build, test и lint сжимают, а команды вроде
cat,git diff,git showи произвольные скрипты отдают без изменений. Результаты grep группируют без потери совпадений; полный оригинал доступен через recovery path. - Убрали номера строк при чтении. Инструмент view больше не префиксует каждую строку — текущие редакторы матчят код по контексту. В офлайн-бенчмарках стоимость инференса упала примерно на 5%, в онлайн-эксперименте — около 3% без регрессии по качеству.
- Короче промпт task tool. Meta-prompting сократил его примерно вдвое, но первый онлайн-запуск сломал параллелизм независимых агентов. Фикс — одно предложение про независимых агентов и побочные эффекты. Итог: минус около 1300 токенов промпта на ход, примерно 1,8% prompt tokens за сессию и 2,9% normalized cost за активный час.
- Фоновые задачи без лишнего хода. Harness батчит уведомления о завершении shell-команд и sub-agent и сразу отдаёт результат в формате tool-result — раньше каждое завершение требовало отдельный retrieval-only ход. Средняя экономия по AI Credits — около 2,3%.
Более жёсткие инструкции file tool сработали в code review, но в CLI подняли стоимость — изменение не выкатили. Каждую оптимизацию меряют в том workflow, где она реально крутится.
Источник: How we make AI coding more cost efficient without sacrificing task quality.