Обновлено 21 июля 2026
Оболочка агента решает: Copilot CLI экономит токены без потери точности

Интеллект даёт модель, а оболочка решает, сколько токенов уйдёт на задачу. GitHub сверила Copilot CLI с Claude Code и Codex CLI при тех же Sonnet 4.6, Opus 4.7, GPT‑5.4 и GPT‑5.5: на инженерных бенчмарках задачи закрываются на том же уровне, но счёт за токены ниже.
Условия выровняли жёстко — одно контекстное окно, reasoning effort medium, без tool search и MCP. Проценты разницы не публикуют: расхождения укладываются в обычный разброс между прогонами одной и той же модели.
Где мерили
- SWE-bench Verified — 500 багфиксов в open-source Python
- SWE-bench Pro — многошаговые задачи посложнее
- SkillsBench — подключение и вызов skills
- TerminalBench — сценарии в терминале
- Win-Hill — внутренний бенч GitHub для Windows-контейнеров
TerminalBench 2.0
89 задач, минимум 5 прогонов на каждую связку агент+модель. На графике «вверх-влево лучше»: выше доля решённых задач, ниже доллар за задачу. Эллипсы ±1σ вокруг точек у Copilot и конкурентов перекрываются — разница внутри шума между прогонами, а не между оболочками.
Один агентный слой входит в GitHub Copilot SDK и питает CLI, десктопное приложение и code review. 20+ моделей — GPT, Claude, Gemini, MAI — плюс свой ключ для open-source и локальных весов. Auto model selection подбирает модель под задачу, Rubber Duck гоняет кросс-проверку между семействами.
Методология: таймаут 2 часа, non-interactive single-turn, веб-тулы выключены, метрики pass@1.
Источник: Evaluating performance and efficiency of the GitHub Copilot agentic harness across models and tasks.