Перейти к содержимому
Экосистема AI Vibe
← Назад к AI Vibe News

Редакция 25 июня 2026 г.

Обновлено 21 июля 2026

Новости

Оболочка агента решает: Copilot CLI экономит токены без потери точности

График сравнения агентных оболочек: одна модель, разный расход токенов на инженерных задачах.

Интеллект даёт модель, а оболочка решает, сколько токенов уйдёт на задачу. GitHub сверила Copilot CLI с Claude Code и Codex CLI при тех же Sonnet 4.6, Opus 4.7, GPT‑5.4 и GPT‑5.5: на инженерных бенчмарках задачи закрываются на том же уровне, но счёт за токены ниже.

Условия выровняли жёстко — одно контекстное окно, reasoning effort medium, без tool search и MCP. Проценты разницы не публикуют: расхождения укладываются в обычный разброс между прогонами одной и той же модели.

Где мерили

  • SWE-bench Verified — 500 багфиксов в open-source Python
  • SWE-bench Pro — многошаговые задачи посложнее
  • SkillsBench — подключение и вызов skills
  • TerminalBench — сценарии в терминале
  • Win-Hill — внутренний бенч GitHub для Windows-контейнеров

TerminalBench 2.0

89 задач, минимум 5 прогонов на каждую связку агент+модель. На графике «вверх-влево лучше»: выше доля решённых задач, ниже доллар за задачу. Эллипсы ±1σ вокруг точек у Copilot и конкурентов перекрываются — разница внутри шума между прогонами, а не между оболочками.

Один агентный слой входит в GitHub Copilot SDK и питает CLI, десктопное приложение и code review. 20+ моделей — GPT, Claude, Gemini, MAI — плюс свой ключ для open-source и локальных весов. Auto model selection подбирает модель под задачу, Rubber Duck гоняет кросс-проверку между семействами.

Методология: таймаут 2 часа, non-interactive single-turn, веб-тулы выключены, метрики pass@1.

Источник: Evaluating performance and efficiency of the GitHub Copilot agentic harness across models and tasks.