Copilot CLI: HydraFusion сам собирает workflow из нескольких моделей

Copilot CLI получил research preview HydraFusion: в /model одна строка в списке, а внутри среда сама собирает цепочку (черновик, критика или эскалация на более сильную модель). Это шаг дальше Auto model selection: среда выбирает весь сценарий выполнения, а не только модель под запрос.
Сначала /update, затем /experimental on и HydraFusion (Research Preview) в /model. Списание идёт по стандартным тарифам каждой модели в цепочке. В превью GitHub советует начинать с одноходовых задач в режиме autopilot: один сформулированный промпт на существенную правку кода.
Три сценария
- Single: одна модель решает задачу целиком.
- Cascade: дешёвая модель черновит, quality gate принимает результат или эскалирует на сильнее.
- Critique: черновик, независимый критик из другого семейства по паттерну Rubber Duck, затем одна правка.
Цифры с бенчмарков
На TerminalBench 2.1 GitHub показывает плюс 4,9 п.п. к доле подтверждённо решённых задач относительно Claude Opus 5 при стоимости на 67% ниже.
На DeepSWE результат ниже на 1,5 п.п. при экономии 36%. На CheckpointBench, собранном из реальных Copilot-сессий, минус 0,1 п.п. при экономии 65%. Это офлайн-оценки; в research preview GitHub проверяет, как цифры переносятся на живые задачи.
Под капотом
Для каждого запроса HydraFusion смотрит на reasoning, code generation, debugging и tool use и выбирает самый простой workflow, который должен пройти quality bar. Политики routing подбирали beam search по CheckpointBench, DeepSWE и TerminalBench 2.1. Критика идёт в изолированном read-only контексте без инструментов; репозиторий меняется только после финального патча.
Источник: Project HydraFusion: Frontier quality via multi-model orchestration.