GitHub Copilot试水多模型路由:同一任务在三种模式间切换

来源:互联网 时间:2026-09-23

A5站长网9月23日消息,GitHub推出了HydraFusion项目,这是GitHub Copilot的一项高级研究预览功能,目标是通过运行时多模型路由提供前沿级的编码智能。它在之前自动选择模型的基础上往前走了一步,把工作流执行当成一个优化问题,用来自多个提供商的模型动态构建完整的执行计划。目前它只以研究预览形式发布,通过Copilot CLI的/experimental配置向所有层级用户开放。

路由到哪种执行方式,取决于任务复杂度和上下文,一共三种。单一模式下,选定模型的能力足够独立完成,就直接执行,优先速度和延迟。级联模式下,高效模型先出草稿,交给质量门控评估,达标就采纳,不达标则升级到更强的模型。评审模式下,起草模型先出方案,再由一个来自独立模型族、没有工具执行权限的只读评审模型来评估,类似开发里常说的橡皮鸭评审,起草模型再据此做一次结构化修订。

决定走哪条路之前,系统会用针对复杂操作的能力信号来评估进来的提示,这些操作包括多步推理、自动代码生成、结构化调试和高级工具使用。也就是说,路由不是按模型大小硬编码,而是先判断任务实际需要什么能力,再决定是单跑、升级还是加一道独立评审。

为了让执行过程符合生产标准,这套架构还定了五条运行原则:完整的计账机制,追踪每个阶段(起草、评审、修订、升级、重试、回退)的token成本和使用情况;执行边界限制,强制超时与取消处理;评审步骤隔离,在没有工具的环境里执行,防止修改操作;故障安全的补丁应用例程,验证失败或执行被取消时拒绝打补丁;经过验证的路由机制,在运行时启动前预先检查模型可用性和绑定关系。

在三个智能体编码基准的受控离线评估中,这套选择性运行时工作流不仅达到甚至超过了基准的质量指标,同时大幅降低了预估成本。TerminalBench2.1上与Claude Opus5相比,完成验证任务的质量提升4.9个百分点,预估成本降低67%。内部多轮基准CheckpointBench基于可重放的真实Copilot编码会话构建,在这上面平均会话得分与Claude Opus5几乎持平,只差0.1个百分点,预估工作流成本降低65%。

启用方式是更新CLI环境、执行/experimental on,再在/model选择界面里选中HydraFusion,计费按执行过程中调用的底层模型的标准token费率走。对日常用Copilot写代码的人来说,值得留意的不是免费提速,而是同一件事的成本结构变了:同一份工作可能被拆给几个不同价位的模型,评估、修订和升级都会各自产生消耗。

相关文章

标签:

A5创业网 版权所有