郭震 AI公众号:郭震AI

实时 AI 消息

openJiuwen 首发 X-Router 自演进模型路由:昇腾亲和,Agent 越跑越省,实测减少 50+% Token 消耗

openJiuwen 团队正式发布 X-Router 自演进模型路由技术,在 Agent 与模型之间加入一层按请求动态决策的路由引擎,让简单任务走轻量模型、复杂任务才升级到强模型。官方实测显示,在 PinchBench 与 Terminal-Bench 等基准上,开启自演进后模型调用成本最高降低约 51.4%,得分几乎与全云强模型基线持平。

发布时间

10月2日,开源 AI Agent 平台 openJiuwen 团队发布自演进模型路由技术 X-Router,在 Agent 与候选模型池之间增加一层面向请求的智能决策能力。openJiuwen 由华为 2012 实验室、华为云、终端、计算、算力先遣队等团队联合高校与企业开发者共同构建,X-Router 是这套路由能力首次系统对外披露。

量子位的报道先给出了一个普遍困境:绝大多数 AI 应用仍是“一个模型包打天下”,一句“帮我翻译成英文”和需要写代码、反复调试三轮的难题,被送进同一个千亿参数模型。当 Agent 同时握着本地模型、云端模型和多家厂商的服务时,靠写死的规则维护的路由表,既跟不上模型迭代,也难以同时平衡成本与质量。

openJiuwen 把这套路由拆成三层能力。第一层做模型能力画像,基于历史数据离线刻画、在线动态刷新每个模型在不同任务类型与难度下的表现,以及时延、功耗和成本量级,模型版本或表现变化时画像更新时延优于 1 分钟;第二层负责决策,输入不只是当前请求的复杂度,还包括整条多轮轨迹与系统此刻的状态;第三层负责演进,让策略随真实反馈持续变准。

决策环节引入了不少系统层面的信号。团队会读取 KV 缓存亲和性,判断这次请求的上下文与哪个模型上已有的缓存更“熟”;会参考实时负载,避免把请求压到更繁忙的模型上;遇到刚超时或被限流的模型,则写入状态,成为下一轮的排除项。算法本身被设计成纯函数,给定同样的请求和同样的状态快照必须给出同样的决策,跨请求的经验则全部外置到独立状态层,因此状态丢失只会降级为“冷路由”,不会让请求失败。

在选模型之上,路由还能向上编排多模型协同。面对单模型不足以给出可信答案的难题,路由层可以决定这一轮是否发动多个模型、发动哪几个,再由 WorkSwarm 的 MoA 机制完成语义去重、质量筛选、冲突消解与压缩整理。团队表示,路由粒度正从“选模型”升级为“编排整个执行策略”,把模型、工具与子 Agent 放进同一个调度框架。

实测数据来自 WorkSwarm 接入 x-router 后在 PinchBench 全量 147 个任务上的评测,覆盖日志分析、数据分析、编码、研究等 11 个类别,复杂度分类器采用本地部署的 Qwen3-0.6B,直接跑在进程内。全部交给云端强模型 Kimi-K2-Thinking 的基线得分为 71.36%、成本 11.11 美元;x-router 静态路由得分 66.3%、成本 8.25 美元,成本降低 25.7%;开启 Bandit 自演进后成本进一步降到 6.16 美元,得分回升到 70.70%,整体成本较基线降低约 44.6%。

另一组在 Terminal-Bench/LLMRouterBench 上的测试使用 Opus4.8、Qwen3.5-122B 与 Qwen3.5-35B 三档模型池。cost focused 模式下成本降低 51.4%,成功率达到 Opus 的 95.2%;quality focused 模式下成本降低 15.7%,成功率达到 Opus 的 98.6%。两组基准指向同一个结论:接近顶配的质量,可以用大约一半的成本拿到,而省多少、让多少质量,由使用者自己配置。

对 Agent 而言,路由正在从锦上添花的优化变成规模化的前置条件。Agent 与聊天机器人最大的区别是长时间、多轮次、多工具地持续工作,Token 消耗会成倍放大;openJiuwen 表示这套内核追求通用而非单点最优,同一套框架可通过配置实例化端侧、云侧、企业私有化与端云混合四种部署形态,内核用 Rust 编写、Python 侧通过 PyO3 扩展接入,代码已在 gitcode 的 openJiuwen/model-router 仓库开源。

为什么重要

模型路由把成本与质量之间的权衡,变成了可配置、可演进、可观测的系统能力,直接决定 Agent 能否从演示走向大规模生产。随着模型生态继续分化,选择本身正在成为一项核心的基础设施能力。

微博邮件

openJiuwenAgentModel RoutingAscend
返回实时消息

附近消息

全部