实时 AI 消息
openJiuwen 首发 X-Router 自演进模型路由:昇腾亲和,Agent 越跑越省,实测减少 50+% Token 消耗
openJiuwen 团队正式发布 X-Router 自演进模型路由技术,在 Agent 与模型之间加入一层按请求动态决策的路由引擎,让简单任务走轻量模型、复杂任务才升级到强模型。官方实测显示,在 PinchBench 与 Terminal-Bench 等基准上,开启自演进后模型调用成本最高降低约 51.4%,得分几乎与全云强模型基线持平。
10月2日,开源 AI Agent 平台 openJiuwen 团队发布自演进模型路由技术 X-Router,在 Agent 与候选模型池之间增加一层面向请求的智能决策能力。openJiuwen 由华为 2012 实验室、华为云、终端、计算、算力先遣队等团队联合高校与企业开发者共同构建,X-Router 是这套路由能力首次系统对外披露。
量子位的报道先给出了一个普遍困境:绝大多数 AI 应用仍是“一个模型包打天下”,一句“帮我翻译成英文”和需要写代码、反复调试三轮的难题,被送进同一个千亿参数模型。当 Agent 同时握着本地模型、云端模型和多家厂商的服务时,靠写死的规则维护的路由表,既跟不上模型迭代,也难以同时平衡成本与质量。
openJiuwen 把这套路由拆成三层能力。第一层做模型能力画像,基于历史数据离线刻画、在线动态刷新每个模型在不同任务类型与难度下的表现,以及时延、功耗和成本量级,模型版本或表现变化时画像更新时延优于 1 分钟;第二层负责决策,输入不只是当前请求的复杂度,还包括整条多轮轨迹与系统此刻的状态;第三层负责演进,让策略随真实反馈持续变准。
决策环节引入了不少系统层面的信号。团队会读取 KV 缓存亲和性,判断这次请求的上下文与哪个模型上已有的缓存更“熟”;会参考实时负载,避免把请求压到更繁忙的模型上;遇到刚超时或被限流的模型,则写入状态,成为下一轮的排除项。算法本身被设计成纯函数,给定同样的请求和同样的状态快照必须给出同样的决策,跨请求的经验则全部外置到独立状态层,因此状态丢失只会降级为“冷路由”,不会让请求失败。
在选模型之上,路由还能向上编排多模型协同。面对单模型不足以给出可信答案的难题,路由层可以决定这一轮是否发动多个模型、发动哪几个,再由 WorkSwarm 的 MoA 机制完成语义去重、质量筛选、冲突消解与压缩整理。团队表示,路由粒度正从“选模型”升级为“编排整个执行策略”,把模型、工具与子 Agent 放进同一个调度框架。
实测数据来自 WorkSwarm 接入 x-router 后在 PinchBench 全量 147 个任务上的评测,覆盖日志分析、数据分析、编码、研究等 11 个类别,复杂度分类器采用本地部署的 Qwen3-0.6B,直接跑在进程内。全部交给云端强模型 Kimi-K2-Thinking 的基线得分为 71.36%、成本 11.11 美元;x-router 静态路由得分 66.3%、成本 8.25 美元,成本降低 25.7%;开启 Bandit 自演进后成本进一步降到 6.16 美元,得分回升到 70.70%,整体成本较基线降低约 44.6%。
另一组在 Terminal-Bench/LLMRouterBench 上的测试使用 Opus4.8、Qwen3.5-122B 与 Qwen3.5-35B 三档模型池。cost focused 模式下成本降低 51.4%,成功率达到 Opus 的 95.2%;quality focused 模式下成本降低 15.7%,成功率达到 Opus 的 98.6%。两组基准指向同一个结论:接近顶配的质量,可以用大约一半的成本拿到,而省多少、让多少质量,由使用者自己配置。
对 Agent 而言,路由正在从锦上添花的优化变成规模化的前置条件。Agent 与聊天机器人最大的区别是长时间、多轮次、多工具地持续工作,Token 消耗会成倍放大;openJiuwen 表示这套内核追求通用而非单点最优,同一套框架可通过配置实例化端侧、云侧、企业私有化与端云混合四种部署形态,内核用 Rust 编写、Python 侧通过 PyO3 扩展接入,代码已在 gitcode 的 openJiuwen/model-router 仓库开源。
为什么重要
模型路由把成本与质量之间的权衡,变成了可配置、可演进、可观测的系统能力,直接决定 Agent 能否从演示走向大规模生产。随着模型生态继续分化,选择本身正在成为一项核心的基础设施能力。
附近消息
全部10/02 15:35
回归独立后,Manus 发布 Manus 2.0 与 Cue 智能体
据 digitimes 报道,Manus 在经历与 Meta 的关联之后重新获得独立,并同步发布了 Manus 2.0 以及名为 Cue 的 AI 智能体。这被视为该公司重新回到自主发展轨道、继续参与通用智能体竞争的信号。
10/02 15:01
Pi 编程智能体转向支持 MCP,同步发布 1.0 版本
Pi 编程智能体在本周四迎来 1.0 版本,并把曾一度被其作者斥为多余的 MCP(模型上下文协议)支持纳入核心功能,完成一次明显的态度转向。母公司 Earendil 解释称,MCP 本身已经改进,加上团队对 MCP 的改动让集成其他能力变得更简单,例如在 Pi 中使用 Jev 决策模型。
10/02 14:46
arXiv 施行最严投稿新规:每人每月最多 2 篇,被拒也占额度
从 2026 年 10 月 1 日起,arXiv 规定每位投稿人每个自然月最多提交 2 篇论文,且不分领域、被拒稿同样消耗当月额度。量子位援引官方说法指出,此举是为了应对 AI 时代投稿量激增与低质量论文涌入带来的审核压力。
10/02 14:43
横河电机加入新加坡 AI 数据中心测试床联盟
据 IT Brief Asia 报道,横河电机加入新加坡的 AI 数据中心测试床联盟。此举凸显 AI 算力建设与数据中心基础设施正加速结合,也反映新加坡在区域 AI 枢纽布局中的持续投入。