郭震 AI公众号:郭震AI

实时 AI 消息

IBM Research 开源智能体一致性工具,把 Pass^k 差距砍掉一半

IBM Research 指出平均成功率掩盖了智能体重复执行同一任务时的不稳定性:GPT-4.1 的 ReAct 智能体在 AppWorld 上 Mean@5 为 77.4%,五次全对的 Pass^5 只有 53.0%,团队因此在开源工具 ALTK-Evolve 中新增 Consistency Analyzer 与一致性指南,把差距从 24.4 个百分点压缩到 12.0 个百分点。

发布时间
IBM Research 开源智能体一致性工具,把 Pass^k 差距砍掉一半
图源: huggingface.co

一个智能体在排练时表现得很好,到了现场演示却换了一条路径,最后在同一个任务上失败。IBM Research 在 Hugging Face 博客中指出,这在舞台上只是尴尬,在生产环境里则是可靠性问题:同一位用户发出同样的请求,这次成功的工作流下次可能就失败了。

团队用 AppWorld 上的实测数据把问题量化出来。一个由 GPT-4.1 驱动的 ReAct 智能体,五次运行的平均成功率 Mean@5 为 77.4%,但只有 53.0% 的任务做到了五次全部成功,两者之间存在 24.4 个百分点的一致性缺口。换句话说,将近四分之一的基准任务既可能成功也可能失败,而任务本身没有任何变化。对金融对账、合同义务核查这类关键任务来说,这种不稳定性是硬门槛,而不是体验问题。

问题的根源在于评测口径。常见的 Mean@k 只回答平均表现如何,不回答同一个问题再问一次是否还能做好,那需要看 Pass^k,也就是 k 次运行全部成功的任务比例。博客特别提醒,Pass^k 与人们熟悉的 Pass@k 并不是一回事:Pass@k 只要 k 次中有一次成功就算通过,适合可以验证并重试的场景;Pass^k 要求每一次都成功,始终满足 Pass^k ≤ Mean@k ≤ Pass@k。

为什么温度设为 0.0 也解决不了?团队的解释是,智能体每一步决策都来自一个概率分布,分布的形状决定结果。分布陡峭时,陪跑选项远远落后,同样的选择会一次次出现;分布平坦时,几个几乎并列的候选token接近抛硬币。轨迹由几十个决策串联而成,单步很小的翻转概率会累积成整轮运行走偏的较大概率,而 GPU 浮点运算的非结合性、请求批处理等平台因素足以扰动这些几乎并列的选择。

为此,团队构建了两阶段流程。第一阶段是 Consistency Analyzer:给定一条已记录的轨迹,它对每个决策步骤做受控重采样,测量模型在该点的输出到底有多不稳定。具体做法是每个决策步骤额外发起一次模型调用、每次取 5 个补全,在已经记录的上下文上离线回放,不需要新的工具调用或环境交互,也不需要重跑整条任务。检测结果是一份逐步打分的一致性记分卡,用于定位下一次运行中最可能翻转的决策点。

第二阶段是把这些信号写成一致性指南,作为 ALTK-Evolve 中新增的指南类型,在推理时注入上下文。它的目标是针对不确定性本身,而不是针对失败,因此也能抓住那些这次侥幸做对、下次很容易做错的步骤。

效果在 AppWorld 的 test_normal 上得到验证:168 个任务、GPT-4.1 的 ReAct 智能体,每个任务用一条基线轨迹生成一致性指南,再测 5 次全新运行。聚合结果中 Pass^5 从 53.0% 升到 69.0%,Mean@5 从 77.4% 升到 81.0%,一致性缺口从 24.4 个百分点收窄到 12.0 个百分点,接近三分之一原本不稳定的任务变成每次都通过。中等难度提升 22.9 个百分点,困难难度提升 14.3 个百分点,简单难度提升 12.2 个百分点,且 Mean@5 在各难度档上都没有下降。

迁移性也被测试过。把指南用到同一 AppWorld 场景下的另一个相近任务上,Pass^5 仍然提升 13.0 个百分点,只比同任务结果低 3 个百分点;在更弱的 gpt-oss-120b 上,同任务 Pass^5 从 10.1% 升到 16.1%,而相近任务的提升幅度 8.7 个百分点反而更大,说明指南捕捉的是可复用的失败模式,而不是记下了某条轨迹的具体细节。

这套工具已经开源。团队表示 ALTK-Evolve 仓库现在包含 Consistency Analyzer 与一致性指南生成,完整方法论见 arXiv 技术报告,同时希望用户提交自己智能体中出现翻转行为的案例。对正在把智能体推向生产的企业来说,一致性正在成为和准确率同等重要的采购标准。

为什么重要

这项工作把智能体评测的焦点从平均成功率转向可重复性,并给出了可直接使用的开源工具与量化指标。如果 Pass^k 成为行业通用口径,只报告平均准确率的厂商将被迫重新证明自己的可靠性。

微博邮件

IBMAgent开源
返回实时消息

附近消息

全部

09/16 00:00

谷歌:让 AI 理解真实使用的语言,而不只是翻译文本

谷歌称其技术和产品目前已支持 300 多种语言的日常交互,覆盖 70 多亿人,并表示其语言研究已从文本翻译转向直接处理音频与语境的原生音频模型。文章介绍了 Gemini 3.5 Live Translate 与 Transcribe、可在设备端运行的 TranslateGemma 翻译模型,以及多项开放语言数据集。

09/16 00:02

AI 智能体开始用“超现实”方言交流,专家担忧监控与监管难度上升

《卫报》报道,纽约前沿 AI 实验室 Emergence 的研究发现,多家头部公司的自主智能体在被要求于实验性“社会”中协作后,几天内就自行创造出新词汇和共同含义。研究者指出,智能体交流越多,彼此的语言就越晦涩,这让人更难判断它们究竟做了什么,为监控与监管带来新难题。

09/16 00:40

AI Agent招聘平台Jack & Jill完成4000万美元A轮融资

AI Agent招聘平台Jack & Jill完成4000万美元A轮融资。该平台的核心机制是让AI Agent直接把候选人与雇主匹配,跳开传统的中介式投递流程。

09/16 00:55

英伟达公布 AI 工厂效率新结果:同一电力预算多出 24% token

在圣克拉拉的 AI Infra Summit 上,英伟达把 AI 工厂效率作为主题演讲核心,公布 Vera Rubin、DSX 平台与 Emerald AI 的一系列进展。合作方 Lambda 首次在部署环境验证 DSX MaxLPS:相同电力预算下集群 token 吞吐提升 24%、每瓦性能提升 23%。