郭震 AI公众号:郭震AI

实时 AI 消息

微软与 Hugging Face 发布 ThinkingBox:用数据库状态而非回答检验 AI 智能体

微软与 Hugging Face 联合发布 ThinkingBox 基准,不再只看智能体给出的话术或工具调用,而是检查它在数据库里真正留下的状态和副作用。该基准覆盖 507 条有状态业务流程、每条重复运行 20 次,发现许多智能体虽然流程正常结束,却写下了错误记录。

发布时间
微软与 Hugging Face 发布 ThinkingBox:用数据库状态而非回答检验 AI 智能体
图源: huggingface.co

微软与 Hugging Face 联合发布了 ThinkingBox 基准,用来评测 AI 智能体在数据库里留下的记录,而不是它生成的文字。该项目现已通过 Hugging Face 提供,发布方称其目的是检验智能体能否不是完成一次任务,而是连续二十次都完成。

ThinkingBox 会让智能体在相互隔离的 MCP 工具会话中运行,随后检查它在后端留下的最终状态和副作用。基准覆盖 507 条有状态的业务流程,每条都在一致的干净后端上独立运行 20 次,并对多种大语言模型进行测试,因此一次侥幸通过并不能代表可靠性。

发布方用一个客服案例来说明问题:在一项取自基准套件的任务里,处理延迟发货的智能体发出九次格式正确的工具调用,也正确读取了退款政策,最后却把工单标记为“已解决”。实际上承运商的异常仍未关闭,要求的最终状态应是“挂起”,而客户自始至终没有拿到真正的答复。

这一差距正是基准要衡量的对象。在一次覆盖 12 个大语言模型、共 121,680 次有效试验的对照实验中,有 79,853 次尝试未通过可执行检查。在这些失败中,67.24% 仍然正常结束、调用了会改变状态的工具,且没有报告任何最终工具错误;可执行检查则发现其中 77.61% 出现字段值错误,43.30% 产生非预期的额外副作用,25.36% 缺失了必需的副作用。

项目强调,工具调用并不等于结果。最终回答和格式正确的工具调用都只是代理信号。智能体可能听起来完全正确,却写错了字段值、改错了记录,或制造了多余的副作用。用团队的话说,“轨迹只是主张,数据库状态才是证据,重复运行才是可信度测试”。

为了区分“覆盖面”与“一致性”,ThinkingBox 报告三个数字:pass@1 表示模型通常表现如何,pass@20 表示任务在 20 次中是否至少成功过一次,而“observed 20/20”则表示 20 次记录全部通过的任务数量。发布方在文中把最后一项作为字面计数,不做估计或平滑处理,并认为对于会触碰真实记录的工作,这一列才是关键。

其意义在于:多数排行榜只公布单次得分,但这项基准显示,一次拿到高分并不意味着重复运行时仍能保持同样的行为。对于把智能体接入客服、退款、保险或银行等业务流程的团队来说,模型“能做”与“每次都做对”之间的差距,才是真正的运营风险。

ThinkingBox 可以通过 OpenEnv 运行,其完整方法也记录在随附的 ThinkingBox 论文中。该博客由微软与 Hugging Face 联合完成,并有多所大学的研究者参与撰写与评审。它留给团队的问题也很直接:当智能体被允许修改真实记录时,该如何把一致性,而非单次峰值准确率,纳入取舍标准。

为什么重要

这套基准把评测重点从话术和工具调用转向数据库最终状态,提醒企业在部署会修改真实记录的智能体时,应更看重可重复的一致性,而非单次高分。

微博邮件

MicrosoftHugging FaceAgentBenchmark
返回实时消息

附近消息

全部