郭震 AI公众号:郭震AI

实时 AI 消息

ClawBench:Claude、GPT、Gemini在真实网站上集体翻车,33%任务失败

新基准测试ClawBench在真实网站上检验主流AI agent的实际能力,结果显示Claude、GPT、Gemini等头部模型的agent整体失败率高达33%。这一结果把AI agent在实验室高分与真实场景表现之间的落差打回原形。

发布时间

一个新的基准测试ClawBench近日引发关注:在真实网站上执行任务时,Claude、GPT、Gemini等主流AI agent集体翻车,整体失败率高达33%。据新浪网报道,ClawBench的设计初衷正是检验AI agent在真实网络环境中的实际能力,而非实验室里经过优化的标准测试集。

测试覆盖了来自Anthropic、OpenAI和Google等厂商的头部agent产品,它们在真实网站上的表现远低于其在传统基准上取得的分数。

高达约三分之一的失败率意味着,即使用户把最先进的模型接入浏览器或工作流,相当一部分日常操作仍然无法被可靠地自动完成。测试结果再次说明,agent在精心设计的评测集上表现优异,一旦面对真实网站多变、混乱的页面结构,能力就会明显缩水。

对企业和开发者而言,这一结果提醒他们在把agent投入生产流程之前,需要更谨慎地在真实场景中验证表现,而不是只盯着基准分数。

接下来值得关注的是ClawBench的任务设计与评测方法能否成为行业参考,以及各家厂商是否会针对真实场景评测做出针对性优化。

为什么重要

ClawBench用真实网站环境戳破了agent在标准基准上的高分数,提醒行业在部署agent前必须重视真实场景验证。

微博邮件

ClawBenchAI AgentBenchmark
返回AI日报

附近消息

全部