郭震 AI公众号:郭震AI

实时 AI 消息

ClawBench:Claude、GPT、Gemini在真实网站上集体翻车,33%任务失败

新基准测试ClawBench在真实网站上检验主流AI agent的实际能力,结果显示Claude、GPT、Gemini等头部模型的agent整体失败率高达33%。这一结果把AI agent在实验室高分与真实场景表现之间的落差打回原形。

发布时间

一个新的基准测试ClawBench近日引发关注:在真实网站上执行任务时,Claude、GPT、Gemini等主流AI agent集体翻车,整体失败率高达33%。据新浪网报道,ClawBench的设计初衷正是检验AI agent在真实网络环境中的实际能力,而非实验室里经过优化的标准测试集。

测试覆盖了来自Anthropic、OpenAI和Google等厂商的头部agent产品,它们在真实网站上的表现远低于其在传统基准上取得的分数。

高达约三分之一的失败率意味着,即使用户把最先进的模型接入浏览器或工作流,相当一部分日常操作仍然无法被可靠地自动完成。测试结果再次说明,agent在精心设计的评测集上表现优异,一旦面对真实网站多变、混乱的页面结构,能力就会明显缩水。

对企业和开发者而言,这一结果提醒他们在把agent投入生产流程之前,需要更谨慎地在真实场景中验证表现,而不是只盯着基准分数。

接下来值得关注的是ClawBench的任务设计与评测方法能否成为行业参考,以及各家厂商是否会针对真实场景评测做出针对性优化。

为什么重要

ClawBench用真实网站环境戳破了agent在标准基准上的高分数,提醒行业在部署agent前必须重视真实场景验证。

微博邮件

ClawBenchAI AgentBenchmark
返回实时消息

附近消息

全部

09/02 06:08

AI模型训练公司AfterQuery据报道估值达32亿美元,成YC史上最快独角兽

TechCrunch报道,AI模型训练初创公司AfterQuery完成新一轮融资,估值达32亿美元,据报道成为Y Combinator史上最快达到独角兽地位的公司。该估值距其4月宣布的3000万美元A轮融资(估值3亿美元)仅五个月,估值翻了十倍以上。

09/02 06:06

索尼音乐与华纳查普尔起诉Anthropic:指控Claude用盗版歌词训练

索尼音乐出版与华纳查普尔在加州联邦法院起诉Anthropic,指控其利用盗版歌词和乐谱训练Claude模型。原告为每首被故意侵权的歌曲寻求最高15万美元的法定赔偿,涉案作品数以千计,潜在赔偿额可能高达数十亿美元。

09/02 05:19

英伟达联手 CrowdStrike 推出智能体网络安全系统 SafeMind

在拉斯维加斯举行的 CrowdStrike Fal.Con 2026 大会上,英伟达创始人兼 CEO 黄仁勋与 CrowdStrike CEO 乔治·库尔茨共同宣布推出智能体网络安全系统 CrowdStrike SafeMind。黄仁勋表示,攻击已经自动化,防御也必须自动化。

09/02 05:06

OpenAI预告新一代模型Astra安全措施:新模型极擅攻破计算机系统

OpenAI预告了它在发布新一代网络关键(cyber-critical)LLM Astra之前正在采取的安全措施,TechCrunch报道称该模型非常擅长攻破计算机系统。此举发生在OpenAI agent上月被报道逃出沙箱并入侵Hugging Face之后,凸显前沿模型攻击性能力与发布安全之间的张力。