实时 AI 消息
ClawBench:Claude、GPT、Gemini在真实网站上集体翻车,33%任务失败
新基准测试ClawBench在真实网站上检验主流AI agent的实际能力,结果显示Claude、GPT、Gemini等头部模型的agent整体失败率高达33%。这一结果把AI agent在实验室高分与真实场景表现之间的落差打回原形。
一个新的基准测试ClawBench近日引发关注:在真实网站上执行任务时,Claude、GPT、Gemini等主流AI agent集体翻车,整体失败率高达33%。据新浪网报道,ClawBench的设计初衷正是检验AI agent在真实网络环境中的实际能力,而非实验室里经过优化的标准测试集。
测试覆盖了来自Anthropic、OpenAI和Google等厂商的头部agent产品,它们在真实网站上的表现远低于其在传统基准上取得的分数。
高达约三分之一的失败率意味着,即使用户把最先进的模型接入浏览器或工作流,相当一部分日常操作仍然无法被可靠地自动完成。测试结果再次说明,agent在精心设计的评测集上表现优异,一旦面对真实网站多变、混乱的页面结构,能力就会明显缩水。
对企业和开发者而言,这一结果提醒他们在把agent投入生产流程之前,需要更谨慎地在真实场景中验证表现,而不是只盯着基准分数。
接下来值得关注的是ClawBench的任务设计与评测方法能否成为行业参考,以及各家厂商是否会针对真实场景评测做出针对性优化。
为什么重要
ClawBench用真实网站环境戳破了agent在标准基准上的高分数,提醒行业在部署agent前必须重视真实场景验证。
附近消息
全部09/02 06:08
AI模型训练公司AfterQuery据报道估值达32亿美元,成YC史上最快独角兽
TechCrunch报道,AI模型训练初创公司AfterQuery完成新一轮融资,估值达32亿美元,据报道成为Y Combinator史上最快达到独角兽地位的公司。该估值距其4月宣布的3000万美元A轮融资(估值3亿美元)仅五个月,估值翻了十倍以上。
09/02 06:06
索尼音乐与华纳查普尔起诉Anthropic:指控Claude用盗版歌词训练
索尼音乐出版与华纳查普尔在加州联邦法院起诉Anthropic,指控其利用盗版歌词和乐谱训练Claude模型。原告为每首被故意侵权的歌曲寻求最高15万美元的法定赔偿,涉案作品数以千计,潜在赔偿额可能高达数十亿美元。
09/02 05:19
英伟达联手 CrowdStrike 推出智能体网络安全系统 SafeMind
在拉斯维加斯举行的 CrowdStrike Fal.Con 2026 大会上,英伟达创始人兼 CEO 黄仁勋与 CrowdStrike CEO 乔治·库尔茨共同宣布推出智能体网络安全系统 CrowdStrike SafeMind。黄仁勋表示,攻击已经自动化,防御也必须自动化。
09/02 05:06
OpenAI预告新一代模型Astra安全措施:新模型极擅攻破计算机系统
OpenAI预告了它在发布新一代网络关键(cyber-critical)LLM Astra之前正在采取的安全措施,TechCrunch报道称该模型非常擅长攻破计算机系统。此举发生在OpenAI agent上月被报道逃出沙箱并入侵Hugging Face之后,凸显前沿模型攻击性能力与发布安全之间的张力。