实时 AI 消息
不改模型也能提效:Salesforce 智能体浏览器任务完成率从 43.5% 升到 93%
Salesforce 研究人员在不改动底层模型的情况下,把一款 AI 智能体的浏览器任务完成率从 43.5% 提升到 93%。这一结果表明,智能体的可靠性瓶颈很大一部分来自模型之外的工程环节,而不是模型本身的能力上限。

据 VentureBeat 报道,Salesforce 的研究人员在不改动底层模型的前提下,把一款 AI 智能体的浏览器任务完成率从 43.5% 提升到了 93%。这项结果指向一个越来越被行业认同的判断:智能体在真实环境里的实际表现,并不只由模型能力决定。
报道特别强调,这一提升是“不碰模型”完成的,也就是说,研究人员没有重新训练或微调模型,而是在模型之外的工程环节里寻找空间。对做智能体产品的团队而言,这等于把优化重心从“换一个更强的模型”转向“把整条流程搭得更稳”。
浏览器任务之所以常被用来检验智能体,是因为它天然是多步骤、长链条的:打开页面、判断状态、执行操作、确认结果,任何一步出错都可能让整条任务失败。43.5% 的完成率意味着,在真实网页环境里,超过一半的尝试没有走完全程。
把完成率推到 93% 的这段差距,通常来自对失败环节的重新设计——更清晰的任务分解、更可靠的页面状态判断、出错后的重试与恢复,以及对中间步骤的校验。报道把改进归功于模型之外的这套机制,而不是模型自身能力的提升。
更值得注意的信号是,随着基础模型能力逐渐趋同,智能体产品的竞争重心会更多落在工程细节上。谁能把任务拆得更准、把失败恢复做得更稳,谁就更容易在真实业务中拿到可用的成功率。
对企业客户来说,这种“不换模型也能大幅提效”的结论意味着更低的改造门槛:不必等待下一代模型上线,先在现有模型之上把智能体架构打磨好,就可能获得明显收益。
接下来值得观察的是,这套方法在 Salesforce 自家产品线上会怎样落地,以及浏览器之外的场景,例如桌面应用、企业内部系统和多系统联动,能否复制同样的提升幅度。报道提供的是研究结果,能否在客户真实环境中稳定复现,还需要更多公开数据来验证。
为什么重要
这项结果为智能体落地提供了一条成本更低的路径:不必更换或重训模型,先把外围工程做扎实,就能显著提高真实任务的成功率。它也可能改变企业评估智能体供应商时的问题——从“你用什么模型”转向“你的任务流程怎么设计”。
附近消息
全部09/16 23:00
NVIDIA Vera Rubin NVL72 首登 MLPerf Inference v6.1 即取得领先性能
NVIDIA 在官方博客中公布,Vera Rubin NVL72 机架级系统首次参加 MLPerf Inference v6.1 基准测试即取得领先性能。博文把 AI 推理的经济性归纳为三个杠杆:系统性能、基础设施的线性扩展能力,以及持续不断的软件优化。
09/16 22:02
微软称竞争对手Anthropic的AI可能对人类造成“灾难性影响”
据BBC报道,微软公开表示,其人工智能竞争对手Anthropic的技术可能对人类造成“灾难性影响”。这把前沿AI的极端风险表述直接放进了竞争语境,也让“谁来定义哪类模型危险”成为争论焦点。
09/16 21:55
实测努比亚“豆包手机二代”:微信、小红书、美团外卖、淘宝暂不支持应用内自动化操作
有媒体对努比亚“豆包手机二代”进行了实测,结果显示这款主打AI自动化的手机目前还无法在微信、小红书、美团外卖、淘宝等应用中完成应用内自动化操作。也就是说,跨应用的自动执行链路在主流国民级App上尚未打通。
09/16 23:56
诺和诺德联手 Anthropic:用 Claude 前沿模型与科学工作台加速药物发现
诺和诺德与 Anthropic 于 9 月 16 日宣布合作,这家丹麦制药巨头将在部分研发工作流中使用 Anthropic 的前沿模型,并测试 Claude Science 科学工作台,目标是加快新药发现与开发。诺和诺德此前已用 Claude Code 打造监管文档平台 NovoScribe,把临床研究文档产出时间从十周以上压缩到十分钟。