实时 AI 消息
不改模型也能提效:Salesforce 智能体浏览器任务完成率从 43.5% 升到 93%
Salesforce 研究人员在不改动底层模型的情况下,把一款 AI 智能体的浏览器任务完成率从 43.5% 提升到 93%。这一结果表明,智能体的可靠性瓶颈很大一部分来自模型之外的工程环节,而不是模型本身的能力上限。

据 VentureBeat 报道,Salesforce 的研究人员在不改动底层模型的前提下,把一款 AI 智能体的浏览器任务完成率从 43.5% 提升到了 93%。这项结果指向一个越来越被行业认同的判断:智能体在真实环境里的实际表现,并不只由模型能力决定。
报道特别强调,这一提升是“不碰模型”完成的,也就是说,研究人员没有重新训练或微调模型,而是在模型之外的工程环节里寻找空间。对做智能体产品的团队而言,这等于把优化重心从“换一个更强的模型”转向“把整条流程搭得更稳”。
浏览器任务之所以常被用来检验智能体,是因为它天然是多步骤、长链条的:打开页面、判断状态、执行操作、确认结果,任何一步出错都可能让整条任务失败。43.5% 的完成率意味着,在真实网页环境里,超过一半的尝试没有走完全程。
把完成率推到 93% 的这段差距,通常来自对失败环节的重新设计——更清晰的任务分解、更可靠的页面状态判断、出错后的重试与恢复,以及对中间步骤的校验。报道把改进归功于模型之外的这套机制,而不是模型自身能力的提升。
更值得注意的信号是,随着基础模型能力逐渐趋同,智能体产品的竞争重心会更多落在工程细节上。谁能把任务拆得更准、把失败恢复做得更稳,谁就更容易在真实业务中拿到可用的成功率。
对企业客户来说,这种“不换模型也能大幅提效”的结论意味着更低的改造门槛:不必等待下一代模型上线,先在现有模型之上把智能体架构打磨好,就可能获得明显收益。
接下来值得观察的是,这套方法在 Salesforce 自家产品线上会怎样落地,以及浏览器之外的场景,例如桌面应用、企业内部系统和多系统联动,能否复制同样的提升幅度。报道提供的是研究结果,能否在客户真实环境中稳定复现,还需要更多公开数据来验证。
为什么重要
这项结果为智能体落地提供了一条成本更低的路径:不必更换或重训模型,先把外围工程做扎实,就能显著提高真实任务的成功率。它也可能改变企业评估智能体供应商时的问题——从“你用什么模型”转向“你的任务流程怎么设计”。
附近消息
全部09/16 23:00
AI动态:Robots are waiting for a ChatGPT moment: Nvidia’s Les Karpas explains why at TechCrunch Disrupt 2026
据 techcrunch.com 消息,Robots are waiting for a ChatGPT moment: Nvidia’s Les Karpas explains why at TechCrunch Disrupt 2026。The robotics industry is still waiting for their breakthrough into day to day life. Nvidia's Les Karpas has an answer as to why at TechCrunch Disrupt 2026. Register before September 25 to save up to $200 on your pass.
09/16 23:00
NVIDIA Vera Rubin NVL72 首登 MLPerf Inference v6.1 即取得领先性能
NVIDIA 在官方博客中公布,Vera Rubin NVL72 机架级系统首次参加 MLPerf Inference v6.1 基准测试即取得领先性能。博文把 AI 推理的经济性归纳为三个杠杆:系统性能、基础设施的线性扩展能力,以及持续不断的软件优化。
09/16 22:02
微软称竞争对手Anthropic的AI可能对人类造成“灾难性影响”
据BBC报道,微软公开表示,其人工智能竞争对手Anthropic的技术可能对人类造成“灾难性影响”。这把前沿AI的极端风险表述直接放进了竞争语境,也让“谁来定义哪类模型危险”成为争论焦点。
09/16 21:55
实测努比亚“豆包手机二代”:微信、小红书、美团外卖、淘宝暂不支持应用内自动化操作
有媒体对努比亚“豆包手机二代”进行了实测,结果显示这款主打AI自动化的手机目前还无法在微信、小红书、美团外卖、淘宝等应用中完成应用内自动化操作。也就是说,跨应用的自动执行链路在主流国民级App上尚未打通。