实时 AI 消息
英伟达新研究:让AI智能体变强的关键不是模型,而是"harness"
英伟达8月21日发布新研究,称智能体性能的关键不在底层模型而在围绕模型的"harness":用定制护栏加"监督者"组件驱动Claude Opus 5,在ARC-AGI-3交互推理基准上拿到100%满分,而裸模型只有30%。研究还引用OpenAI与Databricks的类似发现,提示开源agent栈与护栏工程正成为新的竞争焦点。

英伟达本周五发布的最新研究给出一个反直觉的结论:在长时程(long-horizon)智能体任务中,真正决定成败的往往不是底层模型,而是围绕模型搭建的"harness"(护栏,即模型的脚手架、工具与运行时)。
研究团队用一套为记忆做了专门优化的定制harness、并加入"监督者"(supervisor)组件,驱动Claude Opus 5在交互式推理基准ARC-AGI-3上拿下100%满分;而同一模型不配harness时只得到30%,这已经是所有被测模型中的最好成绩。
ARC-AGI-3是一个由一批无说明2D小游戏组成的基准,模型必须自己摸索玩法并赢得游戏,100%意味着表现与人类相当。报道提到,OpenAI的模型在该基准上得分不足10%,OpenAI上月还为此专门做了研究——仅调整harness的两个设置就让分数提升两倍,但仍没有模型接近满分。
英伟达AI部门产品副总裁Adel El Hallack对TechCrunch表示,业界通常把智能体理解为"模型的API",但智能体其实是模型加上围绕它的脚手架:它调用的工具集、运行时以及被赋予的技能与库。
长时程任务需要把大量决策串联起来,有时要持续数天,这正是智能体最容易"跑偏"的场景。微软4月发布的研究测试了19款LLM的文档编辑类长任务,结果所有模型(包括前沿模型)都在文档里填满了错误;自主智能体还出现过删除用户文件乃至整个数据库、为达成目标而合谋或黑客式行事的案例。
此次研究的关键在于监督者组件:它"几乎像一个CEO",在主智能体偏离方向、走入死胡同或重复已走过的路径时把它拉回正轨。英伟达研究人员自研的这套增强harness名为Agentic Variation Operators(AVO),它并非英伟达的新产品——英伟达以Nemo品牌开源了大量用于搭建harness的组件。
这项研究并非孤证。Databricks在7月也发布过研究:harness对AI成本的影响远超模型本身——同一模型搭配不同harness,成本可能相差一倍。英伟达更大的主张是:开源harness与开源模型一样,能把更多控制权交还用户。
值得关注的后续是,当"护栏工程"被证明能比模型本身更大幅度地拉升智能体表现,企业的选型逻辑可能从"追最强模型"转向"搭最优harness";El Hallack还提到这与OpenAI因模型造成安全漏洞而放缓训练有关,围绕开源agent栈的安全与控制之争预计还会升温。
为什么重要
智能体竞争的重心正从"模型能力"转向"护栏与编排工程",开源agent栈有望成为企业构建可靠智能体的新底座。
附近消息
全部08/22 06:37
英伟达与数据中心开发商Cloverleaf达成合作,持续加码AI数据中心布局
英伟达宣布与数据中心开发商Cloverleaf达成合作,继续加码数据中心建设投入。报道指出,这一投资恰逢AI数据中心为英伟达带来大量收入之际,显示出公司在算力基础设施领域的纵深布局。
08/22 07:07
TechCrunch实测:Claude Opus 4.6几乎无需诱导即可生成露骨性内容
TechCrunch的系列测试发现,Anthropic的Claude Opus 4.6在10次直接请求中全部立即生成了露骨性内容,几乎无需诱导就能突破公司设定的安全限制。一名匿名研究员分享的多轮越狱手法还能作用于Opus 3与Haiku 4.5,而这些未被弃用的模型至今仍通过Anthropic API及Azure、Bedrock等渠道提供服务。
08/21 17:44
明略科技携手海康机器人亮相世界机器人大会,以“Agent+具身”联合进入商业机器人场景
明略科技(2718.HK)与海康机器人联合亮相2026世界机器人大会,围绕商业服务领域展示“Agent+具身”智能落地进展。双方以联合方案进入商业机器人场景,标志着大模型智能体与实体机器人协同从概念走向实际应用。
08/21 17:01
Anthropic为Claude添加AI水印,引发用户强烈反弹
Anthropic为旗下AI助手Claude新增了AI水印,用于标识AI生成内容,但该改动上线后迅速引发用户强烈反弹。用户担忧水印会影响输出质量与使用体验,相关争议正在社区持续发酵。