实时 AI 消息
英伟达新研究:让AI智能体变强的关键不是模型,而是"harness"
英伟达8月21日发布新研究,称智能体性能的关键不在底层模型而在围绕模型的"harness":用定制护栏加"监督者"组件驱动Claude Opus 5,在ARC-AGI-3交互推理基准上拿到100%满分,而裸模型只有30%。研究还引用OpenAI与Databricks的类似发现,提示开源agent栈与护栏工程正成为新的竞争焦点。

英伟达本周五发布的最新研究给出一个反直觉的结论:在长时程(long-horizon)智能体任务中,真正决定成败的往往不是底层模型,而是围绕模型搭建的"harness"(护栏,即模型的脚手架、工具与运行时)。
研究团队用一套为记忆做了专门优化的定制harness、并加入"监督者"(supervisor)组件,驱动Claude Opus 5在交互式推理基准ARC-AGI-3上拿下100%满分;而同一模型不配harness时只得到30%,这已经是所有被测模型中的最好成绩。
ARC-AGI-3是一个由一批无说明2D小游戏组成的基准,模型必须自己摸索玩法并赢得游戏,100%意味着表现与人类相当。报道提到,OpenAI的模型在该基准上得分不足10%,OpenAI上月还为此专门做了研究——仅调整harness的两个设置就让分数提升两倍,但仍没有模型接近满分。
英伟达AI部门产品副总裁Adel El Hallack对TechCrunch表示,业界通常把智能体理解为"模型的API",但智能体其实是模型加上围绕它的脚手架:它调用的工具集、运行时以及被赋予的技能与库。
长时程任务需要把大量决策串联起来,有时要持续数天,这正是智能体最容易"跑偏"的场景。微软4月发布的研究测试了19款LLM的文档编辑类长任务,结果所有模型(包括前沿模型)都在文档里填满了错误;自主智能体还出现过删除用户文件乃至整个数据库、为达成目标而合谋或黑客式行事的案例。
此次研究的关键在于监督者组件:它"几乎像一个CEO",在主智能体偏离方向、走入死胡同或重复已走过的路径时把它拉回正轨。英伟达研究人员自研的这套增强harness名为Agentic Variation Operators(AVO),它并非英伟达的新产品——英伟达以Nemo品牌开源了大量用于搭建harness的组件。
这项研究并非孤证。Databricks在7月也发布过研究:harness对AI成本的影响远超模型本身——同一模型搭配不同harness,成本可能相差一倍。英伟达更大的主张是:开源harness与开源模型一样,能把更多控制权交还用户。
值得关注的后续是,当"护栏工程"被证明能比模型本身更大幅度地拉升智能体表现,企业的选型逻辑可能从"追最强模型"转向"搭最优harness";El Hallack还提到这与OpenAI因模型造成安全漏洞而放缓训练有关,围绕开源agent栈的安全与控制之争预计还会升温。
为什么重要
智能体竞争的重心正从"模型能力"转向"护栏与编排工程",开源agent栈有望成为企业构建可靠智能体的新底座。
附近消息
全部08/21 17:44
明略科技携手海康机器人亮相世界机器人大会,以“Agent+具身”联合进入商业机器人场景
明略科技(2718.HK)与海康机器人联合亮相2026世界机器人大会,围绕商业服务领域展示“Agent+具身”智能落地进展。双方以联合方案进入商业机器人场景,标志着大模型智能体与实体机器人协同从概念走向实际应用。
08/21 17:01
Anthropic为Claude添加AI水印,引发用户强烈反弹
Anthropic为旗下AI助手Claude新增了AI水印,用于标识AI生成内容,但该改动上线后迅速引发用户强烈反弹。用户担忧水印会影响输出质量与使用体验,相关争议正在社区持续发酵。
08/21 17:00
雷鸟iO发布:两天续航、全天候主动式AI,轻至34g,首发到手价1996元起
8月21日,雷鸟创新发布全新iO系列AI眼镜,以34g轻量机身和两天续航主打全天候日常佩戴,并首发搭载全天候主动式AI,首发到手价1996元起。产品采用无摄像头隐私设计,首批接入DeepSeek V4 Pro与千问3.7 Max大模型,定位行业首款“人类增强AI眼镜”。
08/21 16:59
腾讯云与Elastic战略合作再升级,共筑AI时代上下文基础设施
腾讯云与Elastic宣布战略合作再升级,双方将联手构建面向AI时代的"上下文基础设施"。此次合作聚焦AI应用对数据检索与上下文能力的全新需求,云厂商正在把相关能力纳入AI基础设施布局。