英伟达新研究:决定智能体表现的关键是"harness"而非模型本身
英伟达8月21日发布新研究称,在长时程智能体任务中,围绕模型搭建的harness(脚手架、工具与运行时)比底层模型更能决定成败。研究团队用为记忆优化的定制harness加"监督者"组件驱动Claude Opus 5,在交互式推理基准ARC-AGI-3上拿下100%满分,而同一模型裸跑只有30%,OpenAI模型在该基准上得分不足10%。英伟达AI部门产品副总裁Adel El Hallack对TechCrunch表示,业界通常把智能体理解为"模型的API",但智能体其实是模型加上其周围的脚手架。Databricks 7月的研究也显示同一模型搭配不同harness成本可能相差一倍,当"护栏工程"被证明能更大幅度拉升智能体表现,企业选型逻辑或从"追最强模型"转向"搭最优harness"。





