行业新闻

Nvidia 研究:AI 智能体的关键在 harness,而非模型本身

Nvidia 证明 AI 智能体的能力上限更多由 harness 决定,而非底层模型,为智能体系统设计提供了新方向。

Nvidia 新研究显示,在长周期任务中,模型外的 harness(脚手架,即记忆、上下文、反馈等外围机制)比模型本身更重要。用定制 harness 配合“监督者”组件,Claude Opus 5 在 ARC-AGI-3 交互推理基准上拿到 100%,而裸模型仅 30%。OpenAI 的类似实验也验证了这一点。

正文摘录

Nvidia 刚刚证明,真正的主角是 harness,而不是 AI 模型 Nvidia [发布](https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/) 了一些有趣的新研究,上周五的结果表明,在让 AI 执行长周期任务时,harness 比底层模型本身重要得多。 简单说就是:仅仅通过使用一个为良好处理记忆而调优的定制 harness,并加入一个"监督者"组件,研究人员就让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上拿到了 100% 的分数。(这个基准特别让竞争对手前沿实验室 OpenAI 恼火。)没有 harness 时,Opus 5 得分只有 30%,这已经是所有测试模型中的最高分。 Nvidia 的研究再次表明,虽然模型选择确实重要——它相当于智能体的"大脑"——但它在整个智能体系统中所占的比重远低于许多 AI 用户的认识,尤其是在长周期任务中。真正让模型成为智能体的是 harness:它负责记忆、上下文和反馈。 "总的来说,业界几乎把智能体当作模型的 API 来理解,"Nvidia AI 部门产品副总裁 Adel El Hallack(上图)告诉 TechCrunch。但智能体实际上远不止如此。"它是模型,是模型周围的脚手架(scaffolding),我们称之为 harness,也就是它使用的那套工具。它是运行时,以及我们赋予它的相关技能和库。" 长周期任务是指需要把许多决策串联起来、有时要持续数天才能完成工作的任务。这与 AI 直接对提示词吐出一个回复形成鲜明对比。

阅读原文(techcrunch.com)→

行业新闻Julie Bort2026-08-21原文

相关内容