NVIDIA Vera Rubin 提升后训练工作负载的智能每美元,助力代理 AI
NVIDIA 推出 Vera Rubin 平台,聚焦后训练阶段的智能每美元指标,以解决代理 AI 模型持续学习和适应的成本问题。
代理 AI 模型需要持续适应变化的环境,后训练不再是一次性步骤,而是循环往复的强化学习过程。NVIDIA Vera Rubin 平台通过最大化每次前向和后向传播的产出,降低推理成本每 token,从而提升智能每美元,让后训练成为代理 AI 时代的核心工作负载。
正文摘录
NVIDIA Vera Rubin 通过后训练最大化智能每美元 —— 智能体 AI 的关键指标 想象一位职业运动员。区分顶尖运动员的是比赛间隙发生的事情:持续打磨、适应新对手、根据上场比赛暴露的问题精进技能。 智能体 AI 也是如此。模型不再被要求给出一个答案。它被赋予一个目标,必须随着环境变化、边界情况出现和工具变更而持续适应。与生成式模型对提示词做出响应不同,智能体模型必须规划、使用不同工具,并从运行中遇到问题后恢复。 这就是为什么后训练——在原始数据上完成初始训练后对模型进行优化的阶段——不再是一次性的收尾步骤。它是持续进行的,因为智能体模型运行的环境变化很快。智能体使用的工具可能每周都在变。生产环境中暴露的边界情况是任何测试集都未曾预料的。每次部署都带来自己的代码库、策略和环境。 当新问题从生产环境涌现时,后训练循环会回滚。计算规模增长不是因为单次运行更大,而是因为运行从未停止。智能体 AI 为后训练引入了一种新的计算模式,使其成为智能体时代的核心工作负载,也是智能每美元的主要驱动因素。 后训练的目标是通过在持续学习循环中最大化每一次前向和反向传播的收益,来最大化智能每美元。前向传播——推理——[以每token成本衡量](https://blogs.nvidia.com/blog/lowest-token-cost-ai-factories/)。这意味着每token成本的每一项改进都会直接转化为智能每美元的提升。 智能体后训练解析 后训练是构建智能的环节。在预训练中,模型学习预测下一个 token,这给了它流畅性,但没有智能。后训练中它学会写代码、规划多步骤任务、使用搜索工具以及在出错时恢复。推理则是之后的事情:模型在实际工作中运行,按每token成本计价。