权重还是技能?机器人学习技术综述:从预测动作的权重到会编写自身技能的机器人
机器人学习正在分化成两条路径:VLA 模型 将能力固化进冻结权重,另一种智能体则通过编写代码生成与改进自身技能。本综述沿 权重 vs. 技能 这一主轴组织领域。 其核心贡献是对 代码即策略 方法进行深入梳理,按自我改进程度排序:从 零样本程序合成、闭环自我修复、持久技能记忆,到将执行反馈、技能记忆与进化搜索融为一体的开放循环单元。目前仅 ASPIRE、ENPIRE、RoboClaw 等极少数系统占据该单元。综述还绘制了互补的“技能”一极,从无监督强化学习技能发现到 LLM 技能库,指出“技能”一词至少有五种含义,其中只有代码形式能无需梯度更新而自我改进。 综述进一步将分类法关联到新兴技能经济:商业机器人技能市场可跨机器人分发一键技能,但仅提供静态回放,暴露出 适应、跨具身可移植性、来源、安全验证、组合 与 标准化 等开放问题。作为一次刻意聚焦的综述,它通过统一分类法与对比表,审视了 6 个技术家族 的 77 个代表系统,并为自我改进机制给出了操作性定义,同时说明每个家族无法做到的事项。
论文精读
TL;DR 以“权重 vs. 技能”为轴,系统梳理机器人学习技术,并深入剖析代码即策略方法的自我改进光谱:从零样本合成到执行反馈、技能记忆与进化搜索结合的开放式循环,同时澄清“技能”的五种含义及其技能经济挑战。
问题
问题背景
机器人学习正逐步分化为两条路线:一是权重驱动 (weights),将能力固化在模型参数中,如视觉-语言-动作 (VLA) 模型;二是技能驱动 (skills),让机器人自主编写、精炼可执行代码作为技能。这一分歧引发了对学习方法可扩展性、适应性与自我改进能力的重新审视。
现有方法局限
- VLA 等权重模型:训练完成后,新能力的注入需要重新训练或微调,难以在部署后持续适应新任务。其决策过程缺乏显式技能表征,不易于审计、组合或迁移。
- 传统技能学习方法:“技能”一词至少存在五种不同含义,多数非代码形式的技能(如无监督强化学习发现的 latent skill)在部署后无法不依赖梯度更新实现自我改进。
- 代码即策略 (code-as-policy) 早期工作:多数方法仅停留在零样本程序合成或带简单自我修复的闭环,极少将执行反馈、持续性技能记忆、进化搜索融合为一个开放式自我进化环路。仅有 ASPIRE、ENPIRE、RoboClaw 等极近期的系统开始触及这一空间。
为什么这个问题难且重要
真实世界任务多变、长尾,要求机器人具备在线适应和累积改进的能力。难度在于:
- 自我改进闭环需要安全地集成环境反馈、记忆与搜索,同时避免灾难性遗忘;
- 技能表征必须兼顾可解释性、跨机器人可移植性和组合性,以支撑复杂行为构建;
- 工程落地面临性能、实时性与验证的严格约束。
业界对通用机器人的投入持续加码,但现有技能商业平台仅提供静态回放,暴露出适应性、出处、安全性、跨具身可移植性等开放问题。厘清权重与技能的效能边界,并对自我改进机制做统一分类,已成为推动下一阶段机器人自主性发展的关键。
行业类比
类似对话式 AI 从依赖固定 prompt 到构建可自我反思、使用工具的 LLM agent,机器人学习也正从“静态权重执行”走向“动态技能编写与自我进化”,需要一套兼顾安全与灵活性的系统架构。
核心洞察
- **代码技能是唯一不依赖梯度更新的自我改进媒介**:论文指出“skill”一词在文献中有至少五种不同含义(如无监督发现的技能基元、LLM 知识库中的技能描述等),但只有以可执行代码形式存在的技能,能够在没有模型权重更新(即不进行梯度优化)的情况下,通过执行反馈、自我修复和演化搜索持续提升。这与传统的 VLA 权重模型或基于梯度的 RL 技能发现形成根本差异,为构建能自主进化的机器人智能体提供了新的技术路径。
- **开放式自我改进循环的稀疏性揭示当前系统的关键缺失**:通过将代码即策略方法按自我改进程度排列,从零样本生成到闭环反馈再到持久记忆,最后将技能记忆、执行反馈与演化搜索融合的开放式循环,仅有 ASPIRE、ENPIRE 和 RoboClaw 等极少数系统占据最成熟的阶段。这种分类不仅呈现了从静态策略到动态进化的阶梯,也清晰地暴露了大多数系统无法实现持续自主改进的瓶颈——缺乏技能记忆与跨任务结构化的反馈利用。
- **静态技能市场暴露了从权重固化到技能自主的工程鸿沟**:当前商业机器人技能市场虽然实现了跨机器人一键式部署,但交付的是静态回放技能,缺乏对环境和任务变化的适应性。这呼应了综述中“weights vs skills”的轴线:VLA 模型将能力冻结在权重中,技能市场则将技能冻结在演示轨迹中,都在本质上回避了动态环境中的自我调整和组合。要实现真正自主的技能经济,必须解决可移植性、出处验证、安全组合和标准化等工程问题,即让技能变得像代码一样可动态组合与自动修复。
实验
实验设计
本综述未开展独立实验,而是通过结构化分类框架分析 77 个代表性系统。核心分析轴为 Weights vs. Skills,将方法分为六个技术家族,并重点刻画 Code-as-Policy 方法的自我改进程度谱系:从零样本程序合成,经闭环自修复、持久技能记忆,到执行反馈、记忆与进化搜索结合的开放式循环。
关键发现
- 技能定义的多样性:文献中“技能”至少存在五种不同含义,仅代码形式的技能可在无梯度更新的条件下实现自我改进。
- 自我改进的稀疏前沿:只有极少数近期系统(如 ASPIRE、ENPIRE、RoboClaw)占据了执行反馈、技能记忆与进化搜索三位一体的开放式改进单元格。
- 技能经济的缺口:商业机器人技能市场目前仅提供静态回放技能,暴露出自适应、跨具身可移植性、来源验证、安全、组合及标准化等开放问题。
与基线的深度对比
综述通过对比表明确体现了各家族的能力边界:VLA 模型 依赖冻结权重,难以在线适应新任务;Code-as-Policy 方法虽能通过代码进行自我修正,但需应对符号推理与物理世界之间的语义鸿沟;纯强化学习的技能发现(如 DIAYN)则缺乏跨任务组合能力。这些对比为工程选型提供了清晰指引:需快速泛化时,VLA 是稳妥选择;需长期自主进化时,构建具备反馈闭环与持久记忆的代码技能系统潜力更大。
行业影响
落地场景
机器人学习正从 固定权重策略 向 可编程技能 转向,催生多种产品化路径。物流仓储 中的自主移动机器人 (AMR) 可利用代码即策略动态生成抓取、分拣等精细动作,实现小时级产线切换。自动驾驶 系统通过组合可验证的技能库 (如变道、无保护左转) 提升长尾场景处理能力,并利用执行反馈进行在线自我修复。服务机器人 (酒店、医院) 可通过技能市场下载并适配新任务 (如送物、消毒),无需重训模型。工业仿真 与数字孪生平台集成技能生成引擎,快速验证产线布局。
商业价值
核心降本来自 skill 复用与零样本部署:传统机器人应用开发需数周,代码策略合成可将开发周期压缩至数分钟,减少对机器人编程专家的依赖。技能市场 (如 RoboHub) 提供一次性付费下载的静态技能,但引入自我改进技能库后,可衍生按调用次数或性能提升订阅的 SaaS 模式,开辟持续性收入。体验提升体现在 跨本体泛化:同一技能可在不同品牌机器人上运行,客户可混合部署异构机器人群,降低整体硬件锁定成本。
与现有产品/工作流的接口
技能系统通过 ROS 2 节点或 gRPC 服务 嵌入现有机器人控制栈。代码生成层可对接 CI/CD 流水线,利用仿真环境 (Isaac Sim, Gazebo) 进行自动化回归测试与安全验证。技能元数据 (本体约束、成功率、故障模式) 以标准化 schema 存入 资产管理平台 (如 Fleet Management System),支撑动态调度。对于大模型驱动的技能生成,可通过 Hugging Face 等模型仓库分发策略,与 MLOps 工具链 (MLflow, Weights & Biases) 集成,记录技能进化史并回滚。
具体场景示例
- 电商履约中心:AMR 编队从技能库中索引 "异形件抓取" 技能,闭环反馈修正滑移位姿,单日完成 10 万级拣选任务,技能改进被自动提交到共享记忆库。
- 自动驾驶车队:车辆在无保护左转场景中应用探索生成的技能原语,执行时监控碰撞风险并自我修复,安全变体回传云端,经仿真验证后部署至全车队。
局限
- 覆盖范围有限:论文明确声明是有重点的综述,只检查了 77 个代表性系统,而非全面目录。可能遗漏了一些处于权重与技能中间地带的方法,如基于运动原语的方法,这些原语可被视为参数化技能但非纯代码形式。分类轴可能过于简化,未能充分体现许多方法的混合性质。
- 分类法的局限性:虽然“权重 vs 技能”的二分法提供了清晰的对比,但实际中许多机器人学习系统融合了两者,例如 VLA 模型可能通过集成代码执行环境来扩展能力,而技能方法也依赖预训练权重(如 LLM 的权重)来生成代码。该分类法可能过度强调对立,没有深入探讨混合系统如何运作,从而可能误导从业者认为这两者是互斥的。此外,对于“技能”一词的五种含义辨析虽然有用,但在实践中这些语义经常重叠,分类的严格性可能限制了其实际应用。
- 缺乏实证验证:作为一篇综述,它仅基于文献分析,没有提供实验来验证其提出的自改进机制分类或对比表格中归纳的能力差异。例如,它描述了结合反馈、记忆和进化搜索的开放式循环系统极其稀少,但没有定量比较这些系统在不同任务上的表现,也没有提供实际工程部署的建议,使得结论在指导具体系统设计时可能缺乏说服力。