GigaBrain-0.7: 通过三系统架构将具身基础模型扩展到涌现能力
视觉-语言-动作(VLA)模型已成为通用具身智能体的主导范式,在结构化环境中展现出强大的复杂和长时程任务完成能力。然而,当前 VLA 系统能否受益于更有效的架构设计、扩展到更大规模和更异构的数据体系,并在任务和本体上实现更广泛的泛化,仍是一个开放问题。为此,我们提出 GigaBrain-0.7,一个在多种机器人本体上显著提升泛化能力的具身基础模型。 GigaBrain-0.7 的核心创新包括三个方面:1) 三系统架构,统一了理解、预测和动作生成;2) 大规模预训练,数据规模超过 37,000 小时的异构具身数据;3) 单阶段对齐训练,联合优化视觉-语言理解与多本体动作生成。与之前的 GigaBrain-0 系列以及包括 π{0.5} 在内的现有最优模型相比,GigaBrain-0.7 在基础零样本能力、语言条件指令跟随和训练后任务成功率上均取得了显著提升。 特别是在我们自研的 Maker H01 平台和主流机器人本体上,GigaBrain-0.7 展现了强大的任务适应性和完成能力,覆盖家庭和工业场景。所有训练代码和预训练模型权重将公开发布。
论文精读
TL;DR GigaBrain-0.7 通过三系统架构统一理解、预测与动作,在 37000+ 小时异构数据上做一阶段对齐训练,显著提升跨机器人本体的零样本指令跟随与任务成功率,超越 π0.5 等 SOTA。
问题
问题背景
具身智能领域当前聚焦于构建通用机器人基础模型,其中 VLA (Vision-Language-Action) 已成为主流范式,期望单一模型控制多种机器人完成长程任务。
现有方法局限
已有 VLA 系统在架构、数据与训练上存在明显短板:
- 架构耦合低效:主流采用串行级联 VLM 后接 action expert,高层语义与低层动作割裂,误差沿链路累积;并行 Mixture-of-Transformers 虽缓解延迟,但模块间知识共享不足。
- 数据扩展受限:现有预训练多为同构机器人数据或少量数据源,面对 >37k 小时异构数据时,统一 embodiment 表征与动作空间映射困难。
- 训练流程分离:多阶段训练中视觉语言理解与动作生成独立优化,导致对齐不充分,零样本指令跟随能力弱。
为什么这个问题难/重要
其难点在于:不同机器人 embodiment 的观测空间 与 动作空间 差异极大,需设计统一的接口;同时要平衡高层任务规划与低层实时控制,避免灾难性遗忘。业界关注度高,因为通用具身基础模型是降低机器人应用边际成本的关键,但尚无公认的 scaling 路径。
行业类比:与自动驾驶从模块化规则系统走向端到端基础模型类似,具身智能正需要可扩展架构统一感知、预测与动作。
核心洞察
- GigaBrain-0.7 通过 **三系统架构** 将动作生成、理解规划、预测评估功能解耦,其中 System 1 负责快速动作控制,System 2 负责高层理解与规划,System 3 负责预测与评估。这种设计避免了单一 Transformer 同时处理所有任务时的梯度冲突,并通过 **soft knowledge insulation** 减少系统间干扰。相比仅依赖 VLM 或级联 VLM-action expert 的先前方法,GigaBrain-0.7 能在保持实时反应的同时引入更深层次的认知能力,为复杂长程任务提供更稳定的表现。
- GigaBrain-0.7 在超过 **37,000 小时** 的异构具身数据上采用 **one-stage alignment training**,联合优化视觉语言理解和多实施例动作生成。这与常见的多阶段训练范式(先预训练 VLM 再微调动作专家)不同,能避免阶段间灾难性遗忘和任务偏移。统一机器人表示和数据清洗流程进一步增强了跨本体泛化能力。在零样本指令跟随和复杂操作上,GigaBrain-0.7 显著超越 π0.5 等 baseline,验证了大规模、一体化训练对具身基础模型的重要性。
方法
输入多模态具身数据(图像、语言指令、机器人状态、动作轨迹),经统一表示后进入三系统架构。
关键模块
- 系统2(理解与规划):基于视觉语言模型骨干,负责场景理解、语言指令解析与高层任务规划。
- 系统3(预测与评估):世界模型,通过机器人中心视频预训练与价值学习,具备未来状态预测和动作价值评估能力。
- 系统1(行动与控制):多具身动作生成模块,包含短期视觉记忆、离散与连续动作通路,以及软知识绝缘 和具身感知状态接口,处理不同机器人本体的动作空间差异。
训练流程
- VLA 预训练:联合优化视觉-语言-行动目标,注入时间上下文监督与层次任务监督,实现多具身统一优化。
- 世界模型预训练:先在机器人中心视频上做生成式预训练,再学习价值函数,为后续条件生成提供依据。
- 世界模型驱动后训练:利用子目标图像条件、价值派生条件和条件丢弃机制,将世界模型的预测/评估能力对齐到策略输出。
- 经验强化学习:结合离线经验回放与在线人类纠正,持续改进策略。
输出为通用具身策略,可跨多种机器人执行语言条件任务。
与串行 VLM–动作专家或并行 Mixture-of-Transformers 等以往 VLA 架构不同,GigaBrain-0.7 通过三系统联合与软知识绝缘,在单一网络内实现理解、预测与行动的一体化协同优化。
实验
实验设计
- 评估平台:Maker H01 平台与主流机器人本体,覆盖家庭与工业场景。
- 基线:前代 GigaBrain-0 系列、π_{0.5} 等 SOTA。
- 评估维度:foundation zero-shot 能力、语言条件指令跟随、后训练任务成功率。
- 内部消融:VLM backbone 对比、VLM–action expert 耦合方式、数据规模扩展、temporal context 长度、System 3 预测模块贡献。
关键发现
- 三系统架构(理解/预测/行动)结合 37,000 小时异构数据预训练与单阶段对齐训练,带来显著性能提升。
- 模型在多本体泛化、零样本任务完成、指令跟随上表现更强;后训练后任务成功率大幅提高。
- System 3 的预测与评估模块对复杂操纵有正向贡献;数据扩展与异构来源混合进一步提升性能。
与基线对比解读
- 相比前代 GigaBrain-0,架构改进与数据扩展是主要增益来源。
- 相比 π_{0.5},GigaBrain-0.7 在零样本和指令跟随上体现更优,但论文未给出具体数值,缺乏定量对比依据。
- 作者强调单阶段联合训练减少了串行级联方案的多阶段错误累积,这是相对级联 VLM–action expert 路线的架构优势。
行业影响
落地场景
适合多任务泛化机器人产品,如 电商仓储分拣、家庭服务机器人、工业装配。零样本语言跟随减少逐任务微调。
商业价值
主要降本:37k 小时异构预训练 + 单阶段对齐,新任务上线只需少量数据甚至零样本,降低部署周期与算法人力。增收:可扩展更多 SKU / 场景,提升机器人利用率。体验:自然语言指令操控,降低使用门槛。
与现有产品/工作流接口
- 数据:复用现有 ROS 回放数据,按 “统一机器人表示” 清洗,接入开源管线。
- 推理:模型权重开源(GitHub),以 ROS 节点/gRPC 服务部署,输入图像+指令输出动作。
- 仿真:与 Isaac Sim 等数字孪生集成,先验零样本策略。
- 后训练:System 3 价值预测支持在线强化,融合人工纠正持续迭代。
具体 use case
电商履约中心:控制不同品牌机械臂拣选,“把蓝色盒子放入三号箱” 零样本执行,新增 SKU 无需重训。 家庭服务机器人:作为产品统一大脑,理解口头指令并控制移动抓取,提升跨家居环境与不同底盘泛化,缩短 ODM 适配周期。
局限
- 论文未充分讨论三系统架构在推理时的计算开销与实时性。虽然一体式训练简化了流程,但 System 1/2/3 联合推理可能引入额外延迟,对需要高频闭环控制的动态操作任务可能不友好。对比 π0.5 等轻量级 VLA,GigaBrain-0.7 的模型规模更大,部署在边缘计算设备上的可行性存疑,论文仅报告任务成功率,缺少端到端推理延迟或吞吐量指标。
- 评估覆盖的机器人平台和场景仍有限。尽管宣称多具身泛化,但主要评测集中于自家 Maker H01 平台和少数主流机器人,工业与家庭场景的多样性可能不足以证明跨形态泛化能力。此外,零样本能力评估的基准可能偏简单,未在更具挑战性的长周期、开放世界任务中验证,结果可能高估了模型的真实泛化水平。
- 数据清洗与标注流程依赖大量人工设计(如语言指令重写、子任务标注、多阶段清洗),可能限制数据管线的可扩展性。论文未报告数据质量对最终性能影响的消融,也未分析数据分布偏差是否会导致对特定场景的过拟合,这些因素可能影响模型在全新数据分布下的鲁棒性。