行业新闻

原力灵机发布具身世界模型DW0.5,将强化学习引入虚拟训练

DW0.5是一个可生成失败画面的世界模型,让VLA能在虚拟环境中低成本试错,加速机器人学习。

原力灵机发布具身世界模型DW0.5,它能根据机器人动作预测未来视频画面,既模拟成功也模拟失败。接入强化学习后,真机数据需求降低60%,训练成本下降40%。

正文摘录

代码 Agent 可以自动执行、自动验证、自动反馈。写了代码跑一下就知道对不对,奖励信号非常清晰明确。 它接收的信号不像代码那样有一个编译器就能判定,它们模糊、昂贵,而且每一次真机试错都意味着真金白银的人力和硬件损耗。 但很快,大家发现这个技术存在物理理解缺失、泛化能力极弱、长时序与规划能力不足等等问题,做不到“一家独大”包打天下。 我们认为,在 技术路线 上给自己贴标签是特别愚蠢的。应该以目标为导向:你要解决什么问题,挑选对应的方法去解决它,而不是说我是什么方法、什么流派的,并以此证明只有我才是标新立异的。 一晃眼半年过去了。这个月,原力灵机发布了旗下首款具身世界模型 DW0.5,并将它接入世界模型驱动的具身智能后训练框架 DFOL 2.0。 “这套基模支持多模态输入,包括任务指令、图片和视频,还能选定机器人类型。我们可以凭借历史动作,预测后续视频状态。”原力灵机联合创始人汪天才说。 他介绍道,DW0.5 用上万小时真机、多视角数据完成联合预训练,仿真能力很强,能生成各类画面。 不光能做出机械臂正常作业的视频,就算参考错误动作,也能还原任务失败的场景,以此支撑 DFOL 2.0 框架的在线强化学习训练。 VLA(Vision-Language-Action,视觉-语言-动作模型)先给出候选动作,DW0.5 在虚拟环境中预演未来,判断成功、失败与偏离风险,再把可用反馈送回强化学习(RL,Reinforcement Learning)。 按其披露的数据,这套流程可让后训练中真机数据需求骤降 60%,整体训练成本下降 40%。 具身智能属于物理 AI,它的目标是让机器人在不同环境、不同物体和不同失败条件下持续变强。 真机一次 rollout(一次完整的策略执行)需要占用机器人、场地和人工,一次动作失败可能直接让任务中断;人工反馈虽然更接近真实判断,但难以高频覆盖每个中间状态;

阅读原文(qbitai.com)→

行业新闻衡宇2026-07-16原文

相关内容