行业新闻

CD-LAM 用因果去偏提升世界模型动作控制,仅需数千步微调

世界模型常忽视真实动作指令,CD-LAM 用因果去偏净化隐动作表征,大幅提升控制准确性并降低微调开销。

研究揭示现有隐动作模型(从无标视频中提取动作表征的模型)会将背景等无关信息混入动作信号,导致世界模型(根据动作预测未来画面的模型)忽视真实指令。新提出的 CD-LAM 通过因果去偏净化隐动作表征,让动作误差下降 30% 以上,且后训练仅需 3k-6k 步(约为基线的 10%)。

正文摘录

世界模型迎来因果升级:CD-LAM 仅用几千步微调即可显著增强动作控制 - 来源:机器之心 ![](https://image.jiqizhixin.com/uploads/article/coverimage/c8d3f0ab-e79c-4834-82c3-dd753b8e2cc1/024(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 人类可以轻松想象一个还没做出的动作会带来什么:手一松,杯子会掉;往前一推,抽屉会合上。动作尚未发生,大脑已经预演了可能的结果。对机器人来说,具身世界模型(Embodied World Model,一种根据当前观察和未来动作预测画面变化的模型)会根据当前观察和未来的动作,预测动作执行后的未来画面。有了它,机器人可以先在「脑子里」预演,再决定实际怎么做。机器人规划、策略评估和数据生成等任务,都需要建立在这类预测能力之上。 为了能够利用更多的无标注数据对世界模型进行大规模训练,隐动作模型(Latent Action Model,LAM,一种从视频画面变化中提取隐式动作表征的模型)被设计用于从画面变化里提取「隐动作(Latent Action)」充当伪标签,让世界模型在海量人类视频上预训练(Pre-training),学会「大概怎么动」。之后,仅需要少量带真实动作标注的视频进行后训练(Post-training),即可更快更好地适应真实动作控制。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-27原文

相关内容