行业新闻

复旦与引望提出WAM-Diff2:自动驾驶VLA解码提速15.1倍且性能不降

复旦和引望提出WAM-Diff2,用三级蒸馏将自回归VLA转为扩散模型,解码提速15.1倍,多任务性能持平。

VLA(视觉-语言-动作模型,把驾驶场景理解、感知和规划统一成Token序列)常用自回归解码(逐个Token生成),速度慢且长时预测误差会累积。扩散模型(并行去噪生成)更快,但直接换架构性能大跌。复旦与引望的WAM-Diff2用三级蒸馏把成熟的自回归VLA平滑转成扩散架构,解码提速15.1倍,多任务性能不掉,长时规划更稳。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-19原文

相关内容