Yann LeCun介绍Meta的VLWM模型,通过视频转文本计划实现更好的动作推理。
新的@AIatMeta构建了一个视觉语言世界模型,将视频转化为文本计划,并通过推理选择更好的动作。
在系统2规划上,Elo比系统1高出27%。
它解决的关键问题是:智能体必须预测动作如何改变世界,而不仅仅是标记帧。
VLWM,即视觉语言世界模型,以纯文本表示隐藏状态,预测目标以及交织的动作及其状态变化。
训练目标来自一个“标题树”,它压缩每个视频,然后由LLM提炼成目标和状态更新。
该模型联合学习提出下一个动作的策略和预测下一个状态的动态模型。
在快速模式下,它从左到右完成计划文本,速度很快但可能锁定早期错误。
在反思模式下,它搜索候选计划,展开未来,并选择成本最低的路径。
提供此成本的批评者无需标签进行训练,通过将有效进展排在干扰项或打乱步骤之下。
在规划基准和人类直接比较中,反思搜索产生更清晰、更可靠的计划。
----
论文 – arxiv.org/abs/2509.02722
论文标题:“使用视觉语言世界模型进行推理规划”
在系统2规划上,Elo比系统1高出27%。
它解决的关键问题是:智能体必须预测动作如何改变世界,而不仅仅是标记帧。
VLWM,即视觉语言世界模型,以纯文本表示隐藏状态,预测目标以及交织的动作及其状态变化。
训练目标来自一个“标题树”,它压缩每个视频,然后由LLM提炼成目标和状态更新。
该模型联合学习提出下一个动作的策略和预测下一个状态的动态模型。
在快速模式下,它从左到右完成计划文本,速度很快但可能锁定早期错误。
在反思模式下,它搜索候选计划,展开未来,并选择成本最低的路径。
提供此成本的批评者无需标签进行训练,通过将有效进展排在干扰项或打乱步骤之下。
在规划基准和人类直接比较中,反思搜索产生更清晰、更可靠的计划。
----
论文 – arxiv.org/abs/2509.02722
论文标题:“使用视觉语言世界模型进行推理规划”