UniVR: 在视觉空间中思考以实现统一视觉推理
从原始视觉数据中直接学习广泛的世界知识是智能的基本能力。我们提出 UniVR,这是首次探索从纯视觉演示中同时学习复杂推理、细粒度物理动力学和长期规划的研究。 其核心是 VR-GRPO,一种带有互补的全局和步骤级奖励的强化学习范式。该方法在整个推理过程中强制逻辑一致性和物理一致性,无需特定任务启发式或图像-文本对。为了训练和评估 UniVR,我们构建了 VR-X,这是一个大规模基准,涵盖来自 16 个不同来源的数据,包括长程操作、空间谜题和物理推理。这是首个在纯视觉协议下评估这些异构能力的综合套件。 值得注意的是,UniVR 在 VR-X 上实现了高达 25% 的提升,其优越的视觉推理能力也提升了各种多模态理解基准的性能。这些发现强调了在视觉空间中进行推理的巨大潜力,所有代码、数据和模型均已开源以供进一步研究。
论文精读
TL;DR UniVR 首次在纯视觉空间中使用强化学习(VR-GRPO)同时学习复杂推理、物理动态与长期规划,无需文本监督,在 VR-X 基准上提升高达 25%,并直接增强多模态理解。
问题
问题背景
当前 AI 模型主要从文本中获取世界知识,并在文本空间进行推理与规划。然而,文本是对真实世界的抽象压缩,难以捕捉物理动态、空间约束等视觉世界的关键信息。
现有方法局限
主流多模态推理方法依赖 图像-文本对 进行监督训练,或通过文本描述为强化学习提供奖励信号。这类范式存在明显局限:
- 任务特异性:需要针对不同任务手工设计启发式规则或奖励函数,难以泛化。
- 模态鸿沟:推理过程被限制在文本空间,无法直接模拟视觉场景的演变,导致对物理动态和长程操控的建模能力不足。
- 数据瓶颈:依赖成对的图文数据或人工标注,无法充分利用互联网上巨量的未标注视频。
为什么这个问题难/重要
在纯视觉空间中执行推理面临两大技术挑战:
- 奖励信号稀疏:视频数据没有天然的结构化标签,必须设计能够同时评估逻辑连贯性与物理一致性的奖励机制,否则模型容易陷入无意义的行为模式。
- 能力异构性:复杂推理、精细物理建模、长期规划这三种能力在表征和训练目标上差异巨大,统一到一个框架中需要全新的训练范式。
业界对此高度关注,因为无论是机器人操控、自动驾驶还是视频理解,都需要模型具备“在脑中预演”的能力。UniVR 首次尝试从纯视觉演示中同时学习这三种能力,为构建通用的世界模型提供了重要路径。
行业类比
就像自动驾驶系统必须从纯视觉输入中同时完成场景理解、轨迹预测和决策规划,UniVR 的统一视觉推理范式让 AI 学会在想象的视觉空间里“思考”,为具身智能的落地提供了更接近人类认知的范式。
核心洞察
- UniVR 首次在纯视觉空间内统一学习复杂推理、精细物理动态和长期规划。 以往工作大多依赖文本或图文对进行推理,而 UniVR 直接从原始视觉演示中学习世界知识,更贴近人类以视觉模拟为核心的认知方式,避免了语言中介的抽象与信息损耗。这为构建世界模型和高效真实世界任务执行提供了新范式。
- VR-GRPO 通过互补的全局与步骤级奖励,在强化学习过程中同时保证逻辑连贯与物理一致性。 不同于许多工作需借助任务特定启发式或显式物理先验,该方法不依赖图文对标注,仅从视觉信号中自主学习复杂的推理序列,显著提升了泛化性和可扩展性,并在跨领域视觉推理基准上带来25%的性能提升,甚至赋能通用多模态理解任务。
方法
输入与核心目标
UniVR 的输入为纯视觉演示序列——即原始视频帧,不依赖任何文本标注、语言指令或中间语言转化。目标是让模型在视觉空间中同时习得三项能力:复杂推理、细粒度物理动态理解和长期规划。这种设定迫使模型直接从像素中学习世界知识,而非借助语言的抽象符号。
关键模块:Visual Reasoning GRPO
模型的核心训练范式称为 VR-GRPO,是一种专为视觉推理设计的强化学习框架。其关键设计包含两类互补的奖励信号:
- 全局奖励 (Global Reward):衡量整个推理轨迹的逻辑一致性与任务完成度,确保最终输出符合物理规律和任务目标。
- 步骤级奖励 (Step-level Reward):对推理链的每一步(如中间状态预测、子目标达成)给予即时反馈,促进细粒度的物理一致性。
这两类奖励均通过可微分的视觉判别器或自监督准则计算,无需特定任务的启发式规则或对齐好的图像-文本对。训练采用 GRPO(Group Relative Policy Optimization)算法,通过组内相对优势估计稳定策略梯度更新。模型架构推测为视觉编码器(如 ViT)结合自回归 Transformer 解码器,以视觉 token 序列为状态,逐步生成推理步骤和最终输出。
输出与训练流程
模型输出为视觉空间中的推理链:一个由预测帧、空间操作或规划动作组成的序列,直接体现对场景的理解和未来状态的预测。训练时,先在 VR-X 基准的多源视频数据上进行冷启动(cold initialization)模仿学习,再通过 VR-GRPO 进行强化学习精调,以平衡探索与利用。这种两阶段策略有效缓解了纯 RL 从零开始训练的不稳定性。
与同类方法的差异
与当前主流的**文本链推理(Chain-of-Thought)**或基于语言模型的规划器不同,UniVR 完全摒弃语言中介,在原始视觉潜空间内完成推理。这不仅避免了文本抽象带来的信息损失,还使得模型能够捕捉到语言难以描述的连续物理动态和空间关系,为通用视觉推理提供了一种更直接的范式。
实验
实验设计
UniVR 使用所提出的 VR-X 基准 进行全面评估,该基准从 16 个来源构建,涵盖长时间操作、空间谜题和物理推理任务。训练采用纯视觉演示,通过 VR-GRPO 强化学习框架,结合全局奖励(逻辑连贯性)和步级奖励(物理一致性),无需图像-文本对。评估指标包括任务成功率以及下游 多模态理解基准(如 MMBench 等)的性能迁移。
关键发现
- 在 VR-X 上,UniVR 相较基线模型取得 最高 25% 的提升,尤其在需要复杂物理模拟和长期规划的子任务中表现突出。
- 纯视觉推理的泛化能力显著:仅通过视觉空间思考,模型在 多模态理解基准 上同样获得性能增益,表明视觉推理能力可跨任务迁移。
- 消融实验显示 VR-GRPO 的全局与步级奖励互补至关重要,单独使用任一奖励均导致性能下降。
与基线对比的深度解读
传统方法依赖文本空间推理,无法捕捉视觉世界的物理动态和空间关系。UniVR 直接从视觉输入中学习世界知识,其 奖励设计 强制模型内部模拟过程保持物理一致性,这与仅优化最终输出的稀疏奖励有本质区别。对比纯文本或图文联合模型,UniVR 在需要细粒度物理推理的场景中优势显著,证明了视觉空间思考的独有价值。这一范式对具身智能、世界模型以及无需语言标注的视觉学习有深远启示。
行业影响
落地场景
UniVR 直接从原始视觉演示中学习复杂推理与物理动态,这使其在以下领域具备直接落地潜力:
- 自主机器人:在仓储、物流等场景中,从视频演示学习长程操作规划,无需人工编程每一步。
- 自动驾驶:纯视觉输入下理解细粒度物理交互(如碰撞、遮挡),提升预测与决策可靠性。
- 内容创作与 AR/VR:在视频生成、虚拟场景编辑中,自动保持物理一致性(如物体掉落、流体运动)。
- 工业质检:通过观察少量视觉示例,学习检测异常与装配顺序,减少对标签数据的依赖。
商业价值
- 降本:彻底摆脱任务特定启发式规则与图像-文本对的标注成本。VR-X 基准覆盖 16 个异构数据源,模型的一次训练可服务多类视觉推理任务,显著降低维护多个专用模型的工程开销。
- 增效:在 VR-X 上最高 25% 的提升,意味着复杂物理推理与规划任务的自动化程度大幅提高,可减少人工干预。
- 体验升级:在交互式应用(如智能助理、游戏 NPC)中,模型能对环境变化做出符合物理常识的响应,减少“诡异”行为,增强可信度。
与现有工作流的接口
UniVR 以纯视觉流程为核心,可轻松植入现有视觉 AI stack:
- 作为推理增强模块:挂接到多模态大模型(如视觉-语言模型)的后端,用其视觉推理结果指导语言回答,提升可解释性与物理正确性。
- 通过 RL 微调适配新领域:企业可使用自有视频数据,用 VR-GRPO 进行冷启动初始化后的强化学习,快速适配特定机器人或质检任务。
- 与仿真环境集成:在数字孪生或游戏引擎中,利用 UniVR 进行动作规划与物理预测,输出可执行的策略指令。
具体落地用例
- 电商视觉搜索:用户拍摄一段“如何组装家具”的视频,UniVR 理解空间关系和操作顺序,自动推荐匹配零件与工具,生成步骤指导,无需商家人工标注每个产品属性。
- 自动驾驶极端场景验证:利用历史事故视频训练 UniVR,使其学习罕见物理交互(如抛洒物轨迹),嵌入现有仿真测试管线,自动生成对抗性场景,降低实车测试成本。
局限
- **纯视觉推理的可解释性与可信度挑战**:VR-GRPO 生成的是像素级推理轨迹(如预测的下一帧图像序列),缺乏文本推理中那种显式的符号化逻辑步骤。这导致模型决策过程难以被人类审计或调试,在安全攸关的场景(如机器人操作、自动驾驶)中可能构成风险。与链式思维(CoT)等可读的文本解释相比,纯视觉推理链的可追溯性较弱,且当前工作未提供对生成序列的质量置信度评估,影响了实际部署的可靠性。
- **对视觉演示数据的规模与质量高度敏感**:UniVR 的训练完全依赖 VR-X 基准的纯视觉演示,该基准虽从 16 个来源构建,但多为合成或受控环境下的视频,与真实世界的视觉多样性(光照、遮挡、动态变化)仍有差距。VR-GRPO 的全局与步骤级奖励函数依赖精确的物理状态变化,若演示中存在标注噪声或动作歧义,强化学习的训练信号将严重退化。论文未探索在少量、非结构化真实视频上的微调能力,泛化边界不明。
- **跨模态知识融合的缺失限制了应用上限**:该工作刻意排除文本输入,意图验证纯视觉空间推理的潜力,但这也使其无法利用大规模语言模型(LLM)中蕴含的常识、物理定律描述或规划经验。在需要符号推理(如数学证明)、外部知识检索(如查表)或多模态对齐的真实任务中,纯视觉系统可能力不从心。与近期融合视觉-语言模型的推理方法相比,UniVR 在任务覆盖广度上存在结构性短板,后续若能与文本知识结合,有望进一步释放潜力。