Learning Where Outcomes Change: Credit-Addressable Reasoning for Multimodal Geometry
多模态几何推理要求视觉语言模型(VLMs)提取精确的视觉关系,并在多步推理中保持这些关系。现有的自由形式轨迹模糊了决定答案的关键步骤,而轨迹级强化学习将单一的最终信号分配到整个响应中。我们引入了Credit-Addressable Reasoning,其中推理过程中暴露的语义单元也定义了学习比较替代方案和分配回报的位置。 我们将这一原则实例化为Code-CoT,它保留图表、将视觉关系表示为可寻址的可执行代码,并将推理组织为类型化事件;同时提出CE-GRPO,它利用结构先验和类型归一化熵选择事件边界,从共享前缀采样完整延续,并将结果差异转化为局部优势。 在九个几何基准上,CE-GRPO实现了76.04的平均准确率,分别超过Qwen3-VL-8B和轨迹级GRPO 8.09和3.43个百分点。其相对优势随着中间事件数量的增加而扩大,证明了表示-优化协同设计对长距离、依赖密集的多模态推理的价值。
论文精读
TL;DR 论文提出 credit-addressable reasoning:用可执行代码 Code-CoT 将几何推理拆成可寻址事件,并在事件边界用 CE-GRPO 做局部信用分配,在九个几何基准上平均准确率 76.04,比轨迹级 GRPO 高 3.43 点。
问题
问题背景:多模态几何推理要求 VLM 从图像中提取精确的视觉关系(如平行、垂直、角度等),并通过多步演绎保持这些关系的一致性。当前领域关注如何让模型不仅输出答案,还能展示可验证、可细粒度审查的推理过程。
现有方法局限:
- 主流方法采用自由形式的 chain-of-thought (CoT) 文本 trace,语义单元不明确,关键决策步骤(如识别某个几何元素、应用某条定理)被淹没在冗长叙述中,无法定位错误来源。
- trajectory-level RL(如 GRPO)将整个回答序列的最终正确性信号平均分配到所有 token,这种稀疏、全局的 credit assignment 稀释了关键步骤的梯度信号,使得模型难以有效学习中间推理环节,学习效率低,对长链条推理的改进有限。
为什么难/重要:几何问题的推理链条通常较长,且每一步都依赖前一步提取的视觉关系;一个早期错误会被后续步骤放大,导致最终答案错误。因此,精准的 credit assignment 对于训练模型避免此类级联错误至关重要。业界对可审计、可调试的多模态推理系统需求上升,尤其在需要高可靠性的场景(如自动阅卷、CAD 辅助设计、机器人视觉规划)。
行业类比:类似于将 LLM 代码生成从“只给最终运行结果打分”升级为“逐行单元测试与代码覆盖率分析”,让模型知道具体哪一行逻辑导致了错误,从而进行针对性优化。
核心洞察
- Credit-addressable reasoning 将推理过程中暴露的语义单元与强化学习的信用分配位置对齐。传统 trajectory-level GRPO 把单一终端信号分摊到整个响应,模糊了哪些步骤真正决定答案;该工作通过 Code-CoT 把视觉关系表示为行可寻址的可执行代码,并组织为类型化事件,使每个推理事件成为可独立比较和分配信用的单元。这种表征与优化协同设计让奖励信号能精确定位到改变结果的关键事件,有效提升长链条几何推理的稳定性和样本效率。
- CE-GRPO 使用结构先验和类型归一化熵选择事件边界,从共享前缀采样完整续写,将结果差异转化为局部优势。与从完整轨迹中随机采样的 GRPO 相比,共享前缀确保对比样本仅在特定事件后分叉,从而 outcome difference 可明确归因于该事件及其后续推理;类型归一化熵平衡不同事件类型的信息量,结构先验缩小搜索空间。该方法证明推理轨迹内部的优化粒度与表征粒度一致,能显著提高多模态几何推理的准确率。
方法
输入与总览
该方法面向多模态几何推理,输入为包含几何图形和文本问题的样本。核心思路是将推理过程显式化为可寻址的代码事件,并在事件级进行信用分配。
关键模块一:Code-CoT 推理空间
- 保留原始 diagram,不丢弃视觉信息。
- 将视觉关系转化为 line-addressable executable code,每行代码可独立寻址。
- 推理过程被组织为 typed events,每个事件是一个显式的语义单元,用于后续优化。
关键模块二:CE-GRPO 优化
- 利用 structural priors 和 type-normalized entropy 选择事件边界,确定信用比较的位置。
- 从共享前缀采样完整续写,估计不同决策对应的 outcome。
- 将 outcome 差异转化为 localized advantages,分配到对应事件,而不传播到整个轨迹。
输出与学习
模型最终输出几何答案。整个方法采用 representation–optimization co-design:推理空间和优化信号在事件级对齐,使学习信号更精确。
与同类方法的差异
与 trajectory-level GRPO 仅在回复末尾分配单一 terminal signal 不同,CE-GRPO 将信用定位到中间事件,实现更细粒度的强化学习。
实验
实验设计
评估在九个几何基准上进行,对比 Qwen3-VL-8B 基线、trajectory-level GRPO 与提出方法 CE-GRPO。CE-GRPO 在 Code-CoT 生成的类型化事件中选择边界,基于结构先验和类型归一化熵采样完整续写,将结果差异转化为局部优势。
关键发现
CE-GRPO 平均准确率达 76.04,较 Qwen3-VL-8B 提升 8.09 点,较 trajectory-level GRPO 提升 3.43 点。相对优势随中间事件数量增加而扩大,说明在长链条、依赖密集的多模态推理中,该方法的收益更显著。
对比解读
相较指令微调基线,准确率大幅提升主要来自 Code-CoT 的可执行代码表示与局部信用分配的双重作用;相较轨迹级 RL,CE-GRPO 将学习信号聚焦到事件边界,避免了单一终端信号在长响应上的平均分配。优势随事件数增长进一步验证了表示–优化协同设计的有效性。
行业影响
落地场景
Code-CoT 与 CE-GRPO 适用于需要从图像中抽取精确几何关系并进行多步推理的产品:教育科技中的几何自动解题与分步提示、工程设计软件的图纸理解与约束提取、电商平台的产品尺寸与结构信息抽取、文档智能中的技术图表解析。其代码化、事件化推理表示特别适合可验证、可回溯的场景。
商业价值
- 降本:credit-addressable 训练减少无效探索,提升 RL 样本效率,降低定制化 VLM 的训练算力与数据成本。
- 增收/体验:在几何辅导、CAD 辅助中提供可执行的推理链,能自动生成可验证的解题步骤或结构参数,减少人工审查,提高用户付费意愿与留存。
- 差异化:相比 trajectory-level GRPO,事件级优势分配带来更稳定的长链路推理,有利于构建高精度垂直模型。
与现有产品/工作流接口
模型可封装为推理 API,输出可执行代码轨迹与 typed events,便于与现有验证器(如几何定理检查器、CAD 内核)对接。训练侧,CE-GRPO 可作为插件替换现有 RL 策略,事件边界选择依赖结构先验,无需大幅改动数据管线。推理日志中的事件级 credit 还能用于 A/B 测试与错误归因。
具体落地用例
- 教育科技:在线几何辅导产品中,学生上传几何题图,系统输出逐步
Code-CoT解题代码并高亮关键关系,实时判定哪一步出错,减少人工答疑成本。 - 工程 SaaS:CAD 或建筑信息建模平台集成该模型,自动从图纸或现场照片中提取几何约束并生成可执行参数,辅助设计审查与变更影响分析。
局限
- 该方法依赖 **Code-CoT** 的可执行代码表示,要求模型具备可靠的代码生成能力,并为几何问题设计结构化代码模板与事件类型。对于非代码友好的多模态任务(如开放域 VQA、图表理解或需要隐式视觉关系的场景),推理单元的定义和事件边界划分需要大量领域专家设计,迁移成本较高,限制了方法的通用性。
- **CE-GRPO** 引入了多个关键设计选择,包括事件边界选择的结构先验、类型归一化熵权重、前缀采样长度等超参数。论文未系统探究这些超参数的敏感性和鲁棒性,实际部署时可能需要针对新任务重新调优。此外,代码执行过程增加额外计算开销,代码中的错误会干扰信用分配的准确性,影响学习稳定性。
- 实验仅在几何推理基准上验证,虽然覆盖九个数据集,但任务类型高度同质。对于更复杂的多模态推理(如物理推断、视觉逻辑谜题)或需要长程多模态依赖的任务,**credit-addressable reasoning** 的有效性尚未得到证实。与 trajectory-level GRPO 相比的 3.43 点提升,可能部分来自代码表示本身而非信用分配机制,消融实验需要进一步分离两者贡献。