行业新闻

NTU、CMU 等发布 VBVR-Pro,构建 300 项视觉推理任务与可验证打分器

VBVR-Pro 把视觉推理做成闭环:300 项任务、100 个可验证打分器,既当评测基准也当强化学习奖励,用来训练和比较 30 多个图像、视频、图文交错模型。

图像和视频不只是模型要理解的输入,也可以当成推理的「草稿纸」。NTU、CMU、Berkeley 等高校的研究者联合推出 VBVR-Pro:先定义 300 项视觉推理任务(如在迷宫中规划路径、想象 3D 物体旋转后的样子),再为其中 100 项各写一个可验证打分器,用来代替「让多模态大模型当裁判」的模糊评估。这批打分器还能直接当作强化学习里的可验证奖励,继续提升模型的视觉推理能力。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/1901a25a-ff6b-43df-a6d6-14a416d31e11/060(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 在迷宫里规划一条路径、想象 3D 物体旋转后的状态、持续追踪物体的位置…… 图像和视频不只是模型需要理解的输入,更是可以推理的 “工作空间 “。近年来,原生视觉推理(native visual reasoning)受到越来越多的关注,语言不再是模型推理的唯一途径,模型可以直接理解、探索和更新视觉空间来解决问题。[![](https://image.jiqizhixin.com/uploads/editor/e8c4f7c9-5ffd-40c0-98c1-6b337d7a23f7/1789873603064.png)](https://mp.weixin.qq.com/s/tsw4w-9d9lmz8O2u1eOGg) 但目前,还缺少一套完整的基础设施。用什么任务训练模型的视觉推理能力?怎么评估模型输出的图片或视频是否正确?图片、视频或图文交错(interleaved image-text)哪一个更适合视觉推理?

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-20原文

相关内容