NTU、CMU 等发布 VBVR-Pro,构建 300 项视觉推理任务与可验证打分器
VBVR-Pro 把视觉推理做成闭环:300 项任务、100 个可验证打分器,既当评测基准也当强化学习奖励,用来训练和比较 30 多个图像、视频、图文交错模型。
图像和视频不只是模型要理解的输入,也可以当成推理的「草稿纸」。NTU、CMU、Berkeley 等高校的研究者联合推出 VBVR-Pro:先定义 300 项视觉推理任务(如在迷宫中规划路径、想象 3D 物体旋转后的样子),再为其中 100 项各写一个可验证打分器,用来代替「让多模态大模型当裁判」的模糊评估。这批打分器还能直接当作强化学习里的可验证奖励,继续提升模型的视觉推理能力。
正文摘录
.jpg)  在迷宫里规划一条路径、想象 3D 物体旋转后的状态、持续追踪物体的位置…… 图像和视频不只是模型需要理解的输入,更是可以推理的 “工作空间 “。近年来,原生视觉推理(native visual reasoning)受到越来越多的关注,语言不再是模型推理的唯一途径,模型可以直接理解、探索和更新视觉空间来解决问题。[](https://mp.weixin.qq.com/s/tsw4w-9d9lmz8O2u1eOGg) 但目前,还缺少一套完整的基础设施。用什么任务训练模型的视觉推理能力?怎么评估模型输出的图片或视频是否正确?图片、视频或图文交错(interleaved image-text)哪一个更适合视觉推理?