并非所有 Prompt 都相同:面向多模态强化学习后训练的探索引导式 Prompt 脚手架
在 online reinforcement learning (RL) 中,训练 prompt 对当前策略的信息量差异显著:部分 prompt 已趋于饱和,另一些则难度过高、难以提供可靠的学习信号;但在标准训练流程下,二者获得的 rollout 预算完全相同。 为此,我们提出 exploration-guided prompt scaffolding 框架,在 MLLMs 的 RL 后训练过程中动态调整训练 prompt 的分布。其核心是 Exploration Potential Score (EPS)——一种轻量的、基于 rollout 的 prompt 效用代理指标,由 KL-regularized policy improvement 理论导出,可直接从 on-policy rollout 统计量计算,不引入额外开销。 与直接丢弃低效用 prompt 不同,我们使用 teacher model 生成 scaffolded rewrites,在保留原始任务意图的同时让后续训练更具信息量,从而将 teacher supervision 重新定义为训练数据精炼,而非输出模仿。 在 Geo3K 与 MMK12 上结合 GRPO 后,该方法在 in-domain 与 out-of-distribution 基准上均稳定优于 baseline:域内相对提升最高达 9.7%,并在 MathVision 上取得 11.5%、在 MMMU-Pro 上取得 11.1% 的增益。
论文精读
TL;DR 多模态 RL 后训练中,不同 prompt 对当前策略的信息量差异巨大;本文用 Exploration Potential Score (EPS) 动态筛选低效用提示,并由教师模型重写为更有探索价值的 scaffolded prompt,在 Geo3K/MMK12 上最高相对提升 9.7%,OOD 基准 MathVision 提升 11.5%。
问题
问题背景
在线强化学习(RL)微调多模态大语言模型(MLLM)正成为提升推理能力的主流路径,但训练提示(prompt)对当前策略的信息量差异极大:部分已饱和,部分过难导致噪声梯度。
现有方法局限
标准 GRPO 等算法对每个 prompt 分配相同 rollout 预算,未考虑其动态效用:
- 固定均匀采样 忽略 prompt 难度与模型当前能力的匹配,导致计算浪费在低信息量样本上。
- 基于先验难度的课程学习 需要额外标注或启发式规则,且难以适应策略在训练中的能力变化。
- 现有 prompt 重写工作多针对推理时增强或数据扩增,未将其作为 RL 训练中的动态课程机制,也缺乏低成本、在策略(on-policy)的效用评估指标。
为什么这个问题难且重要
RL 训练的单次 rollout 成本高,低效 prompt 会显著拖慢收敛并浪费算力。设计一个能实时反映 prompt 信息增益的代理指标,且不增加额外前向/后向开销,是技术关键。作者从 KL 正则化策略改进理论推导出 Exploration Potential Score(EPS),可直接从 on-policy rollout 统计量计算,为动态调整训练分布提供理论依据。同时,对低 EPS 的 prompt 采用教师模型进行 scaffolding 改写,保留任务意图但提升探索价值,避免直接丢弃造成的知识遗忘。
行业类比
类似主动学习中选择高不确定度样本来减少标注成本,EPS 相当于 RL 训练中的“sample utility oracle”,使计算资源自动分配给最具学习增益的 prompt。
核心洞察
- EPS 将 prompt 效用从离散的难/易二元判断升级为连续、可测量的**探索潜力**,其推导自 KL 正则化策略改进理论,并可直接从 on-policy rollout 统计中零额外开销计算。与标准在线 RL 中对所有 prompt 分配相同 rollout 预算相比,EPS 能动态识别哪些 prompt 已经饱和、哪些过于困难,从而避免在无信息量的样本上浪费算力,使训练分布始终集中在能产生有效梯度信号的区间。
- 低效用 prompt 不通过 rejection sampling 被丢弃,而是由教师模型生成 **scaffolded rewrites**,在保留原始任务意图的前提下重构 prompt,使后续训练重新变得信息丰富。这一做法把 teacher supervision 从输出模仿转向训练数据精炼,区别于 curriculum learning 只能全局调整难度、或数据增强不考虑当前策略状态,scaffolding 针对当前策略的薄弱 prompt 进行定向重写,让低效用数据持续贡献学习信号,而非简单排除。
方法
输入
方法输入为多模态大模型在线强化学习中的 训练 prompt 集(如 Geo3K、MMK12),每个 prompt 包含视觉输入与任务指令。
关键模块
Exploration Potential Score (EPS) 计算
对每个 prompt 执行 on-policy rollout 获取当前策略的采样轨迹,利用轨迹中的动作概率、奖励等统计量计算 EPS。该分数源自 KL 正则化策略改进理论,近似衡量该 prompt 在当前策略下通过探索还能获得的潜在改进,作为 prompt 效用的轻量代理,无额外模型前向开销。EPS 驱动的 prompt 选择与脚手架生成
根据 EPS 识别低效用 prompt(过饱和或过难导致学习信号弱)。对这些 prompt,引入 teacher model 生成 scaffolded rewrites:保留原始任务意图,但调整表述或子目标结构,使其对当前策略更具信息量。改写后的 prompt 被重新注入训练池。动态 prompt pool 管理
采用异步架构维护动态 prompt 池:训练进程持续用当前策略更新 EPS;脚手架进程异步生成和替换低效用 prompt。训练分布随策略能力演进动态调整。
输出
输出为适配当前策略能力的 自适应训练 prompt 分布,直接用于 GRPO 等在线 RL 优化。
与同类方法差异
区别于直接丢弃低效用样本或均匀采样,本方法将 teacher 监督定位为 训练数据精炼 而非输出模仿,通过改写而非过滤保持任务覆盖,从而提升 RL 后训练效率。
实验
实验设计
方法在 Geo3K 和 MMK12 两个多模态推理数据集上,与 GRPO 在线强化学习后训练集成。训练过程中动态调整提示分布,利用 EPS 选择高潜力提示,并用 teacher 模型生成 scaffolded rewrites 优化低潜力提示。评估涵盖域内(Geo3K/MMK12)和分布外基准(MathVision、MMMU-Pro)。
关键发现
- EPS 提示效用信号有效:高 EPS 提示产生更好的训练结果,而近零 EPS 提示会降低训练效率,说明提示效用并非二元,应动态筛选而非简单丢弃。
- Scaffolded prompt refresh 有效:对低效用提示进行 teacher 引导的改写,保留原始意图的同时提升后续训练信息量,显著提升最终策略性能。
与基线对比深度解读
与标准 GRPO 基线相比,本方法在域内相对提升最高 9.7%,在分布外基准 MathVision 和 MMMU-Pro 上分别提升 11.5% 和 11.1%。这表明动态提示脚手架不仅提升域内性能,更强化了模型泛化能力,且额外开销极小(EPS 仅依赖 rollout 统计)。相比简单丢弃低效用提示或固定提示分布,该方法实现了更高效的样本利用。
行业影响
落地场景
该方法适用于任何对 多模态大模型(MLLM) 做在线 RL 后训练的业务,如视觉推理、数学解题、科学问答、图像理解等。典型场景包括云服务商的模型训练平台、企业内部模型迭代管线,以及需要持续更新能力的对话助手。尤其在 prompt 集规模大、标注成本高、可用 rollout 预算受限时,EPS 能直接提升训练效率。
商业价值
- 降本:EPS 动态识别低效用 prompt 并调整抽样权重,避免均匀分配 rollout 预算,显著降低训练 token 消耗与 GPU 时;teacher 重写保留任务意图,无需额外标注。
- 增收/体验:实验显示 OOD 基准 MathVision +11.5%、MMMU-Pro +11.1%,模型泛化能力更强,可提升用户对复杂多模态任务的满意度和付费意愿。
- 迭代提速:训练周期缩短,模型可更快上线或更新。
与现有产品/工作流接口
EPS 计算基于 on-policy rollout 统计,轻量且无额外前向开销,可无缝集成进现有 GRPO/PPO 训练循环,作为 TRL / OpenRLHF / VeRL 等框架的插件。Teacher 模型可复用已有强模型(如 GPT-4V、Qwen-VL-Max)生成 scaffolded rewrites,输出为可直接合并的 prompt pool(如 jsonl)。集成只需在训练循环中加入 EPS 计算与 prompt 更新模块即可。
具体落地用例:
- 电商多模态客服/商品问答:用户上传商品图片询问属性,训练集中大量简单提示已饱和。EPS 识别后由 teacher 改写为更细粒度或组合查询(如“比较两款商品的材质与适用场景”),提升复杂商品推理能力,减少人工客服转接。
- 在线教育解题:几何/三角函数题 prompt 训练中,部分题型模型已过拟合。EPS 标记低潜力后,teacher 生成变体(增加干扰信息或多步推理),使模型在真实学生交互中更稳健,提升解题准确率和用户体验。
局限
- 论文承认的局限:EPS 的理论推导基于 KL 正则化策略改进,假设了特定的分布形式,在实际复杂策略下可能不精确;同时,教师引导的脚手架重写虽然旨在保留任务意图,但可能引入语义漂移,尤其在开放式任务中,重写后的提示可能改变原始难度分布,影响训练稳定性。此外,实验仅在两个数据集(Geo3K, MMK12)上验证,覆盖任务类型有限,跨领域泛化性有待进一步检验。
- 可推断的局限:方法依赖额外的教师模型进行脚手架生成,虽然声称轻量级,但实际部署时仍增加计算和存储开销,特别是当教师模型本身规模较大时,可能抵消部分训练效率收益。同时,动态提示池管理引入额外超参数(如池大小、刷新频率、选择阈值),这些参数对最终性能敏感,论文未提供系统的敏感性分析,实际调参成本较高。
- 与同类工作对比:与已有的课程学习(curriculum learning)、主动学习(active learning)或提示选择方法相比,该方法主要针对多模态 RL post-training 场景,且仅与 GRPO 集成,未与其他主流 RL 算法(如 PPO、REINFORCE)对比,限制了其在更广泛 RL 框架下的适用性证据。此外,对于纯文本 LLM 的 RL 训练,该方法的迁移性尚未验证。