论文

并非所有 Prompt 都相同:面向多模态强化学习后训练的探索引导式 Prompt 脚手架

并非所有 Prompt 都相同:面向多模态强化学习后训练的探索引导式 Prompt 脚手架

在 online reinforcement learning (RL) 中,训练 prompt 对当前策略的信息量差异显著:部分 prompt 已趋于饱和,另一些则难度过高、难以提供可靠的学习信号;但在标准训练流程下,二者获得的 rollout 预算完全相同。 为此,我们提出 exploration-guided prompt scaffolding 框架,在 MLLMs 的 RL 后训练过程中动态调整训练 prompt 的分布。其核心是 Exploration Potential Score (EPS)——一种轻量的、基于 rollout 的 prompt 效用代理指标,由 KL-regularized policy improvement 理论导出,可直接从 on-policy rollout 统计量计算,不引入额外开销。 与直接丢弃低效用 prompt 不同,我们使用 teacher model 生成 scaffolded rewrites,在保留原始任务意图的同时让后续训练更具信息量,从而将 teacher supervision 重新定义为训练数据精炼,而非输出模仿。 在 Geo3K 与 MMK12 上结合 GRPO 后,该方法在 in-domain 与 out-of-distribution 基准上均稳定优于 baseline:域内相对提升最高达 9.7%,并在 MathVision 上取得 11.5%、在 MMMU-Pro 上取得 11.1% 的增益。

论文精读

TL;DR 多模态 RL 后训练中,不同 prompt 对当前策略的信息量差异巨大;本文用 Exploration Potential Score (EPS) 动态筛选低效用提示,并由教师模型重写为更有探索价值的 scaffolded prompt,在 Geo3K/MMK12 上最高相对提升 9.7%,OOD 基准 MathVision 提升 11.5%。

问题

问题背景

在线强化学习(RL)微调多模态大语言模型(MLLM)正成为提升推理能力的主流路径,但训练提示(prompt)对当前策略的信息量差异极大:部分已饱和,部分过难导致噪声梯度。

现有方法局限

标准 GRPO 等算法对每个 prompt 分配相同 rollout 预算,未考虑其动态效用:

  • 固定均匀采样 忽略 prompt 难度与模型当前能力的匹配,导致计算浪费在低信息量样本上。
  • 基于先验难度的课程学习 需要额外标注或启发式规则,且难以适应策略在训练中的能力变化。
  • 现有 prompt 重写工作多针对推理时增强或数据扩增,未将其作为 RL 训练中的动态课程机制,也缺乏低成本、在策略(on-policy)的效用评估指标。

为什么这个问题难且重要

RL 训练的单次 rollout 成本高,低效 prompt 会显著拖慢收敛并浪费算力。设计一个能实时反映 prompt 信息增益的代理指标,且不增加额外前向/后向开销,是技术关键。作者从 KL 正则化策略改进理论推导出 Exploration Potential Score(EPS),可直接从 on-policy rollout 统计量计算,为动态调整训练分布提供理论依据。同时,对低 EPS 的 prompt 采用教师模型进行 scaffolding 改写,保留任务意图但提升探索价值,避免直接丢弃造成的知识遗忘。

行业类比

类似主动学习中选择高不确定度样本来减少标注成本,EPS 相当于 RL 训练中的“sample utility oracle”,使计算资源自动分配给最具学习增益的 prompt。

核心洞察

  • EPS 将 prompt 效用从离散的难/易二元判断升级为连续、可测量的**探索潜力**,其推导自 KL 正则化策略改进理论,并可直接从 on-policy rollout 统计中零额外开销计算。与标准在线 RL 中对所有 prompt 分配相同 rollout 预算相比,EPS 能动态识别哪些 prompt 已经饱和、哪些过于困难,从而避免在无信息量的样本上浪费算力,使训练分布始终集中在能产生有效梯度信号的区间。
  • 低效用 prompt 不通过 rejection sampling 被丢弃,而是由教师模型生成 **scaffolded rewrites**,在保留原始任务意图的前提下重构 prompt,使后续训练重新变得信息丰富。这一做法把 teacher supervision 从输出模仿转向训练数据精炼,区别于 curriculum learning 只能全局调整难度、或数据增强不考虑当前策略状态,scaffolding 针对当前策略的薄弱 prompt 进行定向重写,让低效用数据持续贡献学习信号,而非简单排除。

方法

输入

方法输入为多模态大模型在线强化学习中的 训练 prompt 集(如 Geo3K、MMK12),每个 prompt 包含视觉输入与任务指令。

关键模块

  1. Exploration Potential Score (EPS) 计算
    对每个 prompt 执行 on-policy rollout 获取当前策略的采样轨迹,利用轨迹中的动作概率、奖励等统计量计算 EPS。该分数源自 KL 正则化策略改进理论,近似衡量该 prompt 在当前策略下通过探索还能获得的潜在改进,作为 prompt 效用的轻量代理,无额外模型前向开销。

  2. EPS 驱动的 prompt 选择与脚手架生成
    根据 EPS 识别低效用 prompt(过饱和或过难导致学习信号弱)。对这些 prompt,引入 teacher model 生成 scaffolded rewrites:保留原始任务意图,但调整表述或子目标结构,使其对当前策略更具信息量。改写后的 prompt 被重新注入训练池。

  3. 动态 prompt pool 管理
    采用异步架构维护动态 prompt 池:训练进程持续用当前策略更新 EPS;脚手架进程异步生成和替换低效用 prompt。训练分布随策略能力演进动态调整。

输出

输出为适配当前策略能力的 自适应训练 prompt 分布,直接用于 GRPO 等在线 RL 优化。

与同类方法差异

区别于直接丢弃低效用样本或均匀采样,本方法将 teacher 监督定位为 训练数据精炼 而非输出模仿,通过改写而非过滤保持任务覆盖,从而提升 RL 后训练效率。

实验

实验设计

方法在 Geo3K 和 MMK12 两个多模态推理数据集上,与 GRPO 在线强化学习后训练集成。训练过程中动态调整提示分布,利用 EPS 选择高潜力提示,并用 teacher 模型生成 scaffolded rewrites 优化低潜力提示。评估涵盖域内(Geo3K/MMK12)和分布外基准(MathVision、MMMU-Pro)。

关键发现

  • EPS 提示效用信号有效:高 EPS 提示产生更好的训练结果,而近零 EPS 提示会降低训练效率,说明提示效用并非二元,应动态筛选而非简单丢弃。
  • Scaffolded prompt refresh 有效:对低效用提示进行 teacher 引导的改写,保留原始意图的同时提升后续训练信息量,显著提升最终策略性能。

与基线对比深度解读

与标准 GRPO 基线相比,本方法在域内相对提升最高 9.7%,在分布外基准 MathVision 和 MMMU-Pro 上分别提升 11.5% 和 11.1%。这表明动态提示脚手架不仅提升域内性能,更强化了模型泛化能力,且额外开销极小(EPS 仅依赖 rollout 统计)。相比简单丢弃低效用提示或固定提示分布,该方法实现了更高效的样本利用。

行业影响

落地场景

该方法适用于任何对 多模态大模型(MLLM) 做在线 RL 后训练的业务,如视觉推理、数学解题、科学问答、图像理解等。典型场景包括云服务商的模型训练平台、企业内部模型迭代管线,以及需要持续更新能力的对话助手。尤其在 prompt 集规模大、标注成本高、可用 rollout 预算受限时,EPS 能直接提升训练效率。

商业价值

  • 降本:EPS 动态识别低效用 prompt 并调整抽样权重,避免均匀分配 rollout 预算,显著降低训练 token 消耗与 GPU 时;teacher 重写保留任务意图,无需额外标注。
  • 增收/体验:实验显示 OOD 基准 MathVision +11.5%、MMMU-Pro +11.1%,模型泛化能力更强,可提升用户对复杂多模态任务的满意度和付费意愿。
  • 迭代提速:训练周期缩短,模型可更快上线或更新。

与现有产品/工作流接口

EPS 计算基于 on-policy rollout 统计,轻量且无额外前向开销,可无缝集成进现有 GRPO/PPO 训练循环,作为 TRL / OpenRLHF / VeRL 等框架的插件。Teacher 模型可复用已有强模型(如 GPT-4V、Qwen-VL-Max)生成 scaffolded rewrites,输出为可直接合并的 prompt pool(如 jsonl)。集成只需在训练循环中加入 EPS 计算与 prompt 更新模块即可。

具体落地用例:

  1. 电商多模态客服/商品问答:用户上传商品图片询问属性,训练集中大量简单提示已饱和。EPS 识别后由 teacher 改写为更细粒度或组合查询(如“比较两款商品的材质与适用场景”),提升复杂商品推理能力,减少人工客服转接。
  2. 在线教育解题:几何/三角函数题 prompt 训练中,部分题型模型已过拟合。EPS 标记低潜力后,teacher 生成变体(增加干扰信息或多步推理),使模型在真实学生交互中更稳健,提升解题准确率和用户体验。

局限

  • 论文承认的局限:EPS 的理论推导基于 KL 正则化策略改进,假设了特定的分布形式,在实际复杂策略下可能不精确;同时,教师引导的脚手架重写虽然旨在保留任务意图,但可能引入语义漂移,尤其在开放式任务中,重写后的提示可能改变原始难度分布,影响训练稳定性。此外,实验仅在两个数据集(Geo3K, MMK12)上验证,覆盖任务类型有限,跨领域泛化性有待进一步检验。
  • 可推断的局限:方法依赖额外的教师模型进行脚手架生成,虽然声称轻量级,但实际部署时仍增加计算和存储开销,特别是当教师模型本身规模较大时,可能抵消部分训练效率收益。同时,动态提示池管理引入额外超参数(如池大小、刷新频率、选择阈值),这些参数对最终性能敏感,论文未提供系统的敏感性分析,实际调参成本较高。
  • 与同类工作对比:与已有的课程学习(curriculum learning)、主动学习(active learning)或提示选择方法相比,该方法主要针对多模态 RL post-training 场景,且仅与 GRPO 集成,未与其他主流 RL 算法(如 PPO、REINFORCE)对比,限制了其在更广泛 RL 框架下的适用性证据。此外,对于纯文本 LLM 的 RL 训练,该方法的迁移性尚未验证。
论文Yuanhao Yue2026-09-14原文

相关内容