论文

PaperGym: 以 Rubric 为中心的科研计划生成进化框架

PaperGym: 以 Rubric 为中心的科研计划生成进化框架

科研计划制定是 AI 科学家的决定性能力,然而科研计划没有可验证的答案,这使得强化学习缺乏所需的环境——即任务与评判器配对。从科研论文中提取的 rubric 可以充当评判器,但现有流程通常从同一内容中提取问题和标准,导致模型可通过复述获得奖励;同时 rubric 被压缩为每次采样的单个标量。 我们提出 PaperGym,一个将每篇论文转化为完整训练环境的统一框架。PaperGym 利用论文的结构:问题从研究目标和背景中合成,而标准则来自方法和实验部分。标准涵盖方法创新性和实验设计,标准泄漏率降至 3.7%,而现有数据集为 11.90% 至 34.10%。 训练过程中 rubric 被使用两次:先作为 OPSD 自教学模型的特权上下文,再作为 GRPO 的奖励信号。在 Qwen3-1.7B/4B/8B 上,该调度方式优于纯监督微调、单独任一阶段以及反向顺序,五个基准平均分分别提升 +5.6、+5.0、+4.8 分。在固定配方下,基于 PaperGym-20k 训练的模型在三方比较中胜率为 58.1%,而 RubricHub Science 为 28.2%。训练后的 Qwen3-8B 在 ResearchQA 上达到 73.48,超过参数量更大的 Kimi K2.6。 我们已发布完整流程、包含 20,000 个样本的语料库 PaperGym-20k,以及基准 PaperGym-Innov 和 PaperGym-Design。

论文精读

TL;DR PaperGym 把论文拆成独立的问题与评分准则,用 rubrics 作为 RL 奖励训练研究规划,超越 SFT 与更大模型,泄露率降至 3.7%。

问题

问题背景

AI 科学家自动化研究规划是当前热点,但研究计划没有可验证的标准答案,导致强化学习难以直接应用。

现有方法局限

  • 现有流水线从论文同一内容中同时提取任务与评分标准,模型可以通过改写原文获得奖励,造成 criterion leakage 高达 11.90%–34.10%。
  • 评分标准被压缩为单一标量,丢失了对方法创新性、实验设计等关键维度的细粒度反馈。
  • 监督微调依赖人工参考答案,但研究计划不存在唯一正确解,SFT 只能模仿形式,难以提升深层规划能力。

为什么这个问题困难且重要

研究规划的评价本身需要从论文中抽取可泛化的质量标准,同时要防止题目与标准重叠导致的奖励作弊。技术上必须在信息隔离与评分覆盖度之间取得平衡。业界对 AI Scientist 类系统投入大量资源,但规划模块常成为整个科学发现流程的瓶颈;若规划质量不改善,后续实验验证和论文生成的可信度都会受制约。

行业类比

类似代码生成中用单元测试作为奖励,但若测试用例直接从实现代码中提取,模型只需记忆测试即可通过——PaperGym 通过分离题目生成来源与评分标准来源,解决同类信号泄漏问题。

核心洞察

  • PaperGym 通过将研究问题与评价标准从论文不同结构中分离提取,解决了现有 RL 环境中奖励可被复述欺骗的问题。现有 pipeline 从同一内容抽取出问题和 rubric,导致 criterion leakage 高达 11.90%–34.10%,模型仅靠复述原文就能获得虚假高分。PaperGym 将问题从研究目标与背景合成,标准从方法与实验导出,leakage 降至 3.7%,保证了奖励信号的可靠性。对实际工程的启示:构建 RL 环境时,任务与评判器必须信息隔离,否则会引入捷径偏差。
  • PaperGym 将 rubric 在训练中两次使用:先作为 OPSD 的特权上下文生成自我教师,再作为 GRPO 的奖励信号,这种顺序设计是关键。相比监督微调、单独使用任一阶段或反向顺序,该调度在 Qwen3-1.7B/4B/8B 上分别提升 +5.6/+5.0/+4.8 平均分,且用固定配方训练的 PaperGym-20k 模型在三方对比中胜率达 58.1%,远超 RubricHub Science 的 28.2%。这揭示了先注入评价知识、再通过强化学习优化的训练 curriculum 能更稳定地提升研究规划能力。

方法

输入:结构化科学论文,提取四类信息——研究目标、背景、方法、实验。数据预处理阶段将论文拆解为独立内容块,避免问题与标准同源。

关键模块一:Rubric 生成与泄漏控制

  • 从研究目标和背景合成研究问题;从方法和实验派生评估标准。
  • 生成两类 rubrics:专用 rubrics(针对方法论创新)与通用 rubrics(针对实验设计合理性)。
  • 通过数据分析检测 criterion leakage,将问题与标准的词汇重叠率降至 3.7%,远低于现有数据集的 11.90%–34.10%。

关键模块二:Rubric-Conditioned OPSD
将 rubrics 作为特权上下文注入自教师模型,引导其生成高质量研究计划,用于监督式微调。特权信息仅在训练阶段可见,测试时不泄漏。

关键模块三:GRPO with Rubric-as-Rewards
将 rubrics 作为奖励信号,对生成的研究计划在方法论创新与实验设计两个维度分别打分,保留细粒度反馈而非压缩为单一标量;随后使用 GRPO(Group Relative Policy Optimization)进行策略优化。

输出:训练后的模型能根据给定研究问题生成结构化研究计划。与同类工作不同,PaperGym 通过问题与标准的结构分离,有效抑制了仅靠 paraphrase 获取奖励的捷径,且两阶段训练分别利用 rubrics 的监督信号与奖励信号,避免单阶段的信息损失。

实验

实验设计

PaperGym 将每篇论文构建为训练环境,通过分离问题与规则来源,使用 rubric 作为 OPSD self-teacher 特权上下文,再作为 GRPO 奖励。在 Qwen3-1.7B/4B/8B 上对比 SFT、单独阶段、反向顺序等策略,并在 ResearchQA、PaperGym-Innov、PaperGym-Design 等基准上评估;同时与 RubricHub Science 训练的模型进行三向对比。

关键发现

  • Criterion leakage 降至 3.7%,远低于现有数据集的 11.90%–34.10%,验证了问题与规则分离的有效性。
  • 两阶段训练(OPSD + GRPO)在五基准平均上比 SFT 提升 +5.6 / +5.0 / +4.8(对应 1.7B / 4B / 8B),优于单独阶段和反向顺序。
  • PaperGym-20k 训练的模型三向对比胜率 58.1%,显著高于 RubricHub Science 的 28.2%。
  • 8B 模型在 ResearchQA 上达到 73.48,超过更大的 Kimi K2.6。

基线对比解读

与现有 rubric 数据集不同,PaperGym 通过结构分离避免 paraphrase 奖励漏洞,criterion leakage 指标直接反映了这一改进。两阶段设计先用 rubric 作特权上下文训练 self-teacher,再作 GRPO 奖励,避免了 GRPO 冷启动不稳定,形成 widen-then-narrow 的熵课程。这解释了该 schedule 优于单独阶段或反向顺序的原因,也表明 RL 训练中奖励信号的质量与使用顺序同等重要。

行业影响

落地场景

PaperGym 构建的 RL 环境可直接训练研究规划类模型,典型产品包括:

  • 企业级 AI 研发助手:输入技术挑战或产品需求,输出带评价标准的研究方案(方法创新 + 实验设计),辅助 R&D 团队快速筛选方向。
  • 文献驱动实验设计工具:在生物医药、材料科学领域,从论文中提取 methodology 和 experiments 作为 rubric,生成可验证的实验计划。
  • 教育科技:训练模型为学生提供研究提案撰写与评估,形成闭环反馈。

商业价值

  • 降本:减少资深研究员在前期规划上的时间,自动化生成初稿,降低试错成本。
  • 增收/加速迭代:缩短从 idea 到实验验证的周期,提升研发管线吞吐量。
  • 质量提升:criterion leakage 仅 3.7%,相比现有数据集更低的 reward hacking,训练出的模型在 ResearchQA 等基准上表现更强,可转化为更可信的自动评审能力。

与现有产品/工作流接口

  • 训练框架集成:将 PaperGym 数据集与现有 RLHF/GRPO pipeline 结合,替换 reward model 为 rubric-based scoring,无需额外人工标注。
  • 模型底座适配:已验证 Qwen3-1.7B/4B/8B,可快速迁移至开源或闭源模型。
  • 评估闭环:提供的 benchmarks(PaperGym-Innov, PaperGym-Design)可用于持续回归测试,监控模型研究规划能力。

具体 use case:电商平台的推荐算法团队可接入 PaperGym 训练的模型,输入“提升长尾商品曝光”的业务目标,自动生成包含特征构造和离线/在线实验设计的候选方案;企业服务软件(如 Notion AI)可嵌入“研究提案生成”模块,帮助客户快速产出技术调研报告。

局限

  • 论文所构造的 **PaperGym-20k** 数据集仅来源于 `cs.CL` 类别的 arXiv 论文,其知识提取与 rubric 生成流程高度依赖计算语言学论文的固定结构(如 method/experiments 分段)。对于其他学科(如生物、物理、社会科学)论文,章节组织与论证方式差异较大,可能导致 rubric 质量下降或问题-标准分离失效。因此该框架的跨领域泛化能力尚未验证,实际应用时需要额外适配。
  • 训练流程包含 **rubric-conditioned OPSD** 与 **GRPO with rubric-as-rewards** 两个阶段,且第一阶段将 rubric 作为特权上下文提供给自教师,但推理阶段模型无法访问对应 rubric,造成训练与推理条件不一致。这种不一致可能削弱模型在真实研究规划任务中的表现,并且两阶段训练显著增加了工程复杂度与算力开销,限制了其在资源受限场景下的应用。
  • 尽管论文提出了 `criterion leakage` 指标并展示了在 ResearchQA 等基准上的提升,但研究计划的评价本质上具有主观性与开放性,自动评估(如 win rate、QA 分数)难以全面衡量研究方案的创新性、可行性与长期影响力。与 RubricHub Science 的对比仅采用三方比较,样本量与评判协议可能存在偏差,需要更广泛的人工评估与跨任务验证。
论文Yuhan Wang2026-08-31原文

相关内容