论文

ActReview:回复引导的训练数据与评分标准奖励,面向可操作的同行评审生成

ActReview:回复引导的训练数据与评分标准奖励,面向可操作的同行评审生成

随着 LLM 越来越多被用于投稿前自审,作者需要的反馈不仅要指出弱点,还要能引导具体的修改。我们把这一任务定义为 Actionable Peer-review Generation,并将其拆解为两个子任务:诊断性论点生成 与 修改建议生成。 我们提出 ActReview,一个以 rebuttal 为引导的后训练框架,把论文层面的诊断与具体、有据可依的修改方案连接起来。核心洞见是:作者的 rebuttal 揭示了回应审稿人关切的可行动作,因而能为面向修改的反馈提供潜在监督。基于 OpenReview 上真实的 review-rebuttal 线程,我们构建了 ActReview-40K:将审稿人指出的弱点与作者回应对齐,并把生成的反馈落地到论文的局部证据上。随后以多任务监督微调后接 GRPO 的方式对 Qwen3-8B-Base 进行后训练,奖励采用候选感知、弱点特定的 rubric 形式。 我们还提出 ActReview-Bench,一个由人工整理的 1,000 条实例基准,用于评估诊断质量与修改有用性。实验表明,ActReview 在可操作性与 grounding 上优于此前的专用评审生成模型,并与强 prompt-based LLM 保持竞争力。人工评估确认修改有用性提升,同时揭示技术准确性上仍存在差距;额外分析支持其对留出论文的泛化能力以及跨独立评审者的稳健性。

论文精读

TL;DR ActReview 利用作者 rebuttal 作为弱监督,从 OpenReview 构建 ActReview-40K,训练模型生成诊断与具体修改建议,并用 rubric rewards 强化可操作性与证据定位。

问题

问题背景:随着 LLM 在预提交自审(pre-submission self-review)中的应用增加,用户对 peer review 的需求从单纯识别弱点转向可操作的修改方案,即 Actionable Peer-review Generation,要求模型同时输出诊断性声明和具体修订建议。

现有方法局限:

  • 传统生成式 review 模型通常只关注诊断性评论(diagnostic claims),缺乏明确的 revision suggestions;
  • 基于 prompt 的 LLM 虽然能生成建议,但往往泛化、未与论文局部证据绑定,grounding 不足;
  • 训练数据稀缺:人工标注 actionable suggestions 成本高,而现有 review-rebuttal 数据中 reviewer 的弱点表述较抽象,作者 rebuttal 中隐含的解决方案(latent supervision)未被模型利用。

为什么这个问题难/重要:

  • 技术挑战:需从非结构化 review-rebuttal 对中提取作者回应作为隐式监督信号,并将其转化为与论文具体段落对齐的修订计划;同时设计合理的奖励信号,因为 actionability 和 grounding 难以用单一自动指标衡量。
  • 工程价值:预提交自审工具需求上升,能输出具体修改建议的模型可显著提升作者迭代效率,但现有方法在技术准确性上仍有差距,存在误导风险。

行业类比:类似 IDE 中针对代码问题的自动修复建议(quick fix),但学术论文修订建议需要更深层的语义理解与证据定位。

核心洞察

  • 利用作者 rebuttal 作为改进反馈的隐式监督信号,从评审意见中提取弱点并与作者回应对齐,构建了 ActReview-40K 数据集。以往工作多依赖 LLM 直接生成审稿意见,关注点在于诊断问题,缺乏对“如何修改”的指引导向。而 rebuttal 天然包含作者针对评审关切所采取的具体行动,通过将弱点与 rebuttal 中的对应部分对齐,模型能够学习到从诊断到修改建议的映射,使生成的反馈更具可操作性与论文证据支撑,这一数据构建角度在同类工作中较为独特。
  • 将可行动审稿生成分解为诊断声明生成与修改建议生成两个子任务,并采用多任务监督微调结合 GRPO 与候选感知的弱点特定 rubric 奖励进行后训练。对于开放性文本生成任务,现有强化学习方法难以定义可靠的奖励信号;ActReview 设计针对每个具体弱点的 rubric(如是否包含具体修改步骤、是否引用局部证据)作为奖励,并在评分时考虑候选集合而非单一输出,缓解了奖励作弊与偏好偏差,相比仅用提示工程的大模型或专门审稿模型,更有效地提升了行动性与 grounding 表现。

方法

输入与问题定义

ActReview 将可操作同行评审生成分解为两个子任务:诊断声明生成 (diagnostic claim generation) 与修订建议生成 (revision suggestion generation),输入为论文原文、评审中识别的弱点 (weakness) 以及定位的证据片段。模型需要先给出具体诊断,再输出可执行的修订计划。

关键模块

  1. 数据构建 ActReview-40K:从 OpenReview 真实评审-反驳 (review-rebuttal) 线程出发,通过自动发现弱点分类体系,将评审中的弱点段落与作者回应进行跨度对齐。利用作者回应中的“可行动作”作为隐式监督,反向增强初始评审,生成包含诊断与修订建议的训练样例。同时结合 PDF 分块、任务特定查询的局部证据检索,保证输出与原文位置关联。

  2. 多任务 SFT:在 Qwen3-8B-Base 上以多任务监督微调同时学习两个子任务,建立基础生成能力。

  3. 基于 Rubric 的 GRPO:构建候选感知、弱点特定的评分准则,将模型生成的候选答案分别按诊断质量、修订有用性、证据定位等维度打分,作为强化学习的奖励信号。GRPO 利用该奖励直接优化生成策略。

输出

模型最终输出结构化的诊断声明和修订建议,且建议附带论文内证据位置。

与同类方法的差异:不同于此前仅依赖评审文本或人工重写作为监督,ActReview 首次系统利用作者反驳作为修订方向的隐式监督,使生成反馈真正指向可操作的修改。

实验

实验设计

模型 Qwen3-8B-Base 在 ActReview-40K 数据集上先进行多任务监督微调(覆盖诊断声明生成与修订建议生成),再使用 GRPO 强化学习,奖励函数采用候选感知、按弱点类型定制的 rubric 评分。评测在人工筛选的 ActReview-Bench(1000 实例)上进行,结合自动指标与人工评估,基线包括先前专用审稿生成模型与强提示基 LLM,并额外进行消融、泛化与跨评判者可靠性分析。

关键发现

  • 可操作性与证据扎实度:ActReview 在 actionability 和 grounding 上显著超越先前专用审稿生成模型,与强提示基 LLM 表现相当。
  • 人类评估:修订建议有用性提升,但技术准确性仍存在差距,说明模型生成的某些诊断或建议可能在事实层面不够严谨。
  • 泛化能力:在未见过的论文上表现稳定,且不同独立评判者间结果一致,表明方法具有一定鲁棒性。

与基线对比解读

核心优势来自 rebuttal 引导的潜在监督信号与 rubric 奖励设计:作者反驳天然揭示了可执行的修改方向,使模型不仅能指出问题,还能给出具体、有依据的修订计划。相比专用模型,ActReview 在反馈粒度与可操作性上更优;相比提示基 LLM,它用 8B 参数达到相近水平,且输出更可控。但技术准确性仍弱于部分强提示基模型,提示在强化可操作性时需平衡事实核查与知识一致性,未来可结合外部知识或引用验证进一步校准。

行业影响

落地场景

ActReview 可用于论文预审工具、内容平台审核、教育项目评价,以及企业内部技术报告预检。核心价值是借助 rebuttal 数据实现弱监督下可执行反馈,提供带原文定位的诊断与修改建议。

  • 内容平台:自动审核技术博文,针对“缺实验对比”“论证不完整”给出具体修改位置。
  • 教育场景:MOOC 项目报告自动反馈,助教只复核。

商业价值

  • 降本:减少编辑/导师初筛耗时,人工聚焦最终裁定。
  • 体验:作者获得即时可追溯建议,缩短修订周期,提升工具留存与转化。
  • 差异化:作为“提交前自检”功能,增加 SaaS 写作/知识管理产品竞争力。

与现有工作流接口

以 Qwen3-8B-Base 权重为基础,可私有化 API 或插件集成。流程:PDF 解析 + chunk 检索 → 输入 review-rebuttal → 输出诊断+建议 → LLM-as-a-Judge 复核 → 自动建 issue。可嵌入 Overleaf/VS Code 插件、CI 评审流水线或文档质量门禁。

局限

  • 技术准确性仍有差距。论文在人类评估中发现,ActReview 生成的诊断声明和修订建议在技术准确性上仍逊于人类专家或强提示词 LLM。模型可能错误归因弱点或提出不合理的修改方案,尤其对于复杂论文的深层问题。这限制了其在真实同行评审中的可信度,因为错误建议可能误导作者。论文未深入分析错误模式,也未给出量化准确度的明确指标,仅依赖人类评估的主观判断。
  • 数据来源和领域泛化受限。ActReview-40K 主要来自 OpenReview 上的计算机科学论文,尤其是机器学习相关领域,可能缺乏对其他学科(如生物医学、物理)的覆盖。不同领域的评审风格和弱点类型差异较大,模型在这些领域的表现可能下降。此外,作者反驳的质量参差不齐,部分反驳可能不完整或未真实反映作者行动,引入噪声。论文虽进行了 held-out papers 的泛化测试,但未评估跨领域性能。
  • 评估体系对可操作性的度量仍不完善。论文使用 claim count、specificity score、suggestion similarity 等自动指标,并引入 example-specific rubric score,但这些指标可能无法完全捕捉真实的修订有用性。例如 suggestion similarity 基于与参考建议的文本相似度,可能奖励与人工注释的相似性而非创新性;rubric score 的构建依赖候选感知,可能偏向模型自身生成的候选。人类评估虽然更可靠,但样本量有限(1000 实例中部分),且评分者间一致性未充分报告。这可能导致对模型优势的过高估计。
论文Yiling Ma2026-09-08原文

相关内容