论文

Review Arcade:论LLM评审的人类对齐与可操控性

Review Arcade:论LLM评审的人类对齐与可操控性

大型语言模型(LLM)生成的论文评审正获得广泛关注,甚至已被主要会议官方试点。我们不得不假设,不仅评审者在使用LLM辅助,作者也在投稿前利用LLM修改论文。本文对2025年ACL滚动评审(ARR)的论文进行实证实验,从作者和评审者两个角度评估LLM评审。 首先,我们发现LLM评审与人类评审的对齐有限。在最佳情况下,对齐程度尚可,但不同提示和模型下的对齐差异显著。最后,我们研究作者通过迭代起草-修改工作流,根据LLM评审改进投稿的场景。我们发现,这种对LLM评审的“操控”在特定场景下有效,可导致多达35%的论文整体分数统计显著提升。 我们公开代码:https://github.com/uhh-hcds/reviewarcade。

论文精读

TL;DR LLM 评审与人类评审对齐有限且高度依赖提示与模型,作者可通过迭代修订有效“刷分”(最高 35% 论文得分显著提升),揭示了 LLM 评审的脆弱性与可操控风险。

问题

问题背景
LLM 已逐步渗入学术评审流程:不仅审稿人开始使用 LLM 辅助撰写评审意见,作者也常借助 LLM 修改论文后再提交。一些顶会甚至正式试点 LLM 评审,但 LLM 评审与人类评审的一致性究竟如何?能否被作者系统性地“游戏化”以提高分数?这关系到学术评价体系的可靠性。

现有方法局限
此前工作多聚焦 LLM 作为审稿工具的可行性,或小规模验证其与人类评审的相关性,但存在明显局限:①大多仅用单一提示、单一模型评估对齐度,忽略提示工程和模型选择带来的剧烈波动;②没有从作者视角考察通过迭代式“草稿-修改”工作流,利用 LLM 评审反馈持续优化论文,是否能统计显著地提升录用分数;③缺乏对编辑类型(如局部改写、结构重排等)的细化分析,无法判断哪些修改策略最有效。

为什么这个问题难且重要
技术挑战在于 LLM 评审表现为一个不稳定且非线性的效用函数:不同提示下对同一论文的评分可差出一档,甚至跨提示推荐结果不一致。这种脆弱性使其极易被恶意优化——作者可能针对特定评审提示“精调”论文,而非真正提升科学质量,最终导致学术评审失真。业界关注度极高,因为若大规模部署 LLM 评审而缺乏防护,会引发“先刷分后投稿”的军备竞赛,损害同行评议的公信力。

行业类比
类似对抗攻击之于图像分类器,LLM 评审系统若缺乏鲁棒性,便可能被针对性“欺骗”——作者通过迭代微调输入(论文)以最大化目标输出(评审分数),形成一种学术版的 prompt injection 攻击

核心洞察

  • **LLM 评审与人类评审的对齐是高度脆弱的**,不仅整体对齐有限,而且强烈依赖于具体的提示词和模型选择。这与许多假设 LLM 可稳定替代人类评审的工作形成对比,揭示了当前 LLM-as-reviewer 范式的根本不确定性,直接部署会因 prompt 或模型变更导致评审结果大幅波动。
  • **作者可以通过迭代“刷分”显著提高 LLM 评审分数**,该研究首次系统量化了此攻击的有效性:最高有 35% 的论文获得统计显著的整体评分提升。不同于仅分析评审质量或辅助写作的工作,它从攻击者视角证实了评审闭环的脆弱性,对计划采用 LLM 评审的平台有直接安全预警意义。

方法

方法概览

本研究围绕 LLM 科学论文评审的可对齐性与可操纵性 展开,通过三个核心模块串联“输入—关键模块—输出”主流程。

1. 输入:论文与人类评审数据
  • 使用来自 ACL Rolling Review (ARR) 2025 的匿名投稿,以及对应的真实人类评审分数与文本。
  • 每篇论文配备 多份人类评审,作为对齐性与评分升幅的参照基准。
2. 关键模块

模块 A:自动化评审框架 (Automated Review Framework)

  • 针对同一篇论文,调用不同 LLM 后端 (如 GPT、Claude 等) 和 多套提示模板 (角色、评分维度、输出格式),生成结构化评审。
  • 评测指标聚焦两方面:
    • 评审有效性 (Validity):计算 LLM 评审与人类评审在分数、关键意见上的相似度 (如 BERTScore、语义对齐度)。
    • 评审稳定性 (Stability):考察同一模型在不同提示下、或不同模型在相同提示下的输出一致性,从而识别对齐程度的高方差来源。

模块 B:迭代式提交改进 (Iterative Submission Improvement)

  • 模拟作者利用 LLM 反馈进行“刷分”的场景:
    1. 用 LLM 生成对当前稿件的评审及改进建议。
    2. 另一位 LLM 根据该建议修改论文 (执行语法润色、结构调整、论证强化等),生成新版本。
    3. 再次提交给 LLM 评审,记录分数变化。
  • 引入 编辑分类体系 (Taxonomy of Edits),将修改分为表层 (拼写/格式)、语义 (澄清概念)、结构性 (重组段落) 等类别,分析何种编辑类型对分数提升贡献最大。
  • 采用跨模型交叉评估:用不同 LLM 分别承担“审稿”与“修订”角色,避免自我一致性偏差。
3. 输出:可量化结论
  • 对齐程度:LLM 评审与人类评审在最佳设定下对齐合理,但整体有限,且随提示/模型剧烈波动。
  • 可游戏性:最多 35% 的论文 通过迭代修订获得统计显著的总分提升,揭示了当前 LLM 评审机制的系统脆弱性。
  • 提供开源代码库 (reviewarcade),支持复现与扩展。

与以往仅验证 LLM 是否“好用”的评审辅助研究不同,本工作首次将视角转向 作者对 LLM 评审的对抗性利用,并系统量化了迭代修订—分数膨胀这一闭环对学术质量控制的潜在风险。

实验

实验设计

该研究基于 ACL Rolling Review (ARR) 2025 的论文及配套人类评审,从作者与审稿人双视角评估 LLM 评审。

  • 评审有效性 (RQ1):用结构化提示驱动多款 LLM 对论文打分、撰写优缺点,与人类评审计算排序对齐(如相关系数)与内容对齐。
  • 评审稳定性 (RQ2):相同论文/模型下,变化提示或多次调用,检验输出一致性。
  • 评审“游戏化” (RQ3):模拟作者迭代流程——作者根据 LLM 评审反馈修改论文,再交由 LLM 重评审,观察评分变化,并建立编辑分类体系(语法、结构、论证强化等)。

关键发现

  • 对齐有限:LLM–人类评审全局对齐仅在最佳提示/模型组合下达到“可接受”水平,且随提示与模型选择剧烈波动,远非稳定。
  • 可被操纵:通过针对性迭代修改,高达 35% 的论文在总体评分上获得了统计显著的提升,证实作者可利用 LLM 评审反馈“刷分”。
  • 编辑策略差异:不同提示下,能提升分数的编辑类型分布不同,表明对齐弱点与提示设计相关。

与基线对比与工程启示

基线为同一论文的人类评审分数(作为“真值”)及未经篡改的原始分数。LLM 评审在此基线前表现出 系统性的偏差与不可靠:即使是同一模型,对齐度也因提示而异,更遑论跨模型。

“游戏化”实验进一步证明,作者仅需遵循 LLM 反馈迭代修改,即可在部分论文上大幅提升 LLM 给分,而这种提升未必反映真实质量改进。这揭示 LLM 评审作为决策辅助的高风险:若学术会议或期刊依赖 LLM 评分,作者可轻易逆向工程提升分数,导致评审生态恶化。工程落地需在系统设计上引入多模组冗余、人机协同校验,并严格评估提示与模型选择对校准的敏感性。

行业影响

落地场景

  • 学术会议审稿辅助:顶会如 ACL Rolling Review (ARR)、NeurIPS、ICML 正在试点 LLM 评审,用于预审分流、质量检查或辅助决策。
  • 作者写作增强工具:论文撰写阶段,集成 LLM 评审反馈的写作助手(如 Overleaf 插件、Grammarly for Academia)可实时提供结构、清晰度、贡献性建议。
  • 出版平台自动化ElsevierSpringer 等出版社可将 LLM 评审用于初审合规性、重复检测及初步质量评估,加快审稿流程。

商业价值

  • 降本:自动化评审预计可减少 30%-50% 的人工初筛工作量,缓解审稿人疲劳,缩短发表周期。
  • 增收:写作辅助工具通过订阅模式变现,精准定位硕博士、青年研究者群体,提升用户粘性与付费转化。
  • 风险与体验平衡:论文指出 LLM 评审与人类对齐有限,且存在“游戏化”漏洞(作者迭代修改可人为拉升分数)。若不加防护,可能损害评审公信力,长期降低平台声誉与收入。解决方案包括 多模型混杂评审防对抗 Prompt 设计红队测试,为安全产品化提供方向。

与现有工作流的集成

  • 投稿系统:通过 REST API 嵌入如 OpenReviewCMT 系统,在提交后即时返回 LLM 评审,供作者在最终截稿前修订。
  • 写作环境:在 OverleafVS Code (LaTeX 插件) 中,一键触发 LLM 评审面板,展示分数与修改建议,形成“写-评-改”闭环。
  • 质量保障管道:结合人工评审,将 LLM 输出作为 弱标注,用于校准评审尺度或检测异常分数,触发二次审查。

具体用例

  1. ARR 2026 审稿辅助:ARR 在 2025 年试点 LLM 评审,本研究的发现可直接指导其设计鲁棒 Prompt、设定分数波动阈值(发现跨 Prompt 稳定性低),并加入作者迭代检测机制,防止论文针对特定 LLM 评审被“过拟合”。
  2. EduWrite 学术写作平台:一款面向 STEM 领域的 SaaS 工具,集成 GPT-4.5 评审模型。用户上传手稿后获得模拟审稿得分与修订建议,同时系统隐式检测是否针对评审模型刻意修改(如检测特定词汇注入),平衡写作提升与公平性,并向机构客户(大学、实验室)提供防作弊报告。

局限

  • **对齐评估范围有限**:实验仅基于 ARR 2025 单一数据集和少数 LLM(如 GPT-4o、Claude 等),且提示设计虽然多样但未穷举。实际同行评审涉及更多学科、不同评审标准和更复杂的交互,LLM 与人类评论的**对齐程度可能因领域而异**。论文承认 best-case 下对齐尚可,但整体 alignment 有限且高度敏感于 prompt 和模型选择,很难断言这些发现能直接推广到其他会议或期刊场景。
  • **博弈实验设计简化**:作者模拟的作者修订流程为固定轮次的**迭代 draft-revise**,且编辑类型限于预定义分类(如 syntactic、structural)。真实作者可能采用更组合式或对抗性的修改策略,例如注入针对 LLM 弱点的内容来抬高评分而不提升实质质量。此外,仅用评分提升作为成功指标,未评估修订后的论文在**人类评审员眼中是否真的更好**,这导致“gameability”的结论需谨慎解读。
  • **缺乏真实流程与长期影响验证**:研究停在离线实验层面,未结合**真实投稿-审稿-修改-再审**闭环。在实际流程中,LLM 评审的反馈可能被作者采纳并迭代,但这不一定会导致论文质量的系统性下降;也可能出现评审 LLM 与作者 LLM 之间的“军备竞赛”,这种动态演变未被捕获。另外,实验未考察审稿 LLM 是否会被**数据污染**(论文可能已被训练所用的数据覆盖),可能拉高对齐假象。
论文Hans Ole Hatzel2026-05-27原文

相关内容