行业新闻

华科大提出LLM校准层,统一顶会审稿评分尺度

华科大提出LLM校准层,统一顶会审稿评分尺度

用LLM分析评语生成参考分数,减少人为评分尺度差异,提升顶会评审公平性。

AI顶会投稿量激增,审稿人评分尺度差异越来越大,同一评语可能对应悬殊分数。华科大团队没有让LLM直接审稿,而是在现有流程后加一层校准模块:用LLM分析审稿评语生成一个锚点分数,与实际评分对比,偏差过大则触发轻量复核。实验表明,校准后的论文排序与长期引用量的匹配度更高,边缘论文的筛选更合理。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg841d143714.png) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg3b253ef414-166.png) 21,575。 这是 NeurIPS 2025 收到的论文投稿数量。 与 2020 年相比,这一数字增长超过一倍。与此同时, ICLR 2026 投稿量也逼近 2 万篇 。AI 顶会热度持续走高,海量稿件涌入的背后,同行评审体系长期存在的痛点被无限放大。 不少投稿人都有同款困惑:两份措辞高度接近的审稿意见,最后给出的分数却能相差巨大。如今投一篇顶会论文,体验越来越像一场纯靠运气的「 抽卡游戏 」。 例如,两位审稿人都认为论文「缺少必要的消融实验」。其中一位认为只是需要补充实验,因此给出较高分;另一位则将其视为影响论文质量的关键问题,直接给出低分。 表面上,两人的意见高度一致,真正不同的是,他们对同一句评语对应着不同的评分尺度。 随着投稿规模不断扩大,这种评分尺度的不一致,正成为影响同行评审公平性和稳定性的重要因素 。 ![](https://aiera.com.cn/wp-content/uploads/2026/07/aieraimg8aade9fe07.png) 近日,来自华中科技大学的李钦宾研究团队在 ICML 2026 Position Paper Track 提出了一种新的解决思路: 不是让大语言模型替代人类审稿,而是利用 LLM 对「评语—分数」 之间的映射关系进行校准。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-07-20原文

相关内容