行业新闻

美团联合北大提出 GeoRA:针对 RLVR 几何特性的低秩适配方法获 ACL 2026 杰出论文

GeoRA 是首个针对 RLVR 优化几何设计的 LoRA 变体,解决了现有低秩方法在强化学习阶段的失配问题,并在多项任务上取得更好效果。

RLVR(基于奖励的强化学习,通过奖励信号引导模型提升推理能力)与传统的 SFT(监督微调,用标注数据训练模型)在优化几何上本质不同:前者的有效更新分散在稀疏子空间,且避开预训练权重的主方向。美团和北大提出的 GeoRA 先定位这些稀疏更新区域,再用 SVD(奇异值分解)压缩为低秩适配器,在数学、医学、代码任务上优于现有 LoRA 方法,并入选 ACL 2026 杰出论文。

正文摘录

![GeoRA: 为RLVR设计的LoRA——ACL 2026杰出论文解析](https://p0.meituan.net/meituantechblog/dd1b7bc8ac3a7f1acaac41c8ede7e469755348.jpg) GeoRA: 为RLVR设计的LoRA——ACL 2026杰出论文解析 履约平台 2026-08-27 顶会论文 大模型 ACL(Annual Meeting of the Association for Computational Linguistics)是计算语言学和自然语言处理(NLP)领域的国际顶级学术会议,是 CCF-A 类会议,也是中国计算机学会推荐的自然语言处理方向最高等级国际学术会议。ACL 2026 杰出论文奖(Outstanding Paper)在圣地亚哥揭晓,全球共 18 篇入选,美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》就是其中之一。 - 论文下载:[GeoRA:Geometry-Aware Low-Rank Adaptation for RLVR](https://aclanthology.org/2026.acl-long.1110/) - 讲解视频:[ACL2026 杰出论文分享(受智源社区邀请)](https://weixin.qq.com/sph/A0tqJo3kVz) RLVR 已经成为提升大模型推理能力的关键范式,但它的训练开销较高,于是一个自然的技术就是用 LoRA 这类参数高效微调方法来做 RLVR。但是,LoRA 及其变体几乎都是在 SFT 场景下建立并验证的。

阅读原文(tech.meituan.com)→

行业新闻2026-08-27原文

相关内容