美团履约团队五篇ACL论文聚焦强化学习与多模态交互
美团提出五项技术,分别解决大模型在RL训练、推理效率、用户模拟、记忆管理和实时交互中的关键瓶颈。
美团履约AI团队在ACL 2026发表五篇论文,涵盖RLVR专用低秩适配GeoRA、将推理过程建模为连续概率流的CoT-Flow、带推理能力的用户模拟器UserLM-R1、基于因果反馈对齐的记忆管理Fine-Mem,以及实现看听说想并行推理的全双工多模态模型DuplexOmni。
正文摘录
 ACL 2026 精选论文分享:美团履约团队前沿技术专场 美团技术团队 2026-06-11 算法 大模型 论文解读 团队介绍 美团业务研发平台 / 履约 AI 算法团队,聚焦构建大模型为基础的 Agent 技术体系,用 AI 赋能美团履约业务, 构建 Agent 自进化的运营系统。在大模型 CPT (Continual Pre-Training)、Post-training、Agentic RL (Agentic Reinforcement Learning) 以及多模态理解等核心前沿方向持续深耕,已在 ACL、EMNLP 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文分享了美团履约团队专场聚焦 ACL 会议论文以及前沿技术实践。 01 GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR 低秩高效:冻结残差分量,高效稠密计算 论文下载 :[PDF](https://arxiv.org/pdf/2601.09361)  论文简介 :基于可验证奖励的强化学习 (RLVR, Reinforcement Learning with Verifiable Rewards) 是提升大规模推理模型能力的关键范式。