行业新闻

美团技术团队顶会论文分享:搜索推荐ASX专场 | 美团

美团技术团队顶会论文分享:搜索推荐ASX专场 | 美团

正文摘录

![美团技术团队顶会论文分享:搜索推荐 ASX 专场](https://p0.meituan.net/meituantechblog/324af03d23fb20dbce75795e103d8f6f232410.jpg) 美团技术团队顶会论文分享:搜索推荐 ASX 专场 美团技术团队 2026-06-18 算法 大模型 论文解读 美团业务研发平台 / 搜推 ASX (Agentic System X) 团队聚焦构建大模型为基础的 Agent 技术体系,在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕,已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了 6 篇进行解读,希望对大家有所帮助或启发。 01 Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards 上下文轨迹老虎机:面向可验证奖励的强化学习 论文下载:[PDF](https://arxiv.org/abs/2602.08499) ![](https://p1.meituan.net/meituantechblog/b59c0ffafdeba4539136582e0271b740362659.png) 论文简介 :现有基于规则奖励的强化学习后训练通常直接使用最近一轮 rollout 进行策略优化,其中,低质量样本会引入噪声,高质量样本又常在单次使用后被丢弃,导致训练不稳定、样本利用不足。本文提出在线样本调度算法 CBS,将样本选择建模为上下文多臂老虎机问题,把每个候选样本视为 arm,并以训练后带来的性能增益作为奖励;通过轻量神经网络预测样本价值,并结合在线反馈动态调度。

阅读原文(tech.meituan.com)→

行业新闻2026-06-18原文

相关内容