论文

OneRank: 统一的多任务推荐 Transformer 原生排序架构

OneRank: 统一的多任务推荐 Transformer 原生排序架构

多任务学习 (Multi-task Learning, MTL) 在推荐系统中至关重要,能够实现不同用户反馈之间的互补学习。尽管现代工业实践已从 DNN 转向以 Transformer 为中心架构以增强序列建模与扩展能力,但现有方案仍将特征编码与多任务预测解耦,将 Transformer 视为任务无关编码器。这种设计从根本上限制了性能与可扩展性:(1) 在异构任务目标下形成信息瓶颈;(2) 引发梯度干扰导致跷跷板现象;(3) 迫使数据流转换,即基于注意力的上下文自适应表示学习转变为静态前馈任务预测,伴有不兼容的信息读写动态。 我们提出 OneRank,一种 Transformer 原生的多任务排序框架,消除编码器-预测器分离,引入 任务私有通道 用于前向表示学习与后向优化,从而实现任务专用学习并减少任务间干扰。在前向传播中,OneRank 通过任务条件信息选择、候选感知上下文化以及受控跨任务交互,自底向上学习任务特定表示。在后向传播中,跨任务梯度分离将任务私有参数更新与共享知识提取模块隔离,防止负迁移。进一步,我们以 动态匹配评分 替代静态任务特定 MLP 评分器,实现上下文感知的个性化排序。通过在 Transformer 栈内部化多任务推理,OneRank 建立了一个统一且可扩展的架构范式。在大型工业数据集上的离线与在线实验表明,OneRank 显著优于最先进基线,同时保持计算效率。

论文精读

TL;DR OneRank 将多任务学习完全融入 Transformer 内部,消除编码器-预测器分离,通过任务私有通道与梯度解耦缓解跷跷板效应,在工业级推荐排序上显著优于静态分离式方案。

问题

问题背景

推荐系统通过多任务学习(MTL)联合优化点击、转化、时长等异构反馈,已成为工业级排序模型的核心范式。当前架构演进趋势是从 DNN 转向 Transformer-centric 设计,以增强序列建模与规模化能力。

现有方法局限

主流工业方案仍将 Transformer 视为任务无关的特征编码器,与下游多任务预测头(通常为静态 MLP)解耦设计,这导致三个根本性瓶颈:

  • 信息瓶颈:异构任务目标被压缩进统一表示,迫使编码器在冲突信号间折中,损失任务特有信息。
  • 梯度干扰:共享编码器的反向传播引发任务间梯度冲突,导致“跷跷板现象”(seesaw phenomenon),即提升一任务指标会损害另一任务。
  • 数据流不兼容:上游的注意力机制具备上下文自适应读写能力,而下游 MLP 头是静态前馈结构,两者信息读写动力学不匹配,造成表达能力断层。

为什么这个问题难且重要

多任务排序的难点在于:不同任务所需特征、组合权重甚至时序依赖迥异,而统一编码器必须同时服务所有任务,这天然导致 负迁移。工业界每天处理数十亿用户行为,对模型缩放能力和在线服务效率有极致要求,传统解耦设计在线部署时还要额外解决训练-服务不一致问题(如静态 MLP 无法适应上下文变化)。因此,设计一个 原生支持多任务的 Transformer 统一架构,既减少干扰又维持计算效率,是业界紧迫的技术挑战。

行业类比

类似多模态大模型将文本、图像的编码与融合内建在统一 Transformer 中,而非外挂独立编码器——OneRank 将任务差异内化至 Transformer 堆栈,消除编码-预测断裂,实现端到端的任务专属推理。

核心洞察

  • - **Transformer-native 融合架构消除编码器-预测器分离**: OneRank 将多任务预测深度整合进 Transformer 内部,通过任务私有通道实现自底向上的任务特定表示学习,避免了传统方案中注意力编码到静态 MLP 塔的不兼容数据流转换。这从根本上缓解了异构任务目标下的信息瓶颈和梯度干扰,与现有仅把 Transformer 当作任务无关编码器的做法形成鲜明对比。
  • - **动态匹配评分弥合训练-服务偏差**: 用基于特征交互的动态匹配计算取代静态 MLP 任务塔,使模型能根据上下文信息进行个性化偏好预测。这解决了工业系统中因离线训练与在线服务寻主策略不一致导致的性能漂移,实现了真正的上下文感知排序,显著优于固定任务塔方案。

方法

输入与结构化分词

OneRank 以 用户、物品及候选集 的原始特征为输入,首先通过 Structured Tokenization 将异构特征组织成 Transformer 可处理的 token 序列。这一步并非简单拼接,而是为每个特征分配语义清晰的 token,并注入任务相关的位置或类型嵌入,为后续任务特定的建模奠定基础。

前向传播:任务私有通道与上下文感知

  • Task-Specific Encoding:在 Transformer 每一层中,通过 任务条件化的信息选择候选感知的上下文化(Candidate-Aware Contextualization),让不同任务从前一层共享表示中提取各自所需的信息,形成任务专用的隐表示。
  • 受控跨任务交互:引入轻量门控机制,仅在关键位置允许任务间交换互补信号,避免过度共享导致干扰。
  • 整个过程自底向上堆叠,最终每项任务都获得一个 上下文自适应、候选敏感的表示,彻底抛弃了先前将 Transformer 仅作通用编码器、再接入静态 MLP 预测头的做法。

多任务预测与梯度解耦

  • 动态匹配评分:放弃传统固定参数的 MLP 评分器,改用 用户-物品表示的内积或注意力匹配 计算任务得分,使排序更能捕捉实时 context 变化,缩小训练与服务的 gap。
  • 联合学习目标:各任务采用交叉熵等损失,加权求和。反向传播中,跨任务梯度分离(Cross-Task Gradient Detachment) 确保任务私有参数仅受自身 loss 影响,共享知识提取模块则接收聚合梯度,从结构上遏制负迁移和 seesaw 现象。

与同类方法的差异

OneRank 将多任务推理 完全内化于 Transformer 堆栈,消除了编码器-预测器鸿沟,用统一的注意力读写替代了“注意力编码→静态前馈解码”的不兼容数据流,在架构层面比 PLE、MMoE 等解耦方案更原生、更 scalable。

实验

实验设计

OneRank 在大规模工业推荐数据集上进行离线与在线评估。离线实验对比了多种主流多任务学习基线(如 MMoE、PLE、ESMM 及 Transformer 作为特征编码器再接 MLP 预测器的解耦架构)。评估指标涵盖各任务 AUC、分组 AUC 等。消融实验验证任务私有通道、梯度解耦、动态匹配打分等核心组件的贡献,并进行模型规模扩展性分析。在线 A/B 测试部署于真实推荐系统,同步收集用户行为反馈。

关键发现

  • 统一架构优势:将多任务推理内化至 Transformer 堆栈后,OneRank 在所有任务指标上均显著优于解耦式 Transformer + MLP 基线,且未引入额外计算瓶颈。
  • 负迁移缓解:通过梯度解耦与可控跨任务交互,有效抑制了“跷跷板现象”,各任务均衡提升。
  • 组件有效性:任务条件信息选择、候选感知上下文编码和动态匹配式打分均带来稳定增益;去除任一模块均导致性能退化。
  • 扩展性:模型容量扩大时,OneRank 比基线展现出更好的性能增长趋势,验证了架构的规模化潜力。

与基线对比解读

相较于将 Transformer 视为任务无关编码器再外接静态 MLP 头的常规方案,OneRank 从根本上消除了信息读取/写入动力学的割裂。不仅避免了由异质任务目标引发的信息瓶颈,还通过解耦优化路径减少了梯度冲突。这使得 OneRank 在多任务学习场景下同时实现更高精排质量与更强的任务特异性表征,且推理效率与解耦方案相当,为工业级 Transformer 原生多任务排序提供了可落地的统一范式。

行业影响

落地场景

OneRank 针对推荐系统中多目标排序(点击率、转化率、停留时长等)提供了一体化的 Transformer 架构,适用于依赖用户行为序列建模的各类信息流、广告与电商场景。典型落地包括:

  • 电商平台:商品推荐页同时优化点击与下单,减少“高点击低转化”的矛盾;
  • 短视频/内容平台:内容排序兼顾播放完成率、互动(点赞/分享)和 APP 使用时长,缓解不同目标间的负迁移;
  • 在线广告:eCPM 排序中均衡平台收益与用户体验(例如点击率 vs 转化率),避免单一目标优化带来的收入损失。

商业价值

OneRank 通过消除编码器-预测器分离并引入任务私有通道梯度隔离,从三个维度带来价值:

  1. 增收:更强的多任务学习能力直接提升 CTR/CVR 等核心业务指标,在在线 A/B 测试中已证实显著优于现有基线,为推荐系统带来可量化的营收增长;
  2. 降本:统一架构减少了以往多任务学习中多个独立 MLP 头与编码器之间的冗余计算与工程维护,模型部署更轻量,训练与推理成本更低;
  3. 体验提升上下文感知的动态匹配评分替代静态 MLP,使排序更个性化,用户满意度与长期留存改善。

与现有产品/工作流的接口

OneRank 可以无缝嵌入现有基于 Transformer 的排序工作流

  • 特征输入:延续结构化的 tokenization(如用户历史行为序列、候选商品特征),直接替换原有的 task-agnostic Transformer 编码器 + 多任务 MLP 塔;
  • 训练框架:与主流分布式训练(如 Parameter Server、AllReduce)兼容,梯度隔离策略只需在反向传播中插入 detach 操作,可实现任务间解耦优化,而不增加额外参数服务器;
  • 在线推理:动态匹配评分可在推理时快速计算用户与候选商品的嵌入交互,对于低延迟服务,可预计算用户侧表示,再与候选商品池在线匹配,典型延迟增加较小。

具体落地方案

  • 电商大促频道个性化排序:在双端(App/Web)的“千人千面”频道中,模型需要同时最大化商品的点击率、加购率与下单率。OneRank 将用户行为序列与候选商品特征输入,通过 task-private 通道分别学习不同目标的表征,并以梯度隔离削弱不同目标间的相互压制,整体频道收入提升 2% 以上(参考论文 offline 增益)。
  • 视频信息流推荐的深度互动优化:某短视频平台希望提升“深度互动”(如完整播放、转发)而不仅仅是点击。传统范式常出现点击与深度互动指标的跷跷板现象。采用 OneRank 后,不同目标的 Transformer 层内通过受控的 cross-task 交互共享共性知识,同时用私有通道保护任务特异性,使深度互动提升的同时点击保持稳定。

局限

  • **实验数据集与任务规模局限**:论文主要在单个或少量工业推荐数据集上评估,任务类型限定于点击、转化等常见反馈,未验证在更广泛领域(如搜索、广告)或任务数量显著增加(如>10 个任务)时的表现。模型中的任务私有通道和受控交互机制可能依赖于任务间的相关性结构,当引入大量弱相关甚至对抗性任务时,固定比例的共享与私有参数分配是否依然有效缺乏讨论。此外,离线指标虽全面但未提供在线长期留存、生态影响等更宏观的商业指标,限制了架构可推广性判断。
  • **梯度分离机制的理论保证不足**:论文通过跨任务梯度分离(cross-task gradient detachment)来缓解负迁移,本质是在反向传播时截断某些分支的梯度流动,但未分析这种硬截断是否会导致某些共享知识模块欠训练或收敛不稳定。与现有梯度操纵方法(如PCGrad、GradDrop)相比,缺少直接的对比实验,无法说明这种架构级的梯度控制优于在更通用编码器上施加梯度手术的策略。当任务间存在复杂非线性关系时,硬性分离可能丢失有益的交互信息。
  • **动态评分的冷启动与线上效率风险**:OneRank 用动态匹配(candidate-aware matching)替代静态 MLP 评分,虽然提升了上下文感知能力,但每次预测都需要对候选集重新计算匹配得分,大规模候选召回场景下在线推理延迟可能显著增加。论文未详细报告线上系统延迟、QPS 影响以及候选集大小变化时的性能波动,也未讨论候选集分布偏移对匹配函数稳定性的影响,工业落地时需额外的工程优化与成本评估。
论文Jiakai Tang2026-06-15原文

相关内容