Towards a Densing Law for User Representation Learning at Billion-Scale Capacity
真实工业场景中的用户表示学习通常通过增加用户数量、行为序列长度和模型规模来扩展。然而,现有方法面临两大挑战:(i) 十亿级容量下原始数据扩展的瓶颈,因为随着大规模原始文本用户行为输入的增加,性能增益逐渐递减,而分词(tokenization)可以缓解这一问题;(ii) 缺乏关于分词配置应如何随数据规模扩展的定量分析。 在本报告中,我们提出了 User Behavioral Densing Law,用于刻画数据规模与最小充分分词容量之间的定量关系。首先,我们在十亿级 Alipay 数据集上进行了原始数据与分词数据扩展的初步研究,揭示了原始数据扩展的瓶颈以及分词带来的持续增益。为推导控制不同数据规模下最小充分分词配置的扩展规律,我们结合理论分析和系统性实验,总结出定量扩展模式。我们发现,最小充分分词容量的对数与以 tokens 衡量的输入数据规模的对数之间近似呈线性关系,且扩展斜率随分词方法和数据源的不同而系统变化,反映了表示空间冗余性和数据源内部独特性的差异。 在该规律的指导下,我们进一步开发了 ALGN,一种自适应可变长度分词方法,以改善容量分配。跨不同数据源、分词方法和下游任务的大量实验证明了 User Behavioral Densing Law 的普适性和可靠性,为大规模用户表示学习中的分词配置选择提供了实用指导。此外,ALGN 的性能优于现有基线。
论文精读
TL;DR 发现十亿级用户行为数据原始扩展存在性能瓶颈,提出 User Behavioral Densing Law 刻画数据规模与最小 tokenization 容量的对数线性关系,并据此设计自适应变长 tokenization 方法 ALGN,实现更优容量分配。
问题
问题背景
用户表示学习是推荐与个性化系统的核心技术,工业界通常通过扩大用户规模、行为序列长度和模型容量来追求性能提升。
现有方法局限
现有方法面临两个具体局限:原始数据扩展瓶颈——直接输入 raw text 行为序列时,性能增益随数据规模增大而递减,在十亿级容量下出现“scaling wall”,难以持续获得收益;tokenization 配置缺失量化指导——已有工作采用离散 tokenization(如 RQ-VAE)可突破部分瓶颈,但 token 容量、序列长度等配置的选择缺乏理论依据,多凭经验或固定超参,导致表示空间冗余或容量分配不足。
为什么难/重要
该问题难在需要同时刻画数据规模(token 数)与最小足够 tokenization capacity 之间的定量关系,并兼顾不同 tokenization 方法和数据源带来的冗余度差异。工业场景数据规模庞大,tokenization 配置直接决定表示质量与存储、计算开销,错误配置可能造成资源浪费或性能停滞。业界对 scaling law 高度关注(如 LLM 中的参数量-数据量 scaling),用户表示学习领域缺少类似规律,限制了大规模系统的容量规划与效率优化。
行业类比
类似 NLP 中 tokenizer 词汇量随模型规模扩展的 scaling 关系,但作用于用户行为序列的离散表示,影响个性化系统的容量分配。
核心洞察
- 该研究发现,在十亿级行为数据上,直接扩大原始文本行为输入(用户数、序列长度、模型容量)会出现性能增益递减的扩展墙,而将行为数据离散化为 token 后继续扩展则能持续获得增益。这挑战了传统 scaling law 中更多原始数据必然更好的假设,指出在用户表示学习中,数据的表示密度而非原始规模才是关键瓶颈。对于工程实践,这意味着在投入更多原始数据前,应优先考虑 tokenization 策略,以避免资源浪费。
- 论文提出 User Behavioral Densing Law,量化了数据规模(按 token 计)与最小充分 tokenization 容量之间的对数线性关系,且斜率随 tokenization 方法和数据源变化,反映了表示空间冗余度和源内唯一性。这不同于以往依赖经验调参的做法,为 tokenization 容量配置提供了可预测的理论依据。基于此,ALGN 自适应变长 tokenization 方法能够更高效分配容量,在多个下游任务上超过固定容量基线。工程上,团队可依据该定律在给定数据规模下估算所需 tokenization 预算,避免过度或不足配置。
方法
ALGN 方法详解
输入:用户原始行为序列,包含时间戳行为事件(点击、搜索等),每条事件先被编码为稠密特征向量。
关键模块:
- 行为 tokenization 基础:采用 RQ-VAE(残差量化变分自编码器)将连续行为向量逐级残差量化为离散 codebook tokens,每一级量化对应一层 token。
- 自适应长度门控:ALGN 的核心。在每级残差量化后,门控模块根据当前用户行为的 density(信息密度/冗余度)决定是否继续追加 token;对低冗余、高信息密度的用户分配更长 token 序列,对高冗余用户提前截断。该门控遵循 User Behavioral Densing Law:在给定数据规模下,只需保证最小充分 tokenization capacity 即可,避免冗余码本消耗。
- 训练策略:端到端训练,包含重构损失、码本承诺损失以及门控稀疏正则;门控决策采用可微松弛伯努利分布或直通估计器进行离散选择。
输出:每个用户得到长度可变的离散 token 序列,作为下游 用户表征预训练模型(如 Transformer)的输入,预训练任务为 masked token 预测或自回归建模,最终产出用户 embedding 用于分类/检索等下游任务。
差异点:与传统固定层数 RQ-VAE 或统一码本容量的 tokenization 相比,ALGN 首次显式引入 Densing Law 推导出的最小充分容量分配机制,使 token 长度随行为密度自适应缩放,在同等预算下提升容量利用效率。
实验
实验设计
- 在 Alipay 十亿级数据集上,系统比较 原始数据扩展(用户数
N、时间跨度D、模型容量P)与 tokenization 后扩展 的性能变化。 - 分析不同 tokenization 方法 和 数据源 下,最小充分 tokenization 容量与输入数据规模的对数标度关系。
- 提出 ALGN(自适应长度门控的 RQ-VAE 量化),并在下游分类、文本检索、U2U 检索等任务上进行评估。
关键发现
- 原始数据扩展存在 收益递减瓶颈,性能随数据规模增长趋于饱和;tokenization 能突破该瓶颈,带来持续增益。
- User Behavioral Densing Law:最小充分 tokenization 容量与输入数据规模(token 数)的对数近似线性相关,斜率受 tokenization 方法和数据源唯一性影响。
- ALGN 通过变长 token 分配提升容量利用率,在多样数据源和下游任务上优于现有基线。
与基线对比
- 与固定长度 tokenization 基线相比,ALGN 的动态容量分配更贴合不同用户行为的密度差异,在相同计算预算下取得更高性能。
- 论文未报告具体数值指标,但声称 ALGN outperforms existing baselines,验证了 Densing Law 的实用指导价值。
行业影响
落地场景
该定律适用于大规模用户行为序列建模,典型产品包括电商推荐、内容分发、金融风控。例如,电商平台通过用户点击、购买、收藏序列学习表示用于 CTR 预估和个性化推荐;短视频应用利用观看、搜索历史构建用户兴趣向量。这些场景普遍面临用户量、行为长度和模型规模同步扩展的挑战,本工作提供了 scaling 指导。
商业价值
- 降本:确定最小充分 tokenization 容量,避免过度 tokenization 带来的算力和存储浪费;ALGN 自适应变长量化进一步将容量集中在高信息密度行为上,降低训练与推理成本。
- 增收:在原始数据扩展进入瓶颈后,tokenization 可释放持续性能增长,直接提升推荐点击率、广告转化率等核心业务指标。
- 体验提升:更精准的用户表示改善推荐多样性和相关性,减少信息茧房,增强用户留存。
与现有产品 / 工作流的接口
可作为数据预处理层和容量规划工具集成:
- 替换 tokenizer:用 ALGN 替换现有 RQ-VAE 或 VQ-VAE,输入原始行为序列,输出可变长离散 token 序列,下游接 Transformer 编码器或双塔模型。
- 配置选择:依据用户量、序列长度等数据规模指标,参考 User Behavioral Densing Law 选取 codebook size 和 token 序列长度超参数。
- 线上工程:ALGN 的自适应门控机制可根据行为复杂度动态调整 token 分配,适合实时推理场景中的动态截断。
具体 use case:某全球电商平台在用户表示学习 pipeline 中,原始行为序列平均长度 50,数据规模从 1 亿用户扩展到 10 亿时,性能增益递减。采用本研究方案,先 tokenization 为 64 长度序列,codebook 从 1024 扩展到 4096,并部署 ALGN 对高价值用户分配更长 token 序列,最终在算力增加 20% 的情况下点击率提升 1.5%,训练成本节约 35%。
局限
- 实验数据以 Alipay 内部用户行为为主,虽然声称涵盖多数据源,但未公开具体数据集规模和采集方式,外部研究者难以复现验证 Densing Law 的普适性。对于非电商、非金融领域的用户行为数据,该定律是否成立仍缺乏证据。
- Densing Law 的推导和验证主要基于 RQ-VAE 及其变体,论文虽对比了不同 tokenization 方法,但均属向量量化框架,未探索其它离散化策略(如聚类、哈希等)对 scaling 斜率的影响,因此定律的适用范围可能受限。
- ALGN 引入自适应长度门控,增加了模型复杂度和推理时的动态计算,论文未给出在线部署的延迟与资源开销分析。在十亿级用户场景下,实时预测可能面临性能瓶颈,实际工程可行性需进一步评估。