RIBOSPAN: 一种面向多功能 RNA 建模的长上下文 RNA 基础模型
全长 RNA(尤其是信使 RNA)常超出已有 RNA 基础模型的预训练上下文长度,限制了在单核苷酸分辨率下的完整转录本建模。为此,我们提出 RIBOSPAN,一个拥有 16.1 亿参数的双向 RNA 基础模型,原生预训练上下文长度达 10,240 nt。RIBOSPAN 结合密集双向自注意力、单核苷酸分词(tokenization)以及注意力隔离的序列打包(sequence packing),实现了对完整长 RNA 的高分辨率建模。 我们通过核苷酸重建、受控长上下文表示基准以及冻结 RNA 类型表示分析对模型进行评估。原生 10K 预训练在 10,240 token 上保持强重建能力,而采用 40% 掩码的持续预训练可在高破坏率下改善恢复效果,同时保持表示质量。长上下文基准进一步表明,原生 10K 模型保持强大的上下文响应性和上下文特定表示分离,同时使扰动引起的表示变化高度局部化。推理时 YaRN 缩放可以恢复短上下文模型直接外推所损失的大部分上下文组织,但会导致远端表示扩散显著增加。 冻结表示评估进一步展示了最先进的 RNA 表示质量,RIBOSPAN 在多种 RNA 类型上取得整体最强性能,并在长 RNA 上保持明显优势。基于同一骨干网络,我们开发了一个多维条件离散扩散框架,用于全长 mRNA 生成和重新设计,包括用于保留蛋白质的 CDS 优化的同义密码子扩散。综上,RIBOSPAN 为可迁移的 RNA 表示学习和全转录本 mRNA 设计建立了强大的长上下文基础。
论文精读
TL;DR RIBOSPAN 是一个 1.61B 参数、原生支持 10,240 nt 上下文长度的 RNA 基础模型,解决现有模型无法全长建模 mRNA 的问题,在长上下文表示和 RNA 类型表征上达到 SOTA,并支持离散扩散 mRNA 生成。
问题
问题背景
RNA 基础模型是计算生物学的前沿方向,目标是通过自监督预训练捕获 RNA 序列的通用表示,支撑结构预测、功能注释与 mRNA 设计等下游任务。
现有方法局限
- 现有 RNA 基础模型(如 RNA-FM、RiNALMo)的上下文长度通常仅为 512–2048 nt,而全长 mRNA 平均长度可达数千至数万 nt,无法在单核苷酸分辨率下完整建模转录本。
- 截断或滑动窗口会破坏长程二级结构与顺式调控元件的上下文依赖,引入序列边界伪影。
- 直接将短上下文模型外推到长序列会导致注意力分布漂移,扰动表示扩散加剧,丧失局部上下文响应能力。
为什么难/重要
- 预训练 10,240 nt 上下文需要同时解决 注意力计算复杂度、序列打包 对样本独立性的干扰,以及长序列中保持扰动局部性等挑战。
- 全长 mRNA 设计与优化是疫苗、基因治疗等应用的核心环节,业界对可扩展的长上下文 RNA 表示与生成模型需求强烈。
- 该工作提出的 attention-isolated sequence packing 与 YaRN scaling 为工程实践提供了可复用的技术路径,例如通过隔离注意力区间减少打包串扰,通过推理时位置插值恢复上下文组织。
行业类比
类似于从 4K 上下文 LLM 升级到 128K 长上下文模型,需要在长文档中保持每个 token 的局部上下文响应与全局一致性;RNA 模型同样面临长序列下表示局部性与上下文组织平衡的问题。
核心洞察
- 原生 10K 上下文预训练使 RNA 基础模型能够对全长 mRNA 进行单核苷酸分辨率的完整建模,不再依赖截断或分窗。现有模型如 RNA-FM 或 Nucleotide Transformer 通常预训练上下文不超过 2048 nt,处理长转录本时会丢失远端调控信息或被迫分段,难以捕捉全局结构。RIBOSPAN 通过 dense bidirectional self-attention 和 attention-isolated sequence packing,在保持长序列内部全局注意力的同时隔离不同打包序列,避免了拼接带来的跨样本污染,这一设计在长 RNA 表示质量和下游任务上形成了明确优势。
- 在生成侧,RIBOSPAN 将离散扩散与同义密码子扩散结合,提供了一种蛋白质序列保持的 CDS 优化新途径,超越了传统基于规则或进化保守性的密码子优化工具。这种框架允许模型在给定蛋白序列和多维条件下,生成编码相同氨基酸但具有更优特性的 mRNA 序列,例如更高稳定性或翻译效率,直接在序列空间中进行可微优化。与现有生成式 RNA 模型多聚焦于短片段或非编码 RNA 不同,RIBOSPAN 面向全长 mRNA 设计,为 mRNA 疗法和疫苗的序列工程提供了更实用的基础工具。
方法
输入与预处理
- RNA 序列(如 mRNA / lncRNA)以 单核苷酸 tokenization 表示,每个碱基(A/C/G/U)映射为独立 token,支持最长 10,240 nt 的完整转录本。
- 使用 attention-isolated sequence packing 将多条短序列打包进同一训练样本,但彼此注意力隔离,实现高效训练且不损失位置信息。
关键模块
- 骨干网络:1.61B 参数的双向 Transformer,采用 dense self-attention,无稀疏化或线性注意力近似,保证长程依赖建模。
- 预训练目标:掩码语言建模(MLM),随机遮蔽单核苷酸并重建;预训练分为原生 10K 上下文训练与继续预训练(40% 高掩码率)两个阶段,以增强严重腐蚀下的恢复能力。
- 长上下文扩展:推理时应用 YaRN scaling,将短上下文模型外推至 10K,但观察到远端表示扩散更大;原生 10K 模型则保持上下文响应和局部性。
输出与下游应用
- 模型输出上下文感知的核苷酸级表示,可用于 RNA 类型分类、长上下文表示基准测试。
- 同一骨干上构建多维条件离散扩散框架,实现全长 mRNA 生成与重新设计,其中 synonymous-codon diffusion 在优化 CDS 时保持蛋白质序列不变。
差异点:现有 RNA 基础模型通常在 512–2048 nt 上下文预训练,无法对完整 mRNA 进行单核苷酸分辨率建模;RIBOSPAN 通过原生 10K 训练、序列打包和 YaRN 扩展,首次实现完整转录本的双向高分辨率表示与生成。
实验
实验设计
RIBOSPAN 采用三层次评估:1) 核苷酸重建,测试原生 10K 预训练在 10,240 nt 下的 masked language modeling 损失与全局重建准确率;2) 长上下文表示基准,通过成对扰动测量上下文分离、跨区域同碱基相似度与远端表示扩散;3) RNA 类型表示基准,冻结序列表征评估跨 RNA 类型的可分离性。同一骨干还支撑离散扩散框架用于全长 mRNA 生成。
关键发现
原生 10K 预训练保持强重建能力;继续预训练配合 40% masking 可提升重度破坏下的恢复,且不损失表征质量。长上下文基准显示,原生 10K 模型维持强上下文响应与上下文特定表征分离,扰动引起的表征变化高度局部化。推理时 YaRN 缩放能恢复短上下文模型直接外推丢失的上下文组织,但导致明显更大的远端表征扩散。
与基线对比
相比短上下文 RNA 基础模型,RIBOSPAN 通过原生 10K 训练避免直接外推的上下文组织丢失。YaRN 虽部分补偿,但以远端扩散为代价,说明原生长上下文预训练对保持局部性更优。冻结表征评估达到当前最优 RNA 表征质量,在长 RNA 上优势显著;离散扩散框架的多维条件控制为全长 mRNA 设计提供新路径。
行业影响
落地场景
RIBOSPAN 的 长上下文双向表示 可直接服务 mRNA 疫苗/药物设计、lncRNA 功能注释、向导 RNA 优化等生命科学 AI 场景。其 单核苷酸 token 化 与 10,240 nt 上下文覆盖多数全转录本,适合做 全转录本单核苷酸分辨率建模。例如,在 mRNA 序列设计工具中,输入目标蛋白序列,利用 synonymous-codon diffusion 生成密码子优化的 CDS,不改变氨基酸序列,提升表达量与稳定性;在科研内容平台,可对长链非编码 RNA 做 frozen embedding 聚类,支撑功能预测与靶点发现。
商业价值
主要走 降本增效 路线。药企与 CRO 在 mRNA 序列优化上通常需多轮湿实验,RIBOSPAN 的 discrete-diffusion 生成 可减少候选序列数量,缩短临床前周期。frozen 表示可直接用于 RNA 类型分类、功能预测,避免每个任务从零训练大模型,推理成本可控(1.6B 参数可在单卡集群部署)。可打包为序列设计 API 或私有化模型授权,按调用量收费,也可作为底座嵌入现有生物信息平台,提升付费转化。
接入现有工作流
模型已在 GitHub 开源(RIBOSPAN-FM),提供预训练权重与推理脚本。工程集成路径:
- 用 Hugging Face
transformers加载模型,批量提取 RNA 序列的 frozen hidden states,接入下游分类器。 - 针对 mRNA 生成,调用扩散采样模块,产出候选 CDS 序列,再与现有表达预测工具(如 RNAfold、优化算法)串联。
- 通过
attention-isolated sequence packing处理变长长序列,无需手动截断,可纳入 Spark/Databricks 等批处理管道。
具体落地 use case:
- 一家生物技术 SaaS 公司在其 mRNA 设计平台 集成 RIBOSPAN,为个性化肿瘤疫苗客户自动生成优化序列,替代人工密码子筛选,单次设计时间从数天降至小时级。
- 一个 科研数据平台 用 RIBOSPAN 对 lncRNA 数据库做嵌入索引,支持相似性检索与功能聚类,面向精准医疗客户提供 API 查询。
局限
- - **计算资源需求较大**:RIBOSPAN 参数量为 1.61B,上下文长度达 10,240 nt,采用密集双向自注意力与注意力隔离序列打包,训练和推理时的显存占用与计算量显著高于现有 RNA 基础模型(如 RNA-FM 约 100M、RiNALMo 约 650M)。这可能导致许多实验室或中小团队难以在自有硬件上微调或部署,限制其实际应用范围。论文未提供详细的推理延迟或显存基准,难以评估生产环境可行性。
- - **预训练数据与评估场景的覆盖偏差**:预训练语料以 mRNA 为主,对 lncRNA、circRNA、snoRNA 等非编码 RNA 的覆盖可能不足;数据来源的物种多样性也未充分说明。长上下文表示基准采用合成扰动(如局部 mask 或替换)来考察上下文响应,但真实生物学变异(如剪接异构体、RNA 编辑、结构重排)的复杂模式未必能被这些扰动完全模拟,因此模型在实际全长转录本分析任务上的表现仍有待验证。
- - **生成框架缺乏实验证实**:基于同一骨干构建的多维条件离散扩散框架(包括同义密码子扩散)主要用于全长 mRNA 生成与重设计,但论文仅展示了计算层面的生成质量与条件控制,未提供体外转录、翻译效率、稳定性等湿实验验证。生成的 mRNA 序列是否具备预期的生物学功能仍属未知;此外,生成过程与表示学习骨干的耦合策略、扩散模型的采样效率等工程细节也未深入讨论,距离实际 mRNA 设计工作流尚有距离。