行业新闻

R3LM:让大模型基于结构证据预测DNA调控活性

R3LM通过将DNA转为结构化证据,让大语言模型能基于生物学推理预测调控活性,比直接读序列更准确、更可解释。

大模型直接读DNA表现差,因为DNA只是碱基字符串。中国人民大学团队提出R3LM,先将DNA编译成结构化生物学证据(如motif、GC含量),再让LLM基于证据推理并预测调控活性,实现了可解释的DNA功能预测。

正文摘录

![论文封面图片](https://image.jiqizhixin.com/uploads/article/coverimage/41084e74-6ba7-4261-8dd8-86c38f218dfb/036(2).jpg) 作者 | 论文团队 编辑 | ScienceAI 为什么大语言模型已经能写代码、解数学题、完成复杂推理,一遇到 DNA 序列却常常失灵? 一段 DNA 在模型眼里通常只是「ACGTACGT……」这样的长字符串。但在生物学家眼中,同一段序列包含着更丰富的调控信息:哪些转录因子可能结合,motif 出现在哪里,它们如何排列,GC 含量暗示了怎样的序列背景,不同细胞类型下这些信号又可能产生什么功能差异。 围绕这一问题,中国人民大学高瓴人工智能学院研究团队提出 R3LM(Reasoning Regression Reward Language Model),探索了一条让大语言模型理解生命序列的新路径:先把原始 DNA 编译成结构化的生物学证据,再让模型基于这些证据进行机制推理,最终输出可解释的调控活性预测。 相关论文《Biological Reasoning-Informed Regression for Interpretable Regulatory DNA Activity Prediction》已被 KDD 2026 接收。

阅读原文(jiqizhixin.com)→

行业新闻ScienceAI2026-07-06原文

相关内容