行业新闻

湖南大学提出 OpticalDNA,用视觉文档方式建模基因组

湖南大学提出 OpticalDNA,将 DNA 建模为视觉文档,用 OCR 式方法提升长序列基因组分析效率与可解释性。

主流 DNA 大模型沿用大语言模型的顺序建模思路,但真实基因组信息稀疏、呈区域化、存在长距离互作。湖南大学团队提出 OpticalDNA,把 DNA 排版成多页可视文档,借鉴 OCR 的思路训练模型去读取、定位、检索、补全,在长距离 eQTL 任务上表现领先且效率更高。

正文摘录

- title: ICML 2026 | DNA 大模型不止于 LLM,湖南大学 OpticalDNA 开启视觉理解新范式 - sourcecompany: 机器之心 - bodymarkdown: ![](https://image.jiqizhixin.com/uploads/article/coverimage/81a6fa5b-4290-4322-8aff-4ffa9e4f00ce/059(2).jpg) 作者 | 论文团队 编辑丨ScienceAI 近年来,DNA Foundation Model 已成为人工智能与生命科学交叉领域最活跃的研究方向之一。 从 DNABERT、Nucleotide Transformer、HyenaDNA,到最新的 Evo、AlphaGenome,越来越多的工作开始借鉴大语言模型(LLM)的技术路线:将 DNA 序列表示为 token,并通过 Transformer、状态空间模型(State Space Model)等架构学习超长序列中的上下文关系。过去几年,这一路线不断推动模型上下文长度和预测能力的提升,也逐渐成为当前 DNA 大模型最主流的建模范式。 不过,随着模型开始处理数十万乃至全基因组尺度的输入,一个新的问题逐渐浮现:除了沿着序列逐步建模,是否还存在一种更符合基因组稀疏、区段化和超长特征的表示方式? 近期,湖南大学/岳麓山实验室曾湘祥教授团队提出了一种新的基因组视觉建模框架 OpticalDNA。不同于现有工作继续沿着序列建模方向优化,OpticalDNA 借鉴 OCR(Optical Character Recognition)的思想,将 DNA 从一维字符序列重新组织为可阅读、可定位、可检索的视觉文档,探索了一条新的基因组基础模型技术路线。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-17原文

相关内容