行业新闻

BetaDescribe 70亿参数模型将蛋白质序列转为功能描述

BetaDescribe 直接读取蛋白质序列并输出功能描述,尤其擅长传统方法无能为力的“孤儿蛋白”,弥合序列与功能间的鸿沟。

BetaDescribe 是一个 70 亿参数的蛋白质语言模型,它把氨基酸序列当作“生物文本”,直接生成功能、定位、结构域等自然语言描述。模型采用“生成器—验证器—评判器”三层架构,类似同行评审,能处理传统方法难以注释的低相似度“孤儿蛋白”,为探索未知蛋白提供新假设。

正文摘录

70亿级参数模型 BetaDescribe,实现从氨基酸序列到功能描述的智能转换 - source\company: 机器之心 ![](https://image.jiqizhixin.com/uploads/article/coverimage/8bcbf147-e268-4b4e-acef-ffac42aac004/056(2).jpg) 编辑丨& 在生命世界中,蛋白质像一套由氨基酸组成的复杂语言。每一条蛋白质序列都携带着关于结构、位置和功能的信息,但如何从这串由 20 种氨基酸字母组成的「密码」中准确读出生命活动的含义,长期以来仍是生物学中的核心难题。 面对一个未知蛋白,研究人员通常需要依赖实验验证,或者寻找数据库中与其相似的已知蛋白,通过序列比对推测功能。然而,生命系统中仍存在大量缺乏明确注释的蛋白质,尤其是那些与已知蛋白序列相似度极低的「孤儿蛋白」,传统方法往往难以判断其真实作用。 AI 正在改变这一局面。2026 年 6 月 29 日,在 PNAS 上发表的「BetaDescribe: Providing rich descriptions from protein sequences」,提出了一种名为 BetaDescribe 的蛋白质语言模型框架。该模型能够直接读取蛋白质序列,并生成类似科学注释的自然语言描述,包括蛋白质功能、催化活性、亚细胞定位以及结构域信息等。

阅读原文(jiqizhixin.com)→

行业新闻ScienceAI2026-07-07原文

相关内容