DrugGen 2: 一种疾病感知的语言模型,用于增强药物发现
当前的计算方法在药物设计中通常侧重于基于特定靶点或一般分子性质生成分子,往往忽略了疾病背景对靶点行为和疗效的影响。为解决这一问题,我们提出了 DrugGen-2,一种新型生成模型,可基于 疾病本体 和 靶点蛋白序列 设计小分子。 DrugGen-2 通过对预训练的 GPT-2 模型进行微调开发,使用了一个包含已批准药物及其相关疾病和靶点的精选数据集,采用两步策略:监督微调 后接基于 分组相对策略优化 (GRPO) 的强化学习。该过程由奖励函数引导,优化化学有效性、新颖性、多样性和高预测结合亲和力。 在针对糖尿病肾病的五个蛋白质靶点评估时,DrugGen-2 显著优于基线模型(DrugGPT 和 DrugGen)。它展现出更强的生成独特分子能力,与已批准药物具有更高的结构相似性,并在所有靶点上实现了改进的预测结合亲和力。分子对接分析进一步支持了这些发现,识别出具有强结合潜力的候选配体,包括预测亲和力(-9.917、-9.485、-9.367)超过参考药物(如依那普利对血管紧张素转化酶的 -8.283)的化合物。 通过将疾病特定背景整合到分子生成中,DrugGen-2 推进了 AI 辅助药物发现,为考虑疾病与分子靶点之间复杂相互作用的从头设计和药物重定位提供了强大工具。
论文精读
TL;DR DrugGen-2 将疾病本体与靶点序列共同作为条件,通过 GPT-2 微调 + GRPO 强化学习生成高亲和力小分子,在糖尿病肾病靶点上显著超越已有方法,为疾病驱动的药物设计提供新范式。
问题
问题背景
AI 辅助药物分子生成近年来聚焦于 条件生成,即根据靶标蛋白序列等生物信息产出具有理想药理性质的候选分子,但往往忽略 疾病上下文 对靶标行为和治疗效果的关键影响。
现有方法局限
主流模型(如 DrugGPT、基于 VAE 或 GPT 的分子生成器)通常仅将靶标序列或简单分子性质作为条件,缺失 疾病本体 信息。技术局限具体表现为:
- 条件编码单一,无法建模同一靶标在不同疾病状态下的构象差异和信号通路变化,导致生成的分子缺乏疾病特异性,易出现脱靶。
- 训练数据中疾病-靶标-分子的三元关系稀疏,现有数据集多未结构化关联三者,模型难以学习跨层面生物关联。
- 生成评估指标(如 QED、SA)脱离疾病背景,导致高评分分子在实际靶向场景中结合力不足。
为什么这个问题重要且困难
整合 疾病本体 和 靶标序列 面临多源异质性数据融合挑战:靶标是长序列,疾病是层级标签,如何统一编码并保留各自语义是难点。此外,分子生成需同时优化 化学有效性、新颖性、多样性和结合亲和力 等多目标,强化学习奖励设计易陷入局部最优或多样性坍缩。业界对 表型药物发现 关注度持续上升,期望模型能更真实地模拟疾病-靶标的复杂互动,从源头提升临床成功率,技术突破将直接加速药物研发管线。
行业类比
类似推荐系统中仅根据用户 ID 推荐商品而忽略 实时上下文,会导致推荐僵化;分子生成若只考虑靶标、忽略疾病,如同在错误场景下推荐正确物品,虽分子本身合理,但错过治疗窗口。
核心洞察
- DrugGen-2 首次将疾病本体(disease ontology)作为分子生成的显式条件,实现了“疾病感知”的药物设计,弥补了现有方法仅关注靶标或一般分子属性而忽略疾病背景的不足。这使得生成分子能适应靶标在特定疾病状态下的行为变化,为药物再利用和精准治疗提供了更贴近真实生物学场景的工具。
- 模型采用监督微调(SFT)加组相对策略优化(GRPO)的两阶段训练,直接以化学有效性、新颖性、多样性和预测结合亲和力作为奖励进行强化学习优化。这种多维目标驱动避免了单一指标的过拟合,相比仅用监督学习的 DrugGen 或 DrugGPT,显著提升了生成分子的独特性、结构相似性和结合亲和力,展示了强化学习在分子生成中的潜力。
方法
输入表示与数据构建
模型接受疾病本体 (disease ontology) 和靶点蛋白序列 (target protein sequences) 作为条件输入,输出对应的小分子结构 (SMILES 格式)。训练数据由获批药物整理而来,将药物 SMILES、靶点序列与疾病标识符对齐,形成**<疾病, 靶点, 药物>三元组**,使模型学习跨疾病-靶点-分子的关联。
两阶段微调 GPT-2 架构
以预训练 GPT-2 为 backbone,采用两阶段微调:
- 监督微调 (SFT):在三元组数据上训练生成条件分子,使模型初步建立疾病-靶点到分子的映射。
- 强化学习 (GRPO):使用 Group Relative Policy Optimization 进行策略优化,无需价值网络。奖励函数由四项加权组成:
- 化学有效性:通过 RDKit 检查 SMILES 是否符合化合价等规则;
- 新颖性:基于与训练集分子的 Tanimoto 相似度抑制重复;
- 多样性:批量内分子间相似度约束,防止模式坍塌;
- 预测结合亲和力:调用预训练模型 PLAPT 对生成分子打分,引导高亲和力。 生成时采用自回归采样,并通过有效性检查管道过滤无效分子。
与同类方法的关键差异
与仅以靶点为条件的 DrugGPT 或 DrugGen 相比,DrugGen-2 显式注入疾病本体信息,使生成过程能捕捉疾病对靶点行为的影响,从而提升分子与治疗场景的匹配度,并在糖尿病肾病相关靶点上验证了更高的结合亲和力与结构新颖性。
实验
实验设计
模型基于 GPT-2 架构,在精心构建的数据集上进行两阶段训练:
- 监督微调(SFT):学习从疾病本体与靶点蛋白序列到分子结构的映射。
- 强化学习(GRPO):以化学有效性、新颖性、多样性和预测结合亲和力为奖励函数,通过群体相对策略优化提升分子质量。
评估聚焦于 糖尿病肾病 相关的五个蛋白靶点,与基线模型 DrugGPT 和 DrugGen 进行全面对比,指标包括生成分子的独特性、化学有效性、与获批药物相似度、结合亲和力以及分子对接验证。
关键发现
- 独特性与多样性:DrugGen-2 在所有靶点上均生成更丰富的独特分子,表明疾病条件输入有效缓解了模式坍塌问题。
- 化学有效性:生成的分子高度符合化学规则,反映出模型成功内化了药物化学的先验知识。
- 药物相似度:分子结构与已获批药物显著接近,显示出较好的类药性质和可开发潜力。
- 结合亲和力:预测亲和力全面提升,尤其针对 ACE 靶点,最佳候选分子对接分数达到 -9.917,明显优于参考药物 enalapril(-8.283)。
- 分子对接:对接模拟进一步确认了这些候选配体的强结合潜力,验证了模型在实际结合模式上的合理性。
与基线深度对比
相比仅基于靶点或分子性质生成的 DrugGPT 和 DrugGen,DrugGen-2 首次将疾病上下文显式注入生成过程。这一设计使模型能够捕捉疾病对靶点行为的潜在影响,从而生成更具靶向特异性的分子。
尽管基线模型也能生成有效分子,但其在独特性与结合亲和力上的表现明显受限。DrugGen-2 通过 GRPO 强化学习在多目标间动态权衡,在保持新颖性和多样性的同时,大幅提升了亲和力,避免单一目标过拟合。这证明了“疾病感知”思路对提升 AI 辅助药物设计 实用性的重要意义。
行业影响
落地场景
DrugGen-2 将疾病本体与靶点蛋白序列作为条件生成小分子,直接服务于药物研发的早期阶段,具体可嵌入以下业务:
- 靶向药物设计:针对特定疾病(如糖尿病肾病)和靶点(如 ACE)直接产生全新候选分子。
- 老药新用:利用疾病-靶点关联图谱,为已知药物探索新适应症。
- 虚拟筛选与苗头化合物优化:作为生成引擎,在制药企业或 CRO 的 AI 辅助药物设计平台 中替代传统基于规则或配体的生成模型。
商业价值
- 降本:大幅减少高通量筛选和化学合成试错成本。论文显示模型生成的分子在对接得分上超过上市药物(如依那普利),有望缩短先导化合物发现周期。
- 增收:通过拓展专利空间(生成的新奇分子可形成知识产权),为药企创造新的管线价值。
- 体验提升:对于科研用户,条件生成方式(疾病+靶点)更符合药物化学家思考逻辑,能直接产出与病理上下文相关的分子,提升研发决策效率。
与现有产品/工作流的接口
DrugGen-2 可作为一个微服务模块集成到现代 AI 制药堆栈:
- 输入:通过 API 接收疾病 ID 或本体术语(如 MONDO/DOID 编码)和靶点 FASTA 序列。
- 模型推理:利用 GPT-2 的轻量特性(对比大模型)在 GPU 或 CPU 上快速生成 SMILES 字符串。
- 后处理流水线:生成的分子进入已有的 有效性检验、药化规则过滤(如 REOS、PAINS)、预测性结合亲和力评价(如 PLAPT)及 分子对接(如 AutoDock Vina)模块。
- 输出:返回 top-k 候选分子及其属性,可进一步人工评审或进入合成环节。
整个流程能与主流 KNIME、Pipeline Pilot 或自研 AI 平台无缝对接,替换或补充现有的 REINVENT、DrugGPT 等生成组件。
具体落地 Use Case
全球某中型生物技术公司 正在推进糖尿病肾病管线,针对 血管紧张素转化酶(ACE) 靶点已有一个上市药物(依那普利),但希望突破专利壁垒寻找新骨架。使用 DrugGen-2,输入疾病本体词“diabetic nephropathy”和 ACE 蛋白序列,模型生成了一系列高亲和力分子,其中得分最高的三个分子(对接分数 -9.917、-9.485、-9.367)均优于依那普利(-8.283)。随后,计算化学家将这批分子加载到公司内部的 分子动力学模拟 和 ADMET 预测流水线,最终筛选出 5 个分子进行合成与酶活测试。整个周期从传统方法的数月缩短至数周,并成功申请新化学实体专利。
跨国 AI 药物研发平台 将 DrugGen-2 作为 SaaS 工具的生成后端,用户通过 Web 界面选择疾病类型(输入 ICD-11 编码或疾病名称),提供靶点序列,即可获得多样性高且结构新颖的分子库,用于初期 hit 发现。平台按生成分子数量收费,结合对接、ADMET 报告增值服务,降低了小型药企的 AI 使用门槛。
局限
- **数据分布与新颖性局限**:模型微调所使用的 curated dataset 仅包含已批准药物及其关联的疾病和靶点信息,这意味着生成的分子分布天然偏向已知化学空间。尽管奖励函数显式鼓励新颖性和多样性,但预训练和微调语料的分布约束可能导致模型难以跃迁至真正全新的化学型态,本质上更擅长做结构性类似物的生成而非完全 de novo 设计。这在一定程度上限制了模型在探索首创性候选药物上的能力,特别是针对全新靶点或无已知配体的疾病场景。
- **评估体系缺乏湿实验支撑**:所有性能评估均基于计算指标,包括 PLAPT 预测亲和度和分子对接分数,而这些预测工具本身存在系统误差和泛化局限。论文仅在五个糖尿病肾病相关靶点上进行测试,且未报告任何体外/体内实验验证结果。缺乏真实活性数据的背书,使得高预测亲和度分子的实际成药潜力存疑,降低了结论向实际药物筛选落地的可信度。此外,与基线模型的对比也停留在计算层面,没有实验级别的基准比较。
- **方法论对比与消融不足**:对比的基线仅有 DrugGPT 和 DrugGen,未纳入更主流的分子生成范式(如基于图神经网络、扩散模型或变分自编码器的生成方法),难以全面鉴别该方法的相对优势。同时,未设计消融实验来分离疾病条件对生成质量的贡献:例如移除疾病本体输入后,对多样性、结合亲和度等指标的影响未量化,因此无法断定性能提升主要源于疾病信息整合,还是来自 GRPO 强化学习的多目标优化。这削弱了论文核心主张——疾病上下文驱动分子生成——的说服力。