Allen Institute 联合 UW、Fred Hutch 启动 9460 万美元 AI BioDesign 计划,David Baker 牵头
一个把湿实验变成模型训练数据流水线的开源科研项目:AI 出设计、实验出数据、数据再训模型,目标是让生物设计的迭代不再卡在实验吞吐量上。
Allen Institute、华盛顿大学和 Fred Hutchinson 癌症中心联合启动为期 5 年、总额 9460 万美元的 AI BioDesign 项目,由诺奖得主 David Baker 与 Jay Shendure 共同牵头。项目用「设计—构建—测量—学习」闭环,让 AI 生成蛋白质等生物分子候选,再通过可并行读取数百万条序列的实验系统把真实结果喂回模型。
正文摘录
.jpg) 编辑丨& AI 设计的蛋白质在相关新闻中已不算新鲜。从蛋白质结构预测到 de novo 蛋白设计,机器学习已经能够生成大量自然界不存在的蛋白质候选,在它们产生实际效用之前,生成结果只是研究流程中的一个环节。设计出来的分子最终能否工作,仍然需要通过真实实验验证。实验得到的数据又会成为下一轮模型训练的材料。 9月3日,Allen Institute、华盛顿大学和 Fred Hutchinson Cancer Center 联合启动 AI BioDesign。项目获得 9460 万美元、为期 5 年的资金支持,由诺贝尔化学奖得主 David Baker 和基因组学科学家 Jay Shendure 共同牵头。项目计划建立一套长期运行的开放科研体系,让人工智能参与生物设计,也参与后续实验方案的选择和迭代。 AI BioDesign 提出的核心流程可以概括为「Design、Build、Measure、Learn」。模型先产生设计,研究人员完成构建,再通过大规模实验获得真实测量结果,新的数据随后返回计算环节,用于训练和改进下一轮模型。这样的循环会持续运行,实验室也因此成为模型学习过程中的重要组成部分。 走向大规模并行 传统生物实验往往针对一个或少量候选分子进行测试。AI 生成能力提升之后,如果每一次模型迭代都只能验证几十个设计,实验很快就会成为整个流程的瓶颈。 AI BioDesign 把重点放在了 multiplex experiment,也就是多重并行实验上。研究团队希望在一次实验中同时测试成千上万甚至数百万种不同设计,再利用测序等技术把这些结果一次性读取出来。