David Baker造了一座“AI生物工厂”:不只要造蛋白质,还要按功能设计生物分子

一种能结合疾病相关靶点的蛋白质,一段控制基因开启或关闭的 DNA,一个能选择性降解或稳定特定蛋白质的工具,这些是一个名为 AI BioDesign 的新科研项目初期准备研究的对象。
它们对应几项具体能力:识别目标、调节基因活动,以及改变细胞中某种蛋白质的存留状态。研究人员希望,未来可以先提出需要的功能,再设计并制造相应的生物分子。
例如,设计一种能够识别癌细胞的蛋白质,或者一个主要在脑细胞中起作用的基因开关。AI BioDesign 要建立的,是让这类设计更可靠、也更容易反复完成的方法。9 月 3 日,Allen Institute、华盛顿大学和 Fred Hutch 癌症中心宣布联合启动这一科研项目。
2024 年诺贝尔化学奖得主、华盛顿大学蛋白质设计研究所所长 David Baker,与基因组科学家 Jay Shendure 共同担任科学负责人。
项目获得科学与技术基金会(Fund for Science and Technology,简称 FFST)五年共 9,460 万美元的资助,其中 4,610 万美元分配给 Allen Institute,4,380 万美元给华盛顿大学,470 万美元给 Fred Hutch。截至 8 月中旬,团队已有 62 人。
这笔投入支持的工作,可以从一个基因开关的设计过程来理解。如果研究人员希望一段 DNA 在某种细胞中促进基因表达,就需要弄清楚:哪种序列能起作用,效果有多强,换到另一种细胞里会怎样。同一段序列的功能可能随细胞环境变化。
要设计一个具有选择性的开关,模型需要学习这些差异。Shendure 参与的一项前期研究已经做过大规模测量。2025 年发表在《自然》的论文报告,团队在三种人类细胞类型中测试了超过 68 万条序列的基因调控活性,并利用实验数据训练模型,预测序列的功能及其变异带来的影响。
AI BioDesign 准备把实验与模型组织成持续运转的流程:模型提出候选设计,研究人员合成、测试,测量结果再用于更新模型。模型还参与决定下一轮应该生成哪些数据,让实验继续补充对生物功能的认识。这里的数据将记录某个设计在什么条件下有效、效果多强,也记录不起作用的结果。“
扰动”则是主动改变生物系统的一部分,再观察变化带来的后果。研究人员希望通过这些人为安排的实验,获得仅靠观察天然序列难以得到的功能信息。此前,Baker 的团队已经在蛋白质设计上积累了一套工具。
RFdiffusion可以生成蛋白质结构,ProteinMPNN 为结构设计氨基酸序列;后续的 RFdiffusion2 将酶的催化活性位点作为关键输入,围绕特定化学反应设计蛋白质。研究人员已通过实验验证部分设计的催化功能。
2025 年 12 月开放发布的 RFdiffusion3 又扩大了设计范围,覆盖蛋白质与其他蛋白质、DNA、小分子之间的相互作用,以及酶的设计。其训练代码和模型权重一并公开,外部研究者可以引入新数据,继续调整模型。实验反馈也早已进入这些团队的工作。
今年 3 月,华盛顿研究基金会宣布向 IPD(UW Institute for Protein Design,华盛顿大学蛋白质设计研究所)提供 700 万美元,支持改进从计算设计、基因合成到实验验证的流程,并将数据反馈给 AI 模型。因此,AI BioDesign 承接的是已有的计算和实验能力。
按其公布的方案,新增投入将支持更大规模的数据生成,围绕多个具体生物学问题建立模型,并把这些工作产生的资源持续提供给外部研究者。从蛋白质扩展到基因调控和细胞功能,研究人员需要测量的问题也随之增加。一个分子能否结合指定靶点,与一段 DNA 会怎样改变细胞活动,需要不同的实验方法。
AI BioDesign 要将三家发起单位各自的优势能力组织到一起,华盛顿大学提供合成生物学和基因组科学研究积累,Fred Hutch 提供细胞系统和转化医学能力,Allen Institute 则有建设大规模开放科研平台的经验。
Shendure 同时担任科学负责人的 Seattle Hub for Synthetic Biology,研究如何让细胞把自身经历记录进 DNA,也是这批研究者已有的技术积累之一。团队选择从可处理的具体问题出发,建立多个模块化模型。
不同任务可以使用适合自己的实验和数据:测量蛋白质能否结合目标,与测量一段 DNA 怎样影响基因活动,需要回答的问题并不相同。官方将这套安排定位为对生物基础模型、虚拟细胞等研究路线的补充。在实验端,批量测量已经开始。
据到访 AI BioDesign 实验室的媒体报道,团队近期一次实验涉及 600 万条不同序列;一支四人的机器学习团队与实验人员合作,选择后续实验,并根据模型的改善程度评估每轮工作。这个规模说明了数据生成能力,却还不能直接回答设计是否更可靠。大量序列中有多少实现预期功能,模型能否处理未见过的设计,以及新增实验究竟带来多大改善,仍需具体结果说明。
为这一长期工作提供支持的 FFST 成立于 2025 年,其初始捐赠基金约为 31 亿美元,资金源自 Paul Allen 的遗产。该基金会计划在四年内至少投入 5 亿美元,重点支持生物科学、环境以及人工智能等领域。AI BioDesign 对这笔资助承诺的产出,包括开放的模型、数据集、实验方法、试剂和评测标准。
其他团队可以从这些资源继续研究,企业也可能据此开发产品。官方提出的癌症和神经退行性疾病治疗、塑料降解酶、生物计算等应用,目前都是潜在方向,尚不能视为项目已经交付的成果。Allen Institute 首席执行官 Rui Costa 在接受 GeekWire 采访时表示,欢迎企业利用项目开放的数据开发产品;三家参与机构也可能从研究中孵化新的公司或其他组织。
模型、数据和实验工具由科研项目提供,后续开发则可以由不同团队继续推进。而最终,这套体系能否真正走通,仍要回到一个个微观而具体的设计上来检验:蛋白质是否找到了指定目标,基因开关是否在预期细胞中准确起作用,以及其他实验室拿到公开的模型和方法后,能否同样稳定地复现出来。
参考资料: 1.https://www.geekwire.com/2026/allen-institute-uw-and-fred-hutch-launch-95m-open-science-initiative/ 2.https://newsroom.uw.edu/news-releases/ai-biodesign-project-aims-to-adapt-natures-design-rules/ 3.https://alleninstitute.org/news/ai-biodesign-accelerator-combines-experimental-biology-and-artificial-intelligence-to-learn-natures-design-rules 排版:胡莉花