不等自然进化了,诺奖得主9460万,赌AlphaFold没走的那条路 - 足球资讯

2026-09-28

David Baker几乎把自然界2亿多种蛋白质结构都预测了个遍。

他选择了一条不同的路径:不去预测自然界已有的构造,而是创造自然界从未出现过的结构。

今年8月的一个清晨,研究助理Jack Boylan查看了前一晚的实验数据。

实验室的DNA测序仪旁边,试管里浸泡着大量人工设计的DNA序列,这些序列在自然界中从未进化出来。哪些有效、哪些无效,全凭这台机器一次性读取并报告。

不久前的一次实验,他们将600万条这样的设计序列同时放入同一支试管进行检测。如果采用传统方法,仅检测这一批样本就需要花费数年时间。

Boylan所在的机构名为AI BioDesign,9月3日在西雅图首次公开亮相,距离艾伦研究所总部仅几步之遥。

这家机构由保罗·艾伦遗产体系投入9460万美元,由2024年诺贝尔化学奖得主Baker和基因组学家Jay Shendure共同领导。

左:David Baker,2024年诺贝尔化学奖得主。右:Jay Shendure,基因组学家。两人共同领衔AI BioDesign。

在这个算力至上的时代,他们不打算用这笔资金去训练更大的模型,而是要在试管上下功夫。

他们采用的方法是构建一个快速运转的循环:

AI提出设计方案,实验室进行构建并测量,结果反馈给模型,模型再决定下一轮要创建什么。

这听起来像是常见的“设计-构建-测量-学习”流程,但真正的不同在于这个循环的运作方式。

这里没有布满机械臂的自动化车间,“规模不是来自机器人,而是来自试管内部的并行处理。”执行总监Jesse Gray说。

所谓试管内部的并行处理,按Shendure的说法,就是利用进化留给人类的细胞生产线,用它来构建和测量数百万个分子。

具体操作是:将数百万条设计序列同时放入同一支试管,让细胞分别构建它们,然后在相同条件下运行。最后交给测序仪,一次性读取哪些有效、哪些无效。

这样一来,模型在学习“设计规则”时,面对的是大量实例,而不是自然产生的有限样本。

这类设计出的分子长什么样?

下图是Baker实验室此前设计的一个结合蛋白:紫色与粉色部分由AI设计,白色是被它整个包裹的胰淀素。

AI设计的胰淀素结合蛋白表面渲染图。

实验不再验证结论,只为喂饱模型

更有趣的是这条生产线的KPI。

实验室按五六人一组编成小队,各自专注于一个具体的生物设计难题,旁边配备机器学习团队随时支援。

每一轮实验的成绩如何计算?不仅看做出了多少个有效的分子,更看模型从这一轮中学到了多少。

传统实验室的逻辑是先有假设,再设计实验进行验证。

AI BioDesign将这个顺序颠倒过来:实验首先是给模型提供的“练习题”,按照“设计—构建—测量—学习”的循环不断重复。

每轮结束时,机器学习团队根据结果挑选出模型最不确定、最可能学到新内容的序列,决定下一轮要测试什么。测试后的数据反馈给模型,模型更新后再生成下一批设计。

目标是让每次实验带来最大的信息量,而不是尽快完成一个成品。

过去是人指挥实验台,现在,实验台开始听从AI的指令。

艾伦研究所研究助理Jack Boylan(左)与AI BioDesign执行总监Jesse Gray,在实验室的DNA测序仪前。

创造自然界没有的蛋白,他2003年就做到了

这不是一个“AI创造了自然界没有的蛋白质”的故事。

这件事,Baker早在23年前就完成了。

2003年,他的团队使用Rosetta软件设计出一个名为Top7的蛋白:93个氨基酸,折叠方式在当时所有已知蛋白中都找不到先例。

2024年的诺贝尔化学奖,一半授予计算蛋白质设计的Baker,另一半授予预测蛋白质结构的AlphaFold团队的Demis Hassabis和John Jumper。

2024年10月9日,David Baker接到诺贝尔奖委员会的电话。

如果说AlphaFold解决的是“读”:预测这串氨基酸会折叠成什么形状,那么Baker解决的就是“写”:为了实现某个功能,需要构造什么形状。

后来,“读”的部分这几年被推上了神坛,AlphaFold2和同期那批大模型采用的都是同一套打法:依靠人类已经积累的数据。

“写”的部分没有这种优势。自然界不存在的东西,数据库中根本查不到,只能自己制造出来、自己测量出来。

因此,它一直困在一个现实的瓶颈中:

AI一晚上能生成数十万个候选设计,传统实验室一年做几百个就算高产。

设计与验证之间的巨大差距,才是这个领域一直难以突破的上限。

用Baker的话说,这个项目真正的突破,是AI的速度第一次开始匹配合成生物学的实验能力。

一边一天生成数百万个候选设计,另一边一管子测掉数百万个,这两个齿轮终于咬合上了。

不追通用大模型,重仓实验基础设施

当大家都在追求一个能回答所有问题、甚至能模拟整个虚拟细胞的通用大模型时,Baker和AI BioDesign选择了另一条路:

创建一批只处理具体难题的小模型,再为每个问题专门制造出海量新数据去训练它。

道理并不复杂。

自然进化留下的样本,只是它在数十亿年里尝试出的一小部分解决方案,用这一小部分去学习普适的设计规则,本身就存在很大缺口。

要填补这个缺口,就需要缺什么数据、自己制造什么数据。而制造数据这件事,不能靠堆显卡,要靠试管、测序仪和实验台。

上一阶段大家争夺的是算力基础设施,下一阶段要争夺的,是实验基础设施。

更反直觉的是,即使押赢了这个局,成果也全部免费公开。模型、数据集、实验方法、试剂、基准,全部开放。

万一别人用这些数据开发出赚钱的药物怎么办?

总裁Rui Costa说得很轻松:“如果有很多公司用这些数据去让世界变得更好,那是我们的运气。”

高速发展也有隐忧。批量制造自然界不存在的分子,必须防范意料之外的生态影响和恶意滥用。

这条链上有一个绕不开的环节:合成DNA。设计再多,最后总得有人把它制成实物。

守在这里的是行业的筛查系统。你下单合成一段DNA,系统会用它与已知的毒素和病原体基因进行比对,匹配上就拦截。

2025年10月发表在Science上的研究显示,微软团队用公开的蛋白设计工具,将72种受关注蛋白改写成约7.2万条合成同源序列,结构和功能大致保留、序列面目全非,四款筛查软件大量漏检。

该团队随后联合四家合成公司打了补丁,检出率大幅回升。

微软团队的AI蛋白设计红队流程:从受关注蛋白生成合成同源序列,再送进筛查软件验证。

问题在于,补丁只能修补已经发现的漏洞。设计能力在指数级前进,守门人却始终在后面追赶。

Baker提出的主张是:所有人工合成的DNA都进行登记留档,记录序列,也记录下单的人。

他认为这是一道实际可行的防滥用门槛。

18个月后开牌,打开生物学的新抽屉

赌局已经下注。

Costa给出的期限是18到24个月拿出真正的进展,五年内开放给全世界的研究者。

Baker的愿景清单上写着:一种新疾病的疗法几周而不是几十年就能开发出来,海里的塑料被酶分解,生物计算机的耗电远低于硅芯片。

这些目前都还只是方向。Baker自己也承认,这条路上会先冒出一批能用、却说不清为什么能用的分子。

制造得出来,但讲不清楚。

达尔文曾用“无尽之形最美”惊叹自然的多样性。

但在Baker看来,那些最美的形式,只是数十亿年里尝试出的一小部分,抽屉里绝大多数格子还没打开过。

现在,他借助AI把抽屉拉开了,一次翻600万格。

AlphaFold把2亿多种蛋白质的结构预测了个遍,“读懂自然”这条路已经走到头。

Baker押注的是,下一段路的关口不在模型,而在数据:一条能源源不断生成新数据的生产线。

参考资料:

https://www.wired.com/story/nobel-prize-protein-design-now-using-ai-to-create-molecules-beyond-nature/?utm_source=chatgpt.com

https://alleninstitute.org/news/ai-biodesign-accelerator-combines-experimental-biology-and-artificial-intelligence-to-learn-natures-design-rules?utm_source=chatgpt.com

https://www.nobelprize.org/prizes/chemistry/2024/press-release/b/?utm_source=chatgpt.com

本文来自微信公众号“新智元”(ID:AI_era),作者:元宇,36氪经授权发布。

扫描二维码分享到微信

在线咨询
联系电话

+86 +86 138 7352 9000

川ICP备2021424104号
战队动态科技有限公司专注成就专业电话:+86 138 7352 9000邮箱:[email protected]成都市高新区天府大道188号