AlphaFold 为何没有真正解决蛋白质折叠 —— Google DeepMind Pushmeet Kohli 与 Biohub Sal Candido 对谈
Why AlphaFold Didn't Solve Protein Folding — Pushmeet Kohli, Google DeepMind & Sal Candido, Biohub
Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在一场对谈中探讨为何 AlphaFold 的突破只是起点,蛋白质结构预测远未解决。
从 AI 的苦涩教训 到尚未破解的蛋白质折叠之谜,Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 正在重新思考:构建真正理解生物学的 AI 需要什么。在 Brandon Anderson 主持的这场特别座谈中,他们探讨了为什么 AlphaFold 的突破只是开端、为什么仅靠扩大算力和数据无法解决生物学问题,以及下一代 AI 模型如何能改变我们对蛋白质、细胞和人类疾病的理解。
我们深入探讨了AI 驱动的生物学的未来:在生物数据中寻找缩放定律、科学直觉与通用架构之间的权衡、为什么蛋白质结构预测远未解决,以及构建生命系统预测模型需要什么。Pushmeet 回顾了 AlphaFold 背后的经验教训、人类可解释性的局限,以及未来的前沿模型是否会比我们更好地理解其他 AI 系统。Sal 解释了为什么蛋白质语言模型可能已经包含我们尚未解锁的科学知识、生物学建模必须如何超越单个蛋白质,以及为什么实现 Biohub 治愈所有疾病的使命需要追求10 倍级的突破,而不是渐进式改进。
生物学的苦涩教训:为什么扩大算力和数据还不够
为什么找到正确的缩放定律比盲目增大模型更重要
低质量的宏基因组数据如何能改进蛋白质语言模型
为什么 AI 研究者为可获取的数据优化,而不是为最重要的科学问题优化
DeepMind 在平衡建模、数据生成与科学专业知识方面的经验
为什么构建虚拟细胞需要本质上不同的数据集
AlphaFold 的手工设计架构与科学直觉的作用
为什么高质量数据比单纯拥有更多数据更重要
归纳偏置、缩放定律与专用 AI 架构的未来
为什么我们并未身处后 Transformer 时代,但架构正在演进
为什么 AlphaFold 并没有真正解决所有蛋白质折叠问题
蛋白质动态与无序性,以及静态结构预测的局限
冷冻电镜显微图像如何能解锁更丰富的生物学表征
从单个蛋白质的模型迈向完整生物系统的建模
费曼的著名原则,以及为什么 AI 如今能创造我们无法理解的东西
蛋白质语言模型中隐藏的生物学知识
为什么可信度与不确定性校准比完全可解释性更重要
前沿 AI 模型能否比人类更好地解读其他 AI 系统
AI 何时能在药物研发中带来10 倍–100 倍的加速
为什么治愈所有疾病需要思考 10 倍级突破,而不是 10% 的改进
LinkedIn: https://www.linkedin.com/in/salcandido/
00:00:00 引言:生物数据的苦涩教训
00:01:00 为生物学寻找缩放定律和正确的数据
00:04:54 DeepMind 的苦涩教训:解决问题 vs. 扩展模型
00:06:50 AlphaFold、数据局限性与构建虚拟细胞
00:09:52 手工设计的架构 vs. 扩展算力
00:11:53 好数据、归纳偏置与模型设计
00:13:39 超越 Transformer:AI 架构的未来
00:14:38 为什么 AlphaFold 还没有解决蛋白质折叠问题
00:17:39 蛋白质动力学、设计与冷冻电镜
00:19:09 从单个蛋白质到完整的生物系统
00:20:43 费曼原则:在不理解的情况下创造
00:22:18 蛋白质语言模型中隐藏的知识
00:23:48 AlphaFold、可信度与可解释性
00:25:56 AI 能否比人类更好地理解其他 AI 模型?
00:27:43 AI 何时将彻底变革药物研发?
00:29:47 为什么治愈所有疾病需要 10 倍级突破
Brandon Anderson [00:00:04]:很高兴来到这里。多么令人兴奋的早晨,这么多酷炫的发布。我想生物科学的未来正在此刻被宣布。这是建模分会场。我们都是建模者,所以谈论数据自然顺理成章。
在数据方面,我喜欢思考的问题之一是如何正确地扩展数据。这让我想到了苦涩教训,只是把它放到数据的框架里重新审视。对于不熟悉 AI 的各位来说,苦涩教训指的是:能够扩展的方法最终会胜出。只要你能扩展得足够多,它就会赢。所以我的问题是,先从 Sal 开始:数据也有苦涩教训吗?
Sal Candido [00:01:00]:当然有。你显然需要正确的数据才能让这一切奏效。关于缩放定律的一个误解是,缩放定律无处不在、始终存在。实际上,很多工作正是在于找到那条缩放定律。我们做的很多事情就是试图弄清楚:在什么情况下,投入更多算力、投入更多数据,就能得到更好的结果?
那是一个很好的局面,因为一旦达到那个状态,你就可以开始转动曲柄。它会变成一个工程问题,而这正是我喜欢的。这与架构有关,但也在很大程度上与数据有关。如果你没有具备正确信息和统计数据的数据来解决你想解决的问题,你就不会得到一个具备你想要的能力和理解的模型。你真正能做的只是从已有的数据中提取信息,并利用它进行超越数据的泛化。
Brandon Anderson [00:02:09]: 在数据收集方面,你如何思考哪些模态是最好的?一个相关的问题是:建模者是否倾向于研究数据可获得的问题,而不是最能服务其目标或对转化医学影响最大的问题?
Sal Candido [00:02:32]: 当然。我不能代表所有建模者,但我很懒,所以我会利用现有可用的东西。这有好的一面,也有坏的一面。
好的一面是,当你做传统机器学习时,你往往在寻找能找到的最干净、高质量的数据样本。但如果你像我一样,你就是在后屋里翻找,翻看别人的杂物,看看那里有什么。一个具体的例子是在宏基因组序列上训练蛋白质语言模型,这些并不是最高质量的数据。事实上,我可以向你保证,其中很多数据甚至不是真正的完整蛋白质。然而它却提升了模型在设计真正有效的蛋白质以及理解我们已知存在的蛋白质方面的性能。
这是积极的一面。但它也可能把你引向一个消极的方向,让你说:“我们就把容易生成的数据规模化吧。”我认为这未必是正确的做法。这也是今天我们与 BBI 讨论的内容令我兴奋的地方之一:走出去问:“我们需要什么数据来解决这个问题?”
这关乎正确的资源,也关乎正确的社区。我们在 Biohub 努力做的一件事就是开放地工作,与社区合作,推动整个社区前进。这一点至关重要,因为如果只有人在构建模型,我们会倾向于已有的数据。如果只有人在生成数据,他们会倾向于能够生成的东西。但如果你能作为一个社区,每一步都以开放的方式共同合作,你就能弄清楚你真正需要什么数据。然后你才能找到那条缩放定律。
Brandon Anderson [00:04:50]: Pushmeet,你怎么看数据的苦涩教训?
Pushmeet Kohli [00:04:54]: Rich 还在 DeepMind 的时候我就在那里,当时他正在思考苦涩教训这个想法。我从 Rich 在 DeepMind 的原始演讲中得到的,并不是关于数据是否有用或者我们应该如何看待机器学习这些具体概念。我的理解是,他在谈论一些更具概念性的东西。
有时候我们在看待问题时,会用一种很“教条”的方式思考解决方案:“我是做建模的”,或者“我是做数据生成的”。我认为这就是苦涩的教训。如果你带着这种心态去解决问题,可能不会成功。问题才是第一位的,你应该在解决方案空间中保持灵活。两种方法你都应该尝试。你应该理解你想要解决的问题。如果它需要建模上的投入,就去做建模;如果它需要收集更多数据,那就去收集数据。
当时机器学习领域的情况是,人们会说:“我们是机器学习研究者。数据集就在那里。这里是一些训练数据,这里是一些测试数据,我们只需要优化模型就行。”这其实是行不通的,因为如果你的最终目标是解决问题,就必须同时关注进入这个流程的两个方面。
而进入这个流程的不仅仅是数据或建模,还有专业知识。以 AlphaFold 为例,我们评估了现有数据集能实现什么,因为我们并不具备这样的核心专业知识,甚至没有资源去说“让我们把 PDB 扩充几个数量级”。世界各地的组织和科学家在构建这些数据上投入的心血是无价的。所以在那里,你必须专注于通过投入建模来获得最大的回报。
但在其他领域,比如细胞基因组学,我们采用了同样的方法并问:“利用细胞-基因数据你能做什么?”经过大量工作后,我们非常清楚地意识到,要实现构建虚拟细胞这一宏大目标,数据还远远不够。这让人们团结起来,专注于推进科学的实际挑战,而不是教条地追随数据生成或建模方面的进展。
Brandon Anderson [00:08:23]: 我很喜欢这个回答。那么可操作的要点是什么?总是先定义问题,然后确定要搜索哪个解决方案空间。但更广泛地说,在我们迈向下一代转化医学的过程中,整个社区应该如何看待这个问题?
Pushmeet Kohli [00:08:47]: 我给任何刚开始进入这个领域的人的建议是,把自己看作一个多学科的人。首先要理解问题。你为什么要研究它?你想达成什么目标?然后再思考需要什么,是建模、算力扩展,还是数据生成。理解问题极其重要,当然你也需要积累自己的专业知识。
同时也存在种种约束。也许你只能生成一定量的数据,或者只能负担训练一定规模的模型。要理解这些约束,尽量快速试错,并着眼于哪些方法从长远来看是可行的,能让你达到所期望的影响力水平。
Brandon Anderson [00:09:52]: 这正好引出我的下一个问题。回顾建模技术的演进,AlphaFold 2 本质上是一件艺术品,包含大量精心手工设计的特征。解决方案的每一部分都经过了深思熟虑。谷歌或 Alphabet 的一些工作仍然停留在那个方向,但总体共识似乎正在转向更具可扩展性、更通用的策略。
我们是否还需要针对某些问题的手工化、工艺化的解决方案?还是资源应该优先投入到规模化上?在资源和资金有限的情况下,你可以投资于算力、人才或数据。我们应该如何看待这种权衡?
Pushmeet Kohli [00:10:48]:让我们从第一性原理出发来探讨。构建更好的模型这门艺术与工艺并非偶然。我们做了大量实验,但背后有一个愿景。来自生物物理学和生物化学的科学直觉告诉我们,氨基酸残基并不是各自孤立地发挥作用,它们会受到其他残基的影响。所以我们要把这个因素融入进去。如果你从科学界学到了某些东西,就利用这些信息,赋予模型这种不公平的优势。
这使得模型的数据效率大大提高,因为它不必重新学习一切。我还得提一句,策划优质数据本身就是一门艺术。事情并不是简单地说一句“多放点数据进去”就行。如果你只是复制同样的数据,那是不会有任何进展的。关键不只是大数据,而是优质数据,以及理解取得进展所需数据的覆盖范围。这本身就是有趣得多、也更具挑战性的问题。
Brandon Anderson [00:12:20]:Sal,看起来你有话想说。你怎么看?
Sal Candido [00:12:24]:我非常赞同。这取决于要解决的问题。如果你的数据量较小,在模型中加入更多的归纳偏置会对你有帮助。在较小的数据规模下,你确实需要它才能取得结果。而随着数据越来越多,有时模型会发现你并不一定知道的东西,而那些归纳偏置,如果并不完全正确,可能会拖累你。随着情况不断改善,这里存在一个临界点。
不过我对你的问题还是有点异议,因为在规模化这件事上其实也有大量的工艺成分。把模型在更多数据上训练、投入更多算力、把模型做得更大,这背后有大量的算法工作。而这不仅仅是基础设施层面的,也不只是让模型更快地运行推理。我们看到各种事物正在超越标准的 transformer,走向更加定制的架构。我认为无论从哪种角度、哪种形式来看,我们都还没有进入后 transformer 时代,但我们正在修改这些架构,使它们更契合目标、表现更好,即便是在互联网规模的数据下也是如此。
随着越来越多的数据涌入,挑战不仅仅在于策划这些数据,或者挑选模型所需的下一批信息,还在于在每一步、每一个规模上追问:什么样的架构才能从这些信息中获得最大价值。
Brandon Anderson [00:14:36]:如果你看看当前蛋白质结构预测的现状,新闻会说蛋白质结构预测已经被解决了。但如果你和我的朋友们聊聊,他们会说:“我们在这方面还有很多工作要做。”功能、动力学和设计仍然是完全开放的问题。距离 AlphaFold 2 发布已经过去大约五年,确实取得了不少进展。
Pushmeet,你认为还会迎来下一次大的飞跃吗?解决这些问题是否存在障碍?是我们没有合适的数据、算法或想法吗?还是说这只是时间问题?
Pushmeet Kohli [00:15:28]: 科学通过隔离出某个东西,然后一步步取得进展的方式运作。当人们说蛋白质折叠问题已经被解决时,在概念层面确实有了进展。但想想蛋白质是构成基石的这种叙事。蛋白质并不是积木,它们也不像积木那样运作。我也总是说蛋白质是构成基石,但我其实并不相信这一点。
蛋白质极其复杂。它们是无序的。它们的形状可能会随环境而改变。John Jumper 和我过去常常讨论这个问题:我们到底想解决什么?我们并不知道蛋白质实际的真实基态,也不知道蛋白质实际采取的结构分布。我们想做的,只是复现某人获得并存入 PDB 的某个结构。我们做的就是这件事。而它恰好很有用。
但这并不意味着我们已经理解了所有的蛋白质动力学。从最高层面来说,说我们取得了进展更容易沟通,但在座的科学家们知道还有多少工作有待完成。有很多值得庆祝的事情,但我们不要停止为蛋白质结构预测和蛋白质动力学提供资金,因为我们才刚刚起步。
Brandon Anderson [00:17:39]: 最大的阻碍是什么?如果你能挥一挥魔法棒说“我们有更多这样的东西”,从而加速功能、动力学或设计方面的进展,你会创造出什么?
Pushmeet Kohli [00:17:54]: 我的背景相当杂。我最初是一名安全研究员,后来进入计算机视觉、贝叶斯理论、判别式机器学习、深度学习、AI 编程,最后是科学。所以当你问我那个问题时,我内心的计算机视觉研究员对冷冻电镜显微图像感到非常兴奋。
我当时想:“这些 PDB 数据是什么?我应该在源头工作。我应该去看冷冻电镜显微图像。我不想要那些结构。它们一定丢失了大量数据。我应该直接在冷冻电镜显微图像上操作。”
获得能够在这个规模上扩展的模型,配合合适数量的数据,并提取其中捕捉到的动力学和分布信息,那将非常了不起。我尝试过,但这需要更多的工作。
Brandon Anderson [00:18:57]: 还有工作要做,但你相信那是一条能够获得那些信息的途径吗?
Pushmeet Kohli [00:19:00]: 是的。我想也许某天会有比我更出色的人去尝试一下,我们就会有所收获。
Brandon Anderson [00:19:07]: 你怎么看,Sal?
Sal Candido [00:19:09]: 这很有意思,因为这些模型相当有用,但它们并不完全解决大多数人想解决的问题。它们解决一个非常特定的目的,同时你也可以用它们去做其他事情。例如,你可以用它们来设计新蛋白质,而这不一定是你最初会想到的用途。
我把我们现在正在构建的模型想象成一个试图理解自行车工作原理的人,但他只在建模其中的一根辐条。这些模型可以随着时间推移越来越好,但你真正需要做的是从辐条模型推进到车轮,再到整辆自行车,因为那才是人们想要理解的。继续这个类比,人们似乎想用自行车的模型来设计皮卡的零件。
当我们把这些模型放到它们实际运作的特定生物学背景中时,我们将能够在更广泛的尺度上了解这些相互作用。我认为事情正在朝这个方向发展。但我同意我们应该继续研究折叠模型,因为它们会不断变得更好。
Brandon Anderson [00:20:43]:关于设计,费曼有一句名言:“我不能创造的东西,我就不理解。”现在我们身处一个很容易在完全不理解的情况下就创造出东西的世界。拥有能帮助人类理解事物的模型,与那些能够有效一次性设计出皮摩尔级结合剂之类的魔法黑盒相比,有多重要?
Sal Candido [00:21:18]:早在 AI 出现之前,我们就在用魔法黑盒设计东西了。从某种意义上说,这仍然有用。但理解真的非常重要,这也是我思考 AI 时关注的核心问题之一。
这些模型要学习的东西太多了。随着智能变得越来越便宜、越来越普及,你可以部署它去更多地了解世界上正在发生的事情。但如何把这些知识从机器中提取出来,让我能够理解?也许这只是我个人深奥的好奇心。我认为有太多东西值得学习。
Brandon Anderson [00:22:05]:很多科学家真的想理解事物,而终点对他们来说可能没那么重要。但我们在这里是要把转化医学作为一个问题来解决,对吧?
Sal Candido [00:22:18]:我认为你越深入钻研事物,就越能找到推动它们前进的正确方式。对我来说非常明显的一点是,这些模型包含的信息比我们所知道的要多得多。
我们已经在模型的可解释性上做了大量工作,例如,你会在其中发现很多信息。人们知道蛋白质语言模型在其表示中学习了某种结构概念,但我们还发现了关于功能和运动的信息。即使是我们现有的模型,也还有很多有待发掘的东西。在提升它们能力的过程中,理解这一点对我们很重要。
归根结底,你期望一个世界模型能从把所有这些信息压缩进一个模型的过程中涌现出来。它是如何完成任务的?它如何设计一个蛋白质?它已经把进化中的信息压缩进了那个模型。除了能产出对我们有用的东西之外,仅仅通过观察模型内部,也肯定有值得学习的东西。
Brandon Anderson [00:23:48]:你怎么看,Pushmeet?设计还是理解?
Pushmeet Kohli [00:23:53]:我的看法有点不同,我认为某种程度的理解是必要的。让我解释一下我说的是什么程度。
AlphaFold 并不完美。AlphaFold 2 当时在该数据集上的 GDT 分数约为 90。但即使它的 GDT 分数达到 95,如果它的 pLDDT 分数完全没有经过校准,谁会信任它?想象一下,它神奇地给出了好答案,却告诉你它非常有信心,然后你为此工作了整整一年,结果发现它完全错了。不确定性度量的校准极其重要。
从这个意义上说,我们确实理解 AlphaFold 2,并且在理解它的行为方式方面取得了很大进展。这与理解它在内部如何求得解决方案是不同的。在这一点上我同意 Sal 的看法,可解释性问的是:它为什么有效?它为什么给出这个答案?
在最宏观的层面上,AlphaFold 2 在其行为和泛化能力方面是可解释的,而我们在发布之前并没有把这一切都弄清楚。当我们发布 AlphaFold 2 并公开权重时,人们发现它是一个出色的无序蛋白预测器。它能判断出蛋白质的哪些部分是无序的。这表明它具备泛化能力。
但可解释性还问了另一个问题:对谁可解释?如果你说的是由一个理性的、受人类大脑认知和计算能力限制的人类来解释,那么不,AlphaFold 2 不可解释。但如果你问的是 AlphaFold 2 对于一个规模更大、更复杂的模型来说,就其工作原理而言是否可解释,那也许是可以的。只是我们还不理解而已。
作为 AlphaFold 2 的使用者,我们确实需要了解它能做什么、不能做什么。理解它的行为特征、优势和局限性极其重要。我们不能在没有这种特性的情况下使用这些模型,否则它们非但无益,反而可能伤害我们。
Brandon Anderson [00:26:53]: 所以你的观点是,严格来说,可解释性并非必需,但确保模型值得信赖、让人类能够做出可付诸行动的决策,才是人们应该关注的重点。
Pushmeet Kohli [00:27:04]: 正是如此。可解释性也取决于观察者。是谁在解释它?如果是一位人类科学家试图解释模型如何做出预测,那是与让另一个规模大得多的 LLM 访问激活层并问它“你能预测 AlphaFold 会做什么吗”完全不同的问题。也许未来的那些前沿模型将能够做到这一点,并想出一套关于 AlphaFold 2 是如何解读并产出其结果的理论。
Brandon Anderson [00:27:43]: 我们还有两分钟,所以给两位一个最后的问题。AI 很有可能在不久的将来为人类健康带来巨大改善。我喜欢定量预测。最乐观的猜测:还要多久我们才能在临床中看到 AI 的成果?Pushmeet,你想先来吗?
Pushmeet Kohli [00:28:08]: 我认为“AI 在临床中的成果”是一个提法不当的问题。如今 AI 已经被应用于药物发现流程的每一个环节。从这个角度来看,它已经在这里了。
但如果你问的是我们何时能看到时间线上 10 倍或 100 倍的加速,那么下一个问题就是:我们加速的是什么?是先导化合物优化?靶点发现?临床前工作还是毒理学研究?
在未来几年里——这也正是今天宣布的这项工作极其重要的原因——我们需要攻克生物学中的一些艰巨挑战。只有这样,我们才能获得真正加速的突破,彻底变革药物发现。AI 将继续被用于那些不断进入临床的东西,但更大的加速只有在对这项工作试图创建的生物学模型有更深入理解之后才能被解锁。
Brandon Anderson [00:29:43]: 好的,谢谢。Sal,请尽快回答,我们的时间快到了。
Sal Candido [00:29:47]: 我真想干脆戴上我的生物黑客帽子来回答这个问题。思考如何推动这个领域向前发展非常重要。我们真正想看到的是切实影响的成果。什么时候会有一款完全由 AI 研发的药物?我不知道,这很难预测。但我确实认为我们很快就会看到快速的进展,因为这些工具已经都在被使用了。
回到你关于基础研究和基础理解的观点,我很早以前在 Google 工作时学到的一点是:有时候,与其追求 10% 的改进,不如问一下实现 10 倍改进需要什么,这样反而更容易解决问题。这并不是因为 10 倍的路径一定更容易,而是因为它能让你以更广阔的视野看到那些你尚未尝试过的解决方案。你会回到第一性原理,问:“我们要怎么做这件事?我们要如何真正推动它?”
这两种方式——10% 和 10 倍——都很有价值,我们应该两者兼顾。让我非常高兴的是,在 Biohub 我们有一个美好而宏大的使命宣言:治愈所有疾病。如果想要做到这一点,你就真的需要弄清楚 10 倍的路径是什么。能够去做这件事是一个绝佳的机会。
Brandon Anderson [00:31:46]: 太棒了。谢谢两位。谢谢你们坐在“火山口”上接受提问。非常有趣。
来源:Latent Space · latent.space