跳到正文
Latent Space·· 3 小时前AI 评分53

Periodic Labs 创始人 Liam Fedus 与 Ekin Dogus Cubuk 谈"合成超级智能"与自主材料发现实验室

Synthesis Superintelligence: from Semiconductors to Superconductors — Periodic Labs’ Liam Fedus and Ekin Dogus Cubuk

AI 导读

Latent Space 播客访谈 Periodic Labs 联创 Liam Fedus 与 Ekin Dogus Cubuk,阐述其"合成超级智能"愿景:让 AI 智能体围绕物理实验室构建强化学习环境,通过预测、合成、表征的端到端材料发现循环学习,而非仅依赖互联网数据。

正文 · AI 翻译

很难相信 Periodic 去年 九月才刚刚成立:

X avatar for @periodiclabs

Periodic Labs@periodiclabs

我们很自豪地宣布 @periodiclabs 成立。我们的使命是加速科学进步。 我们的创始团队曾共同缔造了 ChatGPT、DeepMind 的 GNoME、OpenAI 的 Operator(现为 Agent)、神经注意力机制、MatterGen;曾扩展了自主物理实验室;并曾为重要的……做出贡献

X avatar for @LiamFedus

Liam Fedus @LiamFedus

今天,@ekindogus 和我很高兴地推出 @periodiclabs。 我们的目标是创造一位 AI 科学家。 科学的运作方式是:推测世界可能的样子,进行实验,并从结果中学习。 智能是必要的,但并不充分。新的知识是

2025年9月30日 下午4:05 · 24.3万次浏览

51条回复 · 99次转发 · 684个赞

一年之后,它已被视为最杰出的 AI 科学家实验室之一,拥有令人惊叹的 人才密度,并且在自主实验室建设方面取得了惊人的进展:

X avatar for @LiamFedus

Liam Fedus@LiamFedus

工业规模的科学。今年夏天将来到你附近的实验室。

2026年4月26日 下午3:30 · 25.3万次浏览

69条回复 · 73次转发 · 1300个赞

大多数人都熟悉 Liam 和 Dogus 的标准履历,但在深入了解 Periodic 的过程中,我们发现了一条令人惊叹的“人才斜率”——每一位新加入的员工似乎都比前一位更加出色:

X avatar for @khoomeik

Rohan Pandey@khoomeik

没错,确实如此 我在 periodic 的头几个月里,每周的中期训练会议参加者是: 1. 训练出第一个万亿参数 LLM 的人 2. 发明注意力机制的人 3. 我 被这样的人才密度包围,你会成长得非常快。顺便说一下,我们在招人。

X avatar for @chrisbarber

Chris Barber @chrisbarber

我调查了人们认为估值 100 亿美元以下、人才密度最高的新实验室是哪些: 32票:Core Automation(@MillionInt、@_arohan_) 26票:Periodic Labs(@LiamFedus、@ekindogus) 20票:Flapping Airplanes(@spectorb、@amspector100、@aidanmantine) 18票:Standard Intelligence

2026年10月2日 晚上7:43 · 8.03万次浏览

20条回复 · 16次转发 · 669个赞

从构建能够对嘈杂的物理实验进行推理的 AI 系统,到打造让每台仪器都能变得智能的实验室,Periodic Labs 押注下一个 AI 前沿将不再来自简单地在更多互联网数据上训练,而是来自让模型与真实世界进行实验。在本期节目中,Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 与 swyx 和 Brandon 一同探讨为什么科学发现与数学和编程有着根本的不同,以及构建能够真正发现新材料的 AI 科学家需要什么。

我们深入探讨了 Periodic 对 “合成超级智能” 的愿景:以物理实验为基础的强化学习、AI 驱动的材料表征、模拟与密度泛函理论、高通量实验室,以及从整个科学研究过程而非仅仅从已发表成果中学习的系统。Liam 和 Dogus 还解释了为什么前沿模型仍需要实验、为什么失败的实验可能是最有价值的训练数据之一、让每件实验设备拥有 “140 IQ” 意味着什么,以及自主实验如何能将数十年的科学试错压缩到几个月。

  • 为什么对于科学发现而言,仅有智能是不够的:

  • 当环境是物理世界时,强化学习会如何改变:

  • 为什么科学需要在不确定性、噪声和缺失信息下进行推理:

  • 材料发现循环中的预测、合成与表征:

  • 为什么物理学和材料科学仍远未“被解决”:

  • “物质编译器”与 Periodic 的合成超级智能目标:

  • 相变、X 射线衍射与 AI 驱动的材料表征:

  • DFT、模拟,以及为什么实验仍然是最终的真实基准:

  • 室温超导体、新磁体、电池与更高效的计算:

  • 为什么量子计算未必能自动解决材料发现问题:

  • 让每件实验设备拥有 “140 IQ” 意味着什么:

  • 为什么数据质量和阴性结果比单纯向科学投入更多算力更重要:

  • 在科学研究的过程而非最终答案上训练模型:

  • 为什么即使是未来的前沿模型仍需要进行物理实验:

  • 在 AI、化学、物理和定制硬件领域扩展自主实验室:

  • 自动化实验如何能大幅增加发现新材料时“运气的表面积”:

00:00:00 引言

00:02:49 物理世界中的 AI 与强化学习

00:09:17 端到端材料发现闭环

00:13:28 为什么物理学尚未被“解决”

00:19:04 物质编译器与 AI 表征

00:30:22 DFT、模拟与实验基准真值

00:42:27 梦想材料、算力与量子计算

00:45:57 赋予每台实验室仪器“140 的智商”

00:50:02 实验室自动化

00:53:16 数据、模型与负面结果

00:58:13 用科学的过程训练 AI

01:00:20 为什么前沿 AI 仍然需要实验

01:06:06 扩展自主实验室

01:10:45 组建团队并落地产业界

01:17:01 从 AI 副驾驶到科学成果

01:20:57 自动化搜索超导体

Swyx [00:00:00]: 好的。我们现在在 Periodic。今天我们请到了 Periodic 的 Liam 和 Doğuş。欢迎你们,也感谢你们让我们来到这里。

Liam Fedus [00:00:11]: 是的,很高兴来到这里,也谢谢你们来访。

Swyx [00:00:13]: 我想从你们网站上一句我很喜欢的话开始。它写道:“智能是必要条件,但并不充分。只有当想法被证实与现实一致时,新知识才会被创造出来。”这听起来如此直白,但为什么它并非显而易见?

Liam Fedus [00:00:29]: 我认为这就是 Doğuş 和我在创立 Periodic 时的核心论点和前提:你不能光靠思考就找到解决方案。宇宙如此复杂,要真正推进知识的边界、取得进展,你必须提出这些猜想,然后实际验证它是否成立。再怎么重读教科书或论文、再怎么思考、或者把自己关在房间里,都无法让你推演出所有可能的实验结果——无论是预期之内还是预期之外的——你真的需要这个迭代的过程。这就是我们把这一切整合起来的核心信念,也是为什么从一开始我们就认为:“我们需要有 AI 系统、有物理世界的模拟,但同样也要建立起物理的高通量实验。”我们认为,会由此涌现出一种不同类型的智能。

Swyx [01:21]: 我认为还有一点值得注意:在 OpenAI 和 Google 这样的大实验室里,你并没有这些资源。你必须走出来做自己的事情,因为你其实是在一边走一边发明自己的打法。

Ekin Doğuş Çubuk [00:01:34]: 是的,我认为像这样的团队以前从未存在过。我们试图把固态化学家、固态物理学家、实验科学家、理论科学家、硬件工程师、大语言模型专家和计算机科学家聚集在一起,其中一些技术还非常新。高通量实验、机械臂这些只是在大约过去三年里才被尝试过。力场方面的专长,其中一些力场也非常新。但是,我们觉得拥有一个实验室非常重要。拥有这样的专注点,把这些不同的人聚集在一起共同合作非常重要。我想历史上最接近的例子是像贝尔实验室这样的地方,杰出的理论家、实验家和化学家在一起合作,取得了令人难以置信的成就。所以我们正在尝试做同样的事情,是的。

Brandon [00:02:17]: 我想稍后谈谈力场,不过

Swyx [00:02:19]: 好

Brandon [00:02:19]: 在我们聊到那之前。是的,力场是什么?但在聊到那之前,先说明一下背景:我们的听众中有些是 AI 工程师,有些是科学家。对工程师们来说:在 OpenAI 这样的大实验室工作和你们在这里做的工作有什么区别?我想你已经有所暗示了,但也许可以更明确地说,你需要如何调整自己的思维方式?

Liam Fedus [00:02:49]: 嗯,我觉得一个有趣的地方是,现在我们的强化学习环境直接来源于真实环境,来源于我们的物理实验室。我们的数据来自物理实验室,这可以说是我们的终极真相。仅仅针对某些论文或教科书中已知的答案做优化是不够的,因为我们要超越这些,我认为这是最大的区别之一。但与此同时,还有不确定性下决策的问题。当你针对数学做优化时,精确度很高。你不太需要处理方差、不确定性或异常测量,而这些正是我们流程中的关键。例如,当我们在进行材料发现循环时,从炉子里出来的东西不会自带标签,对吧?连标注过程本身都可能充满随机性和噪声。有时不同机器之间还会有偏差。也许我们会遇到遥测数据不足的情况:我们以为是在某个温度下运行的,但实际上温度有某个偏差。而一个能够接收这些带噪声的数据并像科学家那样做出智能决策的智能体,需要的是另一套推理策略。所以我认为两者有很多共性,比如标准的 mid-training、强化学习、构建使用工具的智能体、方差缩减、确保基础设施在训练和推理之间不存在不一致。但我们必须超越这些,真正思考:在高度不确定性下如何做出准确的工作?如何极其高效地利用有限的数据?所以我们在大规模扩展,但即便如此,这仍然与数字环境非常不同——在数字环境里你可以随意增加更多环境或更多 rollout,而我们没有这样的能力。所以样本效率是另一个关键点。

Brandon [00:04:48]: 这对我来说有点抽象,这也是科学播客里出现了一阵子的话题,不过我觉得,在你谈到实验不确定性时,先解释一下你们具体在实验中做的某个流程是什么样子的、人类会如何处理这个问题,然后再进入 AI 的部分,可能会有所帮助。你有没有一个具体的例子,比如你制造的某类材料,以及在这个过程中你会遇到什么样的测量不确定性?

Ekin Doğuş Çubuk [00:05:17]: 我认为这有很多个维度。其中一个方面是,我认为每一项科学实验都要做某种降维处理,这和编程或数学非常不同。当你做数学或编程时,所有上下文对人类或 LLM 来说都可能是可用的。它是一堆公理,以及人们从中推导出的一些推论。它是一堆函数和 API 调用。所以你进行推理所需的一切都是可用的,你只需要非常聪明地把它想通。而在物理学中,正如你所知,我们面对的原子数量多到任何计算机都无法存储。所以显然,我们必须从表示一个系统的原始维度和比特数,压缩到计算机能容纳的比特数。我想,这正是热力学最初的前提。人们起初对蒸汽机的工作原理非常困惑,但后来发现,用五六个热力学变量就能相当好地解释正在发生的事情,这实在令人惊叹。这就是物理学的美妙之处。

Brandon [00:06:13]: 你有一个满是原子的房间,其中有 10²³ 或 10²⁷

Ekin Doğuş Çubuk [00:06:19]: 没错

Brandon [00:06:19]: 或者类似的数量的原子在这个房间里,然而你只需要温度和压强这些简单的变量,它就能告诉你一切。不,它告诉你的基本是你需要知道的

Ekin Doğuş Çubuk [00:06:28]: 很多

Brandon [00:06:29]: 对于大多数情况来说,对吧?

Ekin Doğuş Çubuk [00:06:30]: 是的。

Brandon [00:06:30]: 比方说,你制造了一种材料,你可以做诸如观察 X 射线结构这样的事情,而这是一个非常有损的投影,对吧?它实际上并不是一个结构,或者说它不会告诉你真实的结构。它告诉你的是其中某些主成分。那么,人类会如何利用这些简单的主成分并进行推理?然后又如何把这一点扩展到 AI 上?

Ekin Doğuş Çubuk [00:06:58]: 在理论物理方面,对吧,我们已经确定能量、能量的平均值以及能量的涨落非常重要。很多热力学都是从这些推导出来的。然后我们意识到反应势垒也非常重要。动力学也非常重要。于是人类可以尝试通过提出一些降维的描述符来推理这个极其复杂的系统。人们也非常喜欢原子层面的图像。你会思考局部邻域是什么样子,它们是八面体还是四面体,尤其是化学家能从中获益良多。好,这是理论方面。而在实验方面,你会尽量收集尽可能多的数据。所以你会有一个实验记录本,把你看到的一切都写下来,等等,当然你也明白自己会漏掉很多东西。就像 Liam 提到的,会出现各种各样的问题。例如,你的炉子会随时间老化,因为在使用炉子的过程中,你烘烤的一些东西会蒸发并覆盖在加热元件上。所以每使用一次炉子,它的性能就变得越来越差。另一个问题是,你有一个炉子,但温度并不完全均匀,所以你把样品放在炉内的哪个位置会影响结果。这个问题我们目前还没有,但也许某天会遇到。光学仪器很容易受振动影响。每当有人走动就会产生影响。我记得我读博士的时候,有一个实验室有个大问题,因为有时他们的结果会和其他时候差别很大,最后他们发现是因为在夜间某个时间点,楼上有人在走动,那个振动影响了激光装置。所以是啊,科学非常难,但这正是它特别之处,对吧?我和 Liam 一直在讨论的另一件事是,目前很多改进都集中在数学、编程和理论计算机科学上,因为这对大语言模型来说更容易。但在现实生活中,大多数需要智慧的事情其实更像科学。存在大量不确定性、大量噪声、大量缺失的上下文,但你必须成为那个有智慧的主体,去弄清楚下一步该做什么。

Liam Fedus [00:08:53]: 我认为在此基础上还有一点很有意思:做数学、做理论计算机科学、做这类事情的最优推理策略,可能并不是做科学的最优推理策略。

Ekin Doğuş Çubuk [00:09:04]: 是的。

Brandon [00:09:05]: 当你的输出是一个含噪的晶体结构,或者是某种——我不确定—— collective variables 之类的量时,你该如何定义 RL 的奖励函数?比如。

Liam Fedus [00:09:17]: 或许这样,我来讲讲这个循环中的一部分,深入聊一下。作为材料发现循环的一部分,我们首先要弄清楚该制造什么。也就是原子组合在一起的稳定性,以及我们是否预期它具有我们想要的性质。我们不只想要一种新颖的原子构型,我们希望这些原子放在一起后具有我们感兴趣的属性。接下来是如何合成它?你究竟怎么把它造出来?这同样不容易。即使你知道某种东西能稳定存在,实际造出它所需的加工条件也非常不容易。但同样的事情是,当你完成这两步、做出某种东西之后,它上面不会自带标签,所以你必须对它进行表征,弄清楚你到底造出了什么。因此在这种情况下,不要想着把强化学习环境设定为:我们启动一个实验,等上几天,然后更新一下你有没有发现室温超导体,那是完全不可行的。

Brandon [00:10:15]: 是的,我正想问这个。对,你不可能把 GPU 搁置一个星期之类的。

Liam Fedus [00:10:19]: 对,完全不可行。

Brandon [00:10:20]: 是啊。

Liam Fedus [00:10:20]: 因为你没有足够多的智能体来充分降低方差。不同仪器之间的 rollout 时间很长。你在等待。实验本身有物理上的极限,比如实际的合成时间或炉子时间。所以就是太慢、噪声太大。因此我们对这个 AI 项目的思考方式,基本上是围绕我们产出的这批数据来构建智能体。就以表征为例,你要寻找的强化学习环境,其奖励是识别出实际存在的物相。给定原始实验数据,你能否有效地进行拟合?我们的做法是用 X 射线照射材料。X 射线的频率或波长与原子间距大致相当,所以你能得到漂亮的衍射图案,它就像晶体结构的指纹。而据此识别实际存在的东西是非常不容易的。我们早期的一些 AI 工作基本上就是构建能完成这项任务的系统。这也能让我们推进得更快,因为当你运行这么多实验时,你很快就会在“理解产出了什么”这件事上遇到瓶颈。不过话说回来,这里的强化学习环境相当直接:你奖励对实际存在物相的识别,惩罚虚假的物相或任何在化学上说不通的东西。这就是一个简洁的小例子,你可以对各个环节都这样做。当你把这些拼接起来,那就是端到端的发现循环。

Brandon [00:12:02]: 好的。你

Liam Fedus [00:12:02]: 也许再

Brandon [00:12:03]: 是。哦,抱歉

Liam Fedus [00:12:03]: 另一部分是,随着我们积累起大量实验数据,你可以把另一件事理解为给世界的状态打上时间戳。也就是说,你可以说:“在这个日期之前,这就是我们掌握的全部实验证据。”然后你可以构建强化学习环境,提出这样的问题:“好,基于这批实验证据和当时的种种选择,科学家接下来做出了什么决定,或者那次实验得出了什么结果?”这也非常有意思,因为它让我们能够做一些在外部更难实现的训练项目。因为如果预训练模型已经记住了这些数据的一部分,然后你在此基础上做强化学习,如果它已经知道答案,而你构建的强化学习任务又依赖于那个答案,它就可以假装努力。就是说,哦,反正它已经知道答案了,所以它根本不用做真正艰难的物理推理,也不必真的去做计算和模拟。它照样得到正确答案,然后你强化了那个策略,把那些推理策略的权重调高。而这些推理策略不会泛化到新系统上,所以对我们没有用处。但随着我们积累起一批批实验数据并把它们串联起来,拥有贯穿整个过程的数据脉络,我们就能够构建其他地方根本无法实现的新型环境。

Swyx [00:13:27]: 我想问我的问题

Brandon [00:13:28]: 认真点

Swyx [00:13:28]: 但我担心我会把话题带偏。我还是直接问吧,因为再说一次,我是搞工程的,不是搞科学的。我熟悉机器学习那边,但不熟悉物理那边。好,这个问题有几个版本,但基本的问题是:难道我们不是已经把大部分物理定律都搞清楚了吗?那为什么我们还没有完美的模拟器?

Brandon [00:13:50]: 哦,这个问题问得好。

Swyx [00:13:52]: 就是说,这问题很基础啊,就像。然后他一副“哈,真可爱”的样子,但是

Brandon [00:13:56]: 不,这真是个好问题

Swyx [00:13:57]: 老兄,我家里堆了一堆物理书。你是什么意思,你是什么意思说我们还没搞完?

Ekin Doğuş Çubuk [00:14:03]: 是的,这里其实有几层情况,对吧?所以

Swyx [00:14:07]: 嗯

Ekin Doğuş Çubuk [00:14:07]: 我觉得首先,我们肯定还远没有搞完任何一条物理定律。即使是

Swyx [00:14:12]: 量子尺度上,好,还有可能特别大的尺度上。但在人类尺度、材料尺度上,我们……还差什么?

Ekin Doğuş Çubuk [00:14:22]: 还没有。这是个非常好的问题。为什么我们还没完成,这也非常有意思,对吧?有一个很常见的故事人们经常讲。当狄拉克在研究量子力学的时候,大约在 1920 年代末,他写了一本量子力学教科书,并且有点把它描述成一切已经完成了。然后有一句话人们喜欢引用,我不确定它到底有多准确,但据说狄拉克说过:“剩下的就是化学了。”意思是说他可以求解氢原子

Swyx [00:14:50]: 只要把一切组合起来就行了。

Ekin Doğuş Çubuk [00:14:51]: 对。他也许能求解一维氢原子链,但他目前无法求解,比如说,氮与氧的相互作用,不过没关系,那只是化学而已。

Swyx [00:15:00]: 是啊。

Brandon [00:15:00]: 物理学家真的喜欢单原子的表示。非常简单的系统。

Ekin Doğuş Çubuk [00:15:05]: 简单的系统。

Brandon [00:15:05]: 而且那是你唯一能求解的。

Ekin Doğuş Çubuk [00:15:07]: 球形奶牛。

Brandon [00:15:07]: 对,球形奶牛。

Ekin Doğuş Çubuk [00:15:08]: 但事实证明,我认为我们在过去一百年里学到的是,首先,那并不成立。它并不是简单求解氢原子方法的简单延伸。而且“剩下的只是化学”也不对。其实那里有很多物理学。我想我们至今还没搞清楚的事情之一就是高温超导。但还有很多其他的

Swyx [00:15:25]: 对你来说“高温”是 175、200 吗?

Ekin Doğuş Çubuk [00:15:28]: 哦,当人们说高温超导时,他们指的是非常规超导。有一种常规超导,主要由电子-声子耦合驱动。在这种情况下,你可以看到同位素效应。如果你取同一个系统,只是改变其中一种元素的重量,你可以看到超导温度按你预期的速率下降。所以那种是常规的。但更高温的超导体,比如铜氧化物,那些高于 77 开尔文、比如 93 开尔文的,结果发现并不遵循那种物理。而我们也不知道它们遵循什么物理。它们只是令人难以置信的超导体。但不仅仅如此。那确实是我们还没有理论的非常热门的话题之一。但还有很多其他我们不理解的东西。例如,即使是简单量子力学系统中的强关联,我们也还无法模拟。密度泛函理论是一个非常强大的工具,它在某些方面非常精确,但只要出现一些强电子关联,它实际上就无法捕捉某些效应。有太多东西要弄清楚。这就是为什么我对 AI 应用于这个领域感到非常兴奋,因为从理论上、计算上和实验上,都有太多东西要弄清楚。而我们在这里取得的每一项进步都应该能改善人类生活,因为我们对材料、固态物理理解得越好,我们就能为它们制造出更好的设备。

Brandon [00:16:41]: Phil Anderson 有一句名言:“多者异也”,意思基本上是,你可能理解了某个事物的所有基本定律,但当你加入大量的事物时,它们会表现出质上截然不同的行为,与简单物理学所预言的不同。所以理解大量事物如何共同行为,看起来似乎应该很简单。基本定律很简单,但集体行为却如此复杂,以至于很难建模。

Ekin Doğuş Çubuk [00:17:07]: 它是涌现的、普适的,这太疯狂了。我们在深度学习模型中也看到了这种现象,对吧?我们在深度学习中处处看到幂律。我们不理解它,但这非常让人联想到物理学中的涌现性和普适性。

Brandon [00:17:20]: 物理学界已经有很多关于神经网络中涌现现象的理论论文。

Ekin Doğuş Çubuk [00:17:24]: 是的,绝对是的。

Brandon [00:17:25]: 嗯。

Swyx [00:17:26]: 我的另一个追问是关于这个过程——姑且这么说——以及最终结果。比如说,你想获得为材料设定的这些目标特性,然后你必须弄清楚实现它们的过程。把这两者分开是否有价值,这样你就可以……只训练一个模型,给定你想要的任何理论上的最终状态,它就能完美地逆向工程任何过程?这有意义吗?

Ekin Doğuş Çubuk [00:17:54]: 回到我们之前谈到的,由于原子数量超过了阿伏伽德罗常数,我们永远无法确切知道发生了什么的来龙去脉。我认为这可能是我们永远无法完美逆向工程一切的一个原因。但我们只是想逆向工程到足以能够改进材料性能的程度,基本上是这样。

Swyx [00:18:13]: 是的。

Brandon [00:18:13]: 你问的是,有没有一个前向模型,你输入一个输入就能预测输出,而你想了解

Swyx [00:18:19]: 是的。

Brandon [00:18:20]: 你想创建一个类似代理模型的模型,它能够理解

Liam Fedus [00:18:22]: 输入是最终的状态,即原子的这种构型,然后预测是

Swyx [00:18:27]: 因为这样你几乎可以把工作拆分开。你可以让一个团队做过程这一侧,另一个团队做特性这一侧,然后

Liam Fedus [00:18:33]: 是的

Swyx [00:18:33]: 你知道,让它们赛跑。

Liam Fedus [00:18:36]: 是的,我认为在这些方面我们还有很多可以取得的进展。把这些智能体工作流拆分到这些不同领域,我认为在合成预测方面我们也可以做很多实证工作。

Swyx [00:18:49]: 是的。

Liam Fedus [00:18:49]: 而面对那样的原子构型,你能用哪些工具?如何根据这些实验证据、根据已有的文献、已有的论文,真正得到这些东西?而最终你是在检验,你到底能不能把它复现出来?

Swyx [00:19:04]: 我之所以这么说,也许也是从公司的角度来思考。你知道,就像台积电(TSMC)有点像半导体的代工厂,但他们并不设计芯片,你可以成为材料领域的台积电,人们带着需求来找你,“嗯,我想要这样的东西”,然后你来摸索出工艺流程,

Liam Fedus [00:19:21]: 是的,就像一个物质编译器。

Swyx [00:19:23]: 对。

Liam Fedus [00:19:24]: 所以我想,给定这些需求

Swyx [00:19:26]: 非常《星际迷航》。

Liam Fedus [00:19:27]: 是的。但这就像是,给定这些需求,这是否真的是一组有效的构型?这个东西,这个东西能存在吗?

Swyx [00:19:33]: 它是一个好的目标函数吗?我不知道。它太庞大了。

Liam Fedus [00:19:37]: 是的。我们基本上把我们其中一个使命称为合成超级智能,所以我觉得这与这个方向是一致的。

Swyx [00:19:44]: 是的。

Brandon [00:19:44]: 我想深入探讨你刚才提到的一点,就是你谈到了相。结合 Doğuş 关于什么是涌现的评论,我想相变这个概念可能对很多听众来说比较陌生。那么你能解释一下什么是相变,以及为什么它是强化学习环境这类事物的一个有用信号吗?

Ekin Doğuş Çubuk [00:20:08]: 相变非常迷人。我觉得人们最容易在日常生活中联想到的,大概就是冰融化,或者水沸腾。你给冰升温,它看起来还是冰,行为也像冰,但在某个温度下,它的温度不再升高,然后变成液体。也就是说,它突然从固相转变为液相。另一个与我们非常相关的例子是伊辛模型。我想计算机科学和数学家可能也在用不同的名字研究它,但基本上,你可以有向上和向下的自旋,它们在同为向上和一上一下时的相互作用项不同。在足够高的温度下,它们通常只是随机地向上或向下。熵占了上风。你降低温度,它们看起来还是一样。但在某个时刻,它们突然开始完美地排列。是的,这就是相变。相变真的很美妙,因为它让物理学家研究某些问题变得更容易。它们往往具有某些空间相关性,这对我们也很有帮助。好,在我们的实验室里,相变通常是这样产生的:我们混合不同的前驱体,基本上就是晶体,然后升高温度或采取其他方式促使它们反应,于是原子开始反应,形成新的晶体。这会体现在 XRD 图谱上,因为通常如果原子的几何结构发生剧烈变化,XRD 图谱就会变化很大。但在一次典型的实际材料发现工作中,当你第一次尝试某种东西时,它不会成功,而且结果不只是一个明确的“是”或“否”,而通常是一个混合非常严重的相。它通常会含有一些前驱体,可能含有一些非晶相,还会有一堆你也许根本没打算合成的相。这就成了一个挑战,也是为什么我们觉得很难把模拟和 AI 结合起来做表征。模拟总是可以说:“哦,这个相看起来不像我们预测的,但这是它的一点小变化。让我现在对它做力场计算,看看它是否仍然稳定。”或者 AI 可以说:“基于上一次实验和这一次,这大概不是我们想合成的相,所以我们换个条件吧。”

Liam Fedus [00:22:18]: 是的,在某些情况下

Swyx [00:22:19]: 给听众说明一下,XRD 是 X 射线衍射,你已经描述过了。

Liam Fedus [00:22:22]: 是的。在某些情况下,存在一个以前从未被记录过的相。它不存在于任何论文或数据库中。因此 AI 必须真正去使用这些工具,来回答:“什么样的原子构型才能真正解释这些相?”但这对指导科学过程来说极其重要,因为假设我们心中有一个目标相,我们真的需要像爬山法那样不断改进,以获得对它更好的测量。所以如果它的占比是百分之一,而我们想要提高这个相的纯度,我们就需要对实验数据有非常好的测量,以判断什么存在、什么不存在。

Brandon [00:22:57]: 所以其中一个优势是你有完全不同的一个变量可以直接观察。回到关于如何处理不确定性的那个问题,你的答案中似乎有一部分是让你的可观测特征变得相当明确。不需要任何解读。是这样吗?这背后的逻辑是如此吗?还是说你只是需要找到一个新物相,所以这就是你在意的点?

Liam Fedus [00:23:20]: 我认为在很多情况下仍然存在歧义。一个很朴素的办法就是重复实验。

Brandon [00:23:25]: 是的。

Liam Fedus [00:23:26]: 我们当然会做重复实验。

Brandon [00:23:27]: 对,对。

Liam Fedus [00:23:28]: 不过不,我认为——你知道,这是一项有挑战性的任务,因为它不是完全确定的,确实存在歧义和其他问题。两个不同的物相实际上可能与同一模式相吻合。

Brandon [00:23:42]: 是的。

Liam Fedus [00:23:42]: 所以我认为这就是为什么系统利用一些化学直觉非常重要,比如“好,鉴于合成条件、鉴于这些先验知识,这极不可能。”这样可以用来帮助消歧。

Swyx [00:23:58]: 所以你是在某种程度上注入了先验,基于你的预期。

Ekin Doğuş Çubuk [00:24:03]: 是的。我认为热力学是最大的先验,对吧?

Swyx [00:24:06]: 确实是。

Ekin Doğuş Çubuk [00:24:07]: 然后物理是很大的先验。我们在这里真正受益的另一个因素是多模态,即材料表征。我们可以做XRD,是的,某些物相在XRD谱图上可能看起来相似,但我们还可以测量它们的电学性质、磁学性质。我们可以测量它们的形貌,比如某种电子显微术。这样,一些在XRD上看起来相似的物相会在其中某些维度上表现出差异。这种多模态真的很有帮助。而且,AI在这里也非常有用,因为人类的上下文和计算能力都是有限的。如果你同时给人类10种不同的模态并说“把它们全部一致地分析出来”,这有点困难。但对AI来说做到这一点其实并不算特别高深。效果非常好,是的。

Liam Fedus [00:24:46]: 是的,所谓超级智能就在于它能做大量的计算。它可以审视一切。这就有点涉及到那句关于在不确定性下更好决策的说法——现在它把来自许多不同仪器的信号纵向地、跨不同实验、跨重复实验地拼接在一起,进而得到一个更好的底层模型

Swyx [00:25:08]: 是的

Liam Fedus [00:25:08]: 而不是仅仅过度依赖来自单一仪器的一次测量。

Swyx [00:25:12]: 让我先,这么说吧。你知道,我想你之前有一段时间也说过,数据多到任何合理的计算机或处理流程都无法容纳。所以在某个时候,你不得不丢弃数据,即使你有所有这些重复样本,即使你大概有十种不同的方法来测量同一件事。这是因为,万一你的某个温度传感器出错了呢?那什么时候丢弃它?你怎么决定怎么做?作为一个渴求数据的机器学习 guy,我什么都想要,对吧?然后我就,你知道

Ekin Doğuş Çubuk [00:25:37]: 所以是,嗯。

Swyx [00:25:37]: 摇摆,全都要学。我不知道自己不知道什么,就是把机器往上一扔就行了。

Ekin Doğuş Çubuk [00:25:42]: 是的。所以我们不丢弃任何数据。我想我指的可能是,假如上帝在观察这个实验

Swyx [00:25:50]: 嗯。

Ekin Doğuş Çubuk [00:25:50]: 实验中的数据比人类能装进计算机的要多。遗憾的是,我们凡人无法观察到所有原子。所以尽管有超过我们能存储量的数据,我们实际上无法访问那些数据。例如,我无法追踪所有原子的位置。所以不幸的是,我们仍处于这样一个阶段:我们收集的任何数据都非常珍贵,我们不会删除任何数据。嗯。

Brandon [00:26:11]: 也许有一种把它和 AI 那边联系起来的思考方式,就是想想探测,比如对基础模型的线性探测,对吧?这个模型拥有所有这些数据,所以上帝拥有材料正在发生什么的完整图景,而实验就是这个小小的线性探针,只有八比特左右的输出。所以你是把这个庞大的东西粗粒化成一点点信息,然后传统上由人类、现在由你的智能体来做的事,就是从这八比特信息中重构

Liam Fedus [00:26:43]: 这是一个类比,是的。

Brandon [00:26:44]: 内部实际发生了什么。

Liam Fedus [00:26:45]: 这是一个类比:你无法对每个参数权重、对该输入的每个激活都有完整的可见性。是的,你只能得到它的某个子集,或者贯穿整体的某些粗粒化特征。

Ekin Doğuş Çubuk [00:26:58]: 是的。不过你可能会发现,你很可能确实会发现,麦克斯韦妖的论证非常有趣,因为那种

Swyx [00:27:05]: 你能,你能再复述一遍吗?因为我不,他之前提到过,我总是忘。

Ekin Doğuş Çubuk [00:27:10]: 那么,在 19 世纪,人们意识到一个系统的熵必须增加,或者说对于一个封闭系统

Swyx [00:27:18]: 嗯。

Ekin Doğuş Çubuk [00:27:18]: 或者保持不变,但不能下降。

Swyx [00:27:20]: 嗯。

Ekin Doğuş Çubuk [00:27:21]: 这就是热力学第二定律。有一个思想实验问的是:如果有一个非常微小、无所不知的恶魔,能够观察原子,然后每当某个原子能量较低时,就打开一扇门让它进入另一个房间,并不断这样做以降低系统的熵——这岂不是会打破热力学第二定律?很长一段时间里,我认为这个问题没有一个令人满意的答案。但后来在 1900 年代,离我们更近一些的年代,有一篇更新的论文,Landauer 提出了一个论证:删除信息必须消耗能量,而麦克斯韦妖在做他这件事的过程中会获取海量的信息,以至于他不得不删除一些信息。而当他删除信息时,就必须消耗能量,这又会确保熵的增加。所以尽管我们还没达到能成为麦克斯韦妖的水平,但我认为你的问题对于一个未来——我们存储的数据多到不得不删除一些——是非常有远见的。

Swyx [00:28:17]: 是啊,不,我显然没想得那么远。这让我想起了空调。空调大概就是这么工作的。不过我也觉得,这就是个为什么不干脆买下世界上所有传感器、对所有东西进行疯狂过度监测、过度复制的问题?

Liam Fedus [00:28:33]: 哦,我们就是这么做的。

Swyx [00:28:34]: 对吧?是啊,好,好,好吧。这就说得通了。

Liam Fedus [00:28:35]: 是的,是的。

Swyx [00:28:35]: 好,那就没问题了。行,好的。

Liam Fedus [00:28:37]: 是啊,我觉得,我觉得这是一个

Swyx [00:28:39]: 确认了。

Liam Fedus [00:28:39]: 对,没错。问题在于你能否观测到单个原子,而这是不可行的。但我们确实添加了海量的遥测数据,这基本上减少了隐藏变量的数量,可以这么说。

Swyx [00:28:49]: 是。是的。出于好奇,你们只待在加州,会不会担心?难道不想在尼泊尔和澳大利亚也这么做吗?

Ekin Doğuş Çubuk [00:28:59]: 是的,可以。我们有开设更多实验室的计划。

Swyx [00:29:02]: 因为很显然,重力和你所处的方位、你所在的位置都很重要。

Ekin Doğuş Çubuk [00:29:07]: 另外专业技能也会因地而异,对吧?我们这里有某些特定类型的专业能力。比如斯坦福的物理系、工程系拥有某些专业技能,这对我们很有帮助,因为我们可以从那里招聘,我们的研究人员也可以与之合作。正如你所说,地理位置可能很重要,但不同城市在物理、化学等领域也可能各有专长上的差异。

Swyx [00:29:27]: 是啊。哦,我们有 Zoom

Ekin Doğuş Çubuk [00:29:28]: 是啊。

Swyx [00:29:28]: 可以用来做这个。

Ekin Doğuş Çubuk [00:29:29]: 是。不过即便如此

Swyx [00:29:31]: 反正你们的实验也不会受到所在位置的影响吧。

Liam Fedus [00:29:34]: 是的。是的,Periodic 的未来不是一个单一的实验室。

Swyx [00:29:38]: 是的。你得登上你的私人飞机去太空,你知道的。

Liam Fedus [00:29:42]: 对。是的,我认为有必要建立这样一个实验室网络。而且,就像 Doğuş 刚才指出的那样,基于专长或材料限制,每个实验室都有各自的最佳位置。限制有很多种,比如许可审批。

Brandon [00:29:56]: 好的,那么其中一个问题就是。我一直很好奇的一件事是,你们如何处理计算工具?或者说,你们如何将计算工具整合到决策工作流中,尤其是当计算和实验不一定吻合的时候?这也涉及高层理解层面的理论。是的,这些是如何协同工作的?

Ekin Doğuş Çubuk [00:30:22]: 是的。这里特别有用的一点是,有些事情在模拟中更容易做、也更准确,而有些事情在实验中更容易做、也更准确。当然,总的来说,实验更准确,但某些测量用实验很难进行。于是你只能做一个粗糙的版本,得到不准确的数据。让我举几个例子。其中之一是,我们用密度泛函理论来估算材料的生成焓,

Brandon [00:30:51]: 抱歉,暂停一下。你能解释一下 density functional theory(密度泛函理论)和 formation enthalpy(生成焓)吗?

Ekin Doğuş Çubuk [00:30:55]: 是的,当然可以。

Brandon [00:30:56]: 抱歉,是 enthalpy(焓),对。

Ekin Doğuş Çubuk [00:30:57]: 好的。密度泛函理论可能是材料领域最常用的模拟方法。它源自 Hohenberg–Kohn 定理,Kohn 也因此获得了诺贝尔奖。当他意识到——没错,量子力学计算非常昂贵,因为每个波函数基本上都有一个指数级的希尔伯特空间,所以你必须解决这个非常困难的问题,尤其是当系统规模增大时。Kohn 和 Hohenberg 发现,事实证明你并不需要在指数级空间中进行计算,至少对于量子力学系统的基态来说,你只需要考虑电荷密度。所以这个定理其实非常简单,我想即使是物理系本科生也能理解。其核心思想是,量子力学系统基态的所有性质都是电荷密度的泛函,这非常了不起,因为电荷密度只是一个三维的对象,而希尔伯特空间和波函数却是指数级的。所以这是一个非常有趣的观察。后来 Kohn 又发表了另一篇论文,我想是和他的博士后 Sham 合作的,即 Kohn–Sham 波函数,这为求解材料量子力学性质的某种近似提供了一种实用的方法。如今,无论在实验室内部还是外部,我们都在大量使用它。而生成焓是我们可以用来理解材料能量的一种测量手段。基本上,我们想问的是:这种材料具有多少能量?因为如果这个能量高于这些原子可能形成的其他材料,那么这种材料很可能无法被制造出来。所以稳定只是意味着它位于其他材料及其能量构成的凸包之上。这样说清楚了吗,还是需要……

Brandon [00:32:42]: 或许可以简单高层次地说一点。密度泛函理论是一种方法,它把一个随电子数量呈指数级困难的问题

Ekin Doğuş Çubuk [00:32:51]: 没错

Brandon [00:32:52]: 也就是随系统规模呈指数级困难的问题,以引入一些误差为代价,近似地降低到通常大约是 n 立方量级的复杂度。这样你就可以计算那些……你现在可以计算原本根本算不出来的量,但要付出一定代价,对吧?如果能完美计算的话,我们就不需要实验室了。但我们做不到。这其实可以很好地呼应我们的第二期节目。Heather Kulik 曾说过一句名言:“材料领域没有 AlphaFold,不仅在计算上没有,而且 ground truth 本身就不存在。”也就是说,我们并不真正知道材料的晶体结构是什么样的,而 DFT 通常是我们最好的途径。

Ekin Doğuş Çubuk [00:33:34]: 是的,我想是这样。也许我要补充两点:DFT 从定义上讲并不一定是一种近似。Hohenberg–Kohn 定理表明

Brandon [00:33:42]: 它不是

Ekin Doğuş Çubuk [00:33:42]: 可以是精确的。但正如你所指出的,交换相关泛函我们目前还无法得到。而对于基于电荷密度的模型,我们也不知道动能泛函是什么。而且即使我们拥有完美的DFT,我仍然认为我们需要实验室。因为即使我们拥有完美的DFT,我们也无法把10的23次方个原子塞进一台计算机里。

Brandon [00:34:03]: 是的。

Swyx [00:34:04]: 你对这个数字非常执着。

Brandon [00:34:06]: 但是。不。好吧。嗯。但是,随着算力的指数级增长,你可以论证说,在n三次方的规模扩展下,原则上你最终是可以计算出这些东西的。你只需暂停等待足够长的时间就行。

Ekin Doğuş Çubuk [00:34:17]: 哦,是的。我们需要超大规模的计算机,没错。

Brandon [00:34:19]: 对。但只要

Ekin Doğuş Çubuk [00:34:20]: 那会需要很长一段时间。

Brandon [00:34:20]: 是的。但只要n三次方是一个不错的规模扩展规律,你就可以,你就可以做到。

Swyx [00:34:24]: 作为一个非科学家,我想提一个观察,不知道你们是否愿意随便聊聊。我来自金融行业。我们有过高斯copula,它是一种为信用违约互换定价的方法,通过做相关性分析,把一切都归约到一个单一的核函数中。这感觉在精神上和VAE很相似,都是把所有这些东西浓缩成一个单一的参数。我在想是不是同样的技巧无处不在。你说的那个听起来比我的维度更高一些,VAE就只是一个sigma那样的东西。但听起来是一回事?

Liam Fedus [00:35:01]: 是的,电荷密度文件仍然是一个相当大的文件。

Swyx [00:35:04]: 是的,没错。你稍微做了一点模糊处理,但已经足够好了。这是最高位有效信息。是的。

Ekin Doğuş Çubuk [00:35:10]: 就我个人所知,没有比这更好的预测新材料稳定性的方法了。它肯定不完美,但肯定比我能想到的其他方法都要好。所以回到你的问题,我们使用它们的原因是,对于某些事情来说,模拟比实验更容易,而且两者能很好地互补。然后我们可以把它做成一个循环。我们觉得模拟本身永远不够,但在模拟、AI和实验构成的循环中,我认为我们能比以前快得多地取得进展。

Brandon [00:35:41]: 模拟能让你做的一件事就是更快速地扩大规模。因为现在算力要上线,比

Ekin Doğuş Çubuk [00:35:48]: 是啊

Brandon [00:35:48]: 建设新实验室要容易得多。那你们如何避免……比如说,你们扩大了大量DFT的规模,如何避免模型过度依赖于此,同时仍然立足于真实世界才是你们最终关心的真相这一点?你知道,你们是如何平衡这一点的?

Ekin Doğuş Çubuk [00:36:05]: 嗯,我们也在同步扩大实验室的规模。

Brandon [00:36:06]: 是啊,你们也在扩大实验室的规模。

Ekin Doğuş Çubuk [00:36:07]: 对,是的。

Brandon [00:36:07]: 但你是可以做到的。我可以想象,凭借现代算力,把 DFT 扩展到数百万、数亿次,而据我猜测,你的实验室每天大概只能做几百、几千次?我不确定。反正即使在高通量的情况下,相比之下仍然相当受限,对吧?

Ekin Doğuş Çubuk [00:36:27]: 是的。一个问题在于,人类和 LLM 其实都相当清楚 DFT 的局限性。比如说,即使我们像你说的那样能用 DFT 做一亿次尝试

Brandon [00:36:39]: 嗯

Ekin Doğuş Çubuk [00:36:39]: 我们也永远无法真正尝试它们的微观结构。微观结构这个概念是说,DFT 通常模拟的是完美晶体,但实际中的晶体通常并不完美,而它们的微观结构——也就是中等尺度上的结构——会实实在在地影响材料性质。当然还有其他问题,比如超导温度这类性质就无法用 DFT 轻易模拟。再说,即使你用 DFT 做一亿次尝试,也不够。所以我们不得不依赖启发式方法、实验等等。

Liam Fedus [00:37:08]: 所以从所有这些计算到真正在实验室里被执行的东西之间,有一个巨大的过滤过程。

Swyx [00:37:13]: 这个过滤是由人来完成的,还是 LLM,还是两者混合?

Ekin Doğuş Çubuk [00:37:17]: 可以是混合的。

Swyx [00:37:17]: 嗯。

Ekin Doğuş Çubuk [00:37:18]: 举个例子,长期以来,Materials Project——也就是最好的开源 DFT 数据库——一直使用实验校准来修正 DFT。所以他们实际上会用实验数据来校准 DFT。我们在内部也这样做。每当我们对某个特定化学体系感兴趣时,你会拿到实验数据,拿到模拟结果,然后就可以对它们进行校准。

Brandon [00:37:37]: 这是另一件事。我和很多生物学家朋友聊过,当你说到材料时,他们总是很困惑——你没法只做一个 XRD 结构就真正知道结构是什么。因为如果你在生物学领域,你可以查看一个蛋白质的晶体结构,通常大体上能以亚埃级的精度重建出来。材料的实验 XRD 和,比方说,生物学领域的做法之间有什么区别?你会丢失哪些信息,为什么这更像是一种有损投影?

Ekin Doğuş Çubuk [00:38:05]: 衍射。

Brandon [00:38:06]: 衍射,抱歉。材料的实验 XRD(X 射线衍射)和生物学领域相比,你会丢失哪些信息,为什么这像是一种有损投影?

Ekin Doğuş Çubuk [00:38:16]: 回答这个问题时很难不显得疯狂。但你不觉得有机化学和生物学几乎源自一个更低的 VC 维,也就是更低的 Kolmogorov 复杂度模型吗?就是那种你几乎可以用一维序列来表示,而且几乎可以被“编译”出来的东西。所以在某种意义上,它在 Kolmogorov 复杂度的意义上更简单。

Swyx [00:38:38]: 一维?

Ekin Doğuş Çubuk [00:38:40]: 就是说,DNA 就只是

Brandon [00:38:43]: 嗯。

Ekin Doğuş Çubuk [00:38:44]: 或者 RNA。

Brandon [00:38:44]: 我认为大多数人会说它更偏向二维,但是

Ekin Doğuş Çubuk [00:38:47]: 好吧,嗯,是啊。我不是生物学家,所以

Brandon [00:38:49]: 是啊。

Ekin Doğuş Çubuk [00:38:50]: 我相信他们是对的。但无机化学的情况,几乎可以说非常疯狂。它显然不是来自这样一个低 Kolmogorov 复杂度的模型,因为三维无机晶体可以容纳金属、绝缘体、超导体、金刚石,差异实在太惊人了。人们尝试过,但我们始终找不到一维表示。很难为三维无机晶体找到 SMILES 字符串。而且原子之间的相互作用方式相当奇怪,比如共价键、离子键、金属键。不过是的,这非常有趣。我有时想知道,你有没有研究过固体电解质的问题?为什么人们无法用固体替代电池中的液体电解质?会形成各种枝晶。基本上,锂会形成这些结构,伸入固体电解质并将其撑裂。你看着那个,会觉得和生物学相比这太原始了。在生物学中,这些系统能实现如此复杂的纳米技术——技术进步,而我们甚至无法让两个界面彼此配合,因为锂会把它破坏掉。是啊,不过我想无机物可以非常耐高温。你可以制造航天飞机,可以制造硅,推动摩尔定律。所以是啊,这是一种权衡。

Brandon [00:40:05]: 是的,我们和其他几位嘉宾也聊过这个。我认为在我看来最大的区别之一是,生物学中,我们拥有一个基本上可以从数百万年进化中借鉴的工具箱

Ekin Doğuş Çubuk [00:40:19]: 是啊

Brandon [00:40:19]: 它已经给了我们所有的工具,我们只需复现它们即可。但同时进化也约束了,嗯,蛋白质等结构的 VC 维数相当低。而像细胞这样大规模系统的涌现行为可能要复杂得多。

Ekin Doğuş Çubuk [00:40:36]: 是啊,还有意识。

Brandon [00:40:37]: 是的。是的,不过也许更具体一点来说。如果你只看一块完美晶体,用 XRD 照射它,得到谱图。这仍然不能唯一地告诉你晶体结构是什么,对吧?

Swyx [00:40:54]: 对。

Brandon [00:40:55]: 所以,这正是

Swyx [00:40:56]: 什么?

Ekin Doğuş Çubuk [00:40:57]: 那只是平均值。

Brandon [00:40:58]: 是啊。

Ekin Doğuş Çubuk [00:40:58]: 只是平均行为。比如,歧化就是一种非常复杂的现象,对吧,可能出现这种情况:你有一块完美晶体,平均来看它的 XRD 谱图完美无缺。但实际上,还存在着另一种模式,原子略微向左或向右偏移,只是平均下来位于中间。是啊,日子不好过啊,是的。

Brandon [00:41:16]: 而蛋白质就不一样,你基本上知道它遵循某种规则,所以你可以,你可以把一个正向模型和它结合起来。

Liam Fedus [00:41:23]: 对。然后你可以逐步走向单晶 XRD,那会很有帮助。

Swyx [00:41:29]: 当我们开始做科学栏目的时候,有 AI 用于科学、AI 用于数学、AI 用于物理等等各种方向。当时有一种较劲的氛围,争论哪个更难。而我认为从科学角度可以论证材料科学是最难的。

Liam Fedus [00:41:43]: 嗯,我们并不完全是因其难度而选择它的。实际上在很多方面它反而更容易。对于大类材料,我们有很好的模拟器,而在生物学中,要对一个细胞、一个器官或一个完整生物体建模是极其困难的。所以这是一个巨大的优势。

Swyx [00:42:01]: 是啊。这难道不有趣吗,在最小的层面上,它是一维或二维的,但接着它有很多个数量级以上的尺度和结构,而这才真正引入了复杂性。这很奇怪。而材料中的复杂性可能更多在于微观结构。

Liam Fedus [00:42:20]: 是的,我仍然认为——材料在不同的长度尺度上也有不同的复杂性。所以是的,微观结构乃至更宏观的层面。

Brandon [00:42:26]: 是啊。

Swyx [00:42:27]: 好。简单换个轻松的话题。说到科幻,假设你可以发明任何你想要的材料,什么最有价值?你看,我这里有一个清单。显然有室温超导体。还有,你提到过电池。我一直觉得是电池。只要比锂离子电池更好,你就成功了。它已经存在一百年了。最后一个是碳纳米管,主要是为了太空电梯。我不知道是不是这样。这三样是我首先想到的。在你们的世界里,人们谈论的“梦想材料”还有哪些?

Ekin Doğuş Çubuk [00:43:03]: 肯定是超导体

Brandon [00:43:05]: 是的

Ekin Doğuş Çubuk [00:43:05]: 磁体。

Brandon [00:43:06]: 对。

Ekin Doğuş Çubuk [00:43:06]: 尤其是如果我们能降低对稀土或难以采购的过渡金属(如钴)的依赖,减少电池中的钴。我认为从根本上非常重要的一点是,如果我们能在计算能效上接近 Landauer 极限。

Brandon [00:43:24]: 你能解释一下 Landauer 极限吗?

Ekin Doğuş Çubuk [00:43:26]: 好。如果你看我们每次 FLOP 或计算花费多少能量,它一直遵循摩尔定律式的行为,效率呈指数级提升。所以我们每次 FLOP 或计算所花费的能量呈指数级下降。我最近没有查证过。十年前我最后一次确认时情况是这样

Brandon [00:43:44]: 是的,太棒了。我记得我第一次了解它的时候,看了看那个数字,我们当时离它还有十几个、二十个数量级吧。

Liam Fedus [00:43:50]: 远超极限,是的,没错。

Brandon [00:43:50]: 而我上次看的时候,发现很奇怪的是,我们已经非常接近了。只差我不知道三四个数量级了。

Ekin Doğuş Çubuk [00:43:59]: 是的。

Brandon [00:43:59]: 实际上就像是

Liam Fedus [00:44:00]: 只是随着多年时间指数级地推进罢了。

Brandon [00:44:01]: 是的,多年的指数级推进

Ekin Doğuş Çubuk [00:44:03]: 四五个,是的。

Brandon [00:44:04]: 是的,相当惊人。

Swyx [00:44:05]: 但在你有生之年,你

Brandon [00:44:06]: 是的,不,我。是的,自从,就在我发现这个以来,大概十年还是十五年前?是的,没有。

Ekin Doğuş Çubuk [00:44:11]: 我们必须做的事情之一就是散热,因为当这些计算发生时,会产生热量,这是必然的,但随后我们必须把它散掉。所以,如果我们能接近 Landauer 极限来高效地进行计算,那对人类来说是件了不起的事,对吧?因为这意味着我们现在进行的计算——这可能是人类所做的最基本的事情之一——能从能源角度尽可能高效地完成,而这在宇宙中是真实存在的物理约束。

Swyx [00:44:34]: 那会不会受量子计算影响?我就随口一提。理论上,大规模、高度并行的计算。

Ekin Doğuş Çubuk [00:44:41]: 它肯定会受可逆计算影响。但说实话,我不是这方面的专家。我不太明白。如果现在能做可逆计算,那你就不用。你实际上不必消耗能量来进行计算,因为你并没有真正删除任何信息。它是可逆的。但我不知道这是否可行。我不知道。量子计算,我猜它必须以某种方式遵守这些定律,因为它们仍然是……它们必须遵守热力学

Brandon [00:45:06]: 它是幺正的,所以

Ekin Doğuş Çubuk [00:45:07]: 是的,没错

Brandon [00:45:07]: 它是可逆的,至少目前是这样。

Swyx [00:45:10]: 我和 Elad Gil 最难忘的对话之一是,他其实是一个对量子计算非常持怀疑态度的人。

Ekin Doğuş Çubuk [00:45:15]: 原来如此。

Swyx [00:45:15]: 他就是,他就是说:“即使你今天就有了量子计算机,也没有应用场景。”我就说:“哇。”

Ekin Doğuş Çubuk [00:45:19]: 我

Swyx [00:45:19]: 它能破解,它能破解它能破解安全体系 RSA。就这么多了。

Ekin Doğuş Çubuk [00:45:22]: 我同意这个观点。比如说,人们常谈论,如果你今天有一台量子计算机,你就能更好地模拟各种东西。我问他们:“好吧,就算我们接受这一点,你会模拟什么?”你看,你依然在模拟完美的晶体,即便 DFT 的预测能力达到完美,它所存在的问题你依然会有。所以,我确实认为人们因为量子计算太令人兴奋而在某种程度上忽略了一些事情。如果我们能在量子逻辑空间而非经典逻辑中进行计算,这实在太令人兴奋了,以至于人们忽略了它真正造出来之后能做什么。也许这没什么关系,因为也许一旦造出来,它会做出我们甚至无法想象的惊人事情。

Swyx [00:45:57]: 好的。接下来我想谈谈实验室自动化,你们已经在实验上形成了闭环。你可以谈谈机械臂之类的。但这基本上就是你们在这里所做的一切。我最喜欢你的一句话是,你们实验室里的每一台设备都将拥有 140 的智商。好吧,这是什么意思?

Liam Fedus [00:46:17]: 在早期,随着我们不断扩大规模,我们意识到仅靠人工操作机器就造成了巨大的瓶颈。比如,对于某一组设备,我们需要技术员和科学家去观察特定的形貌,试图弄清楚我们究竟做出了什么,看看这是否符合我们的意图。而随着实验室规模扩大,我们很快就遇到了这些瓶颈,人工操作根本跟不上。于是我们开始用一些程序化的方法来采集 SEM 的数据。而这个非常简单的程序——大致就是取一个视野、采集、放大再采集——所呈现出来的数据,其实并不太有用。对于我们真正想要的东西来说,它有点太笨了。因此在那时,把 AI 系统直接构建到机器上来控制这些设备就变得非常必要。现在它们拥有了完整的上下文,知道我们想实现什么:实验的意图是什么?我们想合成什么?还有哪些其他实验证据?而且它实际上是在机器内部观察并采集数据。这一点现在非常有价值,因为我们一直在讨论这些隐藏变量导致无法捕捉所有信息,但如果你能在实验进行时进行更智能的数据采集,那么你的数据对于未来的 AI 系统和未来的计算预测来说就会好得多。你将拥有更丰富的数据集。这就是我们所说的话的意思:实验室里的一切都必须具备极高的智能,才能让数据尽可能有用。这就是这番话背后的动机和灵感所在。

Swyx [00:47:57]: 在给每台设备赋予智能这方面,目前的技术水平如何?

Liam Fedus [00:48:02]: 嗯,我认为一个有趣的方面是,延迟

Swyx [00:48:08]: 正是

Liam Fedus [00:48:09]: 是多少?——控制那台仪器的延迟是多少?

Swyx [00:48:10]: 因为既有云端延迟,也有设备端计算的延迟,而

Liam Fedus [00:48:13]: 没错

Swyx [00:48:13]: 也是。

Liam Fedus [00:48:14]: 而且不同的物理过程都带有各自的时间尺度。如果调用 API 之类的操作实在太慢,也就是说推理量、token 数或工具调用次数与实际过程的延迟根本不匹配,那就是不可行的。

Swyx [00:48:33]: 好。说得对。

Liam Fedus [00:48:34]: 这几乎就像自动驾驶汽车一样,对吧?所以。

Brandon [00:48:37]: 我……很快插一句。我听到这个其实挺惊讶的,因为我觉得推理的延迟相比很多需要运行数小时的东西来说似乎很小,对吧?或者,你知道。或者也许我……也许你的实验快得多,或者吞吐量高什么的。说实话我听到这个确实很惊讶。

Liam Fedus [00:48:52]: 最终来说,实验确实需要好几个小时甚至几天,但可能有某些特定步骤,延迟会很关键。

Ekin Doğuş Çubuk [00:49:00]: 是的。你可能想要更精细的控制。另一件事是成本有多高,因为同样出于这个原因,有些模型在分析数据时会非常慢,也让它们非常昂贵。最后还有人类的耐心。如果一个人想要分析某个 XRD 图谱,却要等两个小时才能得到好的结果,我觉得这和他们能在两分钟内得到结果是非常不同的。

Brandon [00:49:25]: 哦,明白了。

Liam Fedus [00:49:26]: 是的。至于推理,它……你知道,你不是对那个模型做一次调用,对吧?你可能要生成很多 token,才能得出这些模式。

Ekin Doğuş Çubuk [00:49:35]: 在循环里运行模拟。

Liam Fedus [00:49:37]: 正是。

Ekin Doğuş Çubuk [00:49:38]: 深度研究在……

Liam Fedus [00:49:39]: 这不是一次工具调用,也不是一条单一的推理线程。所以延迟可能会膨胀得相当厉害。

Brandon [00:49:44]: 我明白你的意思了。

Liam Fedus [00:49:45]: 是的。

Brandon [00:49:46]: 你的延迟中有多少来自工具调用?我猜工具调用主要是 DFT 或计算类的……所以,是的。你的延迟有多少来自这些,又有多少来自实际的推理?

Liam Fedus [00:49:59]: 这真的取决于具体过程。

Brandon [00:50:01]: 好,是的。

Liam Fedus [00:50:01]: 是的。

Swyx [00:50:02]: 我还在想的另一件事是,我想,从小事逐步构建到更大的事,我假设普遍的倾向或典型的开发方式是渐进式的,先一切由人操作,然后找到可以自动化的地方,再在此基础上逐步构建。我担心有时候人们就是这样演化事物的,但那是一种局部最优。

Ekin Doğuş Çubuk [00:50:25]: 类似短视界的优化。

Liam Fedus [00:50:26]: 对。

Swyx [00:50:26]: 没错。其实你应该直接弄个人形机器人放进去就行。

Liam Fedus [00:50:31]: 我们。我认为我们的看法是,解决人形机器人问题实际上会更慢才能达成我们的某些目标。

Swyx [00:50:37]: 只是确认一下。毕竟这些事情你们每天都在做。而我们,就像

Liam Fedus [00:50:41]: 是的

Swyx [00:50:41]: 看到了,但我们。我不了解实际情况,很多人都在搞人形机器人。

Liam Fedus [00:50:46]: 是的。我想其中一个思路是,通过人类和自动化相结合,你可以很快发现实验流程中的瓶颈在哪里,然后逐个消除这些瓶颈。举个例子,如果某个非常精巧的灵巧性任务人类非常擅长,但要花几个月去实现机器自动化,那也许就不值得在那上面花太多时间。而更有希望的做法,也许是那些非常常规、占用科学家和技师大量时间、又容易自动化的任务。所以我认为这里面有一种务实精神。但归根结底,我们想从实验室得到的是海量的数据、高质量的数据、多样化的数据,这些才是我们的目标。完全自动化并不是目标。我们使用自动化,是为了服务于实现数据方面的目标。

Brandon [00:51:39]: 是的。

Liam Fedus [00:51:40]: 但另外,我认为自动化的另一个好处是,机器人在实验室里可能犯的错会更少。而且,让 AI 系统对我们的所有数据拥有完整视角也非常有帮助,因为有时如果数据中出现了某种排列错乱,它就能识别出来。举个例子,我们有一个步骤曾经出现过周期性错误,原因是某台机器被装载错了,数据模式不一致。AI 在阅读这些数据时说:“从运行的内容来看,这不合预期。”它纵向地审视这批数据,然后发现:“如果我做这种循环置换再反转过来,一切就都一致了。”于是我们得以回到物理基础设施,查明装载环节确实出了差错。我认为,管理数据质量是在物理世界中做 AI 的根本。而这些正是我们正在构建的东西。这样你就能改进操作流程,但那时候你就会想:“好吧,这又是一个自动化的绝佳机会。我们怎么才能让它如此可靠、如此耐用,从而再也不出现这类错误?”

Ekin Doğuş Çubuk [00:52:51]: 是的,我认为降低实验数据的噪声底非常重要。文献中的大多数实验数据的噪声底都高得离谱,实际上通常比 DFT 的精度还差。因为不同的人做实验,不同的实验室、世界不同的地方、不同的时间,确实会给结果引入大量波动。所以我们希望通过标准化这些工作流程,最大的收益之一就是降低噪声底。

Swyx [00:53:16]: 你一直很公开地谈论你如何使用开源模型并对它们进行微调以用于这类任务。这样是否更好?基本上是不是……我可以想象这样一种情况:也许让较笨的模型执行一个任务,然后针对该任务进行优化,再由一个通用的前沿模型来监督一切。这是一个好的心智模型吗?还有没有更多我可以考虑的环节?

Liam Fedus [00:53:37]: 我们基本上是混合使用开源模型和闭源模型。你知道,在模拟这一侧,我们在构建 ML 技术栈、模拟技术栈方面是这种模式的巨大受益者。我们不需要在那个方向上发力。但在很多领域,延迟太高、成本太高。而在某些情况下,我们实际上可以……你知道,通过获取这些数据,我们实际上可以超越这些系统即使在最高推理强度下所能达到的前沿水平。所以这不一定是关于成本或帕累托效率的问题,在某些情况下,当你拥有别人没有的数据时,你可以超越它。一种描述方式是用计算效率来衡量。通过获取这些数据,与一些前沿模型相比,你的计算效率可以高得多。这对我们的项目一直是……一直是非常关键的一点。

Swyx [00:54:33]: 是的。我非常……数据质量或数据获取作为计算的一种权衡,我认为存在某种美元换计算、美元换数据的汇率。我觉得钟摆现在可能正摆向数据这一边。显然你会同意这一点,但是……

Liam Fedus [00:54:50]: 是的,尤其是谈到实验数据的噪声底线时。我们需要高质量的数据。如果你把大量计算投入到一堆噪声上,你不会得到任何好东西。

Swyx [00:55:00]: 而且这对你们来说更难,因为你们主动追求稀疏性。你们实际上尝试获得零结果并从中学习,然后

Liam Fedus [00:55:06]: 没错。

Swyx [00:55:06]: 是的。

Brandon [00:55:07]: 是的,你在其他几个场合也谈到过零结果。对材料而言,零结果是什么样的?你们如何有效利用它?尤其是我觉得你们的整体信号在成功方面通常可能相当稀疏。

Liam Fedus [00:55:19]: 零结果可能是:我们本来打算合成某种结构,然后所有证据都表明我们没有合成出那种结构。

Brandon [00:55:28]: 你们有没有故意打算不合成出某种结构的时候?当然有吧。

Liam Fedus [00:55:30]: 是的。

Brandon [00:55:30]: 好的。

Liam Fedus [00:55:31]: 绝对有。

Brandon [00:55:31]: 好,很好。你们做阴性对照

Liam Fedus [00:55:34]: 绝对的,是的。

Brandon [00:55:34]: 定期做。好的。

Ekin Doğuş Çubuk [00:55:35]: 有些杂质情况会毁掉你的性能。是的。

Brandon [00:55:39]: 好的。

Ekin Doğuş Çubuk [00:55:40]: 可能有毒。

Liam Fedus [00:55:41]: 是的,没错。百分之百。

Brandon [00:55:43]: 好的。

Liam Fedus [00:55:43]: 而且在某些情况下,阴性结果其实是……你知道,我们本打算做出这个、那个东西,结果我们实际上识别出了一种以前从未被发现过的新结构。所以在某种意义上是阴性的。我们原本想做别的事情,但数据中涌现出了别的东西。

Ekin Doğuş Çubuk [00:56:02]: 是的。而且总的来说,在训练机器学习算法时,尤其是在非常基础的层面,如果是一个分类算法,如果没有阴性样本,你根本没法训练,因为如果全都是阳性的话。

Brandon [00:56:13]: 是的,是的。

Ekin Doğuş Çubuk [00:56:13]: 而这在材料科学中是一个特别糟糕的问题,因为人们通常只发表他们能合成的晶体,但合成失败时通常不会发表。有时他们可能会发表。而且我们也永远无法真正确定一种晶体是否绝对不可合成,对吧?

Brandon [00:56:30]: 可能只是技术不行的问题。

Ekin Doğuş Çubuk [00:56:31]: 没错。

Brandon [00:56:31]: 是的,是的。

Ekin Doğuş Çubuk [00:56:31]: 可能是技术不行。

Brandon [00:56:32]: 尤其是在文献方面。

Ekin Doğuş Çubuk [00:56:33]: 合成方法的问题、技术的问题。是的。所以我认为,当我们自己做实验并在所尝试的范围内得到阴性结果时,这真的很有帮助,这样我们甚至可以训练一个分类算法。

Liam Fedus [00:56:46]: 我认为还有另一件很有价值的事

Brandon [00:56:48]: 是的

Liam Fedus [00:56:49]: 那就是当你经历这样一连串的阴性结果,最后通过不断迭代,终于得到了阳性结果时,这是一套非常有趣的,我称之为过程工程类的数据。也就是说,通过迭代,你究竟是如何得到那个正确结果的?因为材料科学的很多东西在实际如何制造出来这件事上都存在模糊性。所以,是的。而且实际上,即使是一种已知的材料,要复现它也可能非常不容易。有些东西写在高中教科书里,但另一些东西真的处于前沿,我们也在积累这方面的诀窍。然后构建一个系统,给定这一连串的阴性结果,你究竟如何才能得到那个

Brandon [00:57:35]: 是的

Liam Fedus [00:57:35]: 阳性结果?

Brandon [00:57:36]: 说到分类器的结果,我几乎会假设,如果所有事情都在内部完成,你们的大多数结果实际上会是阴性的而不是阳性的,这有点讽刺,因为文献只会给你阳性结果。所以如果你是从零开始冷启动,问题似乎恰恰相反,就是你

Ekin Doğuş Çubuk [00:57:52]: 是的

Brandon [00:57:52]: 有大量的阴性结果,而阳性结果不够。

Ekin Doğuş Çubuk [00:57:56]: 而且正如你所说,如果我们按每个实验来打标签,那大多数都会是阴性的。

Brandon [00:57:59]: 是的。

Ekin Doğuş Çubuk [00:57:59]: 但如果我们按每个活动(campaign)来打标签,并假设活动在我们成功时才结束,那平衡性可能会好一些。

Brandon [00:58:08]: 我明白了。所以你们的推理轨迹几乎可以覆盖整个活动

Liam Fedus [00:58:12]: 完全正确。

Brandon [00:58:12]: 而不是……好吧。

Liam Fedus [00:58:13]: 这就是关键所在。这类数据在其他任何地方基本上都不存在,我们花了大量时间把科学过程的完整谱系注入到模型中。追踪所有这些数据——比如对话、直觉、在实验室里执行了什么、计算在哪里运行、代码在哪里编写——把这些拼接在一起是非常宝贵的。我认为总体目标是,与其在科学的最终成果上训练,不如在科学实践的过程上训练。

Brandon [00:58:44]: 这感觉非常像你。你在 RSI 上想做的事,也就是让一个模型被训练去训练更好的模型。而现在你是让一个模型被训练去做更好的实验。但是

Liam Fedus [00:58:56]: 完全正确

Brandon [00:58:56]: 区别在于,它不会回流到核心模型里。所以这是

Ekin Doğuş Çubuk [00:59:00]: 除非你正在开发的物理模型能改进芯片,而芯片又能改进 AI。所以这是更广义的

Brandon [00:59:07]: 更大的循环。是的,更高层面的 RSI。

Liam Fedus [00:59:09]: 那就是大型数据飞轮。是的。

Brandon [00:59:10]: 但这是否意味着……是否有可能,在 Fable 6 或 GPT-8 之类的模型中,一个在这类高阶推理轨迹上微调过的模型,实际上可以不需要任何

Liam Fedus [00:59:30]: 嗯

Brandon [00:59:30]: 外部逻辑?因为这其实是同一种思考过程,对吧?

Liam Fedus [00:59:33]: 是的。我认为这里面存在不确定性下的决策问题。显然在机器学习中,运行 AI 循环时会有噪声。但我们确实认为,当你真正与物理世界交互时,会面临另一套挑战。此外,我认为还有一点,那就是把一切压缩进权重中仍然非常有价值。如果推理时计算已经足够,那么所有前沿实验室在 GPT-4 之后就会停止训练,然后说:“好,从现在起,我们要在推理时改进上做到极致。”所以我们认为,由于物理科学与机器学习之间的差异,把这些东西压缩进我们自己的权重中,将会带来不同类型的系统和不同类型的能力。

Ekin Doğuş Çubuk [01:00:20]: 但我们也觉得,即使 Fable 7 变得非常出色,比今天还要好,它仍然需要通过实验来获得结果。原因在于,机器学习在它被训练过的领域表现得非常好,而科学发现几乎从定义上讲就是你没被训练过的东西。这就是我们建设这些实验室的原因,这样无论是开放模型还是封闭模型,都可以利用这些实验室来摆弄宇宙,因为我们觉得不尝试就不可能做出重大发现。

Liam Fedus [01:00:50]: 是的,有

Brandon [01:00:51]: 是啊

Liam Fedus [01:00:51]: 不会是这样的。没有人能零样本搞定室温超导体。

Ekin Doğuş Çubuk [01:00:54]: 从理论上想想

Brandon [01:00:55]: 那倒是挺酷的。是啊。作为一个以前与湿实验室密切合作过的人,我显然比某些人对科学结果的零样本化更持怀疑态度。

Liam Fedus [01:01:05]: 是的。

Brandon [01:01:05]: 但我觉得有些人可能会问这个问题,所以。

Liam Fedus [01:01:08]: 是的。我认为把我们在数学和理论物理中看到的结果与物理世界区分开来非常重要。对吧?就像

Brandon [01:01:18]: 是啊

Liam Fedus [01:01:18]: 这是两回事。

Brandon [01:01:19]: 两件非常不同的事。

Liam Fedus [01:01:20]: 是的。

Ekin Doğuş Çubuk [01:01:20]: 我说的甚至不是理论物理。到目前为止一直是理论计算机科学

Liam Fedus [01:01:22]: 是的

Ekin Doğuş Çubuk [01:01:22]: 编程和数学。

Liam Fedus [01:01:23]: 对。

Brandon [01:01:24]: 是啊。

Ekin Doğuş Çubuk [01:01:25]: 也许理论物理是下一个。

Liam Fedus [01:01:26]: 别来。是啊。

Brandon [01:01:28]: 是啊。

Ekin Doğuş Çubuk [01:01:29]: 哦,对。

Swyx [01:01:29]: 我能不能了解一下你们可以进行的提取层次的心智模型?比如说,在自动化方面,我又回到这个话题了,我们谈到过 campaign,谈过单独的 essay 和运行测试,以及它们怎么样。人类不擅长这些,所以我们应该阻止人类去做。还有其他吗?比如,比 campaign 高一层可以是你们正在测试的一个物理理论?或者比 campaign 低一层是什么?我就是……我喜欢从这个角度来思考,比如想一下,好吧,这现在是一次 API 调用了,你再也不用碰它了。而这个呢,是的,不,这仍然有百分之九十是人做的。也许我们可以这样绘制领域的地图。还有——有其他层次吗?

Ekin Doğuş Çubuk [01:02:17]: 我可以讲几个层次。我觉得你问了一个好问题。我没有非常系统性的答案,但我们可以谈谈几个层次。一个层次是原子结构。这是一种抽象,对吧?我们做的任何事都没有完美的原子结构,但它是一种近似。另一个是连续介质模型。它就不再是原子层面的了,而是一个代表材料的连续网格。

Swyx [01:02:39]: 好。

Ekin Doğuş Çubuk [01:02:39]: 然后在另一个维度上,是热力学。假设你永远做这个实验,最终状态会是什么?然后还有一层抽象,就是动力学,它承认我们不会永远做这个实验,所以时间是重要的。那么一个反应会以多快的速度发生或不发生,即使它的能量更低与否?所以热力学、动力学、原子结构、连续介质。还有什么呢?还有其他的抽象层次吗?

Liam Fedus [01:03:04]: 嗯,我觉得你说的意思是,可能会有一个统领性的新理论进展,为多个研究行动提供指导,对吧?

Swyx [01:03:14]: 这会产生很大的不同。有点像作为投资者,我想说的是:这就是瓶颈所在,各位。一旦我们攻克了它,其他一切都会随之而来。我不知道。

Ekin Doğuş Çubuk [01:03:22]: 对我来说,从一开始,我们的假设就是最大的瓶颈之一是自动化表征,因为把粉末混合起来尝试一些东西并不难。但如果你不能对它进行表征和分析,然后智能地决定下一步该做什么,那么随机混合粉末并不会带来太多好处。所以我们非常专注于自动化表征,用模拟来闭环,因为只有这样你才能尝试很多东西、做出明智的决策,然后决定第二天做什么。

Brandon [01:03:51]: 作为一个后续问题,人类在这个循环中是如何参与的?你在哪些环节引入人类?我猜你大概

Swyx [01:04:02]: 你可以,你可以在任何环节随机加入

Ekin Doğuş Çubuk [01:04:04]: 当然。

Swyx [01:04:04]: 并创造价值。

Liam Fedus [01:04:05]: 是的。

Swyx [01:04:05]: 但你们决定把时间花在哪里?

Brandon [01:04:08]: 看起来可能是所有层面。你有在实验室里实际搬运材料的人,然后你还有指导研究行动决策的科学家,然后你还有人类。那是什么?我只是在问你一个问题。是的。

Liam Fedus [01:04:21]: 是的,百分之百。而且我认为它也一直在变化。

Brandon [01:04:23]: 是的。

Liam Fedus [01:04:24]: 所以,我认为即使只是利用实验活动的指导,在早期那完全是人工驱动的。现在,越来越多地变成了 AI 驱动和人工驱动相结合。而且 Doğuş 之前提到,我们很早就发现表征是一个很大的瓶颈。早期它是人工驱动的,科学家们非常不堪重负,而平衡已经显著转向了 AI 驱动。这使得以前把所有时间都花在这些优化改进上的科学家,现在能够把他们的工作提升到其他事情上。但我认为,这其实是一个时间的函数。这些层面上的每一点都在不断变化。

Swyx [01:05:04]: 是的。就一般的搜索而言,有没有一些在物理世界里表现良好但在其他世界里表现不佳的方法,或者反过来?比如进化搜索在 LLM 中很流行。我猜它在这里效果不太好。

Ekin Doğuş Çubuk [01:05:21]: 其实尤其是在模拟中,人们使用进化搜索已经很久了。它非常擅长结构预测,比如寻找低能量结构。

Swyx [01:05:31]: 好的,所以它有效。是的。

Ekin Doğuş Çubuk [01:05:33]: 另外半导体行业的工艺工程师会做 DOE(实验设计),他们通常会用某种零阶方法,比如贝叶斯优化或进化搜索之类的。我不认为他们用强化学习,但思路类似,是的。

Swyx [01:05:47]: 你必须有某种算法

Ekin Doğuş Çubuk [01:05:48]: 是的

Swyx [01:05:49]: 来把它搞清楚。

Ekin Doğuş Çubuk [01:05:50]: 而且反正所有零阶优化的表现都差不多,对吧?所以。

Brandon [01:05:54]: 是的。好,我想回到我之前提过的问题,也就是扩展性。我很好奇,你们对扩展实验室的愿景是什么?有多种方式。从生物学领域来看,生物学里有很多很棒的技巧。你可以给东西打标签,可以用 DNA 测序做各种有趣的读取。如果你能把复杂的实验映射到测序上,你就可以扩展到数百万甚至上亿规模。你们能做这样的技巧吗?毕竟,每个实验都有它自己的运行时间。我——我有一篇最喜欢的博客文章,我会在节目笔记里引用。但这些实验室的运行时间是什么样的?就材料而言,你们的扩展是否从根本上就是线性的——也就是说你需要更多资源才能做更多事情——还是说你可以用聪明的方式并行化、组合操作,有没有什么技巧?

Liam Fedus [01:06:52]: 嗯,我认为一种思考方式是,强化学习环境并不是简单地运行实验、等待该智能体完整推出、进行计算、经过所有仪器直到最终结果。我们基本上是在所有不同的仪器和所有这些不同的实验活动中就开始产生数据了。而将其扩展用于机器学习的一种方法是,现在可以基于实验活动或计算活动的数据来构建强化学习环境。或者你也可以开始选取仪器的子集,然后说:'好吧,我们要仅基于这台仪器来创建强化学习环境。'或者也许是跨越这些不同的仪器,以达到某种奖励状态。所以这就是一种方式:这有限的数据篮子,当以不同方式看待时,就可以被扩展用于训练目的。所以它并不能触及实际的实验运行,但从机器学习的角度来看是可以的。

Ekin Doğuş Çubuk [01:07:55]: 也许我可以为你给出的生物学例子提供一些类比。人们尝试过的一件事是组合溅射。我不知道你是否听说过。你有这些溅射靶材,并创建这种成分梯度。所以当你看最终产物时,由于每种前驱体都存在梯度,它会在不同的空间位置产生不同的晶体。所以一次就可能尝试数百、数千种晶体。这和你的例子类似,对吧。

Liam Fedus [01:08:23]: 哦,是的,这说得通。

Ekin Doğuş Çubuk [01:08:24]: 据我所知,到目前为止这种方法效果不太好,因为存在扩散性,所以物质会移动。另一个我们考虑过但尚未实施的方法,很多人都在谈论:超导性测量是一个瓶颈,因为与XRD不同,没有高通量的超导性测量,每次测量可能需要一个小时。所以人们想过把不同的候选材料全部混合到一个样品中,然后放入。如果它具有超导性,你就知道其中某一个来源是。然后你可以做一点类似人们进行新冠检测的方式。所以确实存在这样的想法。有些效果很好,有些则不行。是的。

Brandon [01:09:00]: 所以,我想你们即将宣布一笔大规模融资。你们是如何考虑扩展的?

Liam Fedus [01:09:06]: 我们已经做实验室设计有一段时间了,所以我认为这些资源能让我们继续大幅扩展实验室规模,同时也扩展算力,包括AI方面和计算方面。但我认为同样非常重要的是,我们能够建造什么新型实验室?所以我认为我们已经在门洛帕克的初始实验室中验证了这个循环,但我们将继续扩展到新型实验室,并重复同样的流程。

Ekin Doğuş Çubuk [01:09:33]: 是的,像我们正在努力打造的那种实验室,我认为以前从未以这样的规模或这样的方式建过。所以到目前为止,我们从自身的搭建过程中学到了很多,这些经验指引我们打造下一个版本、再下一个版本。然后,正如你所说,我们可以提升规模、提升雄心、提升仪器的质量。有些仪器非常昂贵。当我们真正搞清楚哪些投入能带来丰厚回报时,就可以更多地投资于那些方面。

Liam Fedus [01:09:58]: 而且这让……硬件工程已经变得如此核心。比如,早期为了追求速度,我们会买一些现成的仪器。而当我们不断扩展实验室的规模时

Brandon [01:10:08]: 你们就自己制造。

Liam Fedus [01:10:09]: 我们就必须自己制造了。于是我们发现,好,这台仪器速度还不错,这些组件其实相当快,但那台称重机反而成了瓶颈。还有一些与数据质量相关的问题,比如,这台机械臂的静置位置正好在之前混合过东西的板子上方,存在污染风险。所以在硬件设计中,我们会重新设计,让静置位置远离那些东西。正是这些微妙的细节,让我们能够不断降低实验活动的噪声底限。基本上,就是把这些经验积累起来并加以扩展。

Brandon [01:10:45]: 你们公开了组织架构图。你们有很多团队。我想……我们看了你们的招聘页面时很惊讶,心想:“好吧,我们觉得没法完全搞清楚 Periodic 到底在做什么。”

Liam Fedus [01:10:56]: 也许可以讲讲一些组织原则,好让大家理解这个招聘页面。我们招聘 AI 研究与基础设施岗位(计算类、实验类岗位),然后是硬件工程岗位,再然后是产品岗位。

Ekin Doğuş Çubuk [01:11:10]: 我们想要实现合成超级智能,对吧?而我们觉得,要实现这一点,我们需要合适的化学专业知识、合适的物理专业知识、模拟理论,还有薄膜、粉末方面的知识。这些岗位看起来非常多样——硬件工程这些确实如此——但它们在目标上其实是连贯一致的,那就是“为智能而合成”。这也适用于 LLM 研究员、基础设施,甚至产品工程师,因为产品工程师要确保所有研究成果都能变成实验室里实验人员可以使用的产品。

Liam Fedus [01:11:42]: 是的。要与物理世界完成端到端的闭环,确实要求你有能力对物理世界拥有能动性——去搭建这些实验室、高效地运行实验活动、针对它创建 AI 系统并让它们成为计算工具的优秀使用者。这就是 Periodic 的难点,也是它的机遇所在。这样一群人以前从未被聚到一起过。这是一个不可简化、本质上的多学科问题。

Ekin Doğuş Çubuk [01:12:07]: 是的。对我们来说另一个非常重要的指导原则是,我们希望那些在自己领域非常出色且有经验的人亲自动手去做。你知道,现代生活把我们带到了这样一个境地:尤其是在学术界,当某人在某个领域的研究非常出色时,我们会给他们分配大量撰写经费申请、教学等职责,导致他们没有时间亲自在那个领域做研究。但如果你回顾贝尔实验室、IBM 这些取得过卓越进展的机构,都是非常有经验的人在亲自做研究。比如 Bardeen 虽然是理论学家,却每天都在实验室里。Alex Müller 虽然是实验室负责人,也在实验室里做实验。所以我们也努力在这里这样做。我们有一些不同领域的世界顶尖人物,但他们都在亲自做研究。

Brandon [01:12:52]: 你想炫耀一下,还是直接点名?你知道的。

Ekin Doğuş Çubuk [01:12:54]: 哦,我非常乐意。在我读博士的时候,我最喜欢的、和我年龄相仿的计算材料科学家是 Muratan Aykol。他是在我们的一位顾问 Christopher Wolverton 指导下完成博士学业的。他算是我们的计算材料科学专家。他非常出色。虽然他做的是模拟,但有时也是一位非常优秀的实验科学家。他对体系的理解非常透彻。我们的实验室负责人是 Joe Checkelsky,他是 MIT 的教授,但正在休假全职和我们一起工作。Joe 是一位杰出的物理学家,对超导的理解非常深入,而且他曾在日本担任过一段时间的教授,所以在合成和化学方面学得非常好,对于一位物理学家来说尤其难得。我们还有 Daniel Chica,他曾是 Mercury Canasides 课题组的博士生,该组可能是世界上最好的固态化学课题组之一。Daniel 是他的合成专家之一,所以他的双手就像魔术师一样。像这样的例子还有很多。

Liam Fedus [01:13:50]: 不,我知道。还有 Dima Bahdanau,他一直在领导我们的许多 AI 和 LLM 工作。他就是神经网络注意力机制的发明者。

Brandon [01:13:59]: 哦,Bahdanau。Bahdanau 注意力。

Liam Fedus [01:14:01]: 正是。是的。

Brandon [01:14:03]: 是的。

Liam Fedus [01:14:03]: 是的。是的,他会非常深入地研究追踪数据、训练分布,以及如何将它与实验室连接起来。

Ekin Doğuş Çubuk [01:14:10]: 也就是化学。

Brandon [01:14:11]: 化学。

Ekin Doğuş Çubuk [01:14:11]: 他会钻研得很深。

Liam Fedus [01:14:12]: 他钻研得非常深。他在蒙特利尔的实验室里甚至放着固态合成的书。还有 Ray Nakano,他曾经在 OpenAI 担任一些 operator 工作的技术负责人。他现在也在实验室里。所以当我们做实验室参观时,起初我们还在想:“哦,这个新来的科学家、这个新来的技术员长得真像 Ray。”结果不,那真的就是 Ray 本人在实验室里和科学家们一起将机器自动化。这就是我们的 DNA,也是我们需要的那种人,才能把这件事做成。

Swyx [01:14:43]: 我们还注意到你们设有前线部署工程职位。我们恰好正在筹备一档关于前线部署工程的播客,因为有太多工程师愿意从事这个角色。他们可能根本不知道 Periodic 也有适合他们的职位。这个职位是做什么的,他们如何与客户合作?

Liam Fedus [01:15:01]: 我们一直在构建自己的产品、自己的工具、自己的 AI 和计算

Swyx [01:15:06]: 为自己用。对。

Liam Fedus [01:15:06]: 为我们自己。所以我们一直是自己的“零号客户”。现在我们要做的是把这些同样的工具带给不同的行业,目前我们非常专注于半导体行业。不过,要做到这一点,这些都是非常私有的公司,我们需要能够在一些最安全的环境中运作。因此我们的 Periodic 前线部署工程师和研究人员会真正驻场工作,实际集成我们的 AI 系统和计算系统,帮助我们的合作伙伴更快地达到目标状态。基本上,我们在自己做材料发现、材料工程过程中积累的工具和专业知识,现在要带给各行各业。我们认为这是帮助合作伙伴达成最终状态和目标的最有效方式,而不是把某项技术扔过墙就让他们自己去琢磨。这些前线部署工程师还会在本地进行推理,同时也可以用数据训练。再说一次,当我们把理解这些不同领域的系统部署出去后,我们可以让它在客户或合作伙伴的数据上成为专家,这样他们就能拥有自己的智能,拥有比单纯调用某个 API 或未经训练的模型更有效理解这些领域的系统。因此,这是一个比典型的前线部署工程要广泛得多的角色,因为它确实需要非常深入的机器学习专业知识。在数据训练、基础设施方面都必须极其精确,同时在物理学方面也是如此。所以我们合作的是高度技术性的行业。他们必须理解化学、材料科学的不同领域以及一些器件。这就是我们现在正在构建的职位。

Swyx [01:16:53]: 其中一部分是愿意在台湾长期驻场。嗯,好吧,我了解那种客户。

Swyx [01:17:01]: 有意思的是你们在变现。这是你们目前主要的变现方式,但未来可能会改变。不过,这就是我认为人们并不真正理解 APL Research Lab 的地方。当你把自己与贝尔实验室相比时,人们想到的正是这一点,对吧?就是……

Liam Fedus [01:17:19]: 我认为一个非常好的类比是软件工程。

Swyx [01:17:22]: 对。

Liam Fedus [01:17:22]: 在软件工程的早期,我们有 GitHub Copilot,然后是早期版本的 ChatGPT。人们把这些东西当作副驾驶来帮助他们找到解决方案。随着自动化的进步,现在我们有了像 Codex 这样的东西,我们的工程师中很少有人还像以前那样写代码了。我们认为 Periodic 也可能发生非常相似的事情:你可以用系统来加速研究人员、材料科学家、材料工程师、工艺工程师。但随着自主性、智能和能力的增长,你就可以开始按成果定价了。比如帮我达到这样一种目标状态,我认为这对我们来说是一个非常有趣的领域。

Ekin Doğuş Çubuk [01:18:03]: 是的。我们有点觉得,我们对固态物理和科学最好的贡献,可能是让这些工具和主题变得有利可图,就像 ChatGPT 之前和之后让计算机科学和 LLM 专业在大学里更受欢迎一样。我们想证明固态物理和材料科学研究可以在商业上产生巨大影响,然后这会吸引更多的关注。年轻人会想要学习物理,这将是一个梦想。而贝尔实验室确实产生了巨大的商业影响,对吧?他们虽然未能将一些令人难以置信的进步商业化——当然,他们做了一些根本无法商业化的研究,比如宇宙微波背景——但他们确实从连接东海岸与西海岸的电话线的真空管中获益良多。

Liam Fedus [01:18:49]: 是的。而且我认为,技术与资本有着难以置信的紧密交织,这一点也很有意思。如果你看看多年来聊天机器人的进展,想象一下回顾一下:从 2010 年到 2015 年,聊天机器人有什么进展?对于那五年里它们改进了多少,我们可能会一时语塞。但如果你看看 2021 年到 2026 年这段时间,那就是天壤之别。发生的事情是,ChatGPT 和这些其他系统实现了产品市场契合,这完全改变了资本的格局。这改变了招聘、算力、数据等等方面的格局。

Swyx [01:19:31]: 良性循环。

Liam Fedus [01:19:32]: 正是如此。所以

Swyx [01:19:32]: 就像成功孕育成功。

Liam Fedus [01:19:33]: 正是如此。所以技术,它与资本和那些资源的耦合是极其紧密的,而我们想在物理世界中实现同样的事情。

Swyx [01:19:41]: 是的。

Brandon [01:19:42]: 我一直注意到的一点是,科学领域的资助正在从政府拨款等方式转向风投和私人资金。你们有计划把自己正在做的任何东西开源吗,比如发布数据集或实际的模型?这在未来是否有可能?你知道,有很多模型可能不是你们的最先进水平,但作为发布品仍然可能是有用的。

Ekin Doğuş Çubuk [01:20:07]: 当然。我们做了几件事情。我们一直在为开源做贡献,比如 PyTorch 和 Materials Project 的代码库、Custodian——他们的 DFT 运行器。TorchSim 实际上是由我们这里的一位研究员 Abhijit Ganggan 创建的,他至今仍在维护它。还有 JAX-MD,也是 Abhijit 在维护。所以我们做了很多开源贡献,包括大语言模型。

Liam Fedus [01:20:31]: XLANG、Megatron。

Ekin Doğuş Çubuk [01:20:32]: 是的。

Liam Fedus [01:20:32]: 是的。我们一直是开源社区非常积极的贡献者。

Ekin Doğuş Çubuk [01:20:36]: 我们还有一项学术资助计划,向那些我们认为在真正推动合成超级智能这一方向的大学学术团体提供学术赠款。这方面的发展也很令人欣喜。我认为这笔资助产出的第一篇论文即将发表,能看到更多这样的论文涌现会令人兴奋。是的。

Brandon [01:20:57]: 好的。让我们做个最强假设:假设你们实现了 100% 的实验室自动化,它能完成所有事情,正确地表征一切。你们拥有所有能干任何事的智能体。但我仍然不太清楚你们究竟要如何实现超导。还有很多难题需要解决。在大多数强关联体系或高温体系都没有理论或模型的情况下,通往超导的路径是什么?

Ekin Doğuş Çubuk [01:21:23]: 是的。我们的观点是,设想可能存在超导的化学空间并不难,真正难的是把它们合成出来。这就是为什么我们如此强调合成超级智能。举一个历史上的例子:Alex Müller 当年认为过渡金属氧化物可能是实现超导的好路径时,他其实先尝试的是镍酸盐——镍、氧加一些阳离子,但没成功。然后他尝试了铜酸盐——铜、氧加一些阳离子,成功了,他还因此获得了诺贝尔奖。但我们后来知道,镍酸盐其实也是个好想法。镍和铜在元素周期表上相邻。

Brandon [01:21:59]: 但只有两层,对吧?

Ekin Doğuş Çubuk [01:22:00]: 是的。3d 过渡金属数量也就那么多。

Brandon [01:22:03]: 是啊。

Ekin Doğuş Çubuk [01:22:03]: 然后,Harold Hwang,我们这里一位非常了不起的斯坦福教授,他意识到可以用薄膜形式制备镍酸盐并展示超导性。所以,如果我们实验室里有一个真正优秀的合成超级智能,并且能够真正扩大这些东西的规模,我认为我们不会 ideas 用尽,或者 LLM 不会想不出可以尝试的方向,比如 3D 过渡金属、氧。这里有很多非常相关的想法。很多人一直在尝试钴酸盐,也就是不用铜或镍,而是尝试钴。所以我觉得这非常令人兴奋。也许还有一个值得研究的历史案例,是发现二硼化镁的日本团队。如你所知,那是常压下温度最高的常规超导体,而他们只是通过尝试一堆材料发现了它。我想他们试了 30,000 种不同的东西。其中 30 种似乎表现出有趣的超导性,MgB₂ 就是其中之一。但二硼化镁在此之前的几十年里,一直作为前驱体被晾在人们的架子上,而 BCS 理论早在 1957 年就已经提出了。所以人们发现这些材料的方式并不是从理论推导出来的。也不是因为他们直到那时才能合成。纯粹就是他们尝试了一大堆东西。所以现在想象一下,如果我们拥有你描述的那种完美的自动化——听起来像梦一样——我们在一个月内就试完了 Taketo 团队整个职业生涯尝试的那 30,000 种材料。我们真的就是在大幅增加运气的表面积。

Swyx [01:23:30]: 不,是的,你们所做的非常鼓舞人心。祝贺你们取得的所有成功。我感觉,我感觉你们正在创造,是的,现代的游乐场。我想招募人才对你来说一定超级容易,所以我有点羡慕,不过你们为之付出了努力才有今天,所以,是的。

Ekin Doğuş Çubuk [01:23:44]: 是的。

Swyx [01:23:44]: 是的。那么,非常感谢。是的,和你们两位聊天非常愉快。

Ekin Doğuş Çubuk [01:23:46]: 是的,超级开心。是的。

Swyx [01:23:47]: 是的。谢谢。

来源:Latent Space · latent.space