Shift Left 让晶圆厂制造数据管理更复杂
Shift Left Complicates Fab Data Management
半导体晶圆厂借助设备传感器实时数据和 AI/ML 推理模型,将良率异常检测前移到工艺模块内部,以加速良率学习并改进先进过程控制(APC)。设备传感器参数从约每秒一次提升到每几十毫秒采样一次,数据种类较十年前至少增加 10 倍,部分晶圆厂每年产生数百 PB 数据。如何在 sub-second 处理的同时保留数据上下文与连通性,成为 shift left 带来的主要数据管理难题。
要点:
- “左移”通过将检测提前来提升良率。晶圆厂正利用实时设备传感器数据和 AI/ML 在工艺模块内部识别工艺偏差,并改进先进工艺控制。
- 更高的采样率、数百个传感器参数以及亚秒级分析,正在增加制造数据的体量、速度和多样性。
- 数据上下文与连通性仍然重要。然而,模块级优化对两者都有影响。
半导体晶圆厂正利用 AI/ML 模型和原始设备数据来加快良率学习,但它们收集的数据量——在某些情况下每年高达数百 PB——迫使他们做出关于优化与上下文之间的艰难抉择。
由于检测和量测工具的采样增加,他们所处理的数据量已经爆炸式增长,这些数据用于检测良率问题。其中包括从设备传感器流式传输的数据,这是数据体量中相对较新的组成部分。AI/ML 推理模型利用这些传感器数据进行原位分析,从而实现响应更快的先进工艺控制(APC),并能更快地识别可能对下游良率产生不利影响的变化。
“过去五年里,设备数据部分呈指数级增长,”Intel Foundry 自动化部门高级数据工程经理 Ashish Gupta 说,“这种爆发主要是晶圆厂开展左移工作、转向原位实时工艺控制的结果。”
其他人也认同,设备数据使用的增加已成为数据呈指数级增长的一个来源。
“设备数据在三个维度上扩展了,”Onto Innovation 企业软件业务副总裁 Jae Yong Park 表示,“供应商在过去几年里增加了数百个参数,采样率从大约每秒一次提高到每几十毫秒一次,而且工程师越来越多地处理原始轨迹数据而非汇总数据。这些变化加在一起,使流式数据的体量大幅增加。”
更多的设备数据增加了数据的体量、速度和多样性。在一个工艺模块内的实时使用现在需要亚秒级处理。数百个设备传感器使数据的多样性比十年前增加了至少 10 倍。
“几乎从所有地方都涌出了数据洪流,”Synopsys 产品管理高级总监 Kartik Venkataraman 说。“即便是晶圆厂所能获得的数据——来自其所有设备供应商的数据——也只是该设备所产生总量的一小部分。这部分是因为 OEM 希望把一些信息留给自己。那是他们的知识产权。但很多时候,是因为晶圆厂根本无法处理这些数据。以蚀刻腔室或 CVD 腔室中的 RF 等离子体源为例,它在兆赫兹级别运行。但如果它是脉冲式的——而脉冲是一个如此关键的参数——它是在千赫兹级别运行。每个脉冲都有一个波形,具有一定的形状。它有一定的瞬态响应和一定的下垂。它具有一些特性和特征,其中一些可能是可操作的,能告诉你关于工艺的一些信息,但你不可能监测每一个脉冲。这可是每秒数兆字节的数据。”
对于先进的器件节点,实时/原位数据分析的增长改善了良率学习和先进过程控制。通常,工程师需要等待数天、数周甚至数月才能从后续筛选步骤(如电气测试)中获得良率异常信号。借助 AI/ML 模型,晶圆厂通常可以将识别和决策转移到工艺模块内部。决策可以调整工艺模块设置,或在操作中途中止工艺。这种转变需要对大规模高分辨率数据进行持续监测。
晶圆厂更左移
几十年来,半导体测试一直在将更多测试内容向流程的更早阶段左移。目标是通过在晶圆级测试中增加测试内容来提高最终测试或系统级测试的良率。最近,由于 chiplet 的激增,为切割后的裸片增加了一个额外的测试步骤。更早的筛选提高了对已知良好裸片(KGD)出货的信心。这反过来又提高了最终产品的良率和质量。
类似地,晶圆厂正在将设备数据向流程更早阶段左移,利用工艺模块数据来检测良率异常并改进先进过程控制算法。通过依靠设备传感器数据和专门构建的虚拟量测模型,工艺模块可以快速自识别工具内部对良率产生不利影响的偏移。因此,工艺工程师无需等待下游筛选来标记良率问题。AI/ML 推理模型的结果可以近乎实时地识别良率问题的原因。
“左移发生在每个宏观阶段内(设计 => 制造 => 分类 => 先进封装 => 最终测试),”Intel Foundry 的 Gupta 表示。“但把检测向上游移动到晶圆厂模块内部、设计周期内部或测试单元内部,才是数据工程挑战加剧的地方。与其等待汇总的分类结果或步骤后检查,阶段内的左移需要连续的高分辨率监控、原位/腔内分析、异常检测、虚拟量测、自适应测试等。这些活动促成了一场 4Vs(体量、速度、多样性、真实性)数据海啸。”
从根本上说,向工艺模块内部监测的转变增加了三个步骤。AI/ML 推理模型访问实时设备传感器数据。这些模型可以标记出可疑的晶圆加工,需要调整设备参数或发出中止命令。对于后者,根本原因分析将指示后续的纠正措施,例如维护。

图 1:左移更早地识别良率异常,并更好地支持先进过程控制。来源:Intel Foundry
随着晶圆厂日益要求设备供应商提供更多数据,管理这些数据仍然是一个关键课题。为支持原位分析,需要让工艺工程师能够获取设备日志,用于模型构建和监测。
“如今,让供应商以标准格式导出关键相关数据至关重要,因为芯片制造商已经开始在传统系统(YMS、FDC、R2R)之外自行利用这些数据,”Onto Innovation 销售与产品营销高级总监 Prasad Bachiraju 表示。“此外,他们需要以标准格式将基板(晶圆/面板)所发生情况的知识传递给下一步,以便信息被利用并优化下一个工艺。”
其他人则强调实时决策的增长,这需要访问设备数据以支持虚拟量测模型。
“指标应该在线测量,而不是事后测量,因为可能对产品质量产生负面影响的 изменения随时可能发生,”PDF Solutions 产品管理总监 Steve Zamek 说。“我们现在拥有的软件可以捕获这些故障,并在产生任何[更多]废品之前干预设备,将所谓的产品风险降到最低。在我们拥有强大的虚拟量测模型、能够利用实时设备参数准确预测无法测量的原位产品质量指标的情况下,这一点尤其如此。”
设施相关数据也可以从这种左移策略中受益。水温、水压和电力波动等变化也可能影响良率。“这项技术也应应用于 sub-fab 数据,因为与一台晶圆厂设备直接相关的组件的运行参数,对该设备所加工材料质量的影响越来越大,”Zamek 指出。“支持这种近乎实时分析的行业标准和技术已经存在,因此这一用例的障碍微乎其微。”
向 AI/ML 提供数据
AI/ML 推理模型正在支持利用设备传感器数据实现更复杂的原位监控。与多变量统计过程控制(SPC)相比,推理模型会主动消耗并分析更大量、更多种类的数据,以支持腔室分析、异常检测和虚拟量测。
“很难量化目前收集的数据中用于分析的百分比。然而,随着机器学习和人工智能的出现,晶圆厂正在收集并使用原始轨迹数据进行异常值检测和根本原因分析,而不再仅仅依赖汇总级数据,”Onto Innovation 的 Bachiraju 说。“其动机是识别传统统计分析可能遗漏的细微信号。”
其他人也证实了如今输入 AI/ML 推理模型的数据量在增加。
“将缺陷检测在晶圆厂模块内向上游转移,直接推动了更高的检测频率、更密集的量测采样,以及跨晶圆的更大规模的站点级测量。与此同时,设备传感器保真度和模态方面的突破正在为丰富的 AI/ML 模型提供动力,这些模型驱动着下一代先进过程控制(APC)、异常检测和虚拟量测应用,”Intel Foundry 的 Gupta 说。
左移的好处包括从提升产品良率到提高整体设备效率(OEE)。
“AI/ML 正在成为质量提升的重要驱动力,因为它能让企业从被动解决问题转向主动预防缺陷,”PDF Solutions 产品管理高级总监 Jon Holt 表示,“通过分析海量的运营、工艺和设备数据,AI 模型能够识别人类往往难以发现的模式,帮助团队在质量问题发生之前进行预测。这提高了工艺稳定性、减少了波动、加速了根因分析,并最终提升良率和产品一致性。在复杂的制造环境中,AI 还支持预测性维护和工艺优化,降低了因设备退化或工艺漂移导致质量逃逸的可能性。”
虽然左移改变了每个操作步骤所发生的事情,但晶圆厂不能忽视筛选步骤,也不能忽视在工艺模块之间连接数据的需求。
检测、量测和测试步骤对于捕捉这些新 AI/ML 推理模型遗漏的问题仍然是有效的筛选手段。此外,当与工艺模块数据相连接时,检测、量测和测试步骤还能发现模型改进之处。然而,用于连接晶圆厂各工艺步骤数据的 AI/ML 模型需要在可信数据上运行,因此必须保留这些步骤之间的可追溯性以及数据的上下文信息。
在数据可信度与可追溯性之间取得平衡可能颇具挑战,部分原因是缺乏可追溯性标准,部分原因是团队倾向于按单个工艺模块来优化数据管理。
“局部优化的陷阱会导致一种可以形容为‘数据丰富但上下文贫乏’的局面,”Gupta 说,“每个工艺模块都只针对其特定的、受时间约束的挑战进行激烈优化,而企业级数据集成、跨模块可追溯性和全局关联则更难被优先考虑(即数据真实性的挑战)。”
在晶圆厂内连接数据
在工艺模块自身的优化与在工艺模块之间连接数据的需求之间进行权衡,仍然是一个难题。然而讽刺的是,连接这些数据恰恰是训练和维护工艺模块内原位推理所需 AI/ML 模型的必要条件。具体而言,某个工艺模块的数据上下文不足,可能是该工艺仅针对自身约束而非跨多个晶圆厂步骤的关联数据进行优化的副产品。这反过来会削弱在工厂内部以及跨工厂打通数据孤岛的能力。
这里的一大挑战是找到正确的切入点。“不仅工具更多了,而且它们都在生成更多、模式相当丰富的数据,”Siemens EDA Calibre 半导体研发参谋长 Jim Schiely 说,“当你看到像 Rapidus 或 Terafab 这样的新兴巨头时,就有一个机会从我们现在已有的认知出发,而不是使用只有局部本体和局部数据血缘的小模型。每个部门都可以从头开始,秉持这是一门信息业务的理念。我们必须把这些不同数据的线索全部建立起来,弄清它们如何连接,以及如何构建这个庞大的数据图。这些图正是 AI 能够大显身手的燃料。”
对于成熟的晶圆厂来说,这需要重塑处于芯片制造核心地位的模型。“25年前我们做光刻建模时,团队里有一些堪称建模界米开朗基罗的人物,”Schiely说。“他们是唯一知道怎么做的人。如果你遇到一个棘手的数据集,可以去找这些人,他们能把它搞定。建模这门学科已经日趋成熟,可用的工具不仅包括计算硬件,还包括Python中可用的库和各种模型。在过去,对某些神经网络模型进行自动化甚至是不可能的。25年前当我们谈论自动化模型拟合时,那听起来很荒谬。而如果你无法让数据保持最新,那么生成所有这些图表并跟踪所有这些数据就不值得,尤其是当这些数据最终被闲置不用的时候。”
AI和数字孪生可以解决这类问题,但对于半导体而言,这些抽象模型需要与多物理场仿真和测试相关联起来。
“核心引擎仍然必须生成真值,而这无法由LLM完成,”Synopsys的Venkataraman说。“我们仍然必须经历这样一个过程:首先确保人类专家把它做对,并用真实数据进行验证和校准。所以校准环节至关重要。物理模型会告诉你它应该如何表现,但你需要实际数据来将其锚定在现实中。一旦做到这一点,你就不只是收集数据然后自己看结果,而是理解数据为什么会是这样。这正是数字孪生应该告诉你的。它应该向你揭示其中的物理原理。真正的学习正来源于此,也正是它使泛化学习成为可能。”
这是目标。但从设计到制造的全流程中,与数据相关的挑战依然存在,而当涉及多个工艺时,这些挑战会进一步叠加。
“先进器件的复杂度不断提升,无论是逻辑领域的全环绕栅极器件、3D DRAM、模块化堆叠NAND,还是更复杂的多芯片封装,如系统级封装中的HBM和SoC,”Lam Research设备智能产品开发董事总经理Russell Dover说。“因此我们需要引入智能工具来实现数字主线,利用AI技术来管理超出我们独自能力范围的事务。从根本上说,这关乎解决问题的速度和更快的学习周期。”
工程师们正在超越工艺模块优化,迈向跨晶圆厂的机群级别。“利用AI,我们可以创建一个校正模型,利用来自不同工艺设备的前馈或反馈,为芯片制造商带来更好的集成结果,”Dover说。“而且数据不在乎物理位置。例如,如果你在亚洲有一家晶圆厂,在世界其他地方还有一家姊妹晶圆厂,你可以把数据合并起来,把它们当作一个虚拟机群来对待。这样你就能超越传统的设备匹配——即在特定晶圆厂和特定工艺中优化一个机群——扩展到跨不同地点的、由多个腔室组成的机群,并推动匹配和产出优化,提高该工艺的Cpk和良率。”
同样的道理也适用于其他工艺。例如,等离子体处理为虚拟量测提供了一个强大的平台,因为腔室壁上残留物带来的条件是不断变化的。SandboxAQ 半导体材料创新与跨垂直战略负责人 Shalini Sharma 表示:“同一种工艺化学品在刚清洗过的腔室中的表现,可能与已处理过数百片晶圆的腔室不同。以等离子体刻蚀为例,随着腔室老化,腔室壁上的聚合物残留会逐渐改变设备内部的气相化学,并使刻蚀速率发生偏移。工程师们通过设计实验、腔室遥测和陪片来表征这些相互作用,然后通过清洗、稳定化处理和逐片控制来加以管理。机器学习可以在射频阻抗、气体流量及其他传感器数据中识别人类难以发现的模式,而虚拟量测可以在传统测量结果出来之前,就估算出薄膜厚度或刻蚀深度等结果。
结论
将检测和工艺控制前移到制造流程的更早阶段正在加速良率学习,但这也给晶圆厂内部的数据基础设施带来了压力。随着制造商在不同工艺步骤中优化 AI/ML 模型,挑战将在于保留数据的相关上下文,以及晶圆厂分析和工艺优化所需的可追溯性。
— Ed Sperling 对本文有贡献。
相关文章
机器人技术与智能设备控制如何推动下一代晶圆厂的生产效率
在幕后,先进的设备控制和机器人技术正在实现更高的重复性、设备正常运行时间和良率。
安全数据共享对芯片制造日益关键
在诸多好处的驱动下,数据共享正逐渐成为先进器件节点和多裸片封装的“必备项”。
数字孪生:云端之上,潜力无限
芯片行业利用大规模计算资源和 AI 打造虚拟沙盒。
故障检测与分类的新前沿
AI 正在带来更及时、更准确的数据,但基于 AI 的指挥与控制尚未出现。
来源:Semiconductor Engineering 芯片与封装 · semiengineering.com