从训练到推理:内存层级正迎来范式转变
From Training to Inference: A Paradigm Shift in the Memory Hierarchy
随着测试时扩展兴起,AI 产业重心正从训练转向推理,内存层级随之发生结构性变化。NVIDIA 与 Google 在 2026 年上半年分别推出 CMX、Rubin 集成 Groq LPX 和专为推理设计的 TPU v8i(比 TPU v8t 多 72 GB HBM3e 与 384 MB SRAM)。
随着测试时扩展(test-time scaling)的兴起,AI 行业的重心正迅速从训练转向推理。NVIDIA、Google 以及其他主要 AI 厂商在 2026 年上半年推出了面向推理的专用芯片,而 Cerebras、SambaNova、Etched 等 AI ASIC 初创公司也发布了新产品并宣布了战略合作。伴随这一转变,内存层级结构正在经历结构性变革,各厂商正转向 HBF、SSD POD 和 SRAM,以突破传统 HBM 在容量和带宽上的限制。
本文面向希望建立清晰、基础性认知、了解 AI 内存需求的读者。
TrendForce 是一份读者支持的刊物。要接收新文章并支持我们的工作,欢迎成为免费或付费订阅者。
目录:
AI 训练的内存需求
AI 推理的内存需求
当行业从训练转向推理时,内存结构如何变化
AI 训练的内存需求
AI 训练是指使用训练数据集教会 AI 模型新能力的过程。AI 推理是指将已训练好的模型应用于新数据以生成响应的过程。由于这两个阶段需要截然不同的内存类型,内存架构近年来迅速多样化。
以当今主流的 Transformer 架构为例,训练过程由三个主要阶段组成:
前向传播:将各层的权重从内存读取到计算裸片上,通过大规模矩阵乘法生成预测输出。随后损失函数将该输出与正确答案进行比较,以衡量误差(loss)。
反向传播:模型按照链式法则,逐层读取在前向传播期间临时存储的激活值,并计算与权重大小相匹配的梯度。
优化器更新:读取梯度后,模型更新并写回权重本身,以及两个与权重大小相同的优化器状态张量(一阶矩 m 和二阶矩 v)。
由于模型必须反复重复这三个阶段以最小化损失并收敛,内存访问速度成为决定训练效率的关键因素。
正是在这样的背景下,HBM(高带宽内存) 应运而生:多层 DRAM 垂直堆叠并通过 TSV 互连。与通过相对较慢的 PCIe 连接的传统 DRAM 不同(PCIe 6.0 x16 提供单向 128 GB/s 带宽),HBM 与计算裸片并排封装在同一中介层上,缩短了数据路径。单个 HBM 堆栈可提供超过 2 TB/s 的带宽(HBM4 在 2,048 个引脚上单向每引脚提供超过 1 GB/s 的带宽),这显著加速了 AI 的产业化进程。
在训练时代,内存层级结构中新增了一层 HBM,填补了片上 SRAM 与传统 DRAM 之间的空白。
相关报告:3Q26 HBM 数据表
AI 推理的内存需求
AI 推理主要包含两个阶段:
预填充(Prefill):输入提示词在单次处理中并行完成。每一层的 Key 和 Value 向量被计算并存储到内存中(即 KV Cache),同时生成第一个输出 token。
解码(Decode):从 KV Cache 中读取 Key 和 Value 向量,逐个生成 token,同时将新计算的 Key 和 Value 向量持续写回 KV Cache,直到响应完成。
由于解码阶段需要对 KV Cache 进行反复的逐 token 读写,而 KV Cache 的大小又随对话轮数、上下文窗口长度和批处理规模的增加而持续增长,仅依靠 HBM 已越来越难以满足不断增长的推理需求。内存容量已成为与带宽并列的第二大关键瓶颈。
与为 AI 训练打造的相对成熟的内存架构不同,AI 推理内存架构目前才随着测试时扩展(test-time scaling)而快速发展。各家厂商仍在积极探索不同的内存方案,内存层级正处于范式转变之中。
为应对 KV Cache 日益增长的容量需求,内存厂商 SanDisk 和 SK hynix 于 2025 年 8 月宣布合作开发 HBF(High Bandwidth Flash),它将多层 NAND 垂直堆叠并通过 TSV 互连。在预期的 1.6 TB/s 带宽下,单个 HBF 堆栈预计可提供约 512 GB 的容量,约为 HBM(16 层 HBM4 堆栈为 48 GB)的十倍以上,填补了 HBM 与传统 DRAM 之间的空白。
在 HBF 尚未实现量产的情况下,许多厂商同时采用 KV Cache 卸载的方式,将较少使用的 KV Cache 下移到更低层级的内存中,以缓解大量 KV Cache 存储带来的压力。在此背景下,NVIDIA 于 2026 年提出了 SSD POD 的概念,填补了本地 SSD 与共享存储之间的空白。
值得注意的是,除 HBF 和 SSD POD 之外,一些推理 ASIC 初创公司还引入了高速 SRAM,以突破 HBM 的速度极限。例如 Groq(其推理技术授权和核心团队已于 2025 年 12 月被 NVIDIA 收入囊中)和 Cerebras,它们利用大容量片上 SRAM 显著提升解码速度。
从训练到推理的内存结构变化
2026 年上半年,随着推理需求持续激增,NVIDIA 宣布将把 Groq LPX 芯片纳入其 Rubin 系列,预计于今年晚些时候推出,同时发布了 CMX(Context Memory Storage Platform)和 Vera CPU 机架。
Google 也发布了专为推理设计的 TPU v8i,与面向训练的 TPU v8t 相比,它多携带 72 GB 的 HBM3e 和 384 MB 的 SRAM。
除了这两大巨头之外,2026年上半年还有多家专注推理芯片的AI ASIC初创公司表现活跃:SambaNova于2026年2月发布了其第五代芯片SN50;Cerebras于2026年4月提交了IPO申请,并宣布与OpenAI和AWS建立合作伙伴关系;Etched则于2026年6月宣布其Sohu芯片已在TSMC成功流片。
回顾训练时代几乎完全由HBM主导的局面,再对比如今推理领域更加多样化的格局,可以预期存储层次结构的设计选择未来将持续走向多样化。
接下来
在下一篇文章中,我们将深入探讨行业领军企业如何借助CXL扩展和KV Cache压缩来解决存储瓶颈,以及这对未来存储市场意味着什么。欢迎订阅,以免错过。
来源:TrendForce Insights 半导体产业洞察 · insights.trendforce.com