存储

内存墙 - 第 3 部分:为智能体 AI 构建全层级支撑体系

Jeremy Werner

人工智能数据流抽象示意图

FMS 2026 |4 部分系列:第 3 部分

内存与存储如何将受限基础设施转化为更具价值的 AI 工作产出


第 1 部分阐释了智能体 AI 时代的内存墙问题。第 2 部分梳理了层级架构:面向推理的优化五层栈、面向执行的四层栈,以及同类内存与存储技术在不同压力下承担的不同职能。这种分层部署逻辑如今需要从 KV 缓存延伸至基础设施的其余环节:如何让数据中心内每一项受限资源都产出更多有价值的 AI 工作? 这正是产品组合的价值所在。产品按层级逐一构建,匹配两类技术栈,每款产品解决不同的问题。它们协同提升整个系统的生产性利用率。

关键不在于美光在每个品类都有产品布局,而在于这些品类如今相互依存、缺一不可。在本就受限的数据中心中堆砌闲置算力,无法赢得智能体 AI 的竞争。制胜之道在于提升生产性利用率:在现有电力、空间和芯片资源的基础上,产出更多有价值的工作。高带宽内存 (HBM) 保障最热上下文数据的高速流转。SOCAMM2 与 RDIMM 让更大规模的工作集保持在足够近的位置,发挥关键作用。CXL 池化内存让闲置容量重新投入工作。SSD 保存运行状态。高密度数据湖存储保障长期上下文随时可用。这不是零散部件的简单堆砌,而是智能体 AI 所需的核心架构。

美光 36GB 12 层堆叠 HBM4 内存产品

36GB 12 层堆叠 HBM4 实现业界领先的能效表现。

点击图片展开

变革始于 XPU 近端

推理工作负载往往受限于带宽。即便速度最快的 XPU(即 GPU、TPU、定制 AI 芯片等全品类 AI 加速器),也可能因等待数据而闲置,单纯增加算力无法解决这一问题。带宽才是破局关键。这就是 HBM 对令牌经济至关重要的原因:当活跃上下文热度最高、距离加速器最近时,HBM 为解码流水线持续提供数据供给。在内存受限的推理工作负载中,更高的 HBM 带宽带来的令牌吞吐量提升幅度,会超过带宽本身的增长幅度。收益的根源在于,同款 XPU 的生产效率得到了提升。正因如此,我们已量产 36GB 12 层堆叠 HBM4,单栈带宽超过 2.8TB/s,能效较上一代产品提升 20% 以上。后续代际产品将实现更大突破。定制化 HBM 还可将特定逻辑单元移近内存栈,减轻 XPU 压力,为成本、功耗或系统级优化留出更多空间。过去,内存只是位于 XPU 旁,等待调用指令。未来,内存将越来越多地直接参与运算工作。这才是真正的变革。

美光 512GB RDIMM 和 256GB SOCAMM2 内存模块

512GB RDIMM 和 256GB SOCAMM2 提供业界领先的容量水平。

点击图片展开

被忽视的容量阈值

多年来,行业讨论基础设施总以算力为先:处理器速度有多快? 这个问题如今已不再是核心。真正的问题在于,系统是否将正确的数据放在了正确的位置。在 AI 领域,“内存刚好够用”是成本最高的配置方案。一旦达不到容量阈值,性能不会平缓下降。而是会急剧恶化,引发数据溢出、逐出与重计算。SOCAMM2 正是为解决这一问题而生:它是高容量内存层级,在 XPU 所在系统中,位于 HBM 的下一层。执行栈在同一层级也需要同等容量,只是服务于不同的处理器。RDIMM 为 CPU 承担这一职能,正如 SOCAMM2 服务于 XPU。同一层级,同一思路,只是两端对接的芯片不同。

4U 机架级系统提供 40TB DDR5 内存容量

单 4U 系统具备 40TB DDR5 内存容量。

点击图片展开

让系统适配智能体

即便内存容量再充裕,一旦被禁锢在单台服务器内,就存在上限。闲置的内存只能一直闲置,即便相邻服务器迫切需要也无法调用。我们的目标不是压缩智能体来适配系统,而是扩展系统来承载智能体。在整个机架范围内动态池化内存,按需分配、随用随调:这是活跃内存,而非冷备溢出资源,可针对工作负载进行调优。基于 CXL 的池化内存正是基于这一理念打造。机架级系统可在单个 4U 机箱中提供最高 40TB DDR5 内存,整机架容量可扩展至 160TB 以上,适用于内存密集型 AI、高性能计算 (HPC) 与数据库工作负载。在美光及生态伙伴的演示中,解耦内存在受限工作负载下,大幅提升了每秒令牌处理量,同时降低了 XPU 资源消耗。这就是最纯粹的生产性利用率提升:不是增加更多 XPU,而是让 XPU 得到更充足的数据供给。执行栈基于同一架构实现池化,同理,CPU 的内存需求也不必局限在单台设备内。

美光 9650 PCIe Gen6 和美光 7600 PCIe Gen5 数据中心 SSD

支持液冷的美光 9650 PCIe Gen6 和美光 7600 PCIe Gen5 SSD。

点击图片展开

为尚未显现的工作负载提前布局

在原始速度方面,HBM 和主内存无可匹敌。但企业的数据量远超出这些内存的承载上限,且这些数据需要存储的时长远超单次会话周期。下一层级便承担这一职能:持久化存储、速度依然出色,且可在工作负载到来前提前配置。

我们在量产前一年多就推出了美光 9650 (PCIe® Gen6 SSD) 的工程样片。这一先发优势为生态系统预留了准备时间,也是本次产品迭代速度快于以往代际更替的原因之一。该产品的发布节奏匹配下一波智能体 AI 平台的发展,而非在平台落地后才跟进补位。对我们而言,行业领先意味着尽早将产品交付给客户,让生态系统有充足时间做好准备。最新的 XPU 平台需要与其数据传输需求相匹配的存储,而 PCIe Gen6 存储正是为此打造。

能效提升的效果同样直观。过去需要 8 块 PCIe Gen5 硬盘才能达到的目标读取性能,如今用 4 块美光 9650 即可实现,因为美光 9650 的读取性能最高可达 Gen5 硬盘的两倍,单位功耗性能也显著提升。这意味着在相同的空间与功耗预算内,硬盘数量更少、能耗更低、空间占用更小,却能产出更多有价值的工作。美光 9650 的 E1.S 规格还支持液冷,同时提供 E1.S 与 E3.S 两种规格。它既适配现代 AI 数据中心的散热需求,也支持风冷环境,助力用户用最新硬件升级现有基础设施。美光 7600 作为 PCIe Gen5 SSD,完善了产品组合,可满足暂不需要 Gen6 性能的工作负载需求。

执行栈依赖同款硬盘则出于不同原因:让智能体可以暂停和恢复任务,而非从头重启。每次重启都会浪费时间、算力和上下文数据。持久化的本地状态将这些浪费的资源重新转化为生产性工作。

美光 6600 ION 245TB 大容量 SSD

适用于高密度存储场景的 245TB 美光 6600 ION SSD。

点击图片展开

数据湖底座正在重构

层级架构的最底层是数据湖,智能体 AI 在此存储和调用所有数据,将冷数据“加热”为洞察的频率远超以往。推理栈从中调取长期上下文数据。执行栈基于同一底座,让每一项行动都以真实企业数据为依据。将数据整合到数量更少、密度更高的硬盘中是正确的方向,因为这能让数据中心在相同物理空间内完成更多工作。随着容量密度提升和存储带宽需求增长,存储架构也需要更强的弹性,包括支持快速路径故障转移的双端口配置。机械硬盘已无法适配这个时代的发展:当工作负载对每 TB 性能的需求提升时,机械硬盘的单 TB 性能反而在下降。我们推出的 245TB 美光 6600 ION 硬盘是当下的解决方案:它是全球市售容量最高的 SSD,单机架容量可超过 176PB。我们正在为下一波数据增长打造云存储优化型 SSD:实现更高的单位功耗带宽、更高的单机架容量,在更小的物理空间内产出更多有价值的 AI 工作。

逐层拆解内存墙

推理侧共五层。执行侧共四层。同类内存与存储技术在不同压力下承担着不同的职能。这就是数据中心内“为每一层级打造专属方案”的内涵。打破内存墙的核心,是将受限的基础设施转化为更具价值的 AI 产出:更多令牌、更多用户、更多状态保存、更多可用的长期上下文,且全部控制在用户面临的电力与空间约束内。要推倒内存墙,必须先筑牢墙下的根基。第 4 部分将这一议题带出我们的边界,探寻 AI 走出这些边界后的运行场景。

高级副总裁兼核心数据中心业务部门总经理

Jeremy Werner

Jeremy Werner 现任美光核心数据中心业务部门 (CDBU) 高级副总裁兼总经理,专注于 OEM 数据中心客户的内存解决方案和所有数据中心客户的存储解决方案。 Jeremy 是一位经验丰富的存储技术高管,拥有超过 25 年的行业经验,领导美光数据中心内存和存储产品组合在超大规模、云和企业市场的战略和执行。 在加入美光之前,他曾担任 KIOXIA America 的 SSD 业务总经理,并在 SandForce、MetaRAM 和 Tidal Systems 等初创公司担任了十年的销售和营销领导职务。 Jeremy 拥有学士学位 来自康奈尔大学,是斯坦福商学院的毕业生,是超过 25 项已获或待决专利的发明者。

相关博客