- English – US
- English – India
- English - Malaysia
- English - Singapore
- 日本語 (Japanese)
- 简体中文 (Simplified Chinese)
- 繁體中文 (Traditional Chinese)
FMS 2026 |4 部分系列:第 3 部分
内存与存储如何将受限基础设施转化为更具价值的 AI 工作产出
第 1 部分阐释了智能体 AI 时代的内存墙问题。第 2 部分梳理了层级架构:面向推理的优化五层栈、面向执行的四层栈,以及同类内存与存储技术在不同压力下承担的不同职能。这种分层部署逻辑如今需要从 KV 缓存延伸至基础设施的其余环节:如何让数据中心内每一项受限资源都产出更多有价值的 AI 工作? 这正是产品组合的价值所在。产品按层级逐一构建,匹配两类技术栈,每款产品解决不同的问题。它们协同提升整个系统的生产性利用率。
关键不在于美光在每个品类都有产品布局,而在于这些品类如今相互依存、缺一不可。在本就受限的数据中心中堆砌闲置算力,无法赢得智能体 AI 的竞争。制胜之道在于提升生产性利用率:在现有电力、空间和芯片资源的基础上,产出更多有价值的工作。高带宽内存 (HBM) 保障最热上下文数据的高速流转。SOCAMM2 与 RDIMM 让更大规模的工作集保持在足够近的位置,发挥关键作用。CXL 池化内存让闲置容量重新投入工作。SSD 保存运行状态。高密度数据湖存储保障长期上下文随时可用。这不是零散部件的简单堆砌,而是智能体 AI 所需的核心架构。
变革始于 XPU 近端
推理工作负载往往受限于带宽。即便速度最快的 XPU(即 GPU、TPU、定制 AI 芯片等全品类 AI 加速器),也可能因等待数据而闲置,单纯增加算力无法解决这一问题。带宽才是破局关键。这就是 HBM 对令牌经济至关重要的原因:当活跃上下文热度最高、距离加速器最近时,HBM 为解码流水线持续提供数据供给。在内存受限的推理工作负载中,更高的 HBM 带宽带来的令牌吞吐量提升幅度,会超过带宽本身的增长幅度。收益的根源在于,同款 XPU 的生产效率得到了提升。正因如此,我们已量产 36GB 12 层堆叠 HBM4,单栈带宽超过 2.8TB/s,能效较上一代产品提升 20% 以上。后续代际产品将实现更大突破。定制化 HBM 还可将特定逻辑单元移近内存栈,减轻 XPU 压力,为成本、功耗或系统级优化留出更多空间。过去,内存只是位于 XPU 旁,等待调用指令。未来,内存将越来越多地直接参与运算工作。这才是真正的变革。
被忽视的容量阈值
多年来,行业讨论基础设施总以算力为先:处理器速度有多快? 这个问题如今已不再是核心。真正的问题在于,系统是否将正确的数据放在了正确的位置。在 AI 领域,“内存刚好够用”是成本最高的配置方案。一旦达不到容量阈值,性能不会平缓下降。而是会急剧恶化,引发数据溢出、逐出与重计算。SOCAMM2 正是为解决这一问题而生:它是高容量内存层级,在 XPU 所在系统中,位于 HBM 的下一层。执行栈在同一层级也需要同等容量,只是服务于不同的处理器。RDIMM 为 CPU 承担这一职能,正如 SOCAMM2 服务于 XPU。同一层级,同一思路,只是两端对接的芯片不同。
让系统适配智能体
即便内存容量再充裕,一旦被禁锢在单台服务器内,就存在上限。闲置的内存只能一直闲置,即便相邻服务器迫切需要也无法调用。我们的目标不是压缩智能体来适配系统,而是扩展系统来承载智能体。在整个机架范围内动态池化内存,按需分配、随用随调:这是活跃内存,而非冷备溢出资源,可针对工作负载进行调优。基于 CXL 的池化内存正是基于这一理念打造。机架级系统可在单个 4U 机箱中提供最高 40TB DDR5 内存,整机架容量可扩展至 160TB 以上,适用于内存密集型 AI、高性能计算 (HPC) 与数据库工作负载。在美光及生态伙伴的演示中,解耦内存在受限工作负载下,大幅提升了每秒令牌处理量,同时降低了 XPU 资源消耗。这就是最纯粹的生产性利用率提升:不是增加更多 XPU,而是让 XPU 得到更充足的数据供给。执行栈基于同一架构实现池化,同理,CPU 的内存需求也不必局限在单台设备内。
为尚未显现的工作负载提前布局
在原始速度方面,HBM 和主内存无可匹敌。但企业的数据量远超出这些内存的承载上限,且这些数据需要存储的时长远超单次会话周期。下一层级便承担这一职能:持久化存储、速度依然出色,且可在工作负载到来前提前配置。
我们在量产前一年多就推出了美光 9650 (PCIe® Gen6 SSD) 的工程样片。这一先发优势为生态系统预留了准备时间,也是本次产品迭代速度快于以往代际更替的原因之一。该产品的发布节奏匹配下一波智能体 AI 平台的发展,而非在平台落地后才跟进补位。对我们而言,行业领先意味着尽早将产品交付给客户,让生态系统有充足时间做好准备。最新的 XPU 平台需要与其数据传输需求相匹配的存储,而 PCIe Gen6 存储正是为此打造。
能效提升的效果同样直观。过去需要 8 块 PCIe Gen5 硬盘才能达到的目标读取性能,如今用 4 块美光 9650 即可实现,因为美光 9650 的读取性能最高可达 Gen5 硬盘的两倍,单位功耗性能也显著提升。这意味着在相同的空间与功耗预算内,硬盘数量更少、能耗更低、空间占用更小,却能产出更多有价值的工作。美光 9650 的 E1.S 规格还支持液冷,同时提供 E1.S 与 E3.S 两种规格。它既适配现代 AI 数据中心的散热需求,也支持风冷环境,助力用户用最新硬件升级现有基础设施。美光 7600 作为 PCIe Gen5 SSD,完善了产品组合,可满足暂不需要 Gen6 性能的工作负载需求。
执行栈依赖同款硬盘则出于不同原因:让智能体可以暂停和恢复任务,而非从头重启。每次重启都会浪费时间、算力和上下文数据。持久化的本地状态将这些浪费的资源重新转化为生产性工作。
数据湖底座正在重构
层级架构的最底层是数据湖,智能体 AI 在此存储和调用所有数据,将冷数据“加热”为洞察的频率远超以往。推理栈从中调取长期上下文数据。执行栈基于同一底座,让每一项行动都以真实企业数据为依据。将数据整合到数量更少、密度更高的硬盘中是正确的方向,因为这能让数据中心在相同物理空间内完成更多工作。随着容量密度提升和存储带宽需求增长,存储架构也需要更强的弹性,包括支持快速路径故障转移的双端口配置。机械硬盘已无法适配这个时代的发展:当工作负载对每 TB 性能的需求提升时,机械硬盘的单 TB 性能反而在下降。我们推出的 245TB 美光 6600 ION 硬盘是当下的解决方案:它是全球市售容量最高的 SSD,单机架容量可超过 176PB。我们正在为下一波数据增长打造云存储优化型 SSD:实现更高的单位功耗带宽、更高的单机架容量,在更小的物理空间内产出更多有价值的 AI 工作。
逐层拆解内存墙
推理侧共五层。执行侧共四层。同类内存与存储技术在不同压力下承担着不同的职能。这就是数据中心内“为每一层级打造专属方案”的内涵。打破内存墙的核心,是将受限的基础设施转化为更具价值的 AI 产出:更多令牌、更多用户、更多状态保存、更多可用的长期上下文,且全部控制在用户面临的电力与空间约束内。要推倒内存墙,必须先筑牢墙下的根基。第 4 部分将这一议题带出我们的边界,探寻 AI 走出这些边界后的运行场景。