DRAM

当内存成为关键变量:我们将 LPDDR 用于数据中心后的收获

Khayam Anjam

霓虹灯照射下的数据中心服务器机架过道

随着 AI 工作负载日益成为数据中心内的主流,通用服务器和 AI 服务器所面临的关键限制因素正在发生变化。除了原生计算能力外,功耗和热管理预算越发显著地决定着机架能够完成多少有效工作。这正是 LPDDR5X 和新型 SOCAMM2 模块化产品为数据中心带来显著优势的关键之处。SOCAMM2 拥有低功耗 DRAM 的能效和密度,并以专为服务器设计的模块化、可维护模块形式提供,这让此前根本无法实现的系统架构成为了可能。

但是,理论上的优势并不等于经过实践验证的方案。因此,我们着手为一个更难以回答的问题寻找答案:当我们将这种新型内存部署到数据中心并运行实际工作负载时,会带来哪些方面的改善?

要以令人信服的方式完成这项工作,我们需要与合作伙伴密切合作:美光数据中心工作负载工程团队与 Meta 的工程师携手合作,使用 Meta 的开源 DCPerf 基准测试套件开展测试,该套件可模拟由超大规模机群组成的生产环境。双方的合作使得测试结果更加值得关注:测试数据基于反映真实数据中心环境的工作负载。

我们考察了决定一种内存技术是否适用于数据中心的各种因素:带宽、延迟、容量和能效。我们所做的工作分析了 LPDDR5X(包括大容量配置)会如何影响上述每种因素。测试得出的一些结果让我们感到惊讶,特别是当我们为容量受限型工作负载提供足够内存来运行时所获得的结果。

结论很简单:有关数据中心内存的讨论不再仅仅局限于更快的速度或者更大的容量。关键在于将合适的内存与合适的工作负载相匹配,而 SOCAMM2 为系统设计师提供了真正的全新选择。

我不会在此剧透相关细节。此次测试的完整描述(方法论、工作负载和数据)已写入美光与 Meta 联合发布的白皮书。如果您正在面临功率上限、容量限制,或者如何以低成本扩展 AI 基础设施等挑战,我认为该白皮书值得您花时间研读。

Systems Performance Engineer, Micron

Khayam Anjam

Khayam Anjam is a Staff Engineer at Micron Technology. As part of Micron’s Data Center Workload Engineering team, he works on characterizing and optimizing modern AI workloads across GPU-accelerated and data center platforms. He also contributes to technical papers, internal reports, and customer-facing collateral. Prior to Micron, Khayam designed AI systems for computer vision and anomaly detection. At Dell Technologies, he authored six patents while contributing to ML, analytics, and reliability initiatives. He brings more than 10 years of industry experience spanning performance engineering, generative AI, and distributed systems. Khayam holds an M.S. in Computer Engineering from Clemson University.

相关博客