DRAM

当内存成为关键变量:我们将 LPDDR 用于数据中心后的收获

Khayam Anjam

霓虹灯照射下的数据中心服务器机架过道

随着 AI 工作负载日益成为数据中心内的主流,通用服务器和 AI 服务器所面临的关键限制因素正在发生变化。除了原生计算能力外,功耗和热管理预算越发显著地决定着机架能够完成多少有效工作。这正是 LPDDR5X 和新型 SOCAMM2 模块化产品为数据中心带来显著优势的关键之处。SOCAMM2 拥有低功耗 DRAM 的能效和密度,并以专为服务器设计的模块化、可维护模块形式提供,这让此前根本无法实现的系统架构成为了可能。

但是,理论上的优势并不等于经过实践验证的方案。因此,我们着手为一个更难以回答的问题寻找答案:当我们将这种新型内存部署到数据中心并运行实际工作负载时,会带来哪些方面的改善?

要以令人信服的方式完成这项工作,我们需要与合作伙伴密切合作:美光数据中心工作负载工程团队与 Meta 的工程师携手合作,使用 Meta 的开源 DCPerf 基准测试套件开展测试,该套件可模拟由超大规模机群组成的生产环境。双方的合作使得测试结果更加值得关注:测试数据基于反映真实数据中心环境的工作负载。

我们考察了决定一种内存技术是否适用于数据中心的各种因素:带宽、延迟、容量和能效。我们所做的工作分析了 LPDDR5X(包括大容量配置)会如何影响上述每种因素。测试得出的一些结果让我们感到惊讶,特别是当我们为容量受限型工作负载提供足够内存来运行时所获得的结果。

结论很简单:有关数据中心内存的讨论不再仅仅局限于更快的速度或者更大的容量。关键在于将合适的内存与合适的工作负载相匹配,而 SOCAMM2 为系统设计师提供了真正的全新选择。

我不会在此剧透相关细节。此次测试的完整描述(方法论、工作负载和数据)已写入美光与 Meta 联合发布的白皮书。如果您正在面临功率上限、容量限制,或者如何以低成本扩展 AI 基础设施等挑战,我认为该白皮书值得您花时间研读。

美光系统性能工程师

Khayam Anjam

Khayam Anjam 是美光科技的一位资深工程师。作为美光数据中心工作负载工程团队的一员,他致力于在 GPU 加速平台和数据中心平台上对现代 AI 工作负载进行特性分析和优化。他还参与撰写技术论文、内部报告和面向客户的宣传资料。加入美光前,Khayam 曾设计过用于计算机视觉和异常检测的 AI 系统。在 Dell Technologies 公司期间,他撰写了六项专利,并参与了机器学习、分析和可靠性项目。他拥有超过 10 年的行业经验,工作领域涵盖性能工程、生成式 AI 和分布式系统。Khayam 拥有克莱姆森大学计算机工程硕士学位。

相关博客