AI

LLM 查询类型如何影响对 GPU 的要求、内存以及功耗

Sayali Shirode

一位女性正在与代表 AI 技术的红色大型数字显示屏互动。

随着 AI 的加速普及,推理正在成为 许多大语言模型 (LLM) 部署背后的主导工作负载。每一个 聊天机器人的回复、搜索结果、代码建议和翻译 请求,都依赖于 AI 模型的实时执行。随着这些 工作负载规模的不断扩大,其运行所需的 AI 基础设施正变得 与模型本身同样重要。在本博客中,我们探讨了 不同的 LLM 查询类型如何会对 GPU 显存 带宽、功耗、吞吐量和能效产生不同的需求。

了解 AI 推理

与通过处理大型数据集来让模型学习的 AI 训练不同, 推理工作负载直接服务于现实世界当中的 AI 应用。每一个推理请求都需要在计算、内存和存储资源之间移动海量 数据,以及时提供 结果。随着 AI 的持续普及,推理已成为 基础设施建设的主要驱动因素之一,使得内存容量、 带宽、性能和能效对于实现大规模 AI 应用 至关重要。

大语言模型推理是指使用训练好的 AI 模型, 根据新的输入来生成输出的过程。当用户提交提示词后, 模型会分析请求,预测最可能的词元序列, 然后生成回复。每一个请求,包括聊天机器人对话、文本摘要、 翻译、推荐,或者内容创作等,背后均由 LLM 推理来处理。

LLM 推理背后隐藏的复杂性

单次 LLM 查询所消耗的能源成本最高可相差 7 倍,具体取决于 提示词的类型(见下方表 1)。这种差异 会给基础设施的规划带来切实影响,而决定性能表现的因素,最终都归结于 内存。

大多数人可能认为 LLM 推理是一个简单的过程:输入一个 提示词,然后收到返回的词元。然而,在底层,它却是一个 复杂且高度可变的计算过程。发送给 LLM 的查询类型 会从根本上改变对资源的需求, 包括需要消耗多少内存带宽,GPU 的 工作强度有多大,需要消耗多少功率,以及这些功率 在一段时间内转化为有效输出的效率如何。

这些特性对 AI 基础设施规划至关重要。正如美光首席执行官 Sanjay Mehrotra 所指出:“没有数据,AI 便无从谈起”, 如果没有合适的内存和存储基础设施, 高效推理同样无从谈起。了解不同查询类型如何引发 不同的需求,才能让容量规划、功耗预算和 成本优化真正发挥作用。

测试方法

为了量化这些差异,我们对推理工作负载进行了测试, 所使用的 LLM 是 GPT-OSS-120B,包括六个不同的查询类别(医疗保健、 技术、科学、编程、翻译和角色扮演)。我们 收集了各种实时指标,包括 GPU 利用率、内存带宽、 功耗、吞吐量和能效等。

  • 我们使用的模型是 GPT-OSS-120B,通过 NIM 容器 进行部署。
  • 这些指标是使用自定义 Python Gradio 界面收集的, 并通过 NVIDIA® nvidia-smi 进行实时 GPU 遥测。
  • 存储设备是一块 15TB 的美光® 9550 NVMe SSD,用于模型和数据集的高速加载。这块 美光 9550 SSD 具备较高的顺序读取吞吐量,对于快速加载模型权重,以及减少 部署过程中的冷启动延迟至关重要。
  • 我们使用的服务器平台是 HPE ProLiant® DL384 Gen12。

六种查询类别

我们选择了六种查询类别来代表现实世界中常见的 LLM 使用场景,每种类别均具有独特的计算特性:

医疗保健:简洁、基于循证的医学查询,需要结构化、基于事实的回复。
提示词示例:"请列出影响心血管疾病风险的循证因素;保持简洁。"

技术:技术性总结,需要相关领域知识及结构化的输出。
提示词示例:"请使用项目符号总结 HBM3E 和 HBM4 之间的主要差异。"

科学:解释性查询,要求使用精确、非笼统的技术语言。
提示词示例:"请解释 CRISPR 的核心机制,不要使用类比。"

编程:代码优化任务,需要分析、推理,并生成代码。
提示词示例:"请优化此函数,以提高速度,并且仅说明其瓶颈。"

翻译:多语言翻译,需要大的上下文窗口,并能够生成大量内容。
提示词示例:"将这段文字翻译成日语,无需添加评论。"

角色扮演:创造性内容生成,具有角色限制和风格要求。
提示词示例:"请扮演一个超负荷的航天器 AI……写一段简短的内部状态日志。"

主要发现:资源需求差异巨大


不同查询类别的性能表现摘要

按查询类别划分的 LLM 推理资源需求
六面板图表,展示并比较执行不同查询类别时,LLM 推理的资源需求。

图 1:涵盖所有六个查询类别的关键推理指标对比视图

类别提示词词元补全词元TTFT
(秒)
解码 TPS平均功耗
(瓦)
解码
能量(焦)
效率
(词元/焦)
医疗健康642572.28655.35170.57920.3246
技术684367.18862.48172.312030.3625
科学652591.51369.76179.56660.3886
编程24410822.00457.12170.632320.3348
翻译115015883.37358.81171.646340.3427
角色扮演932551.29464.88182.57170.3555

表 1:六种查询类别的解码阶段性能表现摘要 (不含预填充)

按 LLM 查询类别展示内存带宽随时间变化的折线图。

图 2:内存带宽利用率随时间的变化,在预填充阶段出现峰值

内存带宽:高效推理的关键因素

内存带宽通常是 LLM 推理的主要制约因素。我们的测试结果显示,各类别之间的峰值内存带宽需求从 348 GB/s(医疗健康)到 475 GB/s(角色扮演)不等。如此之大的差异,意味着基础设施应针对混合工作负载中最繁重的工作负载进行配置,而非针对平均水平进行配置。

图 2 中的时间序列数据展示了预填充阶段内存带宽使用情况,可以看到高度突发的特性。对内存带宽使用情况的观察显示,预填充(提示词处理)阶段会出现峰值,而解码阶段则呈现出更平稳的模式。由于这种突发性需求的存在,平均带宽利用率显著低估了实际的峰值需求。

这也凸显了内存技术的重要性。美光 HBM3E 等高带宽内存解决方案旨在提供 AI 推理工作负载所需的持续带宽。在 GH200 等平台上,HBM 与美光 LPDDR5X(用作 CPU 端内存)协同工作,以保持数据在统一内存架构中的持续流动。单个角色扮演类查询的峰值为 475 GB/s,约为 GH200 总带宽(HBM3e 内存,4.9 TB/s)的 10%,因此同时进行大约十个查询,就能使内存总线饱和。这有助于说明为什么随着模型规模的扩大,内存带宽会成为影响推理性能的主要制约因素。

关键洞察:处理要求严苛的工作负载,需要高达 475 GB/s 的内存带宽。即使是健康知识问答之类的“简单”查询,在峰值时也需要 348 GB/s 的带宽。内存带宽常常成为影响推理吞吐量的因素。

注:单个时间序列图足以描述内存带宽利用率随时间变化的情况,因为在类似文中这样的受内存限制的推理工作负载中,内存带宽、GPU 利用率和功耗是紧密相关的。它们的使用情况一致:当预填充期间内存带宽需求激增时,GPU 流式多处理器 (SM) 的活动和功耗也会随之相应增加。当带宽在解码期间趋于平稳时,其他两者也会随之平稳。仅通过跟踪内存带宽就能获得 GPU 利用率和功耗的可靠指标,因为实际上它们随时间的波动模式是相同的。它们的表现有着相同的根本原因:即 GPU 在推理过程中每个时刻的工作强度。

显示按 LLM 查询类别划分的 GPU 利用率分布的箱线图。

图 3:GPU 利用率数值的分布。更高的箱体表示工作负载波动更大、突发性更强

GPU 利用率:天然具有突发性

下面的箱线图显示了 GPU 利用率在执行不同查询类别时的变化情况。分布越宽,说明工作负载越突发、越不可预测。

关键洞察:GPU 需求具有突发性,难以保持平稳状态。如果基于平均利用率来规划资源配置,系统在需求高峰期将出现资源供应不足的情况。箱形图清楚地说明了这一点:单个推理请求中的利用率波动巨大,这意味着在进行容量规划时,传统的“平均利用率”指标可能会产生误导。

功耗和能效

在执行不同查询类型时,功耗有显著差异。尽管平均 GPU 功耗在不同类别中保持相对一致(170W 至 183W),但单次查询的总能耗差异高达 7.0 倍,从 666J(科学)到 4,634J(翻译),如图 2 所示。这种差异主要是由每次查询所需的持续时间和生成的词元数量所引发的。

用于对比不同 LLM 查询类别的词元数量和处理时间的两张条形图。

图 4:词元数量与所需时间的详细说明。翻译与编程查询所需的资源消耗最多

词元数量与时间:影响成本的真正因素

不同类别之间的最大差异,体现在词元数量和总处理时间上。翻译生成的完成词元数量是角色扮演的 6.2 倍,解码时间是后者的 6.9 倍,解码能耗则是后者的 6.5 倍(表 1)。编程查询生成的完成词元数量是科学查询的 4.2 倍。

按 LLM 查询类别划分的、展示能效随时间变化的折线图。

图 5:能效随时间的变化趋势,数值越高越好

能效:每焦耳词元数量

如图 6 所示,查询期间的能效并非固定不变。在预填充阶段,由于 GPU 正在工作(耗能)但尚未生成任何词元,此时能效处于较低水平,然后随着输出的增加,能效提升。编程和翻译等耗时较长查询的最终能效最高(约为 0.33 词元/焦),因为预填充阶段的前期能耗被分摊到了后期的更多词元上。耗时较短查询或预填充密集型查询的得分较低。对于管理电力预算和可持续发展目标的团队而言,能效指标正变得越来越重要。

能效以每焦耳能量可生成的词元数量来衡量,从 0.3246 词元/焦(医疗保健)到 0.3886 词元/焦(科学)不等。科学领域查询的能效最高,因为它们在保持高解码吞吐量的同时,功耗开销相对较低。对于正在管理电力预算和可持续发展目标的数据中心运营商而言,能效指标正变得越来越重要。

结语

通过文中的分析,有一点非常明确:LLM 推理远非一种 表现一致的工作负载。查询的类型,从根本上决定了对资源 的需求情况,包括内存带宽、GPU 利用率模式、功耗 和能效。

相关数据显示,工作负载十分复杂,对 GPU 的需求具有突发性。 基于平均利用率进行规划,会导致 在需求高峰期性能下降。相反,团队应该关注的是:

  • 考虑预期部署组合中要求最严苛工作负载 的资源需求
  • 同时考虑突发 GPU 利用率和平均利用率
  • 考虑预期部署组合中对资源要求最高的查询类别 的功耗预算
  • 监控各类别指标,以识别优化 机会
  • 考虑峰值情况下的功耗需求,然后规划 适当的功耗预算

通过了解每种查询类型的资源需求特征, 组织可以构建更高效、更具成本效益,且响应速度更快的 AI 基础设施。随着推理工作负载越来越多,基于 正确的内存和存储选择构建 AI 基础设施至关重要,包括高带宽 HBM3E、 大容量 LPDDR5X,以及高吞吐量 NVMe SSD。

准备好优化您的 AI 基础设施了吗? 了解 美光的数据 中心内存产品组合和存储解决方案, 这些产品专为 AI 工作负载而设计,详情请访问 美光 AI 解决方案

技术脚注

1 所有推理测试均在 NVIDIA GH200 平台上进行,该平台采用集成式 72 核 Grace Arm CPU + Hopper H200 GPU,并配备统一内存架构 (480GB LPDDR5X + 144GB HBM3E)。性能表现结果基于内部测试,可能因系统配置、工作负载特征和软件版本而异。

2 美光 9550 NVMe SSD 所能实现的存储性能。详细了解 美光 9550 NVMe SSD

美光存储解决方案工程师

Sayali Shirode

Sayali 是美光系统性能部门的资深工程师。她目前的工作主要致力于分析存储系统中 AI 工作负载和数据中心应用程序的性能。她拥有科罗拉多州立大学电气与计算机工程硕士学位

相关博客