- English – US
- English – India
- English - Malaysia
- English - Singapore
- 日本語 (Japanese)
- 简体中文 (Simplified Chinese)
- 繁體中文 (Traditional Chinese)
本文中 XPU 指代全部类型的 AI 加速器,包含 GPU、TPU 以及定制化 AI 芯片。无论架构如何,利用率都是领导者重点监测的核心指标之一。这很有道理。加速器不仅成本高昂、能耗巨大,往往还是数据中心内最稀缺的资源。
问题就在这里。利用率只能反映芯片是否处于工作状态。它无法告诉我们,这种工作是否产生了对客户有价值的 AI 成果。XPU 在等待数据、移动数据、重建被置换出的上下文、重新计算先前任务、处理开销或生成最终未交付给用户的任务时,可能看起来处于满载状态。
行业亟需一套更优指标,我将其命名为生产性利用率:即在满足工作负载的质量、延迟与服务目标前提下,加速器用于生成有效输出的时间占比。
处于繁忙状态的 XPU 未必能带来高效产出。
生产性利用率是一个管理框架,而非既定的行业标准或通用公式。它旨在将系统设计与基础设施经济学联系起来。
核心问题不仅仅是:“我的加速器有多忙?” 而是“对于投入的每一小时加速器运行时间、每一瓦特电力以及每一美元基础设施成本,我能获得多少有效产出?”
这种区分至关重要,因为利用率这一概念可能会模糊三个截然不同的类别。有用的产出能够交付给用户,并满足工作负载在质量和服务方面的目标。必要的开销能保持系统的可靠性。可避免的浪费是指那些无助于改善最终交付成果的工作,或者是通过更优设计即可消除、且不牺牲质量或可靠性的工作。
可避免的浪费以两种方式表现出来。闲置造成的浪费显而易见:XPU 在等待内存、存储、通信或调度资源。主动浪费则更难察觉。利用率图表看起来很健康,但加速器实际上是在重建状态、重复之前的计算,或者生成对最终结果毫无贡献的输出。
KV 缓存揭示了为何活跃度可能具有误导性
最明显的例子是键值缓存,通常称为 KV 缓存。当模型处理提示和先前的对话时,它会建立有助于生成下一个答案的内部状态。这一初次遍历通常被称为预填充。如果状态保持可访问,系统可以复用它。如果它被驱逐或丢弃,系统可能必须重建它。
预填充和解码对系统造成的压力不同。预填充根据提示词和上下文构建状态。解码模块逐词元生成回复内容。生产性利用率取决于两点:避免重复预填充、为解码模块高效供给数据。
重建该状态会使 XPU 保持活跃。但这对于改善结果可能毫无助益。用户得到的结果与复用状态时相同,但运营商却再次付出了加速器时间、功耗和容量方面的成本。
这属于主动浪费。它看起来往往像是一个计算问题。在实践中,根本原因通常是内存容量、带宽、数据局部性、缓存行为或数据移动。XPU 之所以持续运算,是因为系统无法在合适的位置维持正确的状态。
在合适的工作负载下,设计良好的内存和存储层级能够比重新计算更高效地检索可重用的状态。这并不意味着获取在所有情况下都更好。答案取决于模型、上下文长度、硬件、拓扑结构、工作负载模式和服务目标。
逻辑重用和物理重用之间也存在差异。追踪记录可能会显示提示词或上下文应该是可重用的。但如果底层缓存被逐出、碎片化或移动到无法触及的地方,系统仍然会产生重新计算的成本。生产性利用率必须衡量基础设施实际交付的内容,而不是工作负载理论上可以重用的内容。
要点很简单。驱逐可能将加速器活动变成一种税负。重用可以将相同的基础设施转化为更有用的产出。
内存将容量转化为产出
在 AI 基础设施中,内存与存储并非次要问题。内存和存储这套机制,决定了加速器的算力有多少可以转化为有效任务。
HBM 为高频访问数据与正在执行的任务提供带宽。大容量主内存与内存扩展功能,确保了更多上下文信息和工作状态可随时调用。高性能 NVMe 存储可大规模保存可复用状态,在适配的工作负载场景下,减少不必要的重复计算。
存储层级至关重要,因为 AI 任务并非同质化运算。有些数据必须紧邻加速器。有些状态必须在较长的交互过程中保持可用。部分可复用计算的价值,不止用于生成下一个词元。将所有数据一概视为热数据或冷数据,会忽略工作负载的实际运行方式。
解码往往受限于系统移动权重、KV 状态和中间数据的速度,而不仅仅是峰值计算能力。这就是带宽与数据局部性对有效输出至关重要的原因。
容量同样重要。当 KV 状态占用大量可用内存时,调度器可能会降低并发任务数量。业务需求依旧存在,加速器算力也足够,但系统无法留存足够的工作状态,难以高效服务更多用户。
这正是美光拥有有益视角之处。我们提供 HBM、DRAM、内存扩展以及 NVMe 存储方案。借此我们可以从系统层面观察:在数据与状态流转的全过程中,生产性利用率在哪里提升、在哪里损耗。
结果很简单明了。低生产性利用率可能表现为计算问题,但其根本原因通常是内存带宽、IOPS 或容量不足。如果系统无法为其提供数据、就近保存状态、保留可重用工作并高效移动数据,加速器就无法产生有用的输出。
衡量每加速器小时、每瓦特和每美元的产出
领导者应持续跟踪利用率。这很有用。它能揭示闲置资源、调度问题以及基础编排层面的问题。但它不应被视为衡量经济回报的标准。
更好的运营问题会更精准。每消耗一小时加速器算力能产生多少有效产出? 每瓦功耗对应多少产出? 每投入一美元基础设施资金的产出是多少? 我们有多少次重建了本可重复使用的基础设施? 有多少工作是必要开销,又有多少是可以避免的?
有效吞吐量(Goodput)是朝着这个方向迈出的重要一步。NVIDIA AIPerf 将有效吞吐量(Goodput)定义为每秒完成且满足指定服务等级目标(例如首字延迟和字间延迟)的请求数。这将性能与用户体验联系了起来。生产性利用率提出了一个后续的经济问题:付费加速器使用时长中,有多少比例创造了符合这些目标的有效产出?
这一答案应当决定设计选择:领导者如何设定内存规模、评估存储层级、调整工作负载、扩展容量,以及决定何时真正需要更多的加速器。
下一代人工智能基础设施的优劣,将不再以其 XPU 看上去有多繁忙来评判,而是以每个加速器小时、每瓦功耗和每一美元产生了多少有用的智能成果来衡量。强大的内存和存储层级架构正是将活动转化为产出的关键。
现实问题不仅仅在于是否购买更多的加速器。这关乎系统是否具备合适的内存和存储性能、容量及分层技术,以将昂贵的加速器周期转化为有效利用,并最终实现有用的产出。