内存

解锁词元经济:美光为 AI 计算中的 KV 缓存赋能

Sudharshan Vazhkudai、Sujit Somandepalli、Ramkarthik Ganesan、Wes Vaske

由蓝色和洋红色方块交织而成的,发光的分层金字塔,象征着不断扩张的词元经济。

当您向 AI 提问时,在 AI 生成回复的背后,发生着一些很奇妙的事情。AI 模型不仅仅会“思考”;它还会“记忆”。它会持续追踪对话中的每一个字、每一种关系、每一个细微差别。要保持这种记忆能力,需要投资。记忆所需内存以千兆字节 (GB) 为单位进行衡量,需要在毫秒间调用完成,并且正在悄然成为当今 AI 基础设施中最具价值的单一资产。这就是 KV 缓存,其发展并非简单增长,而是复利式累积叠加。

什么是词元 (Token)?为什么我们应该关心它的“红利”?

词元是系统用于表示、处理或验证信息的最小数据单位,具体取决于应用场景。可以将词元视为 AI 世界的货币。您输入的每一个单词、音节或标点符号都会被转换为词元,这是大语言模型 (LLM) 范畴中的基本单位。当模型生成回复时,它不仅会查看您最近发送的消息,还会查看所有内容,即整个对话的历史记录,并利用所谓的“注意力机制”来计算每个词元之间的关系:这就是模型工作时的“记忆”。

“KV 缓存是 AI 生成每一个词元所带来的内存红利;这项投入会复利式累积,形成上下文、逻辑连贯性与推理连续性。” 


为避免在生成每一个新单词时都从头重新计算这些关系,模型会将计算过程中间生成的数学表示(键 (K) 向量和值 (V) 向量)存储在 KV 缓存中。决定 KV 缓存大小的公式非常严苛:

层数 × 头数 × 头维度 × 序列长度 × 每个元素的字节数

这是词元经济学的现实挑战:KV 缓存成本高昂,很难轻松扩展。在 Llama-3.3-70B 这样的 70B 级模型上,单次 10 万词元的请求就需要数十 GB 的 KV 缓存。如果扩展到类似 Llama 405B 这样的前沿级模型上,在一台系统上,针对单个用户的单次 100 万词元上下文,需要超过 2 TB 的内存容量(HBM 和 DRAM 合计)。如果该系统中有数十个并发用户呢? 就单个中型部署而言,您所面对的,将是高达数十 TB 的 KV 缓存需求。这就是每台服务器所面临的现实情况。对于包含多台服务器的系统,总需求还要再大上几个数量级,而且仍在迅速增长。

该问题还可能进一步加剧:推理模型(即当前功能最强 AI 助手使用的 AI 模型)在内部生成的词元数量,比它们返回给用户的要多 3 到 10 倍。每一个中间词元都必须被缓存,从而极大增加了每个请求的内存占用量。

在并发长上下文会话的情况下,当前 GPU 平台上的 HBM(每节点高达 288 GB)仍然无法容纳全部 KV 缓存。因此,必须做出取舍。

无法忽视的大趋势

在我们研究以上问题的解决方案之前,有必要先了解一下即将到来的大趋势。当今的 AI 计算,大致分为 AI 训练和 AI 推理。未来几年内,推理将成为主流工作负载,占所有 AI 计算的三分之二[1]。到 2030 年,预计推理将占所有 AI 计算需求的 70-90%。

推理是 AI 的核心业务。而内存和存储则是推理经济的基础。

当我们将视角从单台服务器扩展到整个行业时,上述趋势便十分明显。前沿模型的上下文窗口大小,在 2023 年至 2025 年间每年增长约 30 倍,从 128K 词元增长到 1M 词元,并且还在持续增长[2]。目前,仅有一小部分部署支持长上下文窗口。随着长上下文窗口部署比例增长,在多文档推理、大型软件代码库、智能体工作流和多模态应用的驱动下,全球推理集群对 KV 缓存的总需求也在同步加速增长。我们所讨论的并非内存容量所面临的渐进式压力,而是整个 AI 行业在内存和存储需求方面正在发生跳跃式变化。

虽然算法的改进会不断降低每个词元所需的 KV 缓存,但关键的一点在于:每一项此类效率提升,都会立即用于更长的上下文、更多的并发用户以及更复杂的智能体工作负载中。单是智能体 AI,对内存容量的需求就高达标准推理的 10-40 倍。对内存和存储的需求,并没有任何减少迹象,而是持续加速增长中。

下面的分层金字塔模型展示了五个 KV 缓存层级,从近内存,到主内存和扩展内存,再到上下文存储和网络数据湖。

点击图片展开

用于 AI 推理的 KV 缓存对应的内存和存储层级,从近内存到网络数据湖。

复利式收益的金字塔

该解决方案并非单一的内存技术。这是一个包含五层的层级结构,即一个金字塔型结构,其中的 KV 缓存数据会随着老化而向下流动,每一层都专为推理生命周期中的特定时期而构建。其中的每个部分都列出了适用的内存或存储产品、KV 缓存存储大小、数据带宽,以及供调取的 KV 缓存通常的驻留时间。

 

内存和存储层级

每个 GPU 的 KV 缓存存储每个 GPU 的带宽用途(数据驻留)内存类别内存解决方案
10 – 100 GB1 – 20 TB/s活动词元生成(毫秒级至秒级)近内存美光 HBM4 和 HBM3E、美光 GDDR7 — 最靠近 GPU 和其他加速器的内存,需要极高带宽,以支持 LLM 的训练和推理
200 – 400 GB100 – 500 GB/s长上下文查询(秒级至分钟级)主内存美光大容量 DDR5 RDIMM 和 美光 SOCAMM2 — 主内存需要在容量和带宽之间取得平衡,以便为 CPU 和 GPU 提供数据
数百 GB 至 TB100 – 200 GB/s查询调度、上下文切换(分钟级至小时级)扩展内存美光大容量 DDR5 RDIMM 解耦内存阵列 — 网络附属内存提供弹性池化容量,用于扩展主内存,且性能相近
数十至数百 TB20 – 200 GB/s快速执行的多轮工作流(小时级至天级)上下文内存存储美光 9650 SSD、美光 7600 SSD — 推理系统可避免在长上下文多轮工作流中执行重复计算
数 PB< 10 GB/sRAG 与存储(数天至数年)网络数据湖美光 6600 ION SSD — 基于网络文件或对象存储的数据湖,用于存储海量数据,并具备服务多个 AI 服务器所需的性能
注:KV 缓存老化后会被逐层驱逐到更低层级

表格:推理中的 KV 缓存相关内存和存储分层

第 1 层:近内存 (HBM) - 交易大厅

美光 HBM4、HBM3E、GDDR7 | 每个 GPU 对应 10–100 GB 的 KV 数据 | 1–20 TB/s | 毫秒级至秒级

位于顶端的是高带宽内存,它是 AI 领域中速度最快、价格最昂贵的“资产”。这里是活动词元生成的地方:包括实时注意力计算和实时推理。凭借高达 20 TB/s 的带宽,HBM 是词元经济的交易大厅。每一微秒都至关重要,其中的每一个字节都必须能立即访问。

但它容量有限,且价格昂贵。仅模型权重数据就占据了 HBM 的很大一部分,KV 缓存需要争夺剩余的可用容量。随着模型规模的扩大和上下文窗口的扩展,HBM 的容量压力加剧。当需求超出容量上限时,KV 缓存必须向下流转,否则推理过程将陷入停滞。

第 2 层:主内存 (DDR5 / LPDDR) - 营运资金

美光大容量 DDR5、SOCAMM2 LPDDR | 200–400 GB KV | 100–500 GB/s | 秒级至分钟级

当长上下文查询超出 GPU 的即时访问范围时,KV 缓存会流入主内存。可将该层视为营运资金:流动性极高,容量远大于 HBM,但仍受到带宽限制。美光的大容量 DDR5 RDIMM 和 LPDDR SOCAMM2 模块在容量与带宽之间实现了平衡,能够为 CPU 和 GPU 流畅地提供数据。

支持复杂文档分析、法律审查或多轮研究会话的长上下文查询,在活跃处理期间驻留于此。随着 AI 部署迈向支持超过 100 万词元的上下文,这一层级正承受着日益增长且持续不断的压力。

第 3 层:扩展内存(解耦 DDR5) - 信用额度

解耦架构美光大容量 DDR5 RDIMM | 数百 GB 至数 TB 的 KV | 100–200 GB/s | 分钟级至小时级

扩展内存是词元经济的弹性信用额度,由网络附属解耦内存池组成,当查询调度和上下文切换所需资源超过单台服务器 DRAM 的承载能力时,这些内存池将用于承接溢出数据。这一层级在多租户环境中至关重要,在这些环境中,许多用户共享基础设施,且工作负载会动态转移。随着上下文长度和并发数同步增长,这一层用于弥补单台服务器所能承载的容量与 AI 服务实际需要提供的容量之间的差额。

第 4 层:上下文内存存储 (NVMe SSD) - 长期账户

美光 9650 SSD、美光 7600 SSD | 数十至数百 TB 的 KV | 20–200 GB/s | 小时级至天级

随着 AI 从单轮聊天机器人演进为多步骤智能体工作流,KV 缓存从一种瞬态结构转变为一种持久化存储难题。管理复杂企业任务的 AI 智能体不可能在每一次新行动中都重新计算完整的推理历史。这种重新计算不仅缓慢,而且代价昂贵,对于大规模系统,在经济上是无法承受的。

美光的数据中心工作负载工程 (DCWE) 团队在数百种测试配置中选择并验证了基于 NVMe SSD 的 KV 缓存卸载,证明其具备零吞吐量损耗。智能体工作负载所需的容量是标准推理的 10-40 倍,且多为持续数小时到数天的多轮工作流,使得这一层级的作用至关重要。随着智能体 AI 成为主流,上下文内存存储的容量增长在所有层级中将是最快的。

第 5 层:网络数据湖 - 保险库

美光 6600 ION SSD | PB 级 KV | <10 GB/s | 数天至数年

在金字塔的底部,即最宽、最深的一层,是联网数据湖。这是词元经济的保险库,用于检索增强生成 (RAG) 所需的 KV 缓存、长程智能体记忆,以及企业知识库,它们将在此存储数天、数周甚至更久。美光 6600 ION SSD 专为通过网络文件或对象存储同时为多台 AI 服务器提供服务而设计,能够提供 PB 级 AI 存储所需的密度和耐用度。随着 RAG 架构的普及和企业构建持久化 AI 知识库,这一层的容量需求将极为惊人。

总结

KV 缓存是 AI 生成每一个词元所带来的内存红利;这项投入会复利式累积,形成上下文、逻辑连贯性与推理连续性。而这种红利正同时向各个方向增长:每次请求时的更多词元、更长上下文、更多并发用户,以及更持久的智能体会话。

没有任何一种存储技术能够单独带来这种红利。从顶端的 HBM,到底端的网络数据湖,整个层级体系必须协同工作,每个层级各司其职。随着时间推移,KV 缓存的复合价值不断流经整个金字塔的所有层级。

随着推理成为 AI 计算的主导形式,以及 KV 缓存成为推理过程中的主要内存使用者,只有对整个内存和存储层级进行优化的公司,才能以规模化、高速且可持续的方式提供 AI 服务。

文中的金字塔不仅仅是一种架构。它是大规模 AI 的经济基础。每一项性能提升、每一项效率优化,以及每一项 TCO 优势,都源于正确构建了这一层级结构。金字塔的每一层中,都有美光产品的身影。

参考资料

[1] Deloitte Insights,2025 年 11 月。“为什么 AI 的下一个阶段很可能需要更多的算力,而非相反。”

[2] Epoch AI,2025 年 6 月。“大语言模型现在可接受更长的输入,最好的模型能够更有效地利用它们。”

系统设计工程研究员

Sudharshan Vazhkudai

Sudharshan S. Vazhkudai 博士是美光科技的系统设计工程研究员。他在美光组建了数据中心与客户端工作负载工程团队,从端到端系统视角出发,深入探究如何利用深度内存层次结构来构建针对工作负载优化的现代系统架构。在此之前,他在橡树岭国家实验室工作了二十余年,负责构建数据中心解决方案。Vazhkudai 博士拥有密西西比大学计算机科学博士学位,还曾在田纳西大学担任客座教师。

首席存储解决方案工程师

Sujit Somandepalli

Sujit Somandepalli 现任美光科技首席存储解决方案工程师。

存储解决方案架构技术资深专家

Ramkarthik Ganesan

Ramkarthik Ganesan 现任美光科技技术资深专家,主管核心数据中心业务部门的存储解决方案架构工作。他是一位经验丰富的技术专家,在存储系统、性能优化和系统设计领域积累了深厚的专业知识。在美光工作期间,他专注于研究赋能 AI、云和企业工作负载的下一代存储创新。

SMTS 系统性能工程师

Wes Vaske

Wes Vaske 现任美光科技技术团队高级成员。作为存储解决方案架构师,他在数据中心存储系统领域拥有超过 15 年经验,目前专注于为 AI 工作负载开发高性能 NVMe 解决方案。

相关博客