- English – US
- English – India
- English - Malaysia
- English - Singapore
- 日本語 (Japanese)
- 简体中文 (Simplified Chinese)
- 繁體中文 (Traditional Chinese)
当您向 AI 提问时,在 AI 生成回复的背后,发生着一些很奇妙的事情。AI 模型不仅仅会“思考”;它还会“记忆”。它会持续追踪对话中的每一个字、每一种关系、每一个细微差别。要保持这种记忆能力,需要投资。记忆所需内存以千兆字节 (GB) 为单位进行衡量,需要在毫秒间调用完成,并且正在悄然成为当今 AI 基础设施中最具价值的单一资产。这就是 KV 缓存,其发展并非简单增长,而是复利式累积叠加。
什么是词元 (Token)?为什么我们应该关心它的“红利”?
词元是系统用于表示、处理或验证信息的最小数据单位,具体取决于应用场景。可以将词元视为 AI 世界的货币。您输入的每一个单词、音节或标点符号都会被转换为词元,这是大语言模型 (LLM) 范畴中的基本单位。当模型生成回复时,它不仅会查看您最近发送的消息,还会查看所有内容,即整个对话的历史记录,并利用所谓的“注意力机制”来计算每个词元之间的关系:这就是模型工作时的“记忆”。
“KV 缓存是 AI 生成每一个词元所带来的内存红利;这项投入会复利式累积,形成上下文、逻辑连贯性与推理连续性。”
为避免在生成每一个新单词时都从头重新计算这些关系,模型会将计算过程中间生成的数学表示(键 (K) 向量和值 (V) 向量)存储在 KV 缓存中。决定 KV 缓存大小的公式非常严苛:
层数 × 头数 × 头维度 × 序列长度 × 每个元素的字节数
这是词元经济学的现实挑战:KV 缓存成本高昂,很难轻松扩展。在 Llama-3.3-70B 这样的 70B 级模型上,单次 10 万词元的请求就需要数十 GB 的 KV 缓存。如果扩展到类似 Llama 405B 这样的前沿级模型上,在一台系统上,针对单个用户的单次 100 万词元上下文,需要超过 2 TB 的内存容量(HBM 和 DRAM 合计)。如果该系统中有数十个并发用户呢? 就单个中型部署而言,您所面对的,将是高达数十 TB 的 KV 缓存需求。这就是每台服务器所面临的现实情况。对于包含多台服务器的系统,总需求还要再大上几个数量级,而且仍在迅速增长。
该问题还可能进一步加剧:推理模型(即当前功能最强 AI 助手使用的 AI 模型)在内部生成的词元数量,比它们返回给用户的要多 3 到 10 倍。每一个中间词元都必须被缓存,从而极大增加了每个请求的内存占用量。
在并发长上下文会话的情况下,当前 GPU 平台上的 HBM(每节点高达 288 GB)仍然无法容纳全部 KV 缓存。因此,必须做出取舍。
无法忽视的大趋势
在我们研究以上问题的解决方案之前,有必要先了解一下即将到来的大趋势。当今的 AI 计算,大致分为 AI 训练和 AI 推理。未来几年内,推理将成为主流工作负载,占所有 AI 计算的三分之二[1]。到 2030 年,预计推理将占所有 AI 计算需求的 70-90%。
推理是 AI 的核心业务。而内存和存储则是推理经济的基础。
当我们将视角从单台服务器扩展到整个行业时,上述趋势便十分明显。前沿模型的上下文窗口大小,在 2023 年至 2025 年间每年增长约 30 倍,从 128K 词元增长到 1M 词元,并且还在持续增长[2]。目前,仅有一小部分部署支持长上下文窗口。随着长上下文窗口部署比例增长,在多文档推理、大型软件代码库、智能体工作流和多模态应用的驱动下,全球推理集群对 KV 缓存的总需求也在同步加速增长。我们所讨论的并非内存容量所面临的渐进式压力,而是整个 AI 行业在内存和存储需求方面正在发生跳跃式变化。
虽然算法的改进会不断降低每个词元所需的 KV 缓存,但关键的一点在于:每一项此类效率提升,都会立即用于更长的上下文、更多的并发用户以及更复杂的智能体工作负载中。单是智能体 AI,对内存容量的需求就高达标准推理的 10-40 倍。对内存和存储的需求,并没有任何减少迹象,而是持续加速增长中。
复利式收益的金字塔
该解决方案并非单一的内存技术。这是一个包含五层的层级结构,即一个金字塔型结构,其中的 KV 缓存数据会随着老化而向下流动,每一层都专为推理生命周期中的特定时期而构建。其中的每个部分都列出了适用的内存或存储产品、KV 缓存存储大小、数据带宽,以及供调取的 KV 缓存通常的驻留时间。
内存和存储层级
| 每个 GPU 的 KV 缓存存储 | 每个 GPU 的带宽 | 用途(数据驻留) | 内存类别 | 内存解决方案 |
|---|---|---|---|---|
| 10 – 100 GB | 1 – 20 TB/s | 活动词元生成(毫秒级至秒级) | 近内存 | 美光 HBM4 和 HBM3E、美光 GDDR7 — 最靠近 GPU 和其他加速器的内存,需要极高带宽,以支持 LLM 的训练和推理 |
| 200 – 400 GB | 100 – 500 GB/s | 长上下文查询(秒级至分钟级) | 主内存 | 美光大容量 DDR5 RDIMM 和 美光 SOCAMM2 — 主内存需要在容量和带宽之间取得平衡,以便为 CPU 和 GPU 提供数据 |
| 数百 GB 至 TB | 100 – 200 GB/s | 查询调度、上下文切换(分钟级至小时级) | 扩展内存 | 美光大容量 DDR5 RDIMM 解耦内存阵列 — 网络附属内存提供弹性池化容量,用于扩展主内存,且性能相近 |
| 数十至数百 TB | 20 – 200 GB/s | 快速执行的多轮工作流(小时级至天级) | 上下文内存存储 | 美光 9650 SSD、美光 7600 SSD — 推理系统可避免在长上下文多轮工作流中执行重复计算 |
| 数 PB | < 10 GB/s | RAG 与存储(数天至数年) | 网络数据湖 | 美光 6600 ION SSD — 基于网络文件或对象存储的数据湖,用于存储海量数据,并具备服务多个 AI 服务器所需的性能 |
| 注:KV 缓存老化后会被逐层驱逐到更低层级 | ||||
表格:推理中的 KV 缓存相关内存和存储分层
第 1 层:近内存 (HBM) - 交易大厅
美光 HBM4、HBM3E、GDDR7 | 每个 GPU 对应 10–100 GB 的 KV 数据 | 1–20 TB/s | 毫秒级至秒级
位于顶端的是高带宽内存,它是 AI 领域中速度最快、价格最昂贵的“资产”。这里是活动词元生成的地方:包括实时注意力计算和实时推理。凭借高达 20 TB/s 的带宽,HBM 是词元经济的交易大厅。每一微秒都至关重要,其中的每一个字节都必须能立即访问。
但它容量有限,且价格昂贵。仅模型权重数据就占据了 HBM 的很大一部分,KV 缓存需要争夺剩余的可用容量。随着模型规模的扩大和上下文窗口的扩展,HBM 的容量压力加剧。当需求超出容量上限时,KV 缓存必须向下流转,否则推理过程将陷入停滞。
第 2 层:主内存 (DDR5 / LPDDR) - 营运资金
美光大容量 DDR5、SOCAMM2 LPDDR | 200–400 GB KV | 100–500 GB/s | 秒级至分钟级
当长上下文查询超出 GPU 的即时访问范围时,KV 缓存会流入主内存。可将该层视为营运资金:流动性极高,容量远大于 HBM,但仍受到带宽限制。美光的大容量 DDR5 RDIMM 和 LPDDR SOCAMM2 模块在容量与带宽之间实现了平衡,能够为 CPU 和 GPU 流畅地提供数据。
支持复杂文档分析、法律审查或多轮研究会话的长上下文查询,在活跃处理期间驻留于此。随着 AI 部署迈向支持超过 100 万词元的上下文,这一层级正承受着日益增长且持续不断的压力。
第 3 层:扩展内存(解耦 DDR5) - 信用额度
解耦架构美光大容量 DDR5 RDIMM | 数百 GB 至数 TB 的 KV | 100–200 GB/s | 分钟级至小时级
扩展内存是词元经济的弹性信用额度,由网络附属解耦内存池组成,当查询调度和上下文切换所需资源超过单台服务器 DRAM 的承载能力时,这些内存池将用于承接溢出数据。这一层级在多租户环境中至关重要,在这些环境中,许多用户共享基础设施,且工作负载会动态转移。随着上下文长度和并发数同步增长,这一层用于弥补单台服务器所能承载的容量与 AI 服务实际需要提供的容量之间的差额。
第 4 层:上下文内存存储 (NVMe SSD) - 长期账户
美光 9650 SSD、美光 7600 SSD | 数十至数百 TB 的 KV | 20–200 GB/s | 小时级至天级
随着 AI 从单轮聊天机器人演进为多步骤智能体工作流,KV 缓存从一种瞬态结构转变为一种持久化存储难题。管理复杂企业任务的 AI 智能体不可能在每一次新行动中都重新计算完整的推理历史。这种重新计算不仅缓慢,而且代价昂贵,对于大规模系统,在经济上是无法承受的。
美光的数据中心工作负载工程 (DCWE) 团队在数百种测试配置中选择并验证了基于 NVMe SSD 的 KV 缓存卸载,证明其具备零吞吐量损耗。智能体工作负载所需的容量是标准推理的 10-40 倍,且多为持续数小时到数天的多轮工作流,使得这一层级的作用至关重要。随着智能体 AI 成为主流,上下文内存存储的容量增长在所有层级中将是最快的。
第 5 层:网络数据湖 - 保险库
美光 6600 ION SSD | PB 级 KV | <10 GB/s | 数天至数年
在金字塔的底部,即最宽、最深的一层,是联网数据湖。这是词元经济的保险库,用于检索增强生成 (RAG) 所需的 KV 缓存、长程智能体记忆,以及企业知识库,它们将在此存储数天、数周甚至更久。美光 6600 ION SSD 专为通过网络文件或对象存储同时为多台 AI 服务器提供服务而设计,能够提供 PB 级 AI 存储所需的密度和耐用度。随着 RAG 架构的普及和企业构建持久化 AI 知识库,这一层的容量需求将极为惊人。
总结
KV 缓存是 AI 生成每一个词元所带来的内存红利;这项投入会复利式累积,形成上下文、逻辑连贯性与推理连续性。而这种红利正同时向各个方向增长:每次请求时的更多词元、更长上下文、更多并发用户,以及更持久的智能体会话。
没有任何一种存储技术能够单独带来这种红利。从顶端的 HBM,到底端的网络数据湖,整个层级体系必须协同工作,每个层级各司其职。随着时间推移,KV 缓存的复合价值不断流经整个金字塔的所有层级。
随着推理成为 AI 计算的主导形式,以及 KV 缓存成为推理过程中的主要内存使用者,只有对整个内存和存储层级进行优化的公司,才能以规模化、高速且可持续的方式提供 AI 服务。
文中的金字塔不仅仅是一种架构。它是大规模 AI 的经济基础。每一项性能提升、每一项效率优化,以及每一项 TCO 优势,都源于正确构建了这一层级结构。金字塔的每一层中,都有美光产品的身影。
参考资料
[1] Deloitte Insights,2025 年 11 月。“为什么 AI 的下一个阶段很可能需要更多的算力,而非相反。”
[2] Epoch AI,2025 年 6 月。“大语言模型现在可接受更长的输入,最好的模型能够更有效地利用它们。”