- English – US
- English – India
- English - Malaysia
- English - Singapore
- 日本語 (Japanese)
- 简体中文 (Simplified Chinese)
- 繁體中文 (Traditional Chinese)
FMS 2026 |4 部分系列:第 2 部分
同一个大脑,两套记忆(内存)系统
我在第 1 部分中解释了智能体 AI 如何在两个计算堆栈上运行,而非一个。GPU 负责推理、生成和规划。CPU 负责编排、行动并执行计划。如果没有专为两者设计的内存,它们都无法工作。
我在文中强调了大规模运行时的问题:在高并发情况下,上下文可能会增长到数十 TB,而智能体工作流对基础设施流量的要求,可能高达传统基准线的 100 倍。现在,我们来看看推理堆栈如何管理 KV 缓存,然后再看看执行堆栈对内存的需求。
一种优化的 KV 缓存层级
KV 缓存不是一个位置。它是推理过程中的一个关键对象,必须随时可用,供解码流水线的下一次迭代使用。如果系统保留 KV 缓存,则必须能以足够快的速度检索到它,以保持推理的持续进行。如果系统不保留 KV 缓存,则必须重新计算——花费时间、能源和计算资源来重复之前已经完成过的工作。这使得 KV 缓存的放置成为系统级别的一种设计选择:保留什么?存储在何处?何时检索比重新计算更高效? 有些系统可能仅使用两层存储。此处展示的五层架构代表了一种面向未来的优化,每一层在容量和检索时间之间都有不同的权衡。近内存(或称 HBM)可将最活跃的 KV 数据保持在距 GPU 最近的位置。主内存则为活跃上下文提供更多容量。分离式内存池则能够在节点之外提供更大的工作集。上下文内存存储可持久存储 KV 数据,其检索速度快于重新计算。网络化 KV 湖则将该层级扩展至高达艾字节规模的长期上下文。数据中心架构师将配置 KV 缓存层,以针对独特的工作负载和应用基础进行优化;能否在正确的时间将 KV 缓存置于正确的层级,并以最佳方式协调检索、淘汰和重新计算,将决定系统效率的高低。
现在我们来看一下另外的内存
推理只是 AI 工作的一部分。智能体 AI 需要行动,而这正是其它内存大显身手的地方。主内存支持操作执行:实时进行推理、生成和决策。分离式内存可用于扩展内存空间,确保 CPU 的内存需求不会超出整个系统的限制,因为我们更愿意扩展系统,而不愿让其硬件资源的利用率不足。内容内存存储让应用程序能够暂停和恢复,并能够持久地存储本地数据。而网络化数据湖则提供了跨数据中心获取和存储数据所需的大规模存储系统。智能体在 CPU 上执行时,每一次行动都会用到这四个层级。两个技术栈使用了相似的内存和存储技术,但各自面临的压力不同。推理侧必须保证持续将数据供给解码流水线。执行侧必须保持状态,并将决策转化为行动。两个堆栈都推动了对更大容量、更高速内存和存储的需求。
两个堆栈,每一层都很关键
以上就是能够打破内存墙的架构:一个经过优化的、可以扩展到五层的推理层级,以及一个四层的执行堆栈。并非每个系统都需要实现其中的每一层,如何实现最佳设计,将取决于工作负载规模、与延迟有关的要求,以及检索与重新计算之间的成本权衡。有意识地跨两个堆栈设计该层级结构,便能打破内存墙限制。在第 3 部分中,我将探讨美光的产品如何满足这两个堆栈整个层级体系的需求。