- English – US
- English – India
- English - Malaysia
- English - Singapore
- 日本語 (Japanese)
- 简体中文 (Simplified Chinese)
- 繁體中文 (Traditional Chinese)
无论对话时间有多长或提问间隔有多久,ChatGPT 似乎总能记住您与它的所有对话并几乎实时回复,您是否好奇其中的原因?
这种能力虽然神奇,但并非魔法。在它的背后,是一种名为“键值缓存”(key-value cache) 的巧妙机制。
我的同事 Wes Vaske 发表了一篇精彩的文章,解释了什么是键值缓存,以及它如何实现更快、更具上下文感知能力的 AI 响应。受此启发,我对键值缓存进行了深入的研究。目的并非是为了探究键值缓存本身的工作原理(这些工作属于 Wes 等才华横溢的人!),而是了解企业为何需要键值缓存。它为何如此重要?为何营销人员需要关注它? 键值缓存作为一种幕后机制,决定了 AI 用户看到的内容和获得的结果。
随着研究的深入,我越发意识到,所有产品营销人员,乃至所有普及科技产品信息的人士,都应当了解键值缓存。不是了解其实现机制,而是了解其对企业的重要性。只有了解了键值缓存的重要性,我们才能发现硬件性能与用户体验之间的相关性、共鸣度及深层联系。
通俗解读键值缓存
按照我的理解,键值缓存可以简单概括为:它是 AI 模型的短期记忆。它可以让模型记住之前已处理过的提问内容,无需每次都从头重新计算。这种能力听起来可能并不令人惊讶,但在实践中,它却具有颠覆性的意义。
在我们于 NVIDIA GTC 2025 大会上主题为《利用 PCIe Gen6 和新系统架构推进 AI 工作负载》的录制会议中,NVIDIA 的 John Kim 分享了与此主题相关的测试数据。数据显示,随着输入序列长度(词元)的增加,持久化键值缓存的速度会比重算更快。换言之,输入内容复杂度越高,将键值缓存数据存入磁盘所带来的性能增益就越显著。
了解基础原理后,我们该如何将键值缓存的技术优势应用到实际业务场景中?
试想企业 AI 系统协助营销团队制定复杂方案,或是技术客服团队持续处理大量涌入工单的应用场景。这些互动并非针对单一问题的问答,而是冗长的多轮对话,可能需要从大量文档中抽取信息。但借助键值缓存,大语言模型能够始终感知到之前的输入信息,从而在这些更冗长、更深入的对话中,给出更快、更周全的回答。
如果您能理解键值缓存的存在意义及其实现方式,就能更深刻地将性能、用户体验和产品价值联系起来。正是通过这些方面的努力,我们才能赢得客户的信任。
为何键值缓存对企业 AI 和云可扩展性至关重要?
当今时代,企业越发依赖生成式 AI 来提高生产力、速度和内部一致性,生成式 AI 已从“锦上添花”快速转变成“企业标配”。生成式 AI 已成为企业的基础设施,了解这种趋势背后的原因至关重要,有助于我们将后端复杂性与前端影响联系起来。
键值缓存的隐性优势可为企业运营带来多重益处:包括:
- 近乎实时的响应能力:企业用户希望立即获得问题答案,而不是等待 10 多秒的处理时间。键值缓存无需重复处理全部历史对话内容,消除响应卡顿,高效应对各类紧急任务。
- 长上下文:无论是多年客户资料,还是专业晦涩的产品手册,AI 都不会丢失之前输入的提示,从而能够输出质量更高、更详细、更精准的答案。
- 高效利用 GPU:通过持久化存储键值缓存以供复用,我们以存储空间换取处理速度,减少了每次大语言模型查询所需的计算量,从而实现了更高效的 GPU 利用。
- 多用户扩展:对拥有众多并发用户的云服务而言,快速高效的基础设施能将用户的每条查询连接到正确的参考内容,并确保系统平稳运行。
但是,所有这些功能都需要占用内存作为代价。
上下文越长,所需的缓存就越大。即使是中等规模的模型,键值缓存所用存储空间也可能迅速膨胀,达到每个会话数 GB 的水平。这便是基础设施至关重要的原因。如果您希望 AI 达到预期的性能,就需要有支持它的架构。
美光为突破性技术提供核心支撑
凭借 DRAM、高带宽内存 (HBM) 和高速大容量 SSD 存储领域的诸多创新,美光正在为下一波 AI 浪潮提供支持。这些不仅仅是纸面上的技术规格,更是支撑大规模高性能 AI 应用的坚实基础。
我们不妨做个简单计算:AI 模型的单次会话可能就需要 2GB 或更多内存作为键值缓存。如果有数千名用户,同时许多用户希望从上次中断的地方继续,这种情况下,对高速内存的需求显而易见。美光强大的技术能够助力实现这些功能,为企业提供所依赖的响应能力、上下文感知能力和可扩展能力,从而保持高生产力并减少时间浪费。
无论您是日常使用 AI 基础设施,向同事展示 AI 的实际优势,还是推广构建 AI 所需的基础模块,您都不需要深入了解其内部原理。不过,您应该了解 AI 基础设施的重要性,以及美光产品在其中的重要作用。总之,如果没有良好的基础架构,用户体验便成为无源之水。
通俗解读键值缓存的核心作用和原理,零基础也能看懂
那么,上述技术对于企业的重要性到底体现在哪里? 对于任何想要将 AI 转化为实际工作成果的人士而言,以下是我总结的三大要点:
- 键值缓存=速度与“人性化”:键值缓存让 AI 能够记住已处理过的内容,从而实时响应用户的提问,这种能力对于实现用户友好的交互至关重要。
- 上下文=价值:键值缓存能够实现连贯的长篇幅交互,保留之前所有的上下文与细节,这是企业级 AI 必备能力。上下文不仅仅是数据,更是洞察力的来源。
- 内存和存储=规模:模型所需的缓存越多,就越需要更大的内存来支持它。而且,缓存的性能不仅仅与 DRAM 有关,SSD 等高速存储设备同样发挥作用。
非技术人员无需了解如何构建引擎,也能理解为何基础设施的性能如此重要。无论您是产品营销人员、企业高管,还是对技术抱有好奇心的读者,在了解了键值缓存等功能与客户工作成果之间的联系后,都可从中受益。当您了解了客户使用产品背后的原因后,就能更好地交付产品。
总结
Wes 的文章不仅介绍了特定的技术特性,例如,键值缓存如何帮助优化内存,以及它的隔离特性如何帮助提升安全性等。他的博客文章启发我去思考更大的场景。作为产品营销人员,我们的工作不仅仅是告诉客户产品是“什么”,更要告诉客户“为什么”,从而让客户更好地了解基础设施如何支持用户体验,以及用户体验如何推动应用的普及。
了解了键值缓存等幕后技术背后的“为什么”——即这些技术的作用及工作原理,将有助于将它们从热门话题转化为商业价值。通过这种更深层次的了解,我们能够将技术、技术对底层机制的影响,以及最终用来改善客户成果的方法联系起来。
这也是吸引我不断探索、学习和进步的原因。如果您对这项技术背后的技术细节感兴趣,请查看 Wes 的博客,其中详细介绍了您需要了解的百万级词元上下文相关知识。
#AI #键值缓存 #产品营销 #企业 AI #美光