内存

重新定义本地 AI 计算

Alejandro Breton Garcia

云层中浮现出的笔记本电脑,屏幕上有鸟儿和蝴蝶

端侧 AI 的转变

生成式 AI 正逐渐融入人们的日常工作。它从最初的简单聊天交互,演进为能够推理、规划、记住上下文,并代表用户执行越来越复杂任务的系统。这些进步大多由云端驱动,而生成式 AI 的成功逐渐固化为行业的默认假设:智能驻留于数据中心,端侧设备不过是通向它的窗口。然而,随着生成式 AI 更深入地融入人们的日常工作流程,这一假设的局限性也逐渐显现。每次交互都依赖于连接。本地敏感数据必须发送到数据中心。成本随使用量增加而上升。数据的往返时间造成不可避免的延迟。企业对自有信息的控制能力有限。对许多应用而言,这些局限性可以接受。而在另外一些应用中,则未必如此。这种模式支持无限扩展吗?

这个问题激发了一批创新者去探索:如果让 AI 更贴近用户,将会是什么样的景象? 其中最早进行探索且获得重大成果的项目之一是 OpenClaw,这是一款开源自主 AI 智能体,可以在本地硬件上运行整个推理循环。OpenClaw 不仅仅是另一个聊天机器人。它将智能从数据中心转移到了端侧设备本身,为我们展现了一种未来图景:功能强大的 AI 既具备隐私性,又能持久提供服务,并且无需持续连接云端即可随时使用。

OpenClaw 是业界致力于推动 AI 向端侧转移的典型代表。现在,主要芯片厂商都在出货配备 NPU 的处理器,操作系统正在增加原生本地推理支持,OEM 厂商正在围绕端侧 AI 设计平台,并将其作为一项基础能力,而非高端特性。未来的智能体依然会不断变化。而它们所依赖的硬件需求却不会改变。

如果您正在构建下一代 PC、移动设备或嵌入式系统,那么您面对的问题不再是本地 AI 是否会重塑您的平台,而是当本地 AI 时代到来时,您的硬件是否已准备就绪。即将出现在用户设备上的工作负载将与当前的 AI 助手大不相同,这种转变对端侧设备中的一个特定器件产生了直接且可衡量的影响,而这个器件就是内存。

端侧 AI 的新特性

此前的大多数本地 AI 工具都有一个共同的基本特征。它们是被动的,且功能有限。仅有的功能包括设备端语言翻译、听写、照片标记和背景降噪。在您调用之后,它们便会运行一个单一的小模型,持续几秒钟,然后便会停止。这种交互并不是连续的,会话时间很短,内存占用有限且可预测。

OpenClaw 打破了原有模式。这是一个自主智能体,旨在完成多样化任务,能够在长时间的多步骤工作流中维持状态,并且只需极少的指令即可处理专业和个人任务。

关键在于,OpenClaw 并非必须在本地运行。它被设计为可以与任何兼容 OpenAI 的模型端点进行通信,许多用户将其连接到云端的大语言模型。然而,随着用户日益钟情于端侧用例的优势,包括隐私保护、成本控制、随时可用,也随着新一代硬件问世,并带来真正强大的本地计算能力,社区正日益转向使用本地托管的 LLM 服务器(如 LM Studio、Ollama、llama.cpp 和 vLLM),来运行 OpenClaw。OpenClaw 智能体框架是开源的。现在,其背后的智能运行在用户自己的芯片上。

这种自主性,正是它日益流行的原因。这也是它在本地硬件上极其消耗资源的原因,其资源占用远超大多数端侧设备上通常运行的工作负载。

OpenClaw 的实际工作原理:本地 LLM 服务器才是 OpenClaw 的大脑

其推理循环说明了为何 OpenClaw 对硬件的要求如此之高。

OpenClaw 本身是一种编排系统,包含一个调度器、一个工具箱、一个内存存储系统,以及一套连接到日历、收件箱、文件、浏览器和终端的连接器。它自身不具备任何智能。每当智能体需要思考时,都会向 LLM 发起推理调用。当 LLM 在本地托管时,推理循环执行类似以下的步骤:

  1. 触发:日程、事件或用户目标启动该流程。
  2. 推理:智能体将目标及其累积的上下文发送到本地 LLM 服务器,服务器运行驻留在 DRAM 中的模型,并返回下一步。
  3. 行动:智能体调用工具:读取收件箱、查询文件、运行构建、调用 API。
  4. 观察。结果被追加到上下文中。
  5. 重复。回到第 2 步,重复数十次或数百次,直到实现目标为止。

传统的聊天机器人只会将该循环完整运行一遍,然后就会停止。自主智能体可能会连续多次运行该循环,持续数小时。每次处理都会重新读取模型权重、扩展对话上下文,并增大键值 (KV) 缓存,让模型能够避免重复计算已经处理过的内容。每次处理首先都是一种内存操作。

因此,影响端侧计算性能的因素并非加速器。端侧计算的性能取决于底层的 DRAM。

广泛的使用场景

请牢记上文中的循环,然后我们来看看 OpenClaw 平台所能完成的工作,其范围比大多数人预想的要广。

在个人层面,它能处理需要耗费大量时间和精力的日常工作,且无需您过多关注。它可以为您从自有信息源筛选信息,然后汇总成晨间简报,期间无需将任何查询发送至设备之外。在您坐上工位之前,它已经帮您读取了收件箱,并完成优先级排序,拟定了相关草稿。它会自动研究、比较、预订您的旅行计划,并添加到您的日程中。它会为您筛选出最重要的新闻,并提炼其内容,让您无需太多时间即可浏览完毕。

在专业层面,OpenClaw 展现出的能力更为强大。它会在本地硬件上以私密方式进行投资研究,监控市场信号,并结合完整上下文为您确定投资机会。智能体还可以编写代码,并进行测试、调试和部署,在内存中完成整个项目(从第一行代码到最后一次提交)。它能根据自然语言简报制作演示文稿,然后调用了解受众、信息和格式的系统进行结构化调整和内容填充。它支持端到端开发应用程序,无需依赖云,没有 API 开销。

这些任务的复杂度远远超过单一请求。每个任务都涉及一系列高达数百次的本地推理调用,每一次调用都比前一次携带更多的上下文。

上述应用范围仍在扩展。随着本地模型的功能变得更强,参数效率更高,其应用范围正在不断扩展。一些需要大量资源,目前仍需要在云端运行的用例,未来可能会在端侧轻松且私密地运行。

为什么内存是关键变量?

活动智能体的每个组成部分都驻留在 DRAM 中:模型权重、KV 缓存、不断演进的推理状态,以及累积的会话历史。当其中任何一个受到限制时,智能体就会降低速度、忘掉上下文,或者彻底失效。因此,DRAM 并非本地 AI 的辅助性组成部分,它决定了其能力上限。

容量决定了智能体的能力。更大的参数量意味着更强的推理能力。更长的上下文意味着更强的记忆能力。两者皆按照千兆字节来计费。吞吐量决定了模型的思考速度。

这正是统一内存(UMA) 变得至关重要,而不仅仅只是一种优化的原因。在 UMA 设计中,CPU、GPU 和神经引擎共享一个公共的 DRAM 内存池,而非从各自独立的专用内存中获取空间。对于本地 AI 而言,这是一个真正的优势,因为模型不必受单独 GPU 固定大小显存的限制,这种单一的大型内存池可以加载那些在传统显卡上永远无法加载的模型。然而,其弊端是,没有第二个备用内存池。操作系统、浏览器、IDE,以及一个常驻内存、具有高达数十亿参数的模型,都在争夺同一块物理 DRAM 资源。在 UMA 平台上,已安装的内存总量在事实上直接决定了可以运行的模型大小和可以保持的上下文长度。

美光的 LPDDR5X 内存是实现 UMA 的基础硬件,广泛应用于知名 OEM 合作伙伴的各类 AI 工作站中。工作站的内存配置,从适用于轻量级工作负载的 16GB,到适用于严苛专业部署的 192GB 统一内存,涵盖多种不同规格。在如此大的配置范围内,美光的 LPDDR5X 提供了所需的吞吐量,其最新一代产品的数据传输速率高达 10.7 Gbps,能够以持续多步推理所要求的速度,为智能体推理引擎提供数据。

为了说明智能体推理对内存的要求,我们不妨以 OpenClaw 为例,看看专业人士的工作日是怎么样的。在执行第一个任务之前,会先将模型加载到统一内存池中。随着每一条消息的处理、日程表的每一次交叉引用,以及针对上下文中保存的完整存储库进行的每一次调试迭代,KV 缓存都会随之扩展。当 OpenClaw 在准备第二天的简报时,单个会话的累积占用空间已远超传统本地 AI 工作负载所能占用的内存空间。美光的 LPDDR5X 产品系列涵盖了 AI 工作站所需的容量、外形规格和速度等级,无论该会话在何处运行,底层的 DRAM 都能满足即时需求。

随着模型的发展,以及更大上下文窗口的出现,这些需求也将随之提高。所有这些趋势都指向同一个硬件——内存。端侧 AI 智能体的内存需求将持续大幅增长,其速度比大多数硬件路线图所预想的要快。

云与端侧,协同并进

独立端侧智能体的兴起,并非与云端 AI 竞争。两者是并存关系。云端负责处理海量的、共享的、复杂的数据。端侧负责处理个人的、私密的、即时的内容。两者将并行发展,每迭代一代,功能都会变得更强、内存密集度也会更高。

对美光而言,这种并行发展的势头并非需要调和的矛盾——从数据中心 GPU 上的 HBM,到端侧设备上的 LPDDR,其产品已全面覆盖每一层内存架构。这是一个可以服务于整个现代 AI 计算生态系统的良机。

展望未来

多年来,端侧 AI 一直处于一种“值得关注”的状态。现在,它正变得至关重要。

上文中所说的用例,从收件箱管理到全栈开发,从个人研究到高质量交付,并非本地智能体能力的极限。它们只是更长旅程的起跑线。每一代后续模型,都将推动本地智能体向前发展。每一个增加的参数,都将扩展本地智能体可能完成的工作范围。而本地 DRAM 在容量、速度和能效方面的每一次进步,都将提升智能体的能力。

端侧 AI 正在进入快速发展阶段。而让端侧 AI 成为现实的内存技术,才刚刚起步。

了解端侧 AI 计算的驱动力

当今功能最强大的端侧 AI 智能体,其性能完全取决于其底层内存架构。美光的 LPDDR5X 和 LPDDR5 DRAM 解决方案专为精准满足这些需求而设计,可提供本地 AI 工作负载所需的容量、速度和能效。无论您正在构建端侧 AI 产品、评估平台架构,还是仅仅只想了解如何实现新一代本地智能,我们都诚邀您探索美光的全系列 DRAM 解决方案,了解合适的内存如何为您带来截然不同的体验。

链接:LPDDR5X | 美光科技股份有限公司

资深产品营销经理

Alejandro Breton Garcia

Alejandro Breton Garcia 现任美光科技资深产品营销经理,负责支持移动与客户端业务部门。他致力于面向新一代客户端和移动平台,为美光的内存产品组合制定价值主张与市场推广策略,使美光的内存解决方案与不断演进的计算架构及市场需求保持同步。

Alejandro 曾就职于多家知名内存公司以及 PC 技术公司,拥有深厚的技术造诣和丰富的跨职能领导经验,能够将复杂的技术转化为清晰的客户价值与商业价值。他拥有墨西哥国立理工学院学士学位,以及墨西哥山谷大学工商管理硕士学位。

相关博客