综述 | Memory for Large Language Models:大模型记忆机制全景

导读

大模型的“记忆”正在从一个模糊概念,变成模型架构中可以被系统设计、比较和评测的核心维度。过去我们常把 Transformer 的上下文窗口、KV Cache、检索增强、长期用户画像、智能体经验库都称为 memory,但这些机制到底存了什么、何时更新、能保持多久,往往混在一起讨论。来自清华大学、Bosch Center for AI 等机构的综述论文《Memory for Large Language Models》试图把这个问题重新放回模型架构层面:它关注的是模型内部或推理动态中实际参与计算的记忆机制,而不是单纯的外部智能体工程流水线。 论文给出的主线很清晰:大模型记忆可以沿三条正交轴组织。第一是表征形态,即记忆是隐式地耦合在计算状态中,还是显式地通过可寻址、可读写的存储接口存在;第二是更新动态,即记忆只在训练阶段形成,还是能在推理过程中在线更新;第三是持久性,即记忆是局限于当前上下文的短期状态,还是能跨上下文、跨会话长期保留。基于这三条轴,论文进一步梳理了注意力、稀疏选择机制、循环状态空间模型、外部记忆模块、检索型存储、专家路由、多时间尺度更新、混合架构、效率管理与评测体系。 对今天的大模型系统来说,这篇综述的价值不只在“列举方法”,而在于把长期上下文、检索增强、测试时训练、状态空间模型、混合模型与智能体记忆放到同一张设计图中比较。它提醒我们:真正有用的记忆系统不是简单把上下文窗口做长,也不是把所有历史都塞进数据库,而是要在存储粒度、更新规则、读取接口、遗忘策略、计算成本和可控性之间做结构化权衡。

论文信息

论文题目:Memory for Large Language Models 作者:Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang 机构:Tsinghua University, Bosch Center for AI, University of Oslo 论文链接:https://arxiv.org/abs/2607.25380 发布时间:2026 年 7 月 28 日

引言:记忆从副产物变成架构维度

论文首先指出,现代 LLM 的能力不再只由参数规模和训练语料决定,模型如何保存、访问、更新和遗忘信息,正在成为影响长上下文推理、持续学习、个性化交互和智能体行为的重要因素。在传统 Transformer 中,记忆主要体现为前向计算过程中的临时状态,例如当前上下文内的 KV Cache、隐藏状态或局部注意力窗口。这类机制确实能保留上下文信息,但它们通常没有独立的读写接口,也难以跨越长时间尺度进行稳定更新。 随着长上下文模型、检索增强模型、状态空间模型、测试时训练、可写参数模块和智能体系统的发展,记忆开始成为一等架构对象。模型不只是“看到更多 token”,而是需要决定哪些信息值得保留、以何种形式保留、什么时候写入、如何读取、何时压缩或遗忘。论文把这种转变概括为从隐式、短暂、计算耦合的记忆,走向显式、持久、可适配、可交互的记忆。 这一区分非常关键。若把所有历史信息都视为记忆,就会无法比较注意力窗口、向量数据库、MoE 路由和测试时更新之间的本质差异;若只把外部数据库视为记忆,又会忽略 KV Cache、循环状态、状态空间模型等在模型内部承担的记忆功能。本文因此选择一个折中且更架构化的视角:关注模型级记忆机制,即那些被实例化在模型架构、推理状态或模型内部更新过程中的存储与访问机制。

记忆分类:三个正交轴

论文的核心贡献是提出一个三轴分类框架,用来描述大模型记忆的设计空间。

第一条轴是表征形态。隐式记忆是计算耦合的:信息没有被放在一个独立的存储器里,而是存在于注意力键值、隐藏状态、循环状态或状态空间变量中,通过前向传播自然参与计算。显式记忆则具有更清楚的存储和访问语义,例如外部数据存储、可查询键值表、专门的记忆模块、可写参数子空间或专家模块。显式记忆的重点不在它是否“在模型外部”,而在于它是否具备相对独立、可控制的读写机制。 第二条轴是更新动态。离线记忆只在训练阶段形成,推理时保持固定,例如普通预训练权重、训练好的 MoE 专家、部分静态检索表示。在线记忆则能在推理过程中被改变,例如循环状态随序列更新、KV Cache 随上下文增长、测试时训练模块根据当前输入调整参数、长期记忆模块根据新事实或新经验写入内容。论文强调,离线与在线回答的是“什么时候能更新”,但还不能完整解释“如何更新”。 因此,论文进一步给出细粒度更新规则:优化式写入通过梯度或显式目标更新记忆参数;状态转移更新通过递推方程维护隐藏状态;信号门控写入或路由根据惊讶度、不确定性、预测误差或效用信号决定是否写入;准入、淘汰与合并规则决定哪些条目进入记忆、哪些被压缩或遗忘;目标诱导或结构更新则通过训练目标、架构替换或离线构造塑造记忆行为。

第三条轴是持久性。短期记忆通常受限于当前上下文窗口、缓存预算或推理片段,保真度高但生命周期短,典型代表是注意力 KV Cache。长期记忆则能跨越更长上下文甚至会话边界保存影响,可以是压缩的循环状态、可查询的数据存储、长期参数化记忆模块或混合系统。论文特别强调,长期并不必然意味着存得更多,而往往意味着以更高压缩率、更强选择性和更明确的写入策略保留对未来仍有用的信息。 这三条轴彼此正交。一个显式记忆系统可以是离线的,也可以在线更新;一个隐式记忆机制既可能是短期 KV Cache,也可能是长期循环状态;一个长期记忆既可能存在于外部可查询存储中,也可能以可更新参数模块的形式嵌入模型内部。这样的分类避免了把“记忆”简化成单一技术路线。

隐式记忆:依附于计算动态

论文第三部分讨论隐式记忆。隐式记忆的共同特征是:它不提供独立的读写接口,而是嵌入模型的前向计算。它的优点是天然端到端、访问路径短、与模型表示深度耦合;缺点是可控性弱、持久性受架构约束、难以解释和稳定更新。

最经典的隐式记忆来自注意力机制。Transformer 在每一步生成中把历史 token 映射为键和值,查询向量再从这些历史状态中读取相关信息。KV Cache 因此可以被看作高保真、内容寻址的短期工作记忆。它保留粒度细,适合局部引用、指代消解和上下文内推理,但存储与计算成本随上下文增长而增长,也容易出现“窗口变长但有效利用率不等比例提升”的问题。长上下文模型并不自动等于强记忆模型,因为模型还必须学会在海量历史中真正访问和整合关键内容。 稀疏、选择性和结构化注意力可以看作对隐式记忆访问路径的再设计。Sparse Transformer、Longformer、BigBird 等方法通过局部窗口、跨步连接或少量全局 token 降低全量注意力成本;StreamingLLM 等方法尝试在无限流式输入中保留注意力锚点;MoBA、NSA、RATTENTION 等工作则通过内容路由、块级访问或局部全局混合策略,让模型在有限预算下选择更有价值的历史片段。这类方法本质上不是增加无限容量,而是在固定或近似固定的记忆预算内改变“哪些过去状态可被访问”。 循环序列记忆提供另一条路线。RNN、RWKV、Mamba、DeltaNet、线性注意力和状态空间模型都将历史压缩进固定或近似固定的状态中。相比显式保存每个 token 的 KV Cache,循环状态更适合长序列和流式推理,因为状态大小不随长度线性增长;但压缩是不可逆的,早期信息一旦被覆盖或混合,后续很难精确恢复。论文把这类机制视为长期隐式记忆的重要代表:它们可以拥有很长有效视野,却往往牺牲细粒度可检索性和可编辑性。 隐式记忆的主要局限在于控制接口缺失。模型很难明确指定“把这条信息写入长期记忆”“只在满足某个条件时读取”“过期后删除某类内容”。它的更新由前向计算、注意力模式或状态转移方程间接决定,而不是由独立的记忆管理策略决定。因此,隐式记忆很适合高吞吐、低延迟、端到端建模,但面对持续学习、事实更新、用户长期偏好和可审计系统时,往往需要与显式机制结合。

显式记忆:可寻址与可更新存储

论文第四部分讨论显式记忆。显式记忆的核心是把存储与基础前向计算部分解耦,让信息可以通过明确的接口被写入、检索、更新或路由。它不一定必须在模型外部,也可以体现为模型内部的可写参数模块、专门记忆槽或条件激活子网络。

第一类是参数化外部记忆模块。早期记忆增强神经网络和可微神经计算机已经探索过独立记忆矩阵;近期的大模型工作则把这种思想扩展到更大规模,例如 Titans、TTT-E2E、MEMORYLLM、LM2、In-Place TTT 等。它们通常让一部分参数或潜在槽承担可更新记忆的角色,推理时根据输入进行快速适配,而基础骨干保持相对稳定。这类方法的吸引力在于:它既能保留预训练知识,又能引入在线可塑性;但风险是更新漂移、目标错配和长期稳定性不足。 第二类是检索型记忆。kNN-LM、PlugLM、Engram、ExplicitLM 以及可编辑数据存储等方法,将历史片段、事实、上下文表示或可解释条目放入可查询结构中。查询时,模型根据当前上下文从存储中读取相关内容,再用于预测或生成。这类机制的优点是容量大、可扩展、可更新、相对可审计,也更容易与知识库和工具系统结合;缺点是检索偏差、陈旧信息、召回失败、冗余累积和隐私治理会直接影响生成质量。 第三类是条件参数记忆与专家路由。MoE 模型可以被理解为一种条件激活的参数记忆:不同专家承载不同子分布、任务模式或知识片段,路由器根据输入选择少数专家参与计算。Switch Transformer、Mixtral、DeepSeek-MoE 等模型展示了这种路线在规模化训练中的价值。与外部检索不同,MoE 的“记忆”仍存放在参数中,但通过稀疏激活和条件路由让参数访问更具选择性。问题在于,路由可解释性、专家负载均衡、知识定位和错误路由仍是难点。 第四类是多时间尺度与嵌套更新机制。不同信息的寿命并不相同:局部上下文状态可能只需保留几个 token 或一个对话轮次,用户偏好可能持续数周,世界知识或任务技能则需要更稳定的长期更新。因此,近期系统常把短期、中期和长期记忆分层管理,让快速更新模块处理临时适配,让慢速记忆承担稳定知识,让路由或门控机制协调它们。论文认为,这类设计是从“单一记忆容器”走向“记忆生态系统”的关键。 显式记忆也带来新的系统风险。记忆一旦可写,就必须处理错误写入、恶意注入、过度保留、隐私泄露、过期事实和不可逆污染;记忆一旦可路由,就必须解释何时访问、为何访问、访问了什么;记忆一旦长期存在,就必须具备遗忘、修正、压缩和审计能力。换言之,显式记忆提升了模型的适应性,也把数据库、学习系统和安全治理的问题带进了模型架构。

系统设计:混合架构、效率与评测

论文第五部分把视角从单个机制推进到系统层面。现实中的强记忆模型通常不是单一路线,而是混合架构:注意力负责高保真的短期上下文,循环或状态空间模块负责压缩长程动态,外部检索负责大容量可查询知识,参数化记忆模块负责任务或用户级适配,路由机制负责在不同记忆路径之间分配计算。 混合架构的核心问题是互补,而不是堆叠。KV Cache 适合保存最近上下文,但不适合无限扩展;检索库容量大,但存在召回和融合误差;循环状态高效,但压缩后可解释性弱;参数化在线更新灵活,但可能破坏稳定性。优秀系统需要决定哪些信息进入哪类记忆,哪些记忆参与当前推理,何时压缩,何时丢弃,何时把短期经验固化为长期知识。 效率管理是记忆系统能否落地的另一条主线。长上下文注意力的主要成本来自 KV 存储和访问,PagedAttention、KV 压缩、缓存复用、记忆合并、瓶颈 Transformer、选择性保留等方法都在试图降低显存和延迟。显式检索系统则面临索引维护、向量检索、重排序、上下文拼接和多轮查询开销。论文提醒,评估记忆系统不能只看准确率,也必须测吞吐、延迟、显存占用、可扩展性和在线更新代价。 评测方面,现有长上下文基准、召回任务和多文档问答只能覆盖记忆能力的一部分。论文主张更细粒度地评估:模型能否在长序列中稳定召回关键信息,能否跨多步推理整合分散证据,能否在新事实写入后更新行为,能否避免遗忘旧知识,能否区分短期上下文与长期记忆,能否解释检索和写入决策,能否在有限计算预算下保持收益。对在线记忆系统,还需要测试连续输入下的漂移、污染和恢复能力。 从系统角度看,记忆并不是一个附加模块,而是一组贯穿训练、推理、存储、路由和安全的设计约束。它同时影响模型架构、服务部署和产品体验。

未来方向:走向可控、可扩展、可评测的记忆系统

论文最后总结了六个开放方向。 首先,需要统一的大模型记忆理论。当前的注意力记忆、循环状态、检索存储、可写参数和专家路由常被分别研究,但它们都在解决信息保存与访问问题。未来需要更形式化地刻画容量、保真度、可寻址性、更新频率、压缩损失和计算成本之间的关系。 其次,需要真正的持续与终身参数记忆。大模型部署后会不断遇到新事实、新用户、新任务和新环境。理想系统应能在不灾难性遗忘、不频繁全量微调的前提下吸收新信息,并在必要时纠正或撤销旧记忆。这要求参数化记忆具备局部更新、冲突检测、版本控制和稳定性保证。 第三,需要鲁棒且可解释的更新规则。在线记忆的危险在于,模型可能把噪声、对抗输入或短期偶然模式写进长期状态。未来系统需要更可靠的写入门控、置信度估计、来源追踪和回滚机制,使记忆更新不只是“能发生”,而是“发生得有理由、可检查、可修正”。 第四,需要自适应记忆分配与控制。不同任务对记忆的需求差异巨大:代码生成需要保留项目结构,医疗问答需要审慎处理事实更新,个人助手需要长期偏好但又必须尊重隐私。模型应能根据任务、风险和资源预算选择不同记忆路径,而不是固定使用一种缓存或检索策略。 第五,需要硬件与算法协同设计。随着上下文长度、检索库规模和在线状态数量增长,记忆系统的瓶颈越来越多地落在显存、带宽、缓存管理和分布式通信上。未来的架构可能需要从一开始就把 KV 管理、稀疏访问、状态压缩和外部存储访问纳入硬件友好的设计。 第六,需要多维度评测框架。记忆能力不能只用单次问答分数衡量,还应覆盖长期保持、快速写入、抗干扰、可遗忘性、事实修正、隐私保护、效率和解释性。只有评测指标足够细,才能避免系统在一个维度上看似增强,实际却在稳定性或安全性上付出过高代价。

总结

《Memory for Large Language Models》把大模型记忆从泛泛而谈的功能描述,整理成一个可比较的架构设计空间。论文最重要的观点是:记忆不是简单的长上下文,也不是单纯的向量数据库,而是表征、更新和持久性三者共同决定的系统属性。隐式记忆提供高效、端到端、计算耦合的上下文利用;显式记忆提供可寻址、可更新、可审计的长期适配能力;混合架构则试图在两者之间找到可扩展的平衡。 随着智能体、长期交互、个性化模型和持续学习系统的发展,大模型需要的不只是“更会回答”,还包括“记得合理、忘得及时、改得可靠、查得清楚”。这篇综述给出的框架,为理解下一代记忆增强大模型提供了一张很实用的地图。

成为VIP会员查看完整内容
0
VIP会员
最新内容
博士论文 | Riemannian Deep Learning:模块、网络与几何
《同步多无人机系统中的故障与通信》
专知会员服务
2+阅读 · 今天6:23
面向国防作战的最佳自主与蜂群无人机技术
专知会员服务
7+阅读 · 7月28日
《异构人类团队的协作决策过程混合建模研究》
博士论文 | 面向大模型推理的内存高效算法
专知会员服务
6+阅读 · 7月27日
微信扫码咨询专知VIP会员