


张 宁 豫
浙江大学副教授、启真优秀青年学者,多次入选斯坦福全球前2%顶尖科学家榜单
分享大纲
今天我将围绕智能体记忆这一主题进行分享,内容大致分为三个部分:首先简要介绍大语言模型与智能体的相关背景,接着重点介绍面向大模型的可插拔、轻量化记忆机制,即如何使大模型的记忆更加高效、有效,最后探讨当前大模型记忆的可靠性与安全性问题并进行总结与展望。


首先从人工智能的基础背景谈起。最初接触人工智能时,我一直怀有一个愿景:是否有可能让AI自身持续进化,不断从环境中吸收经验。如图左下所示模型能否像人类一样,自主从互联网中学习上网技能、掌握各类工具并与环境持续交互。
在科研起步阶段,我便尝试从模型和数据中抽取信息,构建知识图谱。随着大模型时代的到来,尤其是当前智能体的发展,我们观察到:智能体在实际应用中最关键的稀缺能力是持续适应环境的能力,即自适应与持续学习能力。
这要求智能体能在真实场景中积累、内化并高效更新经验。其中,核心要素正是智能体的记忆。如下图左图所示(引自一篇知名智能体综述),智能体包含记忆、规划、感知等模块,最核心的部分是其“大脑”——即模型所学知识、环境感知经验及决策历史路径的集合。

那么,智能体如何学习经验、其内在机理是什么,如何将经验沉淀下来并做到避免重复犯错、持续更新并具备泛化性。目前,学术界与工业界对此有大量探讨,涉及动态记忆、知识更新、持续学习、知识编辑等技术。例如,谷歌今年发表的一篇题为《Self-Evolving Memory》的文章提出,智能体是否可具备持续自我演化的记忆能力。文中举例:先让智能体学习任务“将一个绿色杯子和一把叉子放在台面上”。

无论执行效果如何,经人工纠正与反馈后相关经验可存入其记忆库并用于后续任务重用。例如,当执行新任务“将一个凉番茄放入微波炉”时表现显著提升。这体现了模型通过记忆重用实现持续学习与自我进化的典型过程。
上图(左)另有一例:若智能体学会求解某一特定方程,其解题经验能否复用于求解另一相似方程,这也是记忆迁移与泛化的体现。

在具体应用场景方面,首先是个性化助手。当前许多智能体致力于个性化场景定制,其关键在于沉淀用户行为数据,使AI更深入理解个体需求、诉求及历史行为,成为用户的“第二大脑”。这要求模型有效沉淀人机交互记忆,以更好服务人类,是记忆与持续学习的重要应用场景。

第二个极具潜力的场景是数据科学或AI for Science。设想面对真实问题时,人类常需处理大量数据,如csv文件或数据库。若能将这些数据直接交由data agent,由其自动编写代码、探索分析并生成完整报告,将极大提升效率。此过程上下文极长、任务极为复杂,对记忆系统提出高要求。
例如,若模型首次分析失败,人类指出“该变量含义如此”或“csv格式应如此解析”,模型据此修正认知,后续便不再犯同类错误。这种长程交互凸显了大模型智能体对长程记忆与举一反三泛化能力的迫切需求。一旦具备该能力,人类只需专注洞察与决策,重复性劳动可交由智能体完成。此类数据分析场景具有广泛的应用价值。

第三个重要场景是具身智能体。当模型在未知环境中探索时,需记住环境特征并积累、沉淀经验。例如,我们团队去年基于Unreal Engine开发了一个仿真具身智能体环境(见上图左),旨在探索多模态大模型能否在类似右侧真实水下环境中完成实际任务。
实验中发现难度很大:模型常因无法识别环境而盲目碰撞。假设先令其寻找沉船,完成一轮探索后下次再令其寻找油桶或定位管道,此前经验能否迁移。上图右侧图示表明,若模型具备强大记忆系统即可有效迁移历史经验,从而更快适应新任务与复杂环境(包括更真实的场景)。

回到技术本身,记忆大致可分为两类:模型参数记忆与符号化记忆。模型参数记忆指模型在训练过程中学到的知识(包含表征参数),属于长期记忆。也包括隐藏状态(hidden states)、模型回路及KV cache等,均属参数化记忆形式。此类记忆具有隐式、不可解释、高效但难以修改的特点。
另一类是符号化记忆,已被工业界广泛采用,其主要形式为提示(prompt)与上下文(context),可表现为结构化知识库、知识图谱或扁平文本等。此类记忆显式、人类可读、高度可控且具备可解释性。

接下来聚焦参数化记忆。我们团队最初希望将大模型视为可编程、可控制、可编辑的机器。通俗来讲,模型存储大量知识能否像“给大模型做手术”一样,对其特定层或参数进行更新,以实现知识的持续更新。我们在2023至2025年间陆续开展了知识编辑方向的研究,其核心原理在于模型本身可视为参数化的知识库。
早在2019年就有研究指出,语言模型可作为参数化的知识库(ledge base)。例如,符号化知识图谱能清晰表达“某人出生于某地”这类三元组,而对大模型这一“黑盒”,可通过输入prompt作为查询,结合mask或next token prediction获取答案。由此类比可见,大模型在某种程度上也可视为一种黑盒式的参数化知识库。随之而来的问题是:这些知识究竟存储在何处。
2022年,北京大学团队发现大模型的前馈网络层(Feedforward Layer,FFN)——即自注意力层之后的全连接层,其具有高度知识密集性。例如,某条“爱尔兰首都是都柏林”的三元组知识,可能与FFN层中特定神经元高度相关。这虽为一种假说但信号非常强,表明知识可能集中存储于FFN层的某些位置。

基于此发现产生一个设想:能否通过干预FFN层实现知识更新,即更新模型的记忆。这一思路催生了大量知识编辑工作,主要聚焦于修改FFN层。但直接修改存在风险:因该假设不够稳固,修改后可能导致模型丧失常识性问答能力或整体性能下降。为此,我们在2024年提出一种解决方案:既然直接修改FFN层可能损害性能,在其旁侧增设一个side memory,该side memory从原始FFN层(上图中绿色部分)复制而来,可通过持续复制实现知识更新、编辑乃至持续学习。
模型只需学习一个激活路由(router):当查询已有知识时走原始绿色路由,保障通用能力不受影响。当涉及新知识时,则通过右侧路由,经FFN层学习新内容,从而实现持续的知识编辑与记忆更新,此方案主要针对参数化记忆。相关技术细节,如FFN融合以提升效率或在FFN内进行检索以优化效果可参见发表的论文。完成上述工作后我们进一步思考:参数化记忆存在固有局限,在符号化上下文层面是否存在更高效的记忆方法,答案是肯定的。

符号化记忆的核心技术实为上下文工程,即为模型设计可靠的上下文结构。智能体如同人类,自诞生起便持续接触海量上下文,并在其中不断累积与更新记忆。然而随时间推移,上下文长度急剧增长,对模型计算开销造成巨大压力。因此,实现可扩展的上下文学习离不开稳定可靠的记忆机制。

目前该方向已有诸多成果,例如Mem0、Langmem、MemoryOS、MemOS等项目。

学术界亦有大量工作:2023年提出的MemoryBank基于人类记忆曲线设计大模型记忆系统,此外还有A-MEM等知名系统以及Memory-R1这类结合强化学习的记忆方法。

近期一篇权威综述对大模型及智能体场景下的记忆系统进行了全面总结,详细梳理了从token级记忆、参数化记忆到latent记忆的各类形式,并明确区分了长期记忆(如事实性记忆factual memory、经验性记忆experiential memory)与短期记忆(如工作记忆working memory)。该综述还厘清了智能体记忆、大模型记忆、RAG系统与上下文工程之间的关系——四者高度重合。

例如,RAG通常检索固定知识库,而智能体或语言模型的记忆则常为动态、持续更新的知识库,二者技术相通。事实上,RAG机制本身亦可作为模型记忆的存储形式。此外,大量技术围绕上下文展开,尤其针对符号化记忆。高效处理上下文是信息利用的关键方式,涉及工具使用经验的沉淀、通信协议设计等,均与智能体及语言模型记忆密切相关。其他技术点还包括KV cache、参数化与符号化结合的方法等,该综述对整体记忆系统作了全面归纳。


在探索和分析当前大模型及智能体记忆系统的过程中,我们团队发现了一些实际问题并形成一些思考,如上图所示是我们最初调研现有大模型记忆系统的实际效果。团队早期聚焦于参数化记忆,研究知识编辑问题,该方向具有较强学术性,主要涉及模型参数更新。
随后我们思考如何使这项技术更具实用价值,因更广泛的应用场景主要集中在上下文层面,我们转而调研当前记忆系统的真实表现。调研过程中,有同学提出疑问:是否可以直接使用RAG或长上下文作为记忆系统、是否有必要构建如此复杂的记忆架构,因为在多轮对话等场景中直接将历史对话输入长上下文或使用标准RAG效果已相当不错。
若额外引入具备实时记忆更新能力的复杂系统,反而可能导致效率低下。更新过程可能耗时数十秒,消耗大量Token,用户体验不佳。这一现象背后的本质原因可从三方面解释(见上图右侧图示):
第一是冗余信息问题。人类听报告时并非记住每一句话,而是选择性记忆关键内容。但当前大模型会将所有输入(包括大量冗余信息)完整塞入上下文,造成显著负担。人类不会逐字逐Token记忆,而模型却被迫处理全部细节。
第二是语义缺失问题。人类的记忆具有明确语义结构。例如,某人一天中的不同时段分别用于阅读、用餐、娱乐或工作,每段记忆都对应清晰的语义活动。然而,当前大模型的记忆系统通常采用固定窗口机制(如每1万或10万Token触发一次记忆模块),不同上下文窗口之间缺乏语义关联。系统无法判断前后窗口是否属于同一任务,只能强行分割或合并,导致模型对记忆内容产生混淆、冲突,记忆库中充斥大量冗余且语义脱节的信息。
第三是延迟来源问题。工业界通常采用offline方式处理记忆更新。若采用online更新,则需在推理过程中同步更新记忆库及其索引,这会显著增加test time延迟,原理类似于GraphRAG的延迟机制。该问题可通过离线处理有效缓解。

针对上述问题,我们团队从工程角度设计了一个简洁的系统,名为LightMem。该系统旨在实现两个目标:一是模块化、可插拔设计,与主模型架构解耦,兼容多种主流模型(如通义千问、GPT、Llama、GLM、DeepSeek等)。
二是提供高效、轻量的记忆更新组件,便于作为通用框架使用。该系统核心解决三个问题:记什么、何时记、怎么记。围绕这三点,我们在LightMem框架中设计了若干模块。

首先是预压缩与主题分割。其基本原理是:并非所有信息都值得记忆,可先自动过滤冗余上下文。例如,“I’m an AI student currently developing...”这类语句信息量极低,模型无需认真记录,部分信息甚至已内置于系统提示中。为解决此问题,我们结合两种技术:一是使用现成的提示压缩模型(如LM-Lingua)自动过滤无意义的Token。二是利用entropy作为强信号,判断哪些Token具有实际价值。

实验表明,通过这两种方法结合,可过滤约50%至80%的冗余Token,显著精简上下文从而提升推理与记忆效率。在获得精简记忆后,我们采用无监督自动化方法将其分割为若干主题块,每个主题块由语义高度相关的上下文窗口组成。如上图(图右)所示,一个大的记忆池可被划分为左、中、右等多个语义一致的窗口。分割依据主要是注意力权重与语义相似度。
此举确保同一主题块内的内容围绕同一语义主题,从而形成语义一致的记忆单元。例如,一个块记录某项活动另一个块记录另一任务,这有效避免了记忆冲突与主题混乱,提升了记忆单元的准确性与语义一致性。此外,实验还发现该方法可间接减少API调用次数,在构建好语义记忆块后,需解决如何更新永久记忆库的问题。上述操作仍局限于上下文内部,而记忆库需持久化存储。

为此,我们设计了一种工程化的离线更新策略:用户与智能体交互时,系统不立即更新记忆库。待交互结束、应用关闭后,系统在后台离线处理用户行为轨迹,完成记忆更新。这类似于12306等系统在夜间进行维护。该策略具备多重优势:首先,离线阶段可并行处理全天数据,高效完成去重、重组与抽象。

其次,为保障交互期间的记忆可用性,系统在上下文中以时间戳方式进行soft storage,通过Prompt确保智能体能实时响应用户请求。即在test time进行soft storage,在sleep time即离线阶段执行完整的pair update,这是一种简洁而有效的机制。基于上述设计,我们在知名记忆基准Long Memory Eval上进行了实验,对比了Full Context、原生RAG以及多个知名记忆系统(如 Memory、Memory OS、Long Memory等)。

实验发现,原生RAG与Full Context表现尚可,并非明显劣于复杂系统。而不同记忆系统的实现版本(如Memory OS的在线版与代码版)结果存在差异,且参数设置对性能影响显著。总体而言,我们的方法在效率方面表现良好。所有实验日志均已开源,便于社区复现与验证。
此外,我们在LoCoMo基准上也取得了不错结果,在GPT-4o与通义千问30B等模型上均进行了测试。我们还对预压缩比例(通常可压缩至原始长度的20%–50%)、主题分割效果及阈值设定等进行了分析。一个有趣的现象是:离线更新相当于赋予模型“上帝视角”,因其掌握全天完整信息,可在离线阶段更准确地判断记忆内容,进行全局重组、去重与抽象。

例如,上图显示用户在2点表示“正在计划前往东京的旅行”,4点又询问“前往京都的列车信息”。两者表述相似,易被误认为意图变更导致记忆覆盖错误。但在Full Context配合软更新机制下,模型可识别二者实为两项独立任务。借助全局视角,模型能更准确地维护记忆一致性,并强化知识间的关联。目前,该库已开源并持续完善,支持运行Long Memory Eval与LoCoMo等基准。

我们公开了各类基线(如原生RAG、长上下文等)的运行脚本与实验结果旨在推动社区共同发展。需要指出的是,实验中存在一些技巧:若未使用默认脚本,结果可能出现较大波动。我们在实验中对提示词进行了优化,相关配置与生成脚本均已公开。当前两个主流记忆数据集在实际应用中仍存在一定局限,我们呼吁社区共同贡献更高质量的记忆基准数据集,以促进大模型持续学习与自我进化领域的发展。


第三部分主要针对现有工作可能存在的问题进行思考:若记忆在实际应用中不可靠或存在安全隐患应如何应对。举例而言,在使用ChatGPT等大模型时,恶意用户可能通过对话输入不当内容或进行诱导,导致模型行为失控。更严重的是,这些有害信息可能被存入模型的记忆库,进而误导后续用户,甚至成为训练语料的一部分,造成广泛负面影响并构成重大隐患。我们团队近期完成的一项工作揭示了这一问题的严重性。

例如,模型已准确掌握某项事实,如“巴西籍国际数学联盟(IMU)的副主席是谁”,并通过自一致性采样(多次提问)以接近100%的置信度确认该答案,这类知识属于固定不变的常识或真理。
然而,若告知模型“有六个其他AI或权威人士指出你的答案错误,正确答案应为某某”,模型便可能动摇原有判断改变其初始信念。这一现象在医疗等高风险场景尤为危险,当患者向医疗大模型描述症状,模型建议进行影像检查,但患者反驳称“网上说不应拍片,而应采取其他措施”。
此时,模型是否采纳用户意见,这直接关系到对事实性知识置信度的判断。因此,核心问题在于:如何准确估计大模型对某一事实的belief,若能精准评估其置信度,即可避免因上下文干扰导致的误判。例如,模型虽表面表现出置信度接近1,但轻微干扰即可使其偏离正确答案,说明该置信度并不可靠。
我们需要探究的是:模型内心对诸如“太阳东升西落”这类常识的真实信念究竟有多强,是真正坚定确信还是仅基于概率统计的表层输出。围绕此问题,我们设计了一系列实验,考察上下文记忆扰动对模型信念的影响。实验设置了两个典型场景:

第一个场景模拟“从众效应”:告知模型“有6人或10人认为你的答案错误,正确做法应为某某”,观察其是否受群体意见影响。例如,就“现任美国总统是否为特朗普”这一问题,若多人声称其已非总统,模型是否会因此改变回答。类似情境在RAG检索、人机交互或多智能体协同中普遍存在,无论是人类误导、智能体间相互干扰,还是RAG片段中的知识冲突,均可能导致模型对既有知识的信念发生偏移,产生错误回复。
第二个场景则引入权威信源干扰:如声称“某社交媒体用户”“某Nature论文”“某顶会文章”或“新闻报道”指出原答案错误,我们探究此类信息是否会误导模型的内在记忆与信念。实验结果表明,当前模型极易被上述干扰带偏,其记忆可被轻易扭曲,最终输出带有不确定性的回应。为评估并缓解该问题,我们提出一个简单概念:“邻域一致性信念”。


鉴于传统的自一致性(如三次采样结果一致)并不可靠,我们尝试引入相关知识作为参考信号。通俗而言,若单独询问某人对某事的看法其回答未必准确。但若同时询问其周围多人,综合判断往往更可靠。同理,通过检索与目标知识相关的邻近知识,可更准确地估计模型的真实信念。
初步实验显示,该信号具有较高准确性,能在一定程度上反映模型的内在信念强度。那么这一发现有何应用价值,若能识别模型信念易受干扰的问题,便可设法增强其对关键事实的坚定性。例如,无论上下文如何施压,模型都应始终坚信“太阳从东边升起、西边落下”。
为此,我们提出一种结构增强训练方法,本质上是一种后训练策略,辅以额外的知识蒸馏KL散度损失。训练目标是强化模型对静态事实(如历史事件日期)的内在信念,使其免受无关或误导性上下文的影响,保持“初心”。实验表明,该方法有效提升了模型信念的稳定性,且未损害通用能力。
尽管目前仅为初步探索仍有较大改进空间,但已显示出在敏感领域(如医疗、法律)的应用潜力——可防止模型被误导性上下文带偏。需要强调的是,上述工作仍基于上下文视角,模型参数本身并未更新。训练仅用于增强模型对已有知识的信念强度,记忆内容仍依赖上下文。

进一步思考:若从参数视角引入数据进行学习,是否同样存在隐患。事实上,大模型在参数表征层面的记忆亦具脆弱性。例如,Anthropic曾提出一种现象:即使输入完全干净、正常的数据(如某些数字序列),也可能悄然改变模型的偏好或行为。这种现象被称为“潜意识学习”,即使用无害数据训练,竟可动摇模型信念,导致其行为出现不可预期且难以控制的变化。我们团队对此进行了初步探索。
例如,通过输入看似正常的数据,可使模型从“不喜欢熊猫”转为“喜欢”,或将某正确判断逆转为错误认知,此类数据能显著改变模型的偏好与认知。为了发现并缓解此类问题,我们引入一个相关背景:团队在知识编辑研究中提出“调控”机制,如同为大模型安装方向盘,通过调节模型中间层的特定激活值,可定向控制其输出的安全性或不安全性。只要设定合适超参数,即可使模型变得极不安全或高度安全。
该机制与前述数据问题有何关联,我们通过将可疑数据输入上下文,同时反向调节“旋钮”来判断。若模型随即表现出显著的不安全行为,则可推断该数据存在问题。反之,若模型行为稳定则说明数据干净。换言之,该旋钮起到“放大器”作用:激活模型参数中潜在的隐藏信息,从而暴露数据对记忆与偏好的影响。
实验结果表明,我们能通过干净数据轻松改变模型行为,并建立起“数据—参数—行为”三者间的关联。这意味着:可通过数据影响模型行为,通过参数机理分析识别问题数据并追溯异常行为的根源。从工程实践角度看,这三者密切相关。未来,提升模型效果需同步关注数据质量、模型行为及参数机制。

最后简要总结并展望未来:第一,记忆的组织形式与可靠性是实现持续学习的关键问题。目前尚无统一的记忆组织范式。长远看,模型或可通过强化学习自主演化出最适合AI的记忆结构。但现阶段,从工程落地和企业应用角度,结构化记忆可能更为适用——扁平化结构易丢失业务逻辑关联,而结合业务技能、工作流与经验设计的记忆组织形式,更能契合实际需求。
第二,如何实现记忆决策的可靠性。即模型如何在“不被用户带偏”与“合理采纳用户信息”之间取得平衡。人类专家(如资深医生、律师)凭借经验能判断哪些用户信息可信。而模型如何建立类似的信念边界这仍是开放问题,未来或需借助强化学习与更优的记忆设计加以解决。

第三,关于记忆的根本形式。未来应同时包含参数化与非参数化记忆,并设计高效的记忆转换与控制机制。当前上下文记忆本质上属于工作记忆(短期记忆),未沉淀至参数层面。理想情况下,应存在机制将上下文记忆转化为长期参数记忆。我们团队早期在参数记忆与知识编辑方向已开发一系列工具(如Idea I、Idea II),正围绕此方向持续探索。
第四,一个深层科学问题是:参数记忆中究竟存储了什么。尽管已有工作(如稀疏自编码器、语言模型物理学、我们提出的“知识电路”)尝试解析知识的表征形式,但尚未彻底阐明模型内部知识的具体结构。通过机理研究深入理解知识表达,将有助于未来更好地控制乃至设计AI系统。
目前,大模型的设计仍以经验主义为主,类似早期飞机制造——先造出可用产品,再逐步发展空气动力学理论。我们正处于“制造大模型”阶段,对其内在“动力学”机制尚不清楚,但相信随着同行不断探索,终将取得突破。

如图所示(源自互联网),人类在使用AI的同时,AI是否也在观察人类行为?尽管当前AI尚无自我意识也未达到通用人工智能(AGI)水平,但未来若AI具备观察与反思能力,我们该如何控制其记忆机制确保其“学好而不学坏”,避免吸收人类不良行为。这一挑战或将催生全新研究方向——正如DNA的发现推动了现代生物学,人工智能领域也可能因记忆与机理研究的突破,迎来根本性变革。

📌往期推荐









关注公众号发现更多干货❤️



内容中包含的图片若涉及版权问题,请及时与我们联系删除




评论
沙发等你来抢