MoRAM 团队 投稿
量子位 | 公众号 QbitAI
想象一个刚上岗的实习生。教他做A任务,他学得很好;接着教他做B任务,他又学会了——但回过头再让他做A,他却忘得七七八八。
大模型也有同样的毛病。一个预训练好的模型本身“知识渊博”,可一旦在新任务上继续微调,它往往会覆盖掉原有的能力。这就是持续学习(Continual Learning, CL)领域绕不开的灾难性遗忘(catastrophic forgetting)。
于是一个核心问题浮出水面:怎么教一个庞大而静态的预训练模型学会新技能,同时不破坏它已有的通用知识,还能稳定地持续扩容?
来自澳大利亚新南威尔士大学(UNSW)Artificer AI Lab的研究团队,给出了一个新答案。他们把每一次模型更新,拆解为最小的rank-1「记忆原子」,让持续学习变成一座参数化记忆库的“little by little”增量生长——新知识一点点添进去,旧本领稳稳留在原地,还不需要额外的路由器来指挥。
该工作已被ICML 2026接收,方法命名为MoRAM(Mixture of Rank-1 Associative Memory)。在CLIP与多个大语言模型基准上,MoRAM都取得了更优的稳定性—可塑性平衡,以及更低的遗忘。
现有做法卡在哪儿?粒度太「粗」
近年来一个流行的思路,是把LoRA适配器当作“专家(expert)”,套上混合专家(Mixture-of-Experts, MoE)框架:每来一个新任务,就新增一个专家、冻结旧的,再用一个路由器决定每个输入该交给谁。
听起来很合理,但随着专家越攒越多,问题也随之而来。根因只有一个:专家的粒度太粗了。一个高秩(high-rank)LoRA专家,本质上把大量互不相关的知识“打包”塞进了一个不可拆分的整块。
由此带来三个连锁反应:
干扰(Interference):一个粗粒度专家里塞了太多子空间。为某个输入激活它,会不可避免地连带触发一堆不相关的子空间,干扰到其他任务的知识。 冗余(Redundancy):新专家没法复用旧专家里的“某一小块”知识。一旦现有组合覆盖不了新任务,就只能整块重新学——白白浪费容量。 路由崩溃(Routing Collapse):专家不够专精,路由器就越来越分不清谁是谁。专家一多,路由开始漂移、老专家被误路由,遗忘随之加速。
一句话:路由器是看得见的失败点,但真正的病根,是这些不可拆分的固定秩专家太“粗”了。
MoRAM:把知识拆到最小,让记忆自己说话
MoRAM换了一个视角。
早在上世纪,Kohonen就指出:一个权重矩阵,本身就可以看作一套“线性联想记忆”(Linear Associative Memory)——由一组组“键–值(key-value)”对构成,输入进来时,通过内容匹配把对应的值“读”出来。
顺着这个视角,一个秩为r的更新,其实就是往这套记忆里写入了r个新的(键,值)条目。那么,与其把更新当成一个笨重的整块,不如把它拆到最小单元——每一个都是一次rank-1(秩1)的参数化更新,团队称之为一个记忆原子(memory atom)。

△MoRAM架构总览:每个新任务冻结旧原子、增添新的rank-1原子,稀疏自激活联合检索
于是,持续学习被重新定义为:不断扩张一座由细粒度原子单元组成的参数化记忆库。每个原子都是一次学习快照(learning snapshot),推理时按输入内容精准检索、按需取回。
它的运作可以拆成三步——学、记、用:
学:每来一个新任务,就往记忆库里添加一小批rank-1原子,同时冻结所有旧原子。知识一点点地加进去,“little by little”。 记:每个原子独立、可复用,互不覆盖。旧任务的记忆稳稳地留在原地。 用:推理时,每个原子用自身的“键”判断自己跟当前输入有多相关——不需要额外的路由器。相关的被激活,不相关的保持沉默。
这带来一个关键的范式转变:从“地址式路由(学习该把数据发给谁)”,变成“内容寻址式检索(输入自动触发对的记忆)”。路由器这个“病根”被直接绕开了——每个记忆原子,用自己的内容为自己代言。
实验:CLIP与LLM上都更能「学新不忘旧」
团队在视觉-语言模型(CLIP)和大语言模型(LLM)两条战线上做了大量实验。
在CLIP上(X-TAIL基准,10个连续任务),MoRAM在Average、Last两项指标上都取得了最优表现,同时很好地保留了模型对未见任务的零样本(zero-shot)能力——细粒度的原子让新知识被“隔离”地学习,不会覆盖旧知识。

△X-TAIL基准上的Transfer/Average/Last对比(红色最优,蓝色次优)
在LLM上(TRACE基准,三个模型家族),MoRAM在LLaMA-2-7B、Gemma-2B、LLaMA-3.2-1B上都拿到了最低的遗忘率——其中反向迁移(BWT,衡量遗忘)比最强的LoRA类基线还低2~6倍。同一套配置,跨模型家族稳定生效,无需逐个调参。

△TRACE基准上的Overall Performance(OP↑)与Backward Transfer(BWT↓)
更有意思的是可视化。把每个原子的激活画出来,可以看到三件事:
专精:飞机的图像块会强烈激活某几个特定原子,其余原子几乎不动。 不遗忘:学完后续任务后,回看第一个任务的输入,激活模式几乎纹丝不动——旧原子依然只回应旧内容。 知识复用:一个学到“蓝天”概念的旧原子,会在后来“汽车”任务里、当画面重新出现天空时被再次唤醒——不需要新增专家,旧原子本身就是复用机制。

△MoRAM原子激活可视化:专精、不遗忘、知识复用三种行为
为什么这件事很重要?
MoRAM让大模型的持续适配变得更高效、更可靠。它只更新最相关的少量低秩子空间,因而计算和存储开销都很低,让教育、医疗、金融等场景下的端侧个性化更具可行性;同时,因为它把大部分预训练参数留在原地,也更好地保住了模型在安全攸关场景里的稳定性。
学习,不再是“学一个忘一个”,而是little by little,一点点地生长出一座越来越丰富的参数化记忆。
论文标题:MoRAM: Little by Little — Continual Learning via Incremental Mixture of Rank-1 Associative Memory Experts
论文作者:Haodong Lu, Chongyang Zhao, Minhui Xue, Lina Yao, Kristen Moore, Dong Gong
论文地址:https://openreview.net/pdf?id=P247k4ELcn
项目主页:https://artificer-ai-lab.github.io/MoRAM/
团队主页(UNSW Artificer AI Lab):https://donggong1.github.io/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢