报告主题:大模型记忆力暴涨,紧凑在线记忆提升大模型长期任务性能
报告日期:9月8日(周二) 14:30-15:30
大型语言模型在长期助手与智能体系统中,日益需要持续积累并复用历史信息。单纯扩大上下文窗口不仅成本高昂,还往往无法确保上下文信息被有效利用。我们提出了一种轻量级记忆机制——δ-memory(δ-mem):它在冻结的全注意力主干网络基础上,额外引入一个紧凑的、在线更新的联想记忆状态。δ-mem 采用“增量学习规则” 持续更新一个固定尺寸的状态矩阵,以压缩和表征过往信息;并在生成过程中,通过该状态矩阵的读出(readout)产生低秩修正项,动态调整主干网络的注意力计算。仅需一个8×8 尺寸的在线记忆状态,δ-mem 即可将平均任务得分提升至冻结主干网络的 1.10 倍,以及最强非 δ-mem 记忆基线方法的 1.15 倍。在对记忆能力要求更高的基准测试中,其增益更为显著:在 MemoryAgentBench 上达到 1.31 倍,在 LoCoMo 上达到 1.20 倍,同时基本保持了模型原有的通用能力。上述结果表明,无需完整微调、更换主干网络或显式扩展上下文长度,仅需一个与注意力计算直接耦合的紧凑在线记忆状态,即可高效实现具备实用价值的记忆能力。论文链接: https://arxiv.org/abs/2605.12357v1报告嘉宾:
张迪是复旦大学博士生,师从欧阳万里教授。他的研究方向聚焦于大语言模型、多模态推理与科学智能(AI for Science),重点致力于将领域知识与大型推理模型相连接。他曾共同作者多项具有影响力的工作,包括 *ChemLLM*、*ChemVLM* 与 *LLama-berry*,推动了大语言模型在科学发现与推理方面的前沿进展。他的论文累计获得900余次引用,并与来自斯坦福大学、NVIDIA Research 以及上海人工智能实验室等机构的研究者开展合作。他也曾担任 ACL、ICLR、NeurIPS 和 CVPR 等学术会议的审稿人。
更多活动
内容中包含的图片若涉及版权问题,请及时与我们联系删除
评论
沙发等你来抢