Awesome-AI-Memory
【中文 | [English](README_en.md)】

👋 简介
大语言模型(LLM)已迅速发展为强大的通用推理与生成引擎。然而,尽管其能力不断提升,LLM 仍然受到一个根本性限制的约束:上下文窗口(Context Window)长度有限。这一限制决定了模型在单次推理过程中能够直接访问的信息范围,使其在本质上仅具备短期记忆能力,难以支持长期对话、个性化交互、持续学习以及复杂的多阶段任务。
为突破上下文窗口的固有限制,面向大模型的记忆与记忆系统(AI Memory & Memory Systems for LLMs)逐渐成为一个重要且活跃的研究与工程方向。通过为模型引入参数之外的外部、可持久化且可控的记忆结构,记忆系统使大模型能够在生成过程中存储、检索、压缩和管理历史信息,从而在有限上下文中持续利用长期经验,实现跨会话的一致性与连续推理能力。
Awesome-AI-Memory 是一个围绕 AI 大模型记忆与记忆系统构建的资源汇编仓库,系统性地收集相关的研究论文、框架工具与实践经验。该仓库致力于梳理并呈现大模型记忆领域快速发展的研究脉络,连接自然语言处理、信息检索、智能体系统与认知科学等多个研究方向。
🎯 仓库目标
本仓库的目标是构建一个集中、持续演进的知识库,为研究者与工程实践者提供参考,助力构建能够长期记忆、持续推理并随时间不断适应的智能系统。
📏 项目范围
本仓库聚焦 Agent Memory 与语言模型内部记忆机制。记忆必须是论文的核心研究问题,并有明确的语言模型或多模态语言模型研究对象。
- 收录:智能体的长期、情节、语义、共享及经验形成的流程记忆;语言模型中的存储、保持、寻址、召回与遗忘;直接针对这些机制的评测、安全研究及综述。
- 流程技能:须具体研究从执行经验形成持久记录、跨任务复用及验证/维护的过程。静态技能包、提示词优化或通用自演化不因出现 skill/memory 关键词而收录。
- 排除:纯视觉或低层机器人状态、硬件/KV 缓存效率、泛化的 RAG/长上下文/工具路由,以及仅声称能迁移到 LLM 的相邻工作。高层语言智能体的具身/多模态记忆仍可收录。
- 证据不足先待复核:核实记忆使用者、内容、存取机制、核心贡献与验证依据;准确说明阅读范围,不将摘要核验称为全文核验。
详见 论文筛选规则与发布检查。
🔔 近期热点研究与新闻
- 2026-10-03 - 🎉 更新 118 篇论文,其中综述 1 篇,方法类与框架类论文 93 篇,数据集和评估基准类论文 16 篇,模型和系统类论文 8 篇
- 2026-09-29 - 🎉 更新 83 篇论文,其中综述 2 篇,方法类与框架类论文 47 篇,数据集和评估基准类论文 17 篇,模型和系统类论文 17 篇
- 2026-09-26 - 🎉 更新 20 篇论文,其中方法类与框架类论文 15 篇,数据集和评估基准类论文 2 篇,模型和系统类论文 3 篇
- 2026-09-23 - 🎉 更新 45 篇论文,其中方法类与框架类论文 29 篇,数据集和评估基准类论文 7 篇,模型和系统类论文 9 篇
- 2026-09-20 - 🎉 更新 25 篇论文,其中方法类与框架类论文 17 篇,数据集和评估基准类论文 4 篇,模型和系统类论文 4 篇
- 2026-09-15 - 🎉 更新 250 篇论文,其中综述 3 篇,方法类与框架类论文 180 篇,数据集和评估基准类论文 32 篇,模型和系统类论文 35 篇
- 2026-09-15 - 🎉 更新 1 篇论文,其中方法类与框架类论文 1 篇
- 2026-07-06 - 🎉 更新25篇论文,数据集和评估基准类5篇,方法类与框架类23篇
- 2026-06-21 - 🎉 更新27篇论文,模型和系统类9篇,数据集和评估基准类5篇,方法类与框架类13篇
- 2026-06-14 - 🎉 更新24篇论文,综述类2篇,模型和系统类4篇,数据集和评估基准类2篇,方法类与框架类16篇
- 2026-06-06 - 🎉 更新45篇论文,综述类1篇,模型和系统类6篇,数据集和评估基准类12篇,方法类与框架类26篇
- 2026-05-10 - 🎉 更新16篇论文,系统&模型类3篇,Benchmark类1篇,方法类12篇;并新增1个开源系统项目
- 2026-05-06 - 🎉 更新16篇论文,系统&模型类2篇,Benchmark类2篇,方法类12篇
- 2026-04-27 - 🎉 更新15篇论文,综述类2篇,系统与模型类3篇,方法类10篇
- 2026-04-17 - 🎉 更新46篇论文,综述类1篇,系统与模型类5篇,Benchmark类3篇,方法类37篇
- 2026-04-07 - 🎉 更新16篇论文,方法类15篇,Benchmark类1篇
- 2026-03-15 - 🎉 更新14篇论文,方法类14篇
- 2026-03-08 - 🎉 更新15篇论文,综述类3篇, 系统&模型类2篇,Benchmark类5篇,方法类5篇。
- 2026-03-02 - 🎉 新增一个代码agent到仓库中
- 2026-02-27 - 🎉 更新20篇论文,综述类1篇, 系统&模型类2篇,Benchmark类2篇,方法类15篇。
- 2026-02-26 - 🎉 更新14篇论文,方法类14篇
- 2026-02-14 - 🎉 更新15篇论文,综述类1篇,方法类12篇,benchmark类1篇,系统与模型类1篇
- 2026-02-09 - 🎉 更新15篇论文
- 2026-02-01 - 🎉 更新16篇论文,方法类9篇,benchmark类4篇,系统与模型类3篇
- 2025-12-24 – 🎉 发布仓库-V(1.0)
- 2025-12-10 – 🎉 仓库初始化
🗺️ 目录表
🧠 核心概念
-
大模型记忆: LLM的记忆机制融合了隐性知识(通过训练过程内化于模型参数中)与显式存储(运行时可检索的外部存储),这种双重架构使模型突破token处理的局限,具备类似人类"记忆过往、认知当下、预见未来"的认知能力。
-
记忆系统:为大语言模型实现记忆功能的完整技术架构,包含四大核心组件:
- 记忆存储层:向量数据库(如 Chroma、Weaviate)、图数据库或混合存储方案
- 记忆处理层:嵌入模型、摘要生成器与记忆分割器
- 记忆检索层:多阶段检索器、重排序模块与上下文注入器
- 记忆控制层:记忆优先级管理器、遗忘控制器与一致性协调器
-
记忆操作:通过记忆系统工具调用执行的原子级记忆操作:
- 写入:将对话内容转换为向量进行存储,通常结合摘要生成以减少噪声信息
- 检索:根据当前上下文生成查询语句以获取Top-K相关记忆
- 更新:通过向量相似度找到相关记忆并进行替换或增强
- 删除:基于用户指令或自动策略(如隐私数据过期)删除特定记忆
- 压缩:将多个相关记忆合并为摘要以释放存储空间
-
记忆管理:在记忆系统内实施记忆管控的方法论,包含以下机制:
- 记忆生命周期:从创建、活跃使用、冷启动访问到归档/删除的全周期管理
- 冲突解决:矛盾信息仲裁机制(如时间戳优先级、来源可信度加权)
- 资源预算:为不同用户/任务分配内存配额以防止资源滥用
- 安全治理:自动检测和去标识化个人身份信息(PII)
-
记忆分类:记忆系统特有的多维度分类体系:
- 按访问频率:工作记忆(当前任务)、常用记忆(个人偏好)、归档记忆(历史记录)
- 按结构化程度:结构化记忆(数据库记录)、半结构化记忆(对话摘要)、非结构化记忆(原始对话文本)
- 按共享范围:个人记忆(单用户)、团队记忆(协作空间)、公共记忆(共享知识库)
- 按时效属性:永久记忆(核心事实)、临时记忆(对话上下文)、时效性记忆(如"用户今天心情不好")
-
记忆机制:驱动记忆系统功能的核心技术组件:
- 检索增强生成(RAG):通过从知识库中检索相关信息来增强生成能力
- 记忆反思循环:模型定期"回顾"对话历史以生成高层次摘要
- 记忆路由:根据查询类型(个人记忆/公共知识库)自动选择检索源
-
显式记忆:以原始文本形式存储在模型外部的记忆,通过融合混合索引策略的向量数据库实现:
- 稠密向量索引:处理语义相似性查询
- 稀疏关键词索引:处理精确匹配查询
- 多向量索引:将长文档切分为多个部分,每个部分独立索引
-
参数化记忆:存储于语言模型固定权重中的知识与能力,具有以下特征:
- 作为模型的核心长期语义记忆载体
- 无需外部检索或显式上下文支持即可激活
- 提供零样本推理、通用响应与语言生成的基础能力
-
长期记忆:设计用于持久存储的关键信息,通常通过外部知识库实现,包含以下功能:
- 自动摘要生成:将多轮对话提炼为结构化记忆
- 上下文绑定:记录记忆上下文以防止错误泛化
- 多模态存储:同时保存文本、图像、音频等多种模态记忆
-
短期记忆:受限于注意力机制的大语言模型上下文窗口中的活跃信息,包含以下关键技术:
- KV缓存管理:复用键值缓存以减少冗余计算
- 上下文压缩:使用摘要替代详细历史(如:"前5轮对话讨论了项目预算")
- 滑动窗口注意力机制:仅关注最近N个token,同时保留特殊标记
- 记忆摘要注入:将长期记忆摘要动态插入短期上下文
-
情景记忆:记录特定用户交互历史的记忆类型,是个性化AI的基础:
- 用户身份识别:跨会话识别同一用户
- 交互轨迹记录:保存用户决策路径与反馈
- 情绪状态追踪:记录用户情绪变化规律
- 偏好演化建模:捕捉用户兴趣长期变化
-
记忆遗忘:大模型中刻意设计的遗忘机制,包含以下技术实现:
- 选择性遗忘(机器遗忘):移除训练数据中特定信息的影响,例如通过遗忘层覆盖特定知识
- 隐私保护遗忘:自动识别并删除个人身份信息(PII),或设置自动过期策略
- 记忆衰减:根据使用频率自动降低低频访问记忆的优先级
- 冲突驱动遗忘:当新证据与旧记忆冲突时,策略性更新或淘汰旧记忆
-
记忆检索:从海量记忆库中精确定位相关信息的复杂过程:
- 语义预过滤:通过向量相似度匹配获取Top-100候选结果
- 上下文重排序:根据当前查询上下文重新排序结果
- 时间过滤:优先选择最新相关数据
-
记忆压缩:在资源受限条件下最大化记忆效用的技术体系:
- 内容级压缩:提取核心信息并舍弃冗余细节
- 表征级压缩:向量量化(如乘积量化编码)、维度约简
- 组织级压缩:聚类相似记忆、构建分层记忆结构
- 知识蒸馏:将外部记忆中的关键模式迁移至参数化记忆
📚 论文列表
以下论文按发表日期排列:
综述
时间
论文与摘要
标签
链接
2026-09-30
The Evolution of Attention in Large Language Models: Mechanisms, Trade-offs, and Emerging Trends
• 将注意力演化视为模型内部上下文记忆的表示、更新、访问、读取与整合问题。
• 梳理 59 个发布记录与 11 个开放端点,比较显式缓存、循环状态、稀疏访问及跨层复用。
• 提出多维有状态记忆路由假设;属于机制综述与架构归纳,不是统一受控性能实验。
2026-09-25
Machine Unlearning for Large Language Models: Foundations, Advances, and Agentic Extensions
• 综述模型参数及智能体外部状态中的遗忘。
• 使用五层系统框架和六类证据维度比较移除主张及恢复测试。
• 指出仅评测模型不足以证明记忆、工具和后续更新中的影响已移除。
2026-09-25
Amnesia by Design, Memory By Necessity: Persistent State for Document Intelligence
• 以持久、证据可追溯的状态重新梳理文档智能。
• 定义状态操作,并按八项标准审查十个评测集。
• 发现跨会话状态演化缺乏覆盖,提出五项纵向评测指标。
2026-09-08
Graph-Based Personalized Memory for LLM Agents: Representation, Evolution, Retrieval, and Evaluation
• 综述长期个性化智能体的图记忆。
• 围绕表示、演化、检索和评测组织研究。
• 比较设计选择,并梳理可靠性与可控性挑战。
2026-07-28
Memory for Large Language Models
• 从模型架构视角综述大语言模型记忆。
• 按表示形式、更新动态及持久性组织记忆机制。
• 综合分析写入、路由、固化、效率权衡及评测方向。
2026-07-20
The Chronos Vulnerability: A Taxonomy of Temporal Persistence and Memory-Based Deception in Agentic AI
• 分类梳理有状态智能体中的时间持久攻击。
• 分析记忆注入、延迟欺骗及工作流级威胁模型。
• 综合轨迹监控、形式验证及可信记忆等防御方向。
2026-06-25
Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents




[](https://arxiv.org/pdf/2606.26627v1)
• 本文从数据中心视角综述 LLM Agent 的隐私问题,关注智能体查询、存储、记忆、交换并据此行动的数据,而不只是按攻击类型分类。
• 论文围绕数据库、文档集合、API、跨会话记忆、中间工作流状态和多智能体通信组织风险,指出敏感信息可能在最终回答生成前就通过多种路径泄露。
• 该综述强调 Agent 隐私需要覆盖记忆写入、检索、委托、日志和工具调用的全生命周期控制,因此持久状态与数据治理是安全部署的核心问题。
2026-06-23
Are We Ready For An Agent-Native Memory System?




[](https://arxiv.org/pdf/2606.24775v1)
• 本文从数据管理视角研究 Agent Memory,指出面向 LLM Agent 的记忆不应只被视作检索增强组件,而应作为支持持久化存储、检索、更新、整合与生命周期治理的系统来评估。
• 论文将 Agent 原生记忆系统拆解为四个模块:表示与存储、提取、检索与路由、维护,并在这一框架下评估了 12 个代表性记忆系统和 2 个基线,覆盖 5 类基准工作负载与 11 个数据集。
• 实验表明不存在一种在所有场景下都占优的记忆架构,效果高度依赖记忆结构与工作负载瓶颈的匹配;细粒度消融进一步量化了表示保真度、检索精度、更新正确性和长程稳定性等因素,成本分析也显示局部维护通常比全局重组更高效。
2026-06-10
Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application




[](https://arxiv.org/pdf/2606.12191)
• 本文系统梳理了LLM代理环境的全生命周期框架,覆盖建模、合成、评估与应用四个核心环节。
• 提出了符号与神经两类环境合成范式,并从结构属性与能力维度分析了环境设计的演化路径。
• 强调代理与环境的协同演化机制(记忆、工作流、轨迹与探索),并指出未来将走向环境即服务与多代理生态。
2026-06-09
Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation




[](https://arxiv.org/pdf/2606.10749)
• 本文从生命周期视角系统刻画LLM代理的安全风险,并统一建模信息流、授权委托与持久状态三类关键交互。
• 通过综述247篇研究,归纳攻击面、防御机制与评估体系,揭示当前安全方法整体仍偏脆弱且不完整。
• 强调需要构建可信边界清晰、权限控制原则化、且贴近真实环境的长期状态安全评估框架。
2026-06-04
Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads




• 将 Agent Memory 定位为长程有状态工作负载,而不只是检索增强模块。
• 提出系统导向分类法和阶段感知 profiling 工具,用于拆解构建、检索和生成成本。
• 分析十个代表性系统,并总结面向规模化部署、新鲜度与延迟权衡的系统建议。
2026-05-23
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory




• 提出 MemEye,一个以视觉为中心的基准测试,用于评估多模态 Agent 的长期记忆能力,避免文本主导的"捷径"问题。
• 设计了二维评估矩阵(X轴:场景/区域/实例/像素粒度;Y轴:原子检索/关系关联/演化合成推理深度)。
• 引入三阶段验证闸门,确保问题无法通过文本上下文、简短字幕或超出 VLM 能力的方式被解决。
2026-06-01
EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning




• 提出 EverMemOS,一个三阶段记忆生命周期(情景记忆形成 → 语义整合 → 重构式回忆),将碎片化对话组织为结构化、可演化的记忆单元(MemCell/MemScene)。
• 引入 MemCell 作为原子记忆单元,包含 Episode + Atomic Facts + Foresight + Metadata;MemScene 用于场景级整合,支持长期用户画像演化。
• 设计重构式检索范式,包含 MemScene 引导检索、前瞻有效性过滤和充分性验证,实现长期推理中"必要且充分"的上下文获取。
2026-05-19
An Agent-Oriented Pluggable Experience-RAG Skill for Experience-Driven Retrieval Strategy Orchestration




• 识别了流水线式检索的三个工程问题:策略逻辑不可复用、路由决策不可观测、工作流耦合导致不可演进。
• 提出 Experience-RAG Skill,包含六个模块(统一接口、场景分析、经验记忆、策略路由、检索器池、结果打包),将检索策略选择封装为可插拔的 Agent skill。
• 规则路由(0.8924)优于学习路由(0.8778/0.8627),经验记忆记录 (scene_features, score_vector, best_margin) 为未来升级到学习路由奠定基础。
2026-04-17
Human Cognition in Machines: A Unified Perspective of World Models





• 从认知架构视角统一梳理世界模型中的记忆、感知、语言、推理、想象、动机与元认知等能力。
• 提出面向科学发现的 Epistemic World Models 类别,并给出跨视频、具身与认知世界模型的分类和未来方向。
2026-04-17
Agentic Frameworks for Reasoning Tasks: An Empirical Study





• 对 22 种常用 Agentic 框架在 BBH、GSM8K 与 ARC 上进行统一评测,比较准确率、耗时、成本与跨基准一致性。
• 结果表明性能差异主要来自编排质量,尤其是记忆控制、上下文增长和失败重试机制会显著影响效率与成本。
2026-04-09
Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering


• 从“外化”视角综述 LLM Agent 的记忆、技能、协议与 harness 工程。
• 指出记忆外化跨时间状态,技能外化程序能力,协议外化交互结构,harness 负责统一协调这些模块。
• 梳理了从模型参数到上下文再到外部基础设施的演进路径,并讨论其中的关键权衡与开放问题。
2026-03-05
Beyond the Context Window: A Cost-Performance Analysis of Fact-Based Memory vs. Long-Context LLMs for Persistent Agents


• 解决业界关于长上下文模型与外部记忆系统在构建持久化代理时的效能与成本优劣之争。
• 在三大主流记忆基准上,从准确率与累计 API 推理成本双重维度,系统交叉评测长上下文与事实型外部记忆方案。
• 长上下文在事实召回上具有优势,但成本随轮次递增;在 100k 上下文长度下,记忆系统在约 10 轮交互后即可实现成本反超,为实际工程选型提供了量化依据。
2026-03-02
Modular Memory is the Key to Continual Learning Agents


• 传统基础模型在持续学习时依赖权重更新,极易导致灾难性遗忘,难以实现大规模经验积累。
• 提出一种结合上下文学习与权重内学习的模块化记忆架构路线图。
• 该架构利用上下文学习实现快速适应,通过权重更新实现能力固化,为构建真正意义上的终身学习智能体提供了理论指引。
2026-03-02
Emerging Human-like Strategies for Semantic Memory Foraging in Large Language Models


• 旨在探究大语言模型内部在处理海量语义记忆时,是否具备类似人类的高效策略性访问机制。
• 借助机械可解释性技术分析语义流畅性任务,严密剖析模型内部收敛性与发散性的记忆搜索模式。
• 证实 LLM 不同层级中存在类人的策略性记忆搜寻行为,为认知对齐研究及强化人机协作奠定了可解释性基础。
2026-02-26
Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions



• 本论文探讨了个性化LLM驱动代理的基础、评估和未来方向,对个性化 LLM 驱动代理的基础、评估及未来方向进行了能力导向的系统性综述。
• 论文围绕用户画像建模、记忆、规划和行动执行这四个相互依赖的核心组件构建了分类法。
• 本文综合分析了用户信号的表示、传播与利用方式,并探讨了从通用辅助到专业领域的应用场景及设计权衡。
2026-01-14
Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey



[](https://arxiv.org/pdf/2602.06052)
• 从存储介质、认知机制和服务主体三个维度构建了统一的分类框架,系统化地定义了基础智能体记忆的分类学。
• 深入剖析了记忆在单智能体与多智能体系统中的动态操作机制,并归纳了提示词学习、参数微调和强化学习三种主流的学习策略。
• 全面梳理了现有的评价指标与基准测试体系,并结合多领域应用现状,提出了提升记忆效率、安全性及多模态能力的未来研究方向。
2025-12-15
Memory in the Age of AI Agents: A Survey



[](https://arxiv.org/pdf/2512.13564)
• 提供了一个全面且最新的智能体记忆全景图,明确将其与 LLM 记忆、RAG 和上下文工程等相关概念区分开来。
• 引入了一个统一的分类体系,通过三个视角审视记忆:形式(Token 级、参数化、潜在)、功能(事实性、经验性、工作)和动态(形成、演变、检索)。
• 探讨了新兴的研究前沿,如面向自动化的记忆设计、强化学习集成和可信度,同时汇编了具有代表性的基准和框架。
2025-09-18
A Survey of Machine Unlearning
[](https://dl.acm.org/doi/full/10.1145/3749987)
• 深入探讨了机器遗忘的概念和背景,强调了其在现代机器学习中的重要性。
• 机器遗忘旨在使学习算法能够有效地消除特定数据的影响,而无需进行完整的模型重新训练。
• 论文分析了机器遗忘的必要性、挑战和设计要求,回顾了当前的研究进展,并强调了该领域在算法有效性、公平性和隐私保护方面的复杂性和多样性。
2025-09-02
A Survey on the Memory Mechanism of Large Language Model based Agents
[](https://dl.acm.org/doi/pdf/10.1145/3748302)
• 探讨了基于 LLM 的智能体的记忆机制,强调了记忆在智能体自我进化和复杂交互中的关键作用。
• 系统总结和分类了现有的记忆模块设计和评估方法,并分析了它们在不同应用场景中的作用和局限性。
• 此类智能体能够改善决策制定和任务执行。
2025-05-31
A Survey of Machine Unlearning in Large Language Models: Methods, Challenges and Future Directions

[](https://arxiv.org/pdf/2503.01854v2)
• 论文调查了大语言模型(LLM)中的机器遗忘,旨在有效消除不良数据(如敏感或非法信息)的影响,无需完全重新训练,同时保留整体模型效用。
• 它定义了 LLM 遗忘的目标和范式,并建立了一个全面的分类体系。
• 论文回顾了现有方法,评估了它们的优势和局限性,并讨论了未来的研究机会。
2025-05-27
Rethinking Memory in AI Taxonomy, Operations, Topics, and Future Directions
[](https://arxiv.org/pdf/2505.00675)
• 探索了人工智能(AI)中关于记忆的多维研究,特别关注大语言模型(LLM)中的记忆操作和管理。
• 对各种类型的记忆表示和操作(包括整合、更新、索引、遗忘、检索和压缩)进行了分类,并系统分析了记忆在 AI 中的重要性及其实现方式。
• 通过广泛的文献回顾,论文确定了四个关键研究主题:长期记忆、参数化记忆、长上下文记忆和多源记忆整合。
2025-04-24
Cognitive Memory in Large Language Models
[](https://arxiv.org/pdf/2504.02441)
• 对大语言模型(LLM)中的记忆机制进行了全面考察,特别关注不同类型的记忆及其在模型中的作用。
• 虽然 LLM 在信息检索和交互总结方面表现出色,但其长期记忆仍然不稳定。
• 将记忆集成到 AI 系统中对于提供上下文丰富的响应、减少幻觉、提高数据处理效率以及实现 AI 系统的自我进化至关重要。
2025-04-23
From Human Memory to AI Memory A Survey on Memory Mechanisms in the Era of LLMs
[](https://arxiv.org/pdf/2504.15965)
• 探讨了人类记忆与基于 LLM 的人工智能(AI)系统的记忆机制之间的关系。
• 主要贡献包括系统定义了 LLM 驱动的 AI 系统中的记忆,及其与人类记忆的概念联系。
• 论文提出了一个基于对象、形式和时间的三维记忆分类体系,并总结了当前个人记忆和系统记忆研究中的关键开放问题。
2025-04-02
Digital Forgetting in Large Language Models: A Survey of Unlearning Methods
[](https://arxiv.org/pdf/2404.02062)
• 论文探讨了大语言模型(LLM)中的数字遗忘及相应的遗忘方法,重点是解决与隐私、版权和社会伦理相关的问题。
• 它分析了不同类型的模型架构和训练过程,以及数字遗忘的实际方法,包括数据重新训练、机器遗忘和提示工程。
• 通过引入“遗忘保证”的概念,论文强调了精确遗忘和近似遗忘的有效机制。
2025-01-12
Human-inspired Perspectives: A Survey on AI Long-term Memory
[](https://arxiv.org/pdf/2411.00489)
• 本文系统地考察了人类长期记忆机制与 AI 长期记忆之间的相互作用,并提出了一种自适应长期记忆认知架构(SALM)。
• 它介绍了人类记忆的结构,包括感官记忆、工作记忆以及不同类型的长期记忆(情景记忆、语义记忆和程序记忆)。
• 论文分析了 AI 长期记忆的分类——参数化记忆和非参数化记忆——及其存储和检索机制。
方法类与框架类论文
时间
论文与摘要
标签
链接
2026-10-01
Role-aware Heuristic Episodic Attention for Conversational LLMs
• 为全局指令与情节交互赋予不同保留策略,减少长对话中的注意力稀释和漂移。
• REA 保留指令前缀与用户输入,压缩模型回复,再按启发式选择原文、压缩表示或省略。
• Long-MT-Bench+ 分数从 6.32 升至 7.36,延迟改善 2.91 倍;评测含三个骨干及中英角色扮演。
2026-10-01
Madeleine: Learning Involuntary Recall for Conversational Memory from Simulated Lives
• 学习当前话语与不相似但相关生活记忆的联想召回。
• Madeleine 从模拟人生生成线索配对,在冻结相似度之上训练查询编码器的联想残差,在线不调用 LLM。
• 接入 HyperMem 得分 66.6,单独使用接近原 HyperMem 且上下文约为其 1/21;结果依赖官方 LoCoMo-Plus 协议。
2026-10-01
FlashBack: Knowing When to Remember in Streaming Vision-Language Models
• 研究历史视频记忆何时应被读取,避免不必要历史干扰实时感知。
• FlashBack 先判断历史证据需求,再用独立 Recall 轨迹及查询局部 Side-KV 融合长短期证据,不改持久 Native 状态。
• 在 OVO-Bench 和 StreamingBench 的多项记忆任务改善,实时能力大致保留;无需额外训练。
2026-10-01
Sleeping Secrets: How Fine-Tuning Reawakens Privacy Risks in Language Models
• 研究输出不可见的私有关联能否在少量再训练后恢复。
• ReGap 由模型生成候选并以似然筛选,再训练 LoRA,不提供秘密答案或私有辅助数据。
• 六模型提升 6–21 个百分点;已暴露关联恢复率 42% 到 63%,未暴露对照无增益,表明潜在记忆残留。
2026-10-01
Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States
• 将历史组织为当前世界估计和未完成需求的显式信念状态,研究持续更新与失效恢复。
• PoS 检查状态一致性及任务进展,识别无进展陷阱后按陷阱与需求类型恢复。
• 四个执行和诊断基准上取得所测最佳总体表现;消融支持一致性验证与恢复,未证明开放世界可靠性。
2026-10-01
Managing Context and Communication in Distributed Agentic UAV Swarms
• 将运行知识写为原子笔记,区分核心、本地和伙伴专属共享记忆。
• 按事件驱动推理维护状态,以接收者相关的语义新颖度和时效选择 gossip 传播。
• 模拟搜救全部运行完成,泛洪仅 70–85%;推理 token 约减半,证据限于十机仿真。
2026-10-01
Not All Experience Belongs in the Weights: Component Routing for Self-Improving GUI Agents
• 拆分定位器、流程、状态事实和教训,比较经验进入参数或上下文记忆的适合度。
• 同一经验池受控分流,以重复性和状态条件性预测去向,并检验写入参数后外部笔记读取变化。
• 在留出骨干 24/24 单元预测去向,平均比较优单一路径高 3.5 分;证据覆盖两环境三种子。
2026-10-01
SIEVE: Selective attention-value Suppression for Vision-Language Models Unlearning
• 对同一人的敏感与允许信息实施选择性遗忘,而非整体移除身份知识。
• SIEVE 抑制待忘信息的注意力值,并结合冻结保留模型匹配与序列目标。
• 跨模型、多模态实验报告隐私删除与保留权衡改善;有效性限于测试的信息和访问方式。
2026-10-01
Typological Alignment of Stack-Based Language Models on Mildly Context-Sensitive Artificial Languages
• 研究堆栈工作记忆限制与语言顺序偏好及跨序列依赖泛化的关系。
• 在多种人工语言中比较堆栈语言模型对层次与跨序列依赖的学习。
• 模型普遍难学跨序列依赖,但有限工作记忆反而改善泛化;证据为人工语言模拟,非自然语言普遍定律。
2026-10-01
Causal Memory Policy: Making Memory Utility Identifiable by Intervening on Retrieval
• 指出从未被召回的记忆无法仅靠存储级操作估计效用,影响保留决策。
• CMP 预留上下文槽按已知概率抽样记忆,并用逆倾向加权估计召回介导的因果效用。
• 必要记忆识别 AUC 从 0.54 升到 0.66,但已识别效用仍不能预测未见查询的保留价值。
2026-10-01
AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents
• 学习何时压缩探索历史、保存哪些工作状态以及如何从摘要继续。
• AutoCompact 先用纠正后的轨迹监督,再联合强化学习编码与压缩行为。
• SWE-bench Verified 和 SWE-PolyBench Verified 分别提升 9.2、5.0 个百分点;256K 不溢出窗口仍有收益。
2026-09-30
Action Conditioned Bisimulation For GUI Agent Memory
• 用动作结果而非页面视觉相似度决定何时合并 GUI 经验状态。
• 在经验预测状态图上,仅当共享动作的结果与后继块一致时按可供性标签合并。
• 闭环实验提高成功率,等探索绕行、旧合并规则及无动作条件版本无同样收益;证据限于 MiniWoB++。
2026-09-30
STRATA: Self-Learning Through Role-Aligned Tiered Agents for Real-Time Strategy Games
• 从完整比赛轨迹形成跨比赛战略经验卡,持续验证后供战略层检索。
• Review Agent 在后续比赛检验修订候选经验,将多局支持的内容压缩为卡片。
• 固定场景观察胜率从 30% 到 100%,不同对手产生不同经验;样本和场景有限,非一般游戏胜率。
2026-09-30
MEMO: Multi-Level Entity-Aware Memory for Streaming Video Understanding
• 按实体、场景语义和空间结构组织流式视频记忆,避免粗粒度压缩丢失细节。
• 轻量全局与实体表示作索引,高分辨率证据另存,查询时选择性回读。
• 在 StreamingBench 和 OVO-Bench 改善多个骨干;方案免训练,但需保存可回读视觉内容。
2026-09-30
Learning What to Forget: Distributional Unlearning for LLM Representation Spaces
• 研究有限预算下怎样选择待忘样本以改变目标知识分布。
• Mamushi 以遗忘与保留密度比导出非参数最优选择,并分析分布迁移界。
• 毒性和主题域实验以较少样本改善遗忘与保留折中;理论依赖分布假设,实验证据不等于完整擦除。
2026-09-30
Switching Linear Attention
• 用固定状态中的多个线性记忆组件提高关联召回与上下文学习能力。
• 将状态更新推导为混合线性回归的在线 EM,每个输出维按输入动态选择组件。
• 在关联召回、上下文语言学习及语言建模上缩小与 softmax 差距,部分设置超过;未宣称所有任务均优。
2026-09-30
RefCon: Iterative Refinement and Contrastive Memory Extraction for Context-Evolving Agent
• 从有噪交互轨迹抽取可复用记忆,研究无金标准时的推理计算扩展。
• RefCon 联合顺序自修订与并行自对比,多轨迹提高记忆质量。
• AppWorld 与 BFCL-V3 上 ACE、ReMe 相对提高 21.6%、16.6%;多样性变体在 ReasoningBank 提高 35.5%,收益与 token 成本相关。
2026-09-30
Beyond the Remembered World: Predictive 4D Belief for Persistent Navigation in Evolving Worlds
• 从带时间戳的物体历史维护位置持久性、迁移与未知位置的概率记忆。
• EvolvingNav 随时间传播信念,用可见性校准的正负观察更新,避免重复计入证据。
• EvoWorld-Bench 含 54 场景与 803,680 任务,仿真及实机改善搜索;收益在可学习时间模式下最明显。
2026-09-30
Faithful Dual-constrained Erasure for Robust LLM Safety Alignment
• 分析危险知识被表面抑制而非删除后,良性再训练使其复现的机制。
• FDCU 用 Fisher 约束保护一般知识,并以双掩码阻止异常启用抑制参数,引导目标表示擦除。
• 报告对再训练攻击更稳健且一般效用损失较小;为所测知识擦除与输出控制任务,非删除的形式保证。
2026-09-30
PatchKV: Weight-Space Compensation of KV Cache
• 将被压缩 KV 缓存丢失的部分上下文写入一次性权重补丁,研究上下文存储载体的补偿。
• PatchKV 以闭式岭回归对齐完整与压缩缓存下的参考查询激活,随后合并权重,供同上下文多个查询读取。
• 在最长 170K token 的 SCBench、SQuAD、NIAH 和 GSM8K 上改善压缩效果;限定于单上下文、多查询设置。
2026-09-30
Experimental Experience Modeling for Autonomous Research
• 从实验轨迹提炼可重复使用的决策经验,并按缺失证据扩充经验库。
• EEM 检索历史记录判断方向是否值得投入;不足时运行低成本试验,再将结果巩固供未来决策。
• 研究基准上改善表现并降低模型交互开销;摘要未提供统一数值或领域外保证。
2026-09-30
Forking: Sudden Overfitting Under Replay
• 分析数据重放下 n-gram 记忆分支对训练续写过度编码造成的突然过拟合。
• 通过受控模型研究重复更新、低频上下文及表拥挤程度如何改变已见与未见续写概率。
• 在基础训练及短预算重复 SFT、类 RL 设置复现损失分叉;更长训练或拥挤表能抑制,非所有重放必然失效。
2026-09-30
LatentHarness: Learning Latent Actions for Memory and Reasoning via Counterfactual Policy Distillation
• 将输入证据和中间推理状态保存在快权重记忆中,联合学习召回与继续计算的选择。
• 内部策略选择 THINK、RECALL 或 EXIT;单步反事实分支按输出 token 收益蒸馏策略与记忆保留。
• 六基准中一般及长上下文推理相对提升 2.8% 和 10.0%;相对最强长上下文基线推理快 5.9 倍。
2026-09-30
LARC: Low-Rank Adaptive Residual Connections for Learning in Frozen Models
• 以低秩残差保存反馈引起的临时内部更新,分离慢初始化、快写入和重置生命周期。
• LARC 在固定语言模型输入侧使用秩 4、12,288 参数状态,通过真实或打乱反馈及保留/重置对照测量后续读取。
• 程序选择误差下降 24.65/36.65 个百分点但仍差于直接规则;CI 回放保留更新使半 Brier 损失从 0.1274 恶化至 0.1808。
2026-09-30
Replay on Demand: An Emergent Curriculum for Balancing Adaptation and Forgetting in Continued Pretraining
• 将旧数据回放配额作为随知识遗忘变化的动态控制量。
• Replay on Demand 在固定预算下联合估计学习潜力与已观察遗忘,按需分配回放。
• 多个模型中达到或改善调优固定回放及模型合并的权衡前沿;不要求预先固定回放比例。
2026-09-30
Persistent Context Graphs for Efficient Memory Compaction in LLM Agents
• 将历史注意力重要度与消息依赖保存为持久上下文图,供新请求选择记忆。
• ReCAP 联合已存重要度、当前相关性及依赖遍历保留消息和支撑上下文,选择阶段不额外调用模型。
• 估计压缩及冷恢复延迟下降约 95%;SWE-Together 历史量约减半且质量相当,延迟为估计指标。
2026-09-30
ChainLoRA: Geometry-Preserving Task Vector Merging for Continual Learning in LLMs
• 针对连续适配器合并中方向重叠和系数耦合导致的旧知识遗忘。
• ChainLoRA 用链式旧知识载体、单侧正交代理和自适应 SVD/Procrustes 对齐维护更新。
• Large SuperNI 上在无回放方法中报告最佳表现,并与标准设置竞争;结果依赖顺序学习协议。
2026-09-30
MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories
• 将视频写为实体落地的第一人称文本情节,并研究增长记忆中的证据遗漏和检索竞争。
• MemLife 使用时间索引智能读取器;MemOpt 以强化学习优化写入忠实性、信息量和可检索性。
• 四个长期基准比最强免训练基线高 4.6–12.0%,写入优化再高 2.7–5.0%;查询时不访问原视频。
2026-09-30
Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning
• 检查目标知识在跨语言、跨文字和释义访问下是否仍可恢复。
• COVER 覆盖 174 种语言和 25 类释义,以冻结模型和良性校准选择有限预算的遗忘源。
• 两个遗忘集合中,相对均匀选择降低留出残余访问 7.8–27.3%;仍为有限探测覆盖。
2026-09-30
ZoneClaw: Mitigating Persistent Memory Attacks by Establishing Memory-Zoning in OpenClaw-Style Computer-Use Agents
• 把持久保存外部声明与赋予行动权限分开,阻断跨任务记忆注入。
• ZoneClaw 设置分层信任区域和不对称权限进程,只有经可信区域交叉校验的内容才能晋升。
• 攻击成功从 372/480 降至 6/480,458/480 次保留效用;防御感知攻击覆盖有限场景。
2026-09-30
Rules Amortize, Pairings Don't: Linguistic Structure Determines What Latent Task Representations Can Replace In-Context Learning
• 比较规则性任务与任意配对能否压缩为可复用的内部任务记忆。
• 从支持样本几何提取质心子空间和谱,驱动条件残差表示,并测试错误任务与留一任务迁移。
• 规则任务可摊销,任意配对仅达约半数上下文学习效果;未见任务迁移为零,限制了跨任务复用结论。
2026-09-30
LabBook: Harnessing Experimental History for Efficient LLM-Driven Discovery
• 以可更新实验笔记指导完整实验日志的选择性读取和新程序生成。
• 每轮由同一智能体结合笔记与检索证据,同时输出下一程序和修订后的 LabBook。
• 49 个 Frontier-CS 问题上改善质量成本折中,并在另九任务有竞争力;结论相对所测演化基线。
2026-09-29
Eternal Sunshine of the Spotless Mind: Systematically Erasing LLM's Memories
• 研究删除请求后关联消息仍泄漏目标信息的问题,提出 DeLLM 记忆删除框架。
• 动态组装查询上下文,并维护消息来源图,沿依赖关系确定需要一并删除的内容。
• 实验报告较高删除率且保留效用;简单关键词或消息匹配不足,摘要未给出统一删除率。
2026-09-29
MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization
• 把用户历史偏好和约束压缩为固定数量软记忆向量,按读取后的任务行为优化。
• 联合组相对结果奖励与置信度门控的在策略蒸馏;文本记忆教师只重评分学生轨迹,推理时移除。
• PersonaMem 两种长度上取得所测最高准确率,并迁移到 PrefEval 和 LongMemEval;消融显示主要收益来自奖励项。
2026-09-29
Triadic Linear Attention: Three-Dimensional Recurrent States for Long-Context Sequence Modeling
• 将历史键值写入三阶张量记忆,以额外键轴扩大可寻址状态。
• 通过键、第二键和值的三元外积写入,用双查询收缩读取;兼容遗忘门、Delta 更新和分块并行训练。
• 报告长上下文语言建模与召回优于其他扩容方案;摘要未给出统一量化增益。
2026-09-29
Long-Term Memory-Guided Enhancement for Target Perception in Audio-Language Models
• 保存干净参考录音的类别隐状态,作为目标声音的长期表征记忆来抵抗声音干扰。
• 利用类别记忆重构输入音频 token,再与原 token 插值后送入冻结语言骨干;语音恢复另加可学习门控。
• 20 类诊断中分类增益为 29.53–46.15 个百分点;加门控的 Qwen2-Audio 词错率由 23.07% 降至 14.77%,证据为受控目标感知。
2026-09-29
MemEvo: Automatic Discovery of Streaming Video Memory Mechanisms
• 把持续视频观测的有界记忆设计转为可执行程序搜索,研究保留、巩固和召回机制。
• 领域语言显式规定表示、准入、保留、合并和预算;LLM 根据实验反馈提案,确定性流水线检验因果与容量约束。
• 在 StreamingBench 与 OVO-Bench 报告效果及效率改善;发现阶段依赖候选执行评估,运行时无需训练。
2026-09-29
Simple Agentic Memory for Generalist Robot Policies
• 按任务指令建立实体关系、进度和顺序状态,补足高层子目标中依赖历史的参数。
• SimpleARM 用感知与事件工具在线写入,结构化查询按需召回,再用当前视野重新定位实体;模型参数冻结。
• RoboMME 成功率 67.17% 对最强非 oracle 基线 44.51%;只验证回合内状态,使用基准专属解析规则,尚无真实机器人结果。
2026-09-29
Do LLMs Really Forget? Hidden-State Leakage in Model Unlearning and How to Fix it
• 指出输出解码不敏感并不意味着隐藏表示中的目标知识已被擦除。
• PARS 使用生成式隐藏状态探针恢复残留知识,并把对抗探针目标加入遗忘。
• 在 TOFU、MUSE、WMDP 发现安全表象下的可恢复信息;提升探针抵抗不等于对所有攻击的删除证明。
2026-09-29
Gödel Forest: Balancing Search Depth and Breadth for Data-Centric Recursive Self-Improvement
• 把各搜索树的成功与失败蒸馏为共享流程经验,使其他树复用经过模型反馈验证的发现。
• 持久树按反馈扩展或剪枝,围绕全局排行榜持续更新紧凑经验,传播失败警告和有效搜索方向。
• RSIBench-Data 六领域平均优于单智能体 10.70%;共享记忆消融比独立并行搜索高 7.00%,结论限于数据策略搜索。
2026-09-29
ATTUNER: Recomputation-Free KV Cache Reuse via Query-Side Adaptation
• 将独立缓存质量下降定位到多个内容块之间的选择,而非已存表示丢失。
• ATTUNER 对查询投影加低秩适配器,用完整预填充分布蒸馏读取固定 KV,因果替换注意力分数验证定位。
• 七基准匹配完整预填充质量且最高快 3.73 倍;训练参数少于 0.05%,不是任意模型缓存保证。
2026-09-29
EASE: Behavior-Adaptive Skill Curation for Self-Evolving Agents
• 根据执行器行为维护由轨迹形成的技能库,研究跨执行器复用时的失配。
• EASE 用在线行为画像、当前轨迹和检索技能决定添加、修改或删除,以时间归因训练共享管理器。
• 三环境减少 34.5–41.0% 技能并改善检索与编辑效用;无需逐执行器微调,仍依赖训练覆盖。
2026-09-29
GitHarness: Git Init Your Harness Working Memory for Perpetual User Requirements
• 把需求及对应工作状态组织为可分支的版本记忆,保留仍有效的历史成果。
• Git Agent 学习识别变化并选兼容历史状态,通过统一恢复与分支接口排除旧信息。
• MTAgentBench 跨五类任务报告效果、有效工作保留和执行效率改善;摘要未给统一数值。
2026-09-29
EGSD: Event-Grounded Self-Distillation for Streaming Video Understanding
• 减少特权问题监督造成的记忆实体覆盖坍塌,保留未来未知查询所需事件。
• EGSD 以可验证实体、动作和细节重权教师信号,并将实体覆盖奖励与结果奖励结合。
• StreamingBench 79.8%、OVO 实时轨 73.4%;有效实体召回高 17.4%,记忆长度多 6.8%,为作者报告。
2026-09-29
UpliftMem: Learning Set-Level Uplift for Agent Memory Retrieval
• 按相对无记忆执行器的集合级收益学习召回哪些经验组合。
• UpliftMem 以样本信息价值选择训练期替代集合探测,冻结执行器训练评分器,测试时无需额外探测。
• 主测试集优于所测基线,固定库与同探测预算控制支持收益;理论闭式推导依赖相关高斯模型。
2026-09-29
XRepoSkill: Learning Transferable Skills for Software Engineering Agents
• 从成功失败轨迹的行为差异提炼带适用条件的规则,避免把偶然行为当成有效经验。
• XRepoSkill 用可执行谓词跨轨迹验证,仅保留跨多个仓库重现的规则,再巩固并按新问题检索。
• 六个基准模型组合解决率最高,DeepSWE 比无技能高 10.3 点、最强技能基线高 5.0 点;评测仓库不在学习池。
2026-09-29
SafeVantage: Vantage-Aware Memory for Reliable Embodied Decisions
• 为语义声明保存支撑视角、姿态和目标位置,将正证据与搜索覆盖分开。
• SafeVantage 预测候选位置可观测性,据预期决策损失选择观察,再结合证据决定肯定、否定或弃答。
• ProcTHOR 等受控测试改善风险与 F1;恢复支撑视角的 ScanNet 干预改善 VLM 回答,证据仍限于所测类别存在任务。
2026-09-29
CoEM: Empowering Long-Context Reasoning with Commit-on-Evidence Memory
• 延迟将原始证据压缩成事实,减少尚未看清用途时的不可逆信息丢失。
• CoEM 在待定集合保留原文,策略决定提交、继续等待或丢弃,冻结验证器检查事实支持并用步骤奖励训练。
• 6,400 文档输入设置中比最强记忆基线高 10.4–11.4 F1;结果限定该长上下文评测。
2026-09-29
Practical Secrets Extraction against Black-box LLMs
• 审计黑盒语言模型是否仍会泄漏训练中记住的凭证。
• 用交叉验证的响应蒸馏本地代理,再结合代理信号和格式检查评估秘密恢复。
• 受控基准及三个部署系统显示仅输出访问仍可能暴露记忆;论文结果不说明任意凭证都可恢复。
2026-09-29
AMU:Admission and Memory Update for Personalized Conversations---Structured Memory with SLM Guided Control
• 在写入时过滤临时请求、重复事实与过时用户状态。
• AMU 先结构化准入,再由小语言模型决定单独存储、去重丢弃或融合更新。
• 受控写入检索实验报告记忆更干净且易召回;摘要没有定量增益或长期部署证据。
2026-09-29
Watch-Think-Interact: Bootstrapping Long-Horizon Multi-Turn Streaming Video Reasoning with Reinforcement Learning
• 以时间标记文本记忆连接压缩摘要和可回读的原始视觉证据。
• 模型在回答、继续观察与回忆历史区间间选择;Stream-GDPO 联合训练时机、回读与记忆更新。
• WTI-82K 含 82,335 问题,StreamingBench 83.3%、OVO-Bench 73.6%;依赖可访问历史片段。
2026-09-29
UnlearningSoup: Is Repeated Tuning Necessary for Large Language Model Unlearning?
• 利用不同遗忘训练结果在权重空间中的共同性能盆地改善保留与删除权衡。
• EfficientSoup 二分插值选择模型,PerformanceSoup 重加权融合多个遗忘模型。
• 报告超参数选择效率提升 2.4–3.3 倍并改善评测表现;需要先获得可融合的遗忘训练结果。
2026-09-29
Traverse: Learning When to Remember, Reset, and Redirect for Long-Horizon Web Search
• 学习何时封存和压缩搜索记忆,防止错误上下文持续影响后续搜索。
• Traverse 使用独立验证状态及 Seal Memory 工具,只训练压缩后的末段以缓解记忆工具训练坍塌。
• BrowseComp 得分 72.83,并在多种搜索基准提升;消融支持自主压缩与训练设计,仍属搜索环境证据。
2026-09-29
When Should Agents Check External State? Budgeting Observations for Stored Intentions
• 为未来条件触发的已存意图分配外部状态检查预算。
• BudgetPM 提供局部效用门控和从整回合后见调度蒸馏的顺序策略,执行器强制统一硬预算。
• 静态版少 42–54% 观察仍保留 99.9–100% 质量;紧预算下顺序版提升 1.92–2.58 Set F1,收益依赖需求容量关系。
2026-09-29
ReMem: Rethinking Perception and Memory in Long-Context Recommendation Agents
• 在分块读取用户历史时持续维护定长偏好记忆,支持偏好变化。
• 顺序选择保留有效交互,并用多记忆 GRPO 将最终答案收益回传到中间记忆更新。
• 三个推荐任务平均提升 5.16%;框架同时含 OCR 感知,整体收益不能全部归因于记忆。
2026-09-29
Learning to Retrieve Missing Evidence for Long-Term Memory QA
• 利用已找到的证据发现问题中未明说的下一步检索线索。
• MERA 将全局记忆与问题证据状态分离,以强化学习奖励轻量规划器找回缺失证据。
• 0.6B 规划器搭配 Qwen3-30B 在 LoCoMo 达 77.40%、LongMemEval-S 达 71.29%;结果依赖证据处理与回答骨干。
2026-09-29
How Can Recommendation Feedback Evolve Agent Memory?
• 用延迟点击及转化反馈维护有容量约束的经验记忆种群。
• TIDE 分离时间、语义和所引用记忆的责任信用,再强化、交叉、变异或淘汰经验,以未来任务 MEG 衡量收益。
• 离线时间回放 MEG 高 7.75 个百分点,线上 A/B 提高点击及激活;信号仍依赖推荐环境与归因假设。
2026-09-29
RoboHarn-Evo: Evolving Hierarchical Physical Knowledge for Self-Improving Robotic Manipulation
• 把物理交互形成的任务和动作知识分层保存,跨回合修订适用性并复用。
• RoboHarn-Evo 分别在子任务与动作决策检索经验,用物理反馈纠错并保留有效知识。
• 80 次交互后留出成功率明显提升,纠正超过 83% 历史错误且保留 95.8% 有效知识;实验覆盖 RMBench 和迁移 RoboDojo。
2026-09-29
ReLMem: Learning Recurrent Memory for Longitudinal EHR Modeling
• 把连续就诊记录更新为固定容量患者记忆,避免反复读取完整历史。
• ReLMem 用轻量压缩适配器递归写入,以相同查询下注意力输出对齐及最终预测监督保留证据。
• 药物预测存储降低 97.1%,同预算宏微 F1 比最强压缩基线高 4.66、4.75 点;不是临床疗效验证。
2026-09-29
VirusCascade: Hijacking Collaborative Reflection in LLM-Powered Recommender Agents
• 研究恶意证据经反思合理化写入偏好记忆,再跨智能体传播的攻击链。
• VirusCascade 联合调整语义叙述和传播结构,受控分析反思持久性与跨智能体放大。
• 四个数据集平均 E@20 为 0.384,比最强基线高 0.185;攻击效果限定于所测隐蔽性约束。
2026-09-29
Explore, Execute, Evolve: A Skill Acquisition and Reuse Loop for Embodied Agents
• 从探索和执行记录持续更新技能库,在下一轮任务中指导探索与操作。
• Explore–Execute–Evolve 循环结合视觉触觉反馈,并把文字指导与可复用代码共同保存。
• LIBERO-10 四智能体首次成功率高 12.5–25.0 点,实机高 8.3 点;运行时间收益随智能体变化。
2026-09-29
ReCAP: Retrieval-Guided Capability Reuse for Multimodal Continual Instruction Tuning
• 把共享能力表示与阶段专属更新分离,以维护旧多模态知识。
• ReCAP 保护重要能力方向,同时回收未使用容量供后续任务写入。
• 报告持续多模态指令学习中的保留收益;结论限于所测任务序列与容量配置。
2026-09-29
EpiCon: Collective Agent Learning through Co-Evolving Multimodal Memory
• 让不同智能体通过持久多模态经验库共享执行经验。
• 独立 2B 控制器修订文本和视觉证据,树组织器分层巩固并检索经验规则,宿主参数不变。
• 11 基准四宿主配置比无记忆高 1.7–4.9 分,记忆操作耗时低 67–74%;跨系统收益取决于库与接口。
2026-09-29
Learning What to Remember: Long-horizon Counterfactual Memory Optimization
• 按每次记忆改写的当前与未来增量效用学习保留内容。
• MGPO 用反事实信用分配扣除旧记忆已贡献的收益,优化有长期价值的更新。
• 提高抽取效果且相对初始策略记忆平均缩短近 80%,支持跨域和读取模型迁移;主证据为结构化抽取任务。
2026-09-29
VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents
• 研究工作记忆不断追加后关键证据被噪声淹没的现象。
• VideoLoop 外层获取证据,内层从文件历史召回并改写有界工作记忆,主动移除累积噪声。
• VideoMME 长视频平均提升 4.2 个百分点;最难四分之一问题的仅上下文评判准确率为 81.1% 对 60.9%。
2026-09-29
Pretraining Latent Information Feedback Transformers with Teacher Supervision
• 跨生成步骤回传深层潜在状态,保存中间结果和替代续写信息。
• 用教师下一词分布构造密集状态,联合预测词与下一状态,预训练并行、推理时递归反馈。
• 语言建模和推理改善,受控状态跟踪超过用八倍数据训练的同规模 Transformer;结果限于所测规模。
2026-09-29
Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies
• 把跨片段的同一物理实体观测聚合成可检索传记,同时保留事件上下文。
• GEB 在写入时建立视觉身份链接,查询时联合读取实体传记与情节证据。
• 四基准含日级和周级视频,EgoLifeQA 准确率 72.0%,高于所引最佳结果 4.4 点;消融支持身份关联和读取。
2026-09-29
What Pretraining and Midtraining Make Learnable from Rewards?
• 研究奖励相同却需要不同未见答案时,预训练如何建立可被奖励调用的检索能力。
• 构造源预测到奖励适配的有限 Adam 路径,并在上下文记忆实验用回放保持检索。
• 独立八世界实验成功率为 75.32% 对替代检索训练的 49.86%;形式构造与受控世界不等于开放任务保证。
2026-09-29
Personalized State-Transition-Aware Memory for Clinical Agents
• 显式保存患者状态转移,区分当前有效信息与被替代但仍有历史价值的记忆。
• STAM 结合语义检索和类型化临床关系,将记录维护到 Active 或 History,按查询门控历史读取。
• 在四个临床基准使用问答、直接状态诊断和近似等上下文比较;摘要未给结果数值,不声称临床验证。
2026-09-29
Vision-Language-Action Autonomous Driving Agent with Language-based Memory
• 将周边关键对象和驾驶历史写为可解释语言记忆,回送后续决策并供其他模型使用。
• 记忆作为推理链扩展输出,SFT 后用轨迹级记忆奖励和步级驾驶奖励分配信用。
• 在全停路口、一般驾驶和场景问答中改善,展示记忆跨模型接入;摘要未给统一量化指标。
2026-09-28
RADNPO: Reference-free Adaptive Negative Preference Optimization for LLM Unlearning
• 针对目标置信度差异调整遗忘力度,改善知识删除与保留的权衡。
• RADNPO 根据置信度和分布集中度重分配目标概率,并对照当前偏好的非目标输出。
• 在 TOFU、MUSE 报告更好的遗忘与效用折中;实验不构成不可恢复删除保证。
2026-09-28
Making LLMs Truly Forget: Deep Unlearning by Searching, Selecting, and Severing Knowledge Paths
• 将目标知识的可恢复性归因于显式及潜在知识路径。
• 构造带置信度的知识图,通过最小割切断恢复支持,同时保留无关知识。
• 报告更深的目标遗忘和保留效果;覆盖受构建图及测试恢复路径限制。
2026-09-28
Learn Now, Use Next, Trust Later: Prequential Test-Time Learning for LLM Agents
• 将单步交互形成的规则假设与可跨回合信任的持久经验分开。
• StepLearn 允许假设立即指导下一步,但要求在来源回合之外前瞻验证后才进入长期指导。
• 四设置比 EvoTest 高 2.2–12.7 个百分点,首次尝试亦有收益;证据来自五轮两环境测试。
2026-09-28
UNBIND: UNlearning By INference-time Directional Steering for Code LLMs
• 区分识别待遗忘代码与抑制逐字复现所需的隐状态方向。
• UNBIND 在推理时干预方向,保持模型权重不变,并分别评测恢复和代码能力。
• 相对 14 个基线报告 F-BLEU 降低 97.3–99.1%;长片段恢复降至 0–2/300,这属于读取抑制而非权重擦除。
2026-09-28
Don't Forget! Decomposing the Training Dynamics of Memorization in Language Models
• 研究重复文本背诵与稀有内容回忆在训练中形成和遗忘的不同动态。
• 用序列梯度对齐追踪记忆,分析其他训练样本造成的干扰及层级贡献。
• 梯度信号比交叉熵更好预测记忆,少量参数消融可移除记忆;证据限于研究的模型与语料。
2026-09-28
SMat-Attention: Structured Long-Context Sequence Modeling
• 研究结构化长程路由如何扩大语言序列记忆的可访问模式。
• 以掩码支撑集的 VC 维度控制路由复杂度,结合分块算法与学习式 top-k 状态读取。
• 多键检索展示路由表达力,部分设置改善召回且语言建模相当;复杂度结论只针对指定掩码族。
2026-09-28
Tokenized Key-Gated Adapter Routing: A Secure Access Control Mechanism Against Private Data Leakage in LLMs
• 将私有知识的可读权限绑定到令牌密钥,而非仅依赖模型遵循隐私提示。
• Locket 对适配器执行密钥路由,并支持完整读取、遮蔽和差分隐私策略。
• 在 Enron、ECHR、Yelp 上报告有效密钥下的知识效用及无效密钥下的泄漏抑制;结果限于测试策略。
2026-09-28
CyFA: Linear Sequence Modeling with Relative-Time-Partitioned Memory
• 按相对时间分区保存历史键值,缓解固定状态内早期关联难以召回的问题。
• 学习时钟共同循环搬移键和值状态,新关联写入零龄槽;坐标变换支持分块训练。
• 同状态容量下召回更强,400M 的 FDA 得分 42.60 对 KDA 的 26.07;结果限于所测预训练与召回设置。
2026-09-28
Fractional State Space Transition for Long Sequence Modeling
• 用幂律长记忆替代指数遗忘,使有界循环状态保留更广时间尺度的信息。
• FRAC 以对数间隔指数模态的有限和逼近分数阶核,支持并行训练与有界状态解码。
• 报告长上下文性能优于 SSM 基线并保持短上下文竞争力;有限模态是对重尾核的近似。
2026-09-28
StateTape: Action-Conditioned Evidence Lifecycle Modeling for Long-Horizon Coding Agents
• 把代码观察记录当作可失效证据,按仓库写入而非上下文长度维护记忆。
• 符号依赖图和写入带定位可能过时记录,小管理模型解决日志无法判断的情况,并召回下一步所需代码。
• TraceBench 与三个编辑密集基准中清除失效证据并提高解决率;依赖代码图与语言规则的覆盖。
2026-09-28
Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression
• 揭示同一信息的召回率随压缩窗口内相位周期变化,研究压缩后的寻址弱点。
• 从头预训练不同压缩 Transformer,用因果干预定位注意力组件的相位分工,并分析理想化学习动力学。
• 大模型跨相位检索差异可达 40 个百分点;平均分会掩盖失败,理论分析限于理想化检索模型。
2026-09-28
Audience-Bound Persistent Memory: Authorization Across the Memory Lifecycle
• 为原始和派生记忆保存授权受众,避免跨会话组装上下文时泄漏。
• 派生内容继承来源受众交集或分区;只有显式授权可扩大范围,未知观看者按公开内容处理。
• 在 10,000 个冻结多人历史中未准入禁止项;保证依赖身份、来源和完整中介假设,部分联合判据因基线事件过少未成立。
2026-09-28
Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference
• 研究源词元离开滑动 KV 窗口后信息能否保留。
• 在五个模型中比较复用缓存状态与重新计算末尾原始窗口。
• 发现潜在信息传递,在两个采用滑窗架构的模型最强;训练原因仍待验证。
2026-09-28
From Attack Success to Attack Severity: Counterfactual Memory Attacks on LLM Agents
• 用反事实遗憾衡量持久记忆攻击的严重程度。
• MemHarm 利用配对下游损失选择有依据的语义编辑。
• 相同攻击支持范围下,以严重程度选取编辑比只优化成功率造成更大损失。
2026-09-28
StateGuard: Analytical-State Management with Validity-Aware Intervention for Long-Horizon Data Agents
• 显式维护长程分析状态的有效性。
• StateGuard 用图表示依赖,并从反事实轨迹学习核验与修复。
• 在三个数据分析基准改善表现,减少陈旧分析产物向下游传播。
2026-09-28
RoboICL: Embodied In-Context Learning with GPT-6 Astra
• 结合示范上下文和有界交互记忆进行机器人控制。
• RoboICL 采用统一观测行动回执格式,并固定保留历史锚点。
• 改善三十个 RoboDojo 任务的进度,实体机器人证据覆盖三项任务。
2026-09-28
PersMem: Internalizing Personality into Dual-Pathway Memory for LLM Agents
• 让人格设定直接影响记忆处理。
• PersMem 用人格参数控制情绪评价、保留、被动检索和目标导向筛选。
• 产生可区分的处理轨迹并改善对话指标,评测反映行为一致性。
2026-09-28
Just-In-Time Agent Memory with Runtime Agentic Research
• 在运行时按当前问题构建记忆上下文。
• JAM 用层级页面存储保留原始历史,并训练主动找证据的研究智能体。
• 报告优于预先构建记忆的任务表现,成本低于既有训练式智能体记忆方法。
2026-09-28
Remember by Asking: Retrieval-Induced Memory Evolution for LLM Agents
• 通过聚焦证据的自提问与检索构建记忆。
• RIME 整合对话证据和既有记忆,必要时回查原始上下文。
• 在 LoCoMo 三项质量指标上领先对照,同时减少查询阶段词元。
2026-09-28
Remember Before You're Asked: MemDream for Self-Probing Memory Evolution
• 在真实问题暴露失败前主动探测并修复记忆。
• MemDream 结合离线梦境循环、学习式修复策略和可逆衰减。
• LoCoMo F1 提升 4.5 分,MemoryAgentBench 总分提升 9.1 分。
2026-09-28
Single-Layer MeMo as a Randomized Hamming-Kernel Classifier
• 将单层 MeMo 分析为随机化联想分类器。
• 相对汉明核预测器推导上下文草图与输出解码误差。
• 模拟和受限 WikiText-2 实验支持分析,但不证明完整语言模型能力相当。
2026-09-28
FlowState: Execution State as Memory for Long-Horizon LLM Agents
• 将执行状态保留为可重访的长程记忆。
• 类型化节点保存关系和原始观测引用,支持增量更新与渐进访问。
• MemoryArena 与 tau3-Bench 分别提升 4.55、13.95 个百分点,词元减少约四成。
2026-09-28
GenMem: Generative Symbolic Memory for Self-Evolving Harness
• 将演化记忆访问建模为生成式符号寻址。
• 稳定层级标识符把检索策略与持续修改的记忆内容解耦。
• 在交互和推理任务上评估离线演化,结论限于受测记忆设置。
2026-09-28
Beyond Skill Evolution: Self-Evolving Context Management Policies for Long-Horizon Agent Harnesses
• 从长程失败中学习上下文管理策略。
• ContextEvo 重建决策时上下文,针对信息管理错误更新策略。
• 在三个基准设置改善;固定或局部演化策略仍受上下文压力影响。
2026-09-28
EP-Mem: Elastic Privacy Memory for Social Relationship-Aware LLM Agents
• 按用户定义的社会关系边界控制记忆披露。
• 结合人物与事件策略,在生成、存储和检索阶段执行约束。
• 在新建及迁移评测中报告泄露减少 75.6%,披露权限判断改善。
2026-09-28
Sprout: Building Dynamic Memory While Reasoning for Agentic Video Understanding
• 在回答问题的过程中增量构建视频记忆。
• 持久时间树结合粗粒度观测和针对性的高分辨率重访。
• 以更低上下文成本达到或超过受测离线记忆方法,无需预先处理完整视频。
2026-09-28
Continuous Context Management
• 每轮将智能体历史压缩为更新后的记忆。
• 结合完整历史特权蒸馏和 GRPO 训练上下文管理。
• 上下文成本降低,但未经训练的压缩常损害成功率,训练收益随模型与环境变化。
2026-09-28
From Experience to Expertise: Adoption-Aware Memory Learning for Data-Scarce NPU Kernel Synthesis
• 依据经验是否实际被采用来学习可复用编程记忆。
• SAGE 估计采用感知效用,并把反复有效的规则巩固到有界上下文。
• NPUKernelBench 执行率达 95.5%,最强受控对照为 84.1%。
2026-09-27
ManiEdit: Sequential Unstructured Knowledge Editing for Language Models from a Manifold Perspective
• 研究连续写入非结构化知识时的编辑效果与原有知识保持。
• ManiEdit 以流形枢轴组织更新,用能量加权约束及递归零空间保护旧知识。
• 四个基准报告 BERT 指标最高增加 27.81、ROUGE 增加 8.50;增益依赖具体基准而非统一平均值。
2026-09-27
Learning Dynamics of Continual Learning: A Unified View of Data Attribution, Forgetting, and Plasticity Loss
• 把旧知识保留与遗忘分解为 token 和层级上的更新相互作用。
• 分析跨样本预测变化,区分正向经验转移、梯度碰撞和逐步侵蚀,并据此选择数据。
• 实验关联读出几何、可塑性和干扰;分析及干预效果限于所测模型与持续学习设置。
2026-09-27
How Linear Attention Remembers
• 解释线性注意力状态中的选择性召回与干扰。
• 结合分析分解,以及预训练模型的写入、保留和读取因果干预。
• 受测范围内负载比经过的上下文更影响召回;混合模型常依赖全注意力状态。
2026-09-27
Beyond Memory Construction: Rethinking Memory Access for LLM-based Conversational Agents
• 将原始交互作为对话记忆的核心记录。
• Threader 采用增量主题分段、多视图检索及局部证据匹配。
• 相对重写式方法,报告更高回答准确率和证据召回,并降低构建成本。
2026-09-27
ActiveMem: Dynamic Latent Memory Trees for Long-Horizon Agents
• 将流程经验组织为保留依赖关系的记忆树。
• ActiveMem 用强化学习学习状态相关路径检索、记忆扩展与剪枝。
• 在受测智能体基准上报告任务完成、稳定性和效率改善。
2026-09-27
Relevance Does Not Imply Applicability: Experience Activation for Personal GUI Agents
• 仅在当前情境适用时激活个人 GUI 经验。
• ExpActivator 匹配当前界面和历史状态,并按时间与场景约束主动意图。
• 四个骨干的步骤成功率平均改善 28%,历史词元约为对照的五分之一。
2026-09-27
Recursive Harness Distillation across Agents for Robot Manipulation
• 通过可复用跨智能体手册传递机器人干预经验。
• 强智能体提炼指导,再依据轻量智能体的执行反馈修订。
• 实体操作成功率从 37.3% 升至 64.0%,两个智能体在仿真中也获益。
2026-09-27
Grounding Memory Summarization in Utility Intent
• 让记忆摘要与下游证据效用对齐。
• MemSuit 蒸馏受问题监督的教师条目,并适配紧凑事实检索。
• 报告多类对话问题收益,学生构建记忆时仅需原始对话。
2026-09-27
TRACE: Governing Memory Validity in Evolving Multi-Agent Systems
• 管理返回协作的智能体能否继续使用既有记忆。
• TRACE 对齐离开时检查点和期间更新,生成有界的有效记忆视图。
• 兼顾有效信息保留与陈旧信息拒绝,但收益伴随额外词元成本。
2026-09-27
Positions Are Not Facts: The Mismatch Between KV Caches and Memory
• 研究将 KV 缓存用作记忆时的语义更新。
• 比较值或记录掩蔽、删除重算,并检查依赖信息的保留。
• 更新数值可能破坏单位和历史回答,缓存位置不能直接等同于可编辑事实。
2026-09-26
Generalization and Memorization along the Learning Trajectory of Neural Language Models: A Geometric Account of Categorization
• 分析范畴泛化与实例记忆在内部表示几何中的竞争。
• 控制训练时长和规模,检查表示空间中未见区域的类结构及实例聚集。
• 早期类结构可泛化,后期实例记忆会侵蚀它;结论来自受控合成语法而非自然语言全面评测。
2026-09-26
TRAP: Understanding and Mitigating Privacy Memorization in Language Models
• 直接度量目标模型相对参考模型对训练片段的额外记忆优势。
• TRAP 用互补数据训练参考模型,以可微分的逐 token 优势实施单边惩罚。
• 报告验证损失见底后记忆仍增长,早停无法保护稀有片段;惩罚减少 PII 记忆但不提供形式隐私保证。
2026-09-26
Authority Before Utility: Non-Compensatory Control for Persistent LLM Memory
• 区分记忆的使用效用与授权状态,研究已删除或撤销内容仍被召回的问题。
• 在 Memora Remembering 上比较硬排除与开发集锁定的归一化软惩罚,保留当前值并阻止遗忘值泄漏。
• 185 个留出单元上错误率为 4.04% 对 19.66%;原预注册主实验被隔离,替代诊断不证明所有标量控制失效。
2026-09-26
Learning an Anchored Prompt Space for Continual Adaptation of Large Language Models
• 以历史任务软提示为保留锚点,研究顺序学习中的知识遗忘。
• LAPS 在更新模型上蒸馏旧提示响应,并用 Bézier 控制跨任务提示空间。
• TRACE 实验报告较少遗忘;这是受任务提示约束的保留机制,尚非开放任务知识保持保证。
2026-09-26
Continual Learning via Self-Probe Gradients
• 通过模型自生成探针保留旧任务知识,降低新更新对旧知识的干扰。
• CPLUS 从少量历史样本生成自探针,利用其梯度缩小冲突更新。
• 四个基准上优于直接回放,尤其在旧数据稀缺时;仍需少量历史样本与探针生成。
2026-09-26
When Can First-Order Models of Fine-Tuning Bound Forgetting?
• 给出旧知识首次遗忘的条件性界,并检验一阶近似何时失效。
• 有限探针估计线性