MemoryLake
返回全部文章
News2026 年 8 月 25 日·13 分钟阅读

通过保留更少内容,智能体记忆变得更准确——保留评分记忆树的启示 (2026)

准确率上升,成本下降,而这源于同一个改变。这种双赢的组合非常罕见,值得仔细研读。

2026 年 8 月 21 日发表的一篇论文——《Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents》(arXiv:2608.20631,作者:Quang Dao、Purvi Kathalkar 和 Kenneth Eaton)指出,与线性记忆基线相比,他们的方法“在减少 32.8% 的 Prompt Token 使用量的同时,将准确率平均提高了 9.97 个百分点”。在更广泛的 GAIA 数据集上,这两个数字分别为 +10.10 个百分点和 -32.2%。

其机制是最有趣的部分,而且它并不是压缩。他们指出了现有研究遗漏的关键点:“现有的记忆方法组织或压缩了执行历史,但对于决定哪些记忆保持活跃提供的机制非常有限。”

此外,还有第二个比标题更重要的实验。他们故意对记忆进行了投毒,并测量了恶意条目传播的范围。本文将涵盖这两个方面,包括该论文明确未确立的内容(其中一个局限性推翻了最诱人的解读),以及本周即可付诸实践的部分。

论文实际测量了什么

结构:任务、子任务、动作以及每个记忆的评分

WMT 将执行过程组织为“任务、子任务和动作”的层级结构,同时为每个记忆分配一个动态保留评分。有两种力量会改变该评分:“基于事件的更新和基于选择的衰减会修正这些评分,使 WMT 能够保留有用信息、折叠已完成的轨迹、抑制低效用内容,并保持对折叠上下文的访问。”

仔细阅读这四个动词,因为这就是其设计核心。保留(Preserve)有用的内容。将已完成的工作折叠(Fold)为摘要。抑制(Suppress)那些没有发挥作用的内容。并且仍然保持访问(retain access)折叠后的材料,而不是直接丢弃。没有任何内容被删除,只是被降级了。

衰减规则是机械性的,而非语义性的:一个不断进入候选池却一直未被选中的记忆会降低评分,而“选中该记忆会将其未选中计数重置为零”,“未进入候选池的记忆则不会衰减”。

为什么不断增长的历史会带来伤害(用论文自己的话来说)

该问题的陈述是我读过的关于记忆管理必要性最清晰的简短总结:“不断增长的执行历史增加了推理成本,并使推理暴露在过时、无关或误导性的信息中,从而可能降低推理质量。”

同一个原因导致了三种不同的成本——金钱、信息过时以及被主动误导。大多数关于智能体记忆的讨论只关注第一点,而将另外两点视为边缘情况。

投毒实验是最强有力的结果

这是该论文得出结论的关键所在。他们构建了一个受控评估,包含“100 个长程场景、297 个子任务和 1,118 个记忆条目,其中包括 709 个良性记忆和 409 个故意投毒的记忆”,并使用攻击成功率、毒物检索率、爆炸半径、放大因子和感染持续性等指标测量了毒物传播的距离。

基线结果是值得铭记的一句话:线性记忆“在几乎所有安全指标上表现最差,因为整个执行历史始终保持可访问状态,导致被投毒的记忆持续存在并反复影响下游推理。”它产生了“最高的攻击成功率、爆炸半径、放大因子和完全的感染持续性”。

完全的感染持续性。一旦一个坏条目进入了只增不减(append-only)的日志中,它就会不断出现。

完整的 WMT 表现出最低的攻击成功率(0.419)、毒物检索率(0.097)、爆炸半径(0.315)和放大因子(0.965),“同时达到了最低的感染持续性(0.009)”。

消融实验展示了哪部分在起作用

这非常有用,因为它告诉了你该借鉴什么,而不仅仅是告诉你某个东西有效。

保留层级结构但移除保留评分和分支优先级“相比线性记忆显著提高了鲁棒性”——单靠结构确实有帮助——但其较高的攻击成功率表明,“平等对待所有保留的记忆会让低价值或误导性的信息继续影响推理”。

移除记忆控制器(导致没有任何内容被折叠或抑制)虽然带来了适度的改善,但依然导致了“完全的感染持续性”,作者对此的解读是:“如果恶意记忆在整个长程执行过程中始终可用,那么仅减少即时暴露是不足够的。”

而在保持生命周期管理的同时移除语义选择,则在特定方面适得其反:“检索整个任务分支增加了 Prompt 的大小,并重新引入了无关或被投毒的信息。”

具体示例是整个理念的缩影

他们的演示追踪了一个正在识别论文的智能体。其中一个动作是“咨询了一个非官方的排名博客。观察结果包含一个未被支持的断言,该动作被明确记录为失败”。

接下来发生的事情是值得借鉴的设计选择:“WMT 将这一失败的动作保留为警告,但较低的评分降低了其作为支持证据的优先级。”当该分支完成时,折叠保留了有用的残留信息——摘要“可以保留受支持的论文身份、官方来源以及关于博客查找失败的警告,而无需在后续 Prompt 中重新播放完整的整个分支”。

记录你尝试过某些方法但失败了是有价值的。只是它不应该与你已验证的来源竞争。

这确立了什么,又没有确立什么

理清边界比数字本身更重要,而该论文的局限性部分异常直接。

它没有测试跨会话记忆。这推翻了最诱人的解读。 用他们的话来说:“基准评估为每个问题初始化一个新的任务树,因此没有评估第 2.3 节中描述的跨对话全局记忆模式。”所以,这只是关于管理智能体任务内执行历史的证据,而不是关于跨越数周对话的持久记忆层。任何引用它来证明长期记忆库应该衰减的人,都将其延伸到了超出测量范围的领域——包括我们自己,所以在这里首先予以说明。

仅限小型开源权重模型。 Qwen3-8B、Gemma 4 E4B 和 Llama-3.1-8B。作者从正反两方面进行了推论:“更大的模型可能更擅长忽略过时或无关的上下文,从而可能减少 WMT 的相对准确率提升。然而,它们更高的 Prompt 处理成本可能会保留或增加选择性上下文构建的效率优势。”他们得出结论,这种相互作用“仍然是一个开放性问题”。

单一基准系列。 “我们的评估仅限于 GAIA 基准系列”,且两个集合“共享相同的任务构建 and 答案格式”。他们指出了可能存在差异的场景:“交互式网页环境、软件工程智能体、具身任务或扩展对话。”

⭐ 保留评分测量的是有用性,而不是真实性。 这是论文中最诚实的一句话,也是具有最大实际意义的一句话:“保留评分评估的是操作效用,而不是事实正确性。一个有用的记忆可能会因为反复未被选中而被抑制,而误导性的信息如果对表面上成功的动作做出了贡献,则可能会保持高分。”一个能让智能体看起来很成功的、自信的错误答案可能会被晋升。

参数是手动调整的。 初始化值、基于事件的更新、分支聚合系数和淘汰阈值都是“手动指定的”,并且“对于其他智能体架构或任务分布可能不是最优的”。

效率的提升并非在所有地方都是免费的。 “基于 LLM 的选择器和摘要生成器也可能引入选择或压缩错误,并需要额外的模型调用,因此对于执行历史有限的短期任务,WMT 的效率优势可能会变小。”

MemoryLake 未参与此项研究,这里的任何内容均未评估任何记忆产品(无论是我们的还是其他任何人的)。

它符合一系列并不完全指向同一方向的研究结果。 早期的工作测量了通过精心策划的指南检索获得的实际收益,这些收益随着模型能力的提升而扩展——应该给 AI 智能体多少记忆。三天前,一项重新评估发现,自我改进记忆智能体所报告的收益存在噪声且依赖于顺序——智能体记忆真的能提高性能吗。这篇论文是对前一篇论文担忧的部分解答:如果由于坏条目永久保持活跃而导致噪声累积,那么降级未选中的条目正是对抗这种情况的一种机制。虽然只是部分的解答,且仅针对一个基准系列、在 8B 规模下。

人们会从中得出什么误读,以及为什么不应该

“所以智能体记忆应该忘记事情。” 这里没有任何内容被删除。条目被降级、折叠并保持可访问——这比“遗忘”是一个更保守的主张。

“这证明了持久记忆层需要衰减。” 本可以测试该模式的实验明确未被评估。这是一个合理的假设,但并不是这篇论文的发现。

“仅靠结构就足够了。” 消融实验表明事实并非如此——没有保留评分的层级结构会让误导性内容继续影响推理。

“评分解决了记忆投毒问题。” 它显著减少了投毒影响,但并未消除。0.419 的攻击成功率虽然优于基线,但仍然不低。

“你可以信任这个评分。” 作者特别警告你不能信任它:评分追踪的是操作效用,因此一个对表面上成功的动作做出贡献的误导性记忆可能会保持高分。

“这是小模型的把戏。” 情况可能恰恰相反。作者称与模型规模的相互作用尚未测试,并认为即使准确率收益缩小,效率收益也可能随着模型变大而增加。

解决方案:按使用情况为记忆评分,并允许人工推翻它

可迁移的想法并不是算法本身。而是:在论文测量的每个维度(成本、过时性和错误条目的传播范围)上,只增不减的历史记录都是最糟糕的情况,而解决方案是引入生命周期,而不是提供更大的上下文窗口。

由此可以得出以下三点,且不需要实现 WMT。

停止将你的记忆库视为只增不减的。 如果你的设置中没有任何东西可以降级条目,那么坏条目就是永久性的。这就是“完全感染持续性”的结果,这是设计的属性,而不是内容的属性。

将失败保留为警告,而不是证据。 具体示例就是这种模式:记录博客的断言站不住脚,并确保该记录不能被引用为支持。大多数记忆设置要么完全丢弃失败,要么将其与确认的事实混在一起存储,无法区分。

不要让使用情况成为唯一的信号。 这是将论文自身的警告付诸实践。基于效用的评分有时会晋升一个自信的错误,并埋没一个你很少需要但必须保证正确的事实。必须有某种机制能够推翻评分,而在生产环境中,这种机制就是阅读该条目的人。

最后一点正是为什么一个可检查的存储至关重要:记忆应该是你可以阅读、纠正和删除的条目,而不是一个只会增长的日志或一个你无法检查的评分。设置只需三个步骤。

步骤 1:创建 API 密钥

登录 MemoryLake 并创建一个 API 密钥。一个凭证即可跨越你连接的所有工具。

创建 MemoryLake API 密钥
创建 MemoryLake API 密钥

步骤 2:上传你的第一批记忆

简短的条目,每个条目只包含一个断言——这也是使条目在以后可纠正的原因:

上传你的第一批记忆到 MemoryLake
上传你的第一批记忆到 MemoryLake

简明陈述已验证的事实。 每个条目一个断言意味着可以修复错误的条目,而无需重写整段上下文。

失败的方法,标记为失败。 “批处理端点看起来正确,但会默默丢弃超过 10k 的记录。”将其保留为警告,而不是结论。

附带原因的约束条件。 原因可以防止正确的条目被认为已过时的人删除。

在任何对时间敏感的内容上标注日期。 信息过时是论文提到的三种成本之一,也是人一眼就能看出来的成本。

步骤 3:连接你的 AI 和智能体

连接你使用的工具。MemoryLake 可通过 MCP 和 API 访问,因此 MCP 原生智能体(包括 Claude Code、Codex 和 OpenClaw)通过指向 MCP 服务器进行连接,而其他助手则通过 API 读取相同的记忆。检索是按查询进行的,而不是将完整历史重新播放到每个 Prompt 中。

通过 MCP 连接你的 AI 和智能体
通过 MCP 连接你的 AI 和智能体

三个诚实的限制,第一个正是本文的重点。MemoryLake 不是 WMT 的实现,未参与此项研究,也不像论文描述的那样对你的条目进行评分或衰减——它带给你的是论文自身警告所暗示的人工监督,因为评分无法被信任用来区分有用和真实。它只保存你或你的智能体放入其中的内容。而且它不管理智能体的任务内执行历史,而这才是这篇论文实际讨论的内容。

这在实践中改变了什么

只增不减不再是默认设置。 如果没有任何东西可以降级条目,那么一个坏条目就会永远存在。这现在是一个经过测量的结果,而不再仅仅是担忧。

失败有了专门的分类。 以一种无法被引用为支持的方式记录某些方法行不通,成本很低,但几乎没有人这样做。

更大的上下文窗口不再是解决这个问题的答案。 这里的成本是信息过时和误导,而不是容量——这正是为什么长上下文窗口不是记忆中所区分的。

Prompt 成本和准确率不再需要权衡。 减少 32.8% 的 Token 却提升了 9.97 个百分点,这说明通常认为“更好的上下文意味着更多的上下文”的假设至少在某些地方是错误的。

审查条目变成了真正的工作。 基于使用情况的评分无法区分有用和真实,因此必须由人来做——这也是如何检测 AI 记忆冲突背后的普遍问题。

管理智能体记忆中保持活跃内容的最佳实践

在扩大存储之前,先让降级成为可能。 只增不减的存储在成本、信息过时和错误传播方面都是最糟糕的情况。

将已完成的工作折叠为摘要,并保持对细节的访问。 这就是论文的设计,也是 Token 数量下降的原因。

将失败的尝试标记为警告。 保留作为警示,降低其作为证据的优先级。

不要信任使用情况评分作为真实性信号。 作者表示它评估的是操作效用,而不是事实正确性。

定期阅读你的条目。 错误的条目比缺失的条目更糟糕,因为它会与正确的上下文竞争。

选择性检索,而不是按分支检索, 并为任何可能过时的内容标注日期。拉回整个分支会增加 Prompt 大小并重新引入被投毒的内容。

将单一基准、8B 规模的结果视为方向性的。 有用,但尚未定论——而且这项研究根本没有测试跨会话记忆。

将推理与事实保存在一起。 没有约束条件的结论会被删除或重新争议;这就是为什么 RAG 不是记忆中所讨论的形式。

结论

与线性历史相比,具有单条目保留评分的层级记忆在 GAIA-Text 上的准确率提高了 9.97 个百分点,同时减少了 32.8% 的 Prompt Token 使用量,在更广泛的 GAIA 数据集上则分别提高了 10.10 个百分点和减少了 32.2% 的 Token。为了达到这一效果,没有任何内容被删除:条目被保留、折叠、抑制或降级,且折叠的上下文仍然可以访问。

投毒实验是更有用的那一半。在 1,118 个条目中包含 409 个故意投毒的条目时,线性记忆在几乎所有安全指标上表现最差,这是由于结构性原因——整个历史记录始终保持可访问状态,因此坏条目不断重新浮现,导致完全的感染持续性。评分和生命周期管理降低了攻击成功率、毒物检索率、爆炸半径和放大因子,而消融实验表明这三个组件缺一不可。

两个警告决定了你能将这一结论推广多远。评估为每个问题初始化了一个新的任务树,因此跨对话记忆模式从未被测试过——这是关于任务内的执行历史。此外,保留评分“评估的是操作效用,而不是事实正确性”,这意味着一个能让智能体看起来很成功的、自信的错误可能会保持高分,而一个很少使用但很重要的事实却会衰减。

这就是具有实际意义的收获。给你的记忆一个生命周期,而不是一个只增不减的日志;将失败保留为警告,而不是证据;并保持人工能够推翻评分——因为论文自身的局限性表明,评分只能告诉你什么被使用了,而不能告诉你什么是正确的。

常见问题

什么是 Weighted Memory Tree?

一种用于 LLM 智能体的记忆系统,它将执行过程组织为任务、子任务和动作,并为每个记忆赋予一个动态保留评分。基于事件的更新会提高评分,而基于选择的衰减会降低评分,从而使系统能够保留有用信息、将已完成的轨迹折叠为摘要、抑制低效用内容,并仍然保持对折叠内容的访问。

它的性能提升了多少?

相对于线性记忆,在 Qwen3-8B、Gemma 4 E4B 和 Llama-3.1-8B 上,GAIA-Text 的准确率平均提高了 9.97 个百分点,GAIA 的准确率提高了 10.10 个百分点,而 Prompt Token 使用量分别下降了 32.8% 和 32.2%。

这是否意味着 AI 记忆应该删除旧信息?

不。在这种设计中没有任何内容被删除——低效用的条目被降级,已完成的分支被折叠为摘要,同时保留对折叠上下文的访问。该论文的结论是关于持续调节哪些信息保持活跃,而不是丢弃它。

这是否证明了持久记忆层需要衰减?

它没有测试这一点。作者指出,基准测试为每个问题初始化了一个新的任务树,因此没有评估其设计中同样描述的跨对话全局记忆模式。结果是关于管理任务内的执行历史。

记忆投毒实验显示了什么?

在 100 个场景的 1,118 个记忆条目中(709 个良性,409 个故意投毒),线性记忆在几乎所有安全指标上表现最差,因为完整的历史记录始终保持可访问状态,从而导致了最高的攻击成功率、爆炸半径、放大因子和完全的感染持续性。完整系统具有最低的攻击成功率(0.419)、毒物检索率(0.097)、爆炸半径(0.315)和放大因子(0.965)。

保留评分能判断记忆是否正确吗?

不能,作者对此非常明确:保留评分“评估的是操作效用,而不是事实正确性”。一个有用的记忆可能会因为反复未被选中而被抑制,而误导性的信息如果对表面上成功的动作做出了贡献,则可能会保持高分。这一差距正是支持保持记忆可由人工阅读和编辑的论据。