MemoryLake
返回全部文章
News2026 年 8 月 21 日·11 分钟阅读

AI Agent 记忆真的能提升性能吗——为什么任务顺序决定了答案 (2026)

2026 年 8 月 18 日发表的一篇论文提出了大多数关于 Agent 记忆的文章都避而不谈的问题,而其答案令人颇感不安,值得仔细研读。

由 Qinyuan Ye、Yu Li、Yada Pruksachatkun、Jiaxin Zhang 和 Chien-Sheng Wu 撰写的《On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification》(arXiv:2608.18066)重新评估了两种基于记忆的自我改进 Agent 方法,并发现它们报告的大部分性能提升可能只是实验排序方式带来的假象。他们对文献中这一空白的表述非常直白:这些方法“在最近的文献中展现出了巨大的前景。然而,这些方法的可靠性方面却被严重忽视了”。

我们发布了很多关于 Agent 记忆的内容,所以值得坦率地说明:这篇论文让我们的立场变得更加复杂,而这也理所应当。以下是它所测量的内容、它明确声明不主张的内容,以及其中本周真正具有可操作性的一个建议。

这篇论文究竟做了什么

先前工作遗漏的两个维度

该研究的设定是重新评估,而非提出新方法。作者采用了两种现有的基于记忆的方法——即“通过维护文本记忆库,从在线任务流中学习并随着时间推移不断改进”的 Agent——并在他们描述的两个维度上扩大了评估范围:“(1) 包含多次运行以量化方差,以及 (2) 随机打乱任务以研究任务顺序的影响。”

这两点在大多数经验性机器学习中都是标准做法,但在这里却都缺失了。这就是全部的方法论贡献,而这足以改变结果。

发现一:在加入记忆之前,测量就已经存在噪声

他们的第一个观察结果(逐字引用):“在复杂环境和多步骤任务中,Agent 评估本身就存在噪声,而在其上叠加自我改进循环会进一步放大这种噪声。”

请把这句话读两遍,因为它包含两个部分。在多步骤任务上的 Agent 基准测试本身就存在噪声——相同的 Agent、相同的任务、不同的运行、不同的得分。然后,自我改进循环会获取该噪声信号并将其反馈回记忆库,从而影响下一次运行。噪声不仅会持续存在,还会不断累积。

对于任何进行自我评估的人来说,实际的后果是:开启记忆与关闭记忆的单次运行对比几乎说明不了任何问题。如果你曾因为某个指标上升了一次就发布了记忆功能的更新,这篇论文正好解释了为什么那并不能算作证据。

发现二:任务顺序起到了很大作用

第二个观察结果非常引人注目:“Agent 的改进高度依赖于任务顺序。先前的工作通常采用默认的排序,这引入了隐式课程,成为了成功的隐藏先决条件。”

隐式课程意味着默认的任务序列恰好是由易到难,或者恰好把传授有用经验的任务排在了需要这些经验的任务之前。Agent 按照这个顺序学习并得到了提升。一旦打乱顺序,提升幅度就会缩水——记忆库其实受益于一个无人刻意设计或报告的教学序列。

这是一种换汤不换药的常见失败模式。它不是欺诈,也不是粗心大意;它只是一个未受控制的变量,因为这个领域还很年轻,所以没有人想到去控制它。

他们测试并仅部分证实的假设

作者并没有止步于这一否定性结果。他们手动检查了记忆库,并提出了一个假设:“任务和环境的低规格说明(underspecification)导致了这种脆弱性。”换句话说,Agent 写下了模糊或错误的经验,是因为任务和环境从未足够清晰地告诉它什么是“好”的标准。

然后,他们对此进行了测试,方法是“在记忆构建过程中融入能够提供更好规格说明的信息,例如详细的评估细则和环境反馈”。

结果得到了摘要中最诚实的一句话:“虽然这些增加的信息部分弥补了先前实验中的性能退化,但仍然存在显著差距,这表明还有其他未表征的因素导致了这种脆弱性。”

“部分地”。“仍然存在显著差距”。“其他未表征的因素”。这是一个拒绝过度推销自己解决方案的研究团队,而这正是这篇论文值得信赖的原因。

这说明了什么,又没有说明什么

理清这一界限比标题本身更重要。

它研究的是两种具体方法,而非整个类别。 该重新评估涵盖了两种基于记忆的自我改进方法。它不是一篇综述,也没有声称每种 Agent 记忆方法都是脆弱的。

它针对的是在无人看管下自行写入记忆的 Agent。 具体的研究对象是在没有人类参与的情况下,通过在线任务流维护文本记忆库的 Agent。这与人类写下项目约束,或团队在文件中维护规范完全是两码事。这里没有任何内容表明写下来的上下文不再有用。

这是一次可靠性批判,而非全盘否定。 研究发现,报告的收益依赖于顺序且存在噪声——而不是说记忆毫无作用。一个其效果取决于任务顺序的方法,在某些顺序下仍然是有益的。

它没有点名任何产品。 这些是针对基准测试的研究方法。将其解读为对任何厂商记忆功能的判决,是这篇论文未曾做出的过度延伸,其他人也不应该这样做。

而且它与指向相反结论的研究结果并存。 就在四天前发表的一项工作测量了注入自我提炼指南带来的真实收益,其提升幅度取决于模型——这在应该给 AI Agent 多少记忆中有所提及。两者都可以是真实的:收益确实存在,但这些收益报告的幅度比文献所暗示的要更不稳定。两者的调和在于更好的评估,这正是这篇论文所呼吁的——“报告多次运行的结果,并在具有挑战性的条件下对其进行压力测试”。

人们会从中得出什么误读,以及为什么不应该

“Agent 记忆不起作用。” 这不是论文的意思,作者也极力避免这样说。两种方法,一种评估协议,依赖于顺序的收益。

“所以我们应该跳过记忆,使用更大的上下文窗口。” 这是一个完全不同的问题,有其自身的答案,不受本论文的影响——这在为什么大上下文窗口不是记忆中有所讨论。

“解决方案是评估细则。” 评估细则和环境反馈确实有所帮助,但并没有完全消除差距。将它们视为终极解决方案忽视了论文中关于“仍然存在显著差距”的论述。

“基准测试毫无用处。” 恰恰相反。这篇论文证明了,只要运行得当(多次运行、打乱顺序),基准测试是非常有参考价值的。

“让 Agent 自己管理记忆,它自己会搞定的。” 这是该论文最直接颠覆的观念。无人看管的自我改进循环会将评估噪声放大并引入记忆库中。

“我们的内部 A/B 测试显示了提升,所以我们没问题。” 如果该 A/B 测试是在固定任务顺序下的单次运行,那么这篇论文正是解释了为什么这还不能算作证据。

解决方案:让记忆可检查,并认真对待测量

论文最后提出了两条建议,它们是具有可操作性的部分。第一条是评估:报告多次运行的结果,并在具有挑战性的条件下进行压力测试。第二条对于任何在此基础上进行构建的人来说更有趣:“我们关于低规格说明的发现,呼吁建立能够实现有效人类监督的系统和界面,以防止 Agent 以不可预测的方式失败。”

人类监督。界面。写入记忆构建的规格说明。结合起来看,建议并不是“给 Agent 更少的记忆”——而是停止让记忆成为一个 Agent 在无监督下写入的黑盒子。

对于一个行之有效的设置,需要遵循以下三点:

评估时考虑方差和打乱顺序。 至少运行三次,并排列组合你的任务序列。如果打乱顺序后收益消失了,你就知道你的任务顺序其实就是那个“课程”。

在积累之前先明确规格。 论文的部分解决方案是在记忆构建中引入更好的任务和环境规格说明。在实践中,这意味着写下“正确完成”的标准是什么,这样 Agent 提炼出的经验才有对错的参照物。

保持记忆对人类可读且可编辑。 如果你看不到写入了什么,你就无法捕捉到那些会影响接下来五十次运行的模糊或错误的记录。

最后一点正是 MemoryLake 的构建核心:将记忆视为你可以阅读、纠正和删除的单个条目,而不是一个只会不断膨胀的不透明存储库。设置只需三个步骤。

步骤 1:创建 API 密钥

登录 MemoryLake 并创建一个 API 密钥。一个凭证即可连接你所有的工具。

创建 MemoryLake API 密钥以保持 Agent 记忆可检查
创建 MemoryLake API 密钥以保持 Agent 记忆可检查

步骤 2:上传你的第一批记忆

写下论文中指出 Agent 所缺失的规格说明,作为简短的条目,每条包含一个主张:

将评估细则、约束条件和被否决的方法写入为记忆条目
将评估细则、约束条件和被否决的方法写入为记忆条目

对于你的循环任务,“正确”意味着什么。 用文字表述的评估细则。这是论文中发现有帮助的唯一类别。

环境未声明的约束条件。 速率限制、顺序要求、没有最新数据的测试数据库。Agent 无法自行推断的环境反馈。

已被排除的方法及其原因。 在打乱的任务顺序下,Agent 没有可以依赖的课程——书面的否决记录正是用来替代幸运序列的东西。

你纠正过不止一次的内容。 如果人类必须说两次,那么无监督循环是永远无法自行推导出来的。

步骤 3:连接你的 AI 和 Agent

连接你使用的工具。MemoryLake 可通过 MCP 和 API 访问,因此支持 MCP 的原生 Agent(包括 Claude Code、Codex 和 OpenClaw)可以通过指向 MCP 服务器进行连接,而其他助手则通过 API 读取相同的记忆。

通过 MCP 连接 Agent,使记忆保持可读和可纠正
通过 MCP 连接 Agent,使记忆保持可读和可纠正

三个坦诚的局限性,其中第一个正是本文的重点。MemoryLake 并非本研究的一部分,也无法解决其所描述的脆弱性。 这里没有任何内容声称精心策划的记忆层能让自我改进的 Agent 变得可靠——作者表示其他因素仍未被表征,这适用于任何存储库。一个可检查的层带给你的是他们所呼吁的人类监督,以及修复错误条目的能力,而不是在发生回归时才发现它。它只保存你或你的 Agent 写入其中的内容。而且它不是一个评估套件:多次运行的规范需要由你自己来实现。

这在实践中改变了什么

单次运行的对比不再被视为有效结果。 这是成本最低且回报最高的改变。运行三次并打乱顺序。

“Agent 学会了”变成了一个你需要去核实的主张。 打开记忆,阅读条目,看看它提炼出的经验是否真的正确。

编写评估细则变成了工程工作。 低规格说明被列为促成原因。明确什么是“好”的标准不再是一项文档杂务。

顺序无关性成为一个设计目标。 如果你的 Agent 仅在某一个任务序列中有所提升,那么你拥有的是一个课程,而不是一个记忆系统。

修剪比积累更重要。 在噪声下写入的错误条目会与正确的条目混在一起——这也是为什么 RAG 不是记忆背后的普遍问题。

评估 Agent 记忆的最佳实践

至少运行三次。 运行之间的方差是原工作遗漏的两个维度之一。

刻意打乱任务顺序。 如果改进依赖于顺序,你会在发布前想要知道这一点。

报告分布范围,而不是最好的数字。 这是论文核心诉求的简要概括。

在构建记忆之前先写好评估细则。 在记忆构建中引入更好的规格说明是已被证明有明显帮助的干预措施。

阅读 Agent 写入的内容。 手动检查正是作者最初发现“低规格说明”假设的方法。

为条目注明日期并删除过时的条目。 在存在噪声的情况下,一个旧的错误条目比空无一物的存储库更糟糕。

不要根据两种方法就对整个类别下结论。 两个方向都不要:既不要说“记忆有用”,也不要说“记忆没用”。

在设计上保持人类在环(human in the loop)。 论文自身的结语建议是建立能够实现有效人类监督的系统和界面——其具体形式在AI 记忆是什么,不是什么中有所讨论。

结论

Agent 记忆真的能提升性能吗?根据这篇论文中的证据:有时可以,但效果没有报道的那么好,而且在两种著名方法中测量到的大部分差异都可以追溯到无人控制的任务顺序。作者对这意味着什么保持谨慎——在加入自我改进循环之前,Agent 评估本身就存在噪声,循环会放大噪声,更好的规格说明有所帮助但仍留有显著差距,且其他因素仍未被表征。

对于从业者来说,它改变的主要是规范而非架构。多次运行你的对比测试。打乱顺序。写下正确标准的样子,而不是寄希望于 Agent 自行推断。并将记忆保存在人类真正可读的地方,因为论文自身的结论是呼吁人类监督,而不是更聪明的无人看管循环。与能够自我改进的记忆相比,可供检查和纠正的记忆是一个更保守的主张——但根据这些证据,这才是站得住脚的主张。

常见问题

Agent 记忆真的能提升 Agent 性能吗?

论文给出的答案是,提升确实存在,但远没有报道的那么可靠。通过多次运行和打乱任务顺序重新评估两种基于记忆的自我改进方法,作者发现 Agent 评估在多步骤任务中本身就存在噪声,自我改进循环会放大这种噪声,且性能提升高度依赖于任务顺序。

什么是“隐式课程”?

这是作者对默认任务排序的称呼,这种排序恰好以一种有益的顺序来教导 Agent。正如他们所说,先前的工作“通常采用默认的排序,这引入了隐式课程,成为了成功的隐藏先决条件”。一旦打乱顺序,报告的收益就会缩水。

这是否意味着 AI 产品中的记忆功能不起作用?

不是。该研究涵盖了针对基准测试的两种研究方法,具体是指在没有人类参与的情况下,通过任务流维护自身文本记忆库的 Agent。它没有评估任何产品,也没有声称写下来的上下文不再有用。

作者找到解决方案了吗?

找到了一个部分的解决方案。在记忆构建过程中加入更好的规格说明——详细的评估细则和环境反馈——“部分弥补了性能退化”,但他们指出“仍然存在显著差距,这表明还有其他未表征的因素导致了这种脆弱性”。

我应该如何评估自己 Agent 中的记忆?

遵循论文的建议:报告多次运行的结果,并在具有挑战性的条件下进行压力测试。具体来说,至少运行三次,排列组合你的任务顺序,并比较分布范围而不是单个最佳数字。如果打乱顺序后收益消失了,说明任务顺序才是关键所在。

这是否与显示记忆带来收益的研究相矛盾?

不直接矛盾。其他最近的研究测量了注入提炼指南带来的真实收益,其幅度因模型而异。这篇论文的主张更窄,且关乎可靠性:此类收益报告的幅度比文献所暗示的要更不稳定,而解决方案是进行更严格的评估,而不是放弃记忆。