MemoryLake
返回全部文章
News2026 年 8 月 19 日·12 分钟阅读

应该给 AI Agent 多少记忆?一项针对 8 个模型的研究发现(2026 年)

直觉上的答案是“全部”。把 Agent 学到的所有东西都给它,它应该会变得更好。然而,IBM Research 的研究人员于 2026 年 8 月 18 日发表的一项研究表明,这种想法经常出错,并且用数据指出了出错的具体情况。

他们的总结只有一句话:“Agent 记忆不是一个直接开启的功能。它是需要根据模型进行校准的剂量。”在从主流开源模型到前沿商业系统的八个模型中,他们发现了三种截然不同的模式——在其中一种模式中,给 Agent 更少的记忆,反而比给它全部记忆带来了更高的准确率和更低的成本。

对于任何构建 Agent 的人来说,这都是一个真正有用的结果,它让通常关于 Agent 记忆的宣传变得更加复杂,而不是简单地证实它。以下是测量的指标、具体数据、作者本人表示该研究尚未证实的内容,以及在您自己的设置中需要做出的调整。

这项研究究竟测试了什么

这里的“记忆”指的是提炼出的指南,而非对话记录

这是首先需要明确的一点,因为这个词涵盖了几个不同的概念。作者明确指出:“这里的‘记忆’并不意味着重放过去的对话记录。它指的是一个指南集——从 Agent 自身先前的轨迹中提炼出的成功策略、需要避免的错误以及边缘情况。”

其循环是:Agent 尝试任务并生成轨迹;系统“从其成功和失败的运行中”提取行为指南;将其整合为一个可重用的集合;在推理时,Agent 会接收完整集合或其中的一部分。至关重要的是,“没有更新任何模型权重。”改变的是“Agent 可获得的指导”,而不是模型本身。

因此,这不是一项关于对话历史的研究,也不是一项关于长上下文窗口的研究——这一区别值得与为什么大上下文窗口不是记忆区分开来。

基准测试与两个指标

评估在 AppWorld 上进行——“横跨 9 个模拟应用(日历、消息、支付等)的 585 个多步任务(168 个 test_normal + 417 个 test_challenge)。”

两个评分,它们之间的差距正是最有趣的部分:

TGC — 任务目标完成度(Task Goal Completion)。“Agent 完整且正确完成的单个任务的比例。”这是衡量“是否有效”的核心数据。

SGC — 场景目标完成度(Scenario Goal Completion)。“一个更严格、非全即无的指标。”每个场景都捆绑了同一任务的几个变体,而“只有当 Agent 在每个变体上都取得成功时,SGC 才将该场景计为通过。它衡量的是可靠性。”

三种配置

两种记忆配置都源自同一个指南集,“仅从 AppWorld 的训练集中挖掘一次……”,作者指出“没有任何测试集数据用于构建它”。不同之处在于呈现方式:

Baseline(基线)——“无记忆——出厂状态的 Agent。”

Full guideline set(完整指南集)——“在每个 ReAct 步骤中注入挖掘出的每一条指南。”

Curated retrieval(精选检索)——“这些指南中固定、高置信度的核心部分,加上为每个任务检索到的少量任务相关指南(固定部分 + 变量部分)。”

他们观察到的三种模式

Model模式Baseline TGC / SGC最佳记忆 TGC / SGC最佳配置Δ TGCΔ SGC
gpt-oss-120b (117B MoE)较弱 / 选择性39.9 / 21.456.0 / 37.5curated retrieval+16.1+16.1
DeepSeek-V3.2 (671B MoE)较强且有提升空间79.8 / 64.389.3 / 80.4full guideline set+9.5+16.1
Claude Opus 4.6较强且有提升空间90.5 / 87.594.6 / 94.6full guideline set+4.1+7.1
GPT-5.5较强(接近天花板)92.3 / 82.195.2 / 89.3full guideline set+2.9+7.2
GLM-5 (745B MoE)饱和87.5 / 80.487.5 / 80.4full guideline set0.00.0

有三点非常突出。

强模型吸收了所有内容。 仍有提升空间的模型在完整指南集上表现最好,“包括罕见的边缘案例教训”,因为“它们有能力吸收并应用所有这些内容。”

较弱的模型受到容量的伤害。 “较小或较弱的模型会被庞大的指南集淹没。”对于 gpt-oss-120b,完整集合相比 curated retrieval “提升更少,多消耗了约 50% 的 token”。

严格指标的提升幅度超过了核心指标。 DeepSeek 的 TGC 提升了 +9.5,但 SGC 提升了 +16.1,因为“优秀的指南尤其能帮助 Agent 解决场景的每一个变体,而不仅仅是平均情况。”即使是接近天花板的模型在可靠性上也在持续提升:GPT-5.5 和 Opus 分别增加了 +7.2 和 +7.1 个百分点的 SGC。作者的表述值得铭记——“只要模型还有未解决的失败模式,记忆就会持续发挥作用。”

而有一个模型则毫无变化。GLM-5 在这些任务中,无论有无记忆,得分都完全相同。这其中的含义是作者最为谨慎对待的地方,下文将对此进行介绍。

颠覆传统成本权衡的结果

对在每一步注入指南的本能反对意见是成本,这是一个合理的担忧。他们的测量结果如下:

Model配置每个任务的 Token (baseline)每个任务的 Token (+ memory)开销
DeepSeek-V3.2full guideline set148K263K+78%
gpt-oss-120bfull guideline set110K166K+51%
gpt-oss-120bcurated retrieval110K116K+5%

因此,对于较弱的模型,选择性检索在两个维度上同时胜出:“在仅增加 +5% token 的情况下,TGC 提升了 +16.1 个百分点。”正如作者所说,“在这里,更好的性能并不需要更多的推理成本。”

对于任何预算有限的人来说,有两个支持性发现非常重要。首先,开销是输入膨胀,而不是更多的工作:“DeepSeek 在有记忆和无记忆的情况下运行的 ReAct 步骤数量大致相同(平均约 18-19 步),因此增加的成本是输入 token 的膨胀,而不是更长的轨迹。”其次,有一个标准的调节杠杆——“生产环境中的真正效率杠杆是提示词缓存(prompt caching):指南集的静态部分在各个步骤中是相同的,可以进行缓存,从而大幅降低实际成本。”他们建议为此进行设计:“保持共享指南集前缀的稳定,以便其保持可缓存状态。”

最后一点具有直接的设计启示。在每次调用时重新洗牌输出的记忆层会破坏缓存。而一个拥有稳定核心和少量可变尾部的记忆层运行成本更低——这也是在较弱模型上赢得准确率优势的配置。

这项研究证实了什么,又没有证实什么

作者对自身研究的局限性有着极强的自律,正确引用他们的话是解读这一结果的诚实方式。

“饱和”描述的是一种现象,而非原因。 针对 GLM-5 毫无起色的结果:“我们称之为饱和模式——这个标签描述了我们观察到的现象,而不是一个被证实的原因。该模型在这些任务上可能已经接近其天花板,指南可能没有解决其剩余的失败问题,或者它可能没有有效地应用这些指导。”这并不是关于模型质量的结论。这只是一个基准测试、一个指南集、一种配置。

能力层级不等于参数量。 “决定模型进入哪种模式的不仅仅是参数量。基准测试的提升空间、上下文窗口大小、架构、指南质量和任务分布似乎都会影响模型的最终表现,而分离这些因素是正在进行的工作。”请注意,745B 的 GLM-5 和 671B 的 DeepSeek 处于不同的模式。

上下文窗口的解释只是一个假设。 他们认为更大的窗口可能会更好地吸收完整集合,并直接表示:“我们尚未运行隔离该因素的对照实验。”

这只是一个基准测试。 “这些结果是在 AppWorld 上验证的——这是一个严格的多步基准测试,但它只是单一的基准。”更广泛的基准测试和实际部署已被列入后续计划。

检索本身也承认是不完美的。 “我们目前的检索通过余弦相似度对指南进行排序,我们已经证明这并不能完美预测哪些指南对特定任务有帮助。”他们将“学习型选择器”列为下一步——这意味着,尽管采用了粗糙的选择方法,精选检索(curated-retrieval)的数据依然取得了成功。

极弱的模型不在讨论范围内。 “在低于最低能力基线的情况下,自我提炼缺乏信号。”

综合来看:该研究发现的方向得到了很好的支持,但具体数据仅属于该基准测试和该方法。不要将这些百分比直接套用在您自己的系统上。

人们对 Agent 记忆的误解

将存储视为问题的全部。 大多数记忆设置都致力于捕获更多内容。而这项研究表明,捕获只是简单的一半——针对每个任务注入了什么,才是决定准确率 and 成本的关键所在。

因为现在上下文很便宜,所以注入所有内容。 便宜并不意味着免费,在这里它增加了 +51% 到 +78% 的开销,而且对于较弱的模型,更多的上下文反而让结果变差。

假设更大的模型需要更少的帮助。 接近天花板的模型在可靠性指标上仍然取得了显著的提升。核心准确率掩盖了这一点,但严格的指标没有。

通过平均情况下的成功来评估记忆。 TGC 在整个过程中都低估了收益。如果您的 Agent “通常是正确的”,那么记忆所修复的可能是它失败的变体,而这正是 SGC 所衡量的。

当一个模型没有表现出收益时,就断定记忆不起作用。 作者明确拒绝根据他们自己的数据得出这一结论。

解决方案:校准剂量,这意味着控制检索到的内容

这项研究的实际转化并不是“少存储”。而是记忆层必须能够进行选择、保持稳定的核心可修剪——因为剂量是您针对每个模型和每个任务做出的决策,而不是在设置时一劳永逸。

将您的记忆拆分为核心和尾部。 一个始终注入的、小而高置信度的集合,加上每个任务检索到的任务相关条目。这就是在较弱模型上同时赢得准确率和成本优势的配置,而且它也是保持可缓存的配置。

保持核心稳定,以便提示词缓存发挥作用。 如果始终开启的部分在各个步骤中保持字节级一致,您就能享受缓存折扣。默默地重新排序会使这一优势付诸东流。

在您自己的模型上测试这两种剂量。 在您的任务上测量完整集合与“核心+检索”的对比。该研究本身的结论是,答案因模型而异。

衡量严格的指标。 不要只计算完成的任务数;要计算同一任务的每个变体通过的频率。这正是这些收益显现的地方。

进行修剪,因为指南质量被列为一个关键因素。 错误或过时的条目并不是无害的——它们会与优秀的条目一起被注入。

要做到这一点,需要将记忆存储在您可以检查和编辑的地方,而不是让它在单个助手内部累积。这就是 MemoryLake 的作用:一个您的 Agent 可以通过 MCP 或 API 读取的记忆层,其中的条目是独立的且可编辑的,而不是一个不透明且不断膨胀的混乱整体——这正是让校准剂量成为可能的原因。设置只需三个步骤。

步骤 1:创建 API 密钥

登录 MemoryLake 并创建 API 密钥。一个凭证即可通行您连接的所有工具。

创建 MemoryLake API 密钥以校准 AI Agent 获得多少记忆
创建 MemoryLake API 密钥以校准 AI Agent 获得多少记忆

步骤 2:上传您的第一批记忆

按照研究中指南集的形式编写条目——每条指南包含一个主张,尽可能针对行为:什么有效、需要避免什么,以及破坏了先前尝试的边缘情况。值得记录的类别包括:

将高置信度的 Agent 指南核心写入 MemoryLake
将高置信度的 Agent 指南核心写入 MemoryLake

您进行过多次的修正。 根据定义,这些是您置信度最高的核心条目。

失败模式及如何避免它们。 该研究的收益主要来自于解决以前会失败的变体。

看似随意的限制。 速率限制、顺序要求、行为与文档不符的 API。

已经被排除的方案。 没有任何交付物包含的类别,以及每个新 Agent 都会再次提议的类别。

步骤 3:连接您的 AI 和 Agent

连接您使用的工具。MemoryLake 可以通过 MCP 和 API 访问,因此 MCP 原生 Agent(包括 Claude Code、Codex 和 OpenClaw)可以通过指向 MCP 服务器进行连接,而其他助手则可以通过 API 读取相同的记忆。

通过 MCP 将 Agent 连接到 MemoryLake,以便保持剂量可调
通过 MCP 将 Agent 连接到 MemoryLake,以便保持剂量可调

三个诚实的局限性。MemoryLake 并非这项研究的一部分,上述任何百分比都不是关于它的声明——结果属于作者在他们自己的基准测试上使用的他们自己的方法。它保存您或您的 Agent 写入的内容,因此质量取决于您的输入。而且它不会改变模型的能力;如果您的 Agent 剩余的失败不是指导能够解决的那种,那么更好的记忆也无法解决它们。

这在实践中改变了什么

“更多上下文”不再是默认的解决方案。 对于较弱的模型,更多内容反而让情况变糟。选择性检索才是杠杆。

可靠性成为您关注的指标。 在每个层级(包括接近天花板的模型),严格的“所有变体”衡量指标的提升幅度都超过了核心准确率。

成本不再是反对记忆的理由。 在一个模型上,仅增加 +5% 的 token 就换来了 +16.1 个百分点的提升,而其余模型则可以通过在稳定核心上使用提示词缓存来控制成本。

更换模型变成了重新校准。 更换模型后,合适的剂量可能会随之改变,因为能力层级无法从参数大小中预测。

修剪成为一项提升性能的活动。 指南质量被列为决定模型进入哪种模式的因素之一——这使得删除过时条目成为真正的性能优化工作,而不仅仅是整理。关于 token 方面的讨论,请参阅使用记忆层减少 token 使用量

为 Agent 记忆配比剂量的最佳实践

从一个高置信度的小核心开始。 只有当您能证明增加内容有所帮助时,才去扩大它。

对于其他所有内容,按任务进行检索。 对于没有提升空间的模型,几条相关的条目优于完整的集合。

保持始终开启的前缀字节级稳定。 可缓存性是决定成本是否可承受的关键。

在您自己的任务上运行 A/B 测试。 在您的工作负载上对比完整集合与精选集合。该研究的核心发现正是:答案并非普适。

采用非全即无的评分方式,而不是平均分。 可靠性才是指导发挥价值的地方。

记录日期并删除。 过时的条目也会被注入。

不要将毫无起色的结果解读为记忆无用的证据。 作者针对他们那一个零收益的案例提出了三种可能的解释,但并未断定是哪一种。

将记忆保持在模型外部。 这项研究中没有更新任何权重——这就是为什么该方法“采用成本低,且在我们测试的八个模型中具有可移植性”。可移植性是保持其外部化的一个属性,具体情况请参阅持久化记忆意味着什么

结论

值得吸取的发现正是作者在章节标题中所写的那句话:“记忆应该被校准,而不仅仅是累积。”具有提升空间的强模型使用了完整的自我提炼指南集。较弱的模型在使用紧凑核心加上按任务检索时表现更好——而且是在仅增加 +5% token 而不是 +51% 的情况下实现的。一个模型没有表现出可测量的变化,作者刻意拒绝仅根据单一基准测试来解释原因。

对于您自己的 Agent,这可以转化为三个习惯:将稳定的始终开启的核心与检索到的尾部分开,衡量可靠性而不是平均成功率,并将修剪视为性能优化的一部分。同时,将记忆本身保存在可检查和可编辑的地方,因为“多少”是您每次更换模型时都需要调整的旋钮——而不是一次性打开的开关。

常见问题

给 AI Agent 更多的记忆总能提升性能吗?

不能。在这项研究中,较小或较弱的模型会被“庞大的指南集淹没”——对于 gpt-oss-120b,注入所有内容获得的准确率提升少于精选检索(curated retrieval),且多消耗了约 50% 的 token。而具有提升空间的强模型确实从完整集合中受益。

在这项研究中,“记忆”指的是什么?

从 Agent 自身过去的轨迹中提炼出的指南集——包括成功的策略、需要避免的错误以及边缘情况——并在推理时重新注入。它不是对话记录,也不是模型微调:没有更新任何权重。

Agent 记忆在 token 方面需要多少成本?

在他们的测量中,在每一步注入完整的指南集使 DeepSeek-V3.2 每个任务增加了 +78% 的 token,gpt-oss-120b 增加了 +51%,而精选检索(curated retrieval)仅增加了 +5%。开销主要是输入 token 的膨胀,而不是更长的轨迹,他们指出对静态部分进行提示词缓存(prompt caching)是生产环境中的主要效率杠杆。

有一个模型表现出零提升。这是否意味着记忆不起作用?

作者明确拒绝得出这一结论。他们称之为“饱和模式”,并指出该标签“描述了我们观察到的现象,而不是一个被证实的原因”,同时列出了三种可能的解释——在这些任务上接近性能天花板、指南没有解决剩余的失败问题,或者指导没有被有效地应用。

我该如何为我的 Agent 决定合适的记忆量?

在您自己的任务上测试这两种剂量:完整集合对比“小而高置信度的核心 + 按任务检索”。对非全即无的可靠性进行评分,而不是平均完成度,因为收益主要集中在这里,并保持始终开启的部分稳定,以便其保持可缓存状态。

我可以将这些百分比应用到我自己的系统中吗?

请将研究方向视为可借鉴的,而将具体数据视为该研究特有的。作者指出,这些结果是“在 AppWorld 上验证的——这是一个严格的多步基准测试,但它只是单一的基准”,能力层级无法从参数量中预测,而且他们的检索是通过余弦相似度对指南进行排序的,他们表示这并不能完美预测哪些指南会有所帮助。