实际会转移什么
首先是来自 OpenAI 官方模型页面的规格。 Astra 提供了“1,050,000 上下文窗口”和“128,000 最大输出 token”,知识截止日期为“2026 年 4 月 30 日”。OpenAI 将其描述为“我们最强大的模型,专为最困难的端到端工作而构建”,并推荐用于“复杂推理、编码、计算机使用、研究和文档创建”。推理是可调的:reasoning.effort 支持“low、medium、high、xhigh 和 max”。
可用性是分阶段的,因此请做好混合使用期的准备。 根据模型页面:“GPT-6 Astra 今天开始向我们 Trusted Access 计划中的企业推出,未来几天将通过 API 以及我们的 Plus、Pro、Business 和 Enterprise 计划提供访问权限。”API 速率限制表还将免费层(Free tier)列为“不支持”。
这在实际中很重要,但人们往往低估了这一点:在一段时间内,您会在某些地方运行 Astra,而在其他地方运行其他模型。存在于一个模型对话历史中的任何上下文在另一个模型中都是不存在的。
指令文件会完全转移,因为它们从来都不是特定于模型的。 这是一个好消息,值得精确解释其原因。Codex 的文档指出“Codex 在进行任何工作之前都会读取 AGENTS.md 文件”,它构建的发现链——全局文件,然后是自根目录向下的项目文件——与由哪个模型回答毫无关系。Claude Code 中的 CLAUDE.md、Cursor 中的 .cursor/rules、Amp 和 Warp 中的 AGENTS.md 也是如此。
因此,如果您的规范存在于文件中,切换模型不会给您带来任何损失。如果它们存在于对话中,切换模型会让您失去所有这些规范。
在任何界面上,对话历史都不会转移。 新模型就是一个新对话。在 API 上这显而易见——您需要自己构建消息数组,除非您自己携带,否则什么都不会保留。在聊天界面中,这不那么明显,因为界面看起来是连续的,但回答问题的实体已经改变了。
知识截止日期是任何窗口大小都无法弥补的部分。 2026 年 4 月 30 日。您自己在这之后做出的四个月的决策都落在了它后面。这是我们不断重申的一个区别的最清晰例证:为什么长上下文不是记忆。容量是模型一次可以容纳多少内容。记忆是模型启动时是否存在任何内容。
计算机使用(computer use)甚至改变了“上下文”所指代的内容。 Astra 支持计算机使用,模型页面将 Apply patch、Skills、MCP 和 Tool search 列为支持的功能。当智能体(agent)代表您操作应用程序时,相关的上下文不仅是您的代码库,还包括它被允许接触哪些系统、您对这些系统的内部名称是什么,以及上个月的哪些临时解决方案仍然需要。这些都无法从代码仓库中推导出来,也都不在训练截止到 4 月的模型中。
快照(Snapshots)锁定的是行为,而不是知识。 文档指出“快照允许您锁定模型的特定版本,以便性能和行为保持一致。”这对于可复现性很有用。但它不会让锁定的版本获得更多关于您项目的信息。
手动迁移
步骤 1:写下模型所缺少的这四个月的信息
这是整个切换过程中价值最高的一小时,但几乎没有人花时间在这上面。
打开您团队最近的历史记录——自 5 月以来合并的拉取请求(PR)、决策记录、您经常链接的 Slack 线程——并写下发生了什么变化。不需要写下所有内容。只需写下如果智能体不知道就会出错的内容。
具体来说,这通常分为五个类别。依赖和框架迁移:您迁移到了什么,以及至关重要的是,您从什么迁移了出来,因为较早训练的模型会自信地推荐旧事物。弃用:代码库中仍然存在但绝不能再扩展的服务、端点和内部库。4 月之后确定的规范:命名决策、错误处理模式、审查规则。所有权变更:现在哪个团队拥有哪个界面。带原因的约束:“API 在路径中进行版本控制,因为有两个移动客户端锁定了旧版本”这句话抵得上十行风格指南,因为如果没有这个原因,智能体可能会好心地将其删除。
然后将其保存在持久的地方。如果您的指令已经存在于 AGENTS.md 或 CLAUDE.md 中,就把它放在那里——这些文件是独立于模型的,因此这项工作在下一次切换中也能保留下来,这就是将项目文档转化为 AI 记忆中所阐述的观点。
步骤 2:决定在混合期如何处理,然后验证一次对话
在分阶段推出期间,您将同时使用这两个模型。做出以下两个决定可以帮您渡过难关。
首先,将您的指令层保持在一个地方,而不是每个模型一个。人们很容易想写一个针对 Astra 调整的指令文件,同时保留旧文件给旧界面使用。这会导致两个文件从第一天起就产生分歧,这也是为什么智能体忽略您的指令文件背后的机制——并不是因为它们无法读取,而是因为它们读取了多个相互矛盾的副本之一。
其次,刻意调整推理力度,而不是保留界面的默认设置。reasoning.effort 接受 low 到 max,在模型缺乏上下文的任务上,更高的推理力度并不会产生更好的答案。它只会产生一个推理更充分的错误答案。先给它上下文。
然后验证一次。开始一次全新的 Astra 对话,问它一个正确答案完全取决于 4 月之后决策的问题——即在截止日期之前的答案是确凿错误的问题。阅读返回的内容。如果它给您的是旧答案,说明您的指令层没有传达到它,您在两分钟内就发现了这一点,而不是在拉取请求中。
在此期间,顺便检查一下在实践中一百万个 token 实际会消耗您多少成本。极大的窗口会诱使您粘贴所有内容,但塞满整个代码库的对话与仅包含十个关键事实的对话是不同的。您加载的内容与您获得的回报之间的关系是在智能体记忆中保留更少内容的主题。
更好的方法:彻底告别繁琐的切换迁移
上述所有内容都是实实在在的工作,而令人不快的是,您在升级到 GPT-5.6 时也做过同样的工作,并且在 12 月发布新模型时您还会再做一次。每一次模型切换都会变成一次上下文迁移,因为上下文被存储在了错误的地方——在对话内部,或者在您为每个工具维护的文件内部。
另一种选择是将持久的部分保留在两者之外。关于您项目的事实不会随着模型的改变而改变。如果它们存在于您的智能体读取的层中,模型切换就会变成它本应有的样子:仅仅是模型切换。您将不同的模型指向相同的知识,它在启动时就已经掌握了相关信息。
这也永久性地解决了知识截止日期问题,而不是一次性的。2026 年 4 月 30 日不再是一个需要您用长篇粘贴来掩盖的悬崖,因为这之后的四个月已经被写在了模型可以触及的地方。MemoryLake 只需三个步骤即可设置完成。
步骤 1:创建 API 密钥
登录并从您的仪表板生成一个 API 密钥。它不与特定模型、快照或计划层级绑定,在跨界面分阶段开放新模型访问权限时,这一特性至关重要。

步骤 2:上传您的第一批记忆
从上面步骤 1 中的列表开始:您迁移到和迁出的内容、已弃用的内容、自 4 月以来确定的规范、所有权以及附带原因的约束。

添加计算机使用智能体需要但无法推断的内容——它应该接触哪些内部系统、您的团队如何称呼它们、由于供应商尚未修复某些问题而仍然存在的哪些手动步骤。
步骤 3:连接您的 AI 和智能体
将 Astra 指向该存储库,并将您在其他地方仍在运行的任何模型也指向同一个存储库。在分阶段推出期间,这就是“单一事实来源”与“两个逐渐偏离的事实来源”之间的区别,正如在不丢失上下文的情况下在 AI 模型之间切换中所论证的那样。

这在实践中改变了什么
第一个改变是截止日期不再重要。每个模型都有一个截止日期,而且每一个都属于过去,而弥补这一差距的方法是写下您自己最近的历史,而不是寄希望于下一次发布能将这条线推得足够远。
第二个改变是,大窗口变成了一种能力,而不是一种负担。您可以容纳一百万个 token;但您不应该不得不花掉它们来重新建立“您是谁”的认知。加载任务,而不是背景介绍。
第三个改变是,下一次切换的成本会很低。这是一年内第四或第五次前沿模型的发布让团队考虑迁移,而那些不断付出高昂代价的团队,正是那些将上下文保留在对话中的团队。
切换到 GPT-6 Astra 的最佳实践
- 看清这两个数字。 1,050,000 个 token 的容量,以及 2026 年 4 月 30 日的知识截止日期。改变您工作的是第二个数字。
- 写下截止日期之后的这几个月发生的事情。 迁移、弃用、规范、所有权以及带原因的约束。
- 保持单一指令层,而不是每个模型一个。 指令文件从来都不是特定于模型的;不要让它们变成那样。
- 做好混合期的准备。 推出是通过 Trusted Access、API 和付费计划分阶段进行的,且 API 免费层被列为不支持。
- 有目的地设置
reasoning.effort。 从 low 到 max 是一个真实的范围,推理力度不能替代上下文。 - 用一个 4 月之后的问题进行验证。 一个在截止日期前回答会出错的提示词,可以告诉您您的上下文是否已传达到模型。
- 锁定快照是为了可复现性,而不是为了知识。 锁定的版本表现一致;但它不会知道更多。
- 为计算机使用提供其专属的上下文。 哪些系统、它们在内部被称为什么、哪些临时解决方案仍然适用。
结论
Astra 的有趣之处不在于它能容纳一百万个 token。而在于一个如此强大的模型在开始每次对话时,仍然不知道您的团队在 5 月做出了什么决定。
做好切换意味着将这两个问题分开。能力来自模型,而且它确实更好了。知识来自您,而避免在每次切换时都为此付出代价的唯一方法,是将它保存在模型可以读取的地方,而不是保存在恰好发生过对话的地方。