已发布的内容与仍未知的细节
官方宣称
Qwen3.8-Max 拥有约 2.4 万亿参数,据阿里巴巴称,在某些基准测试中,其排名超越了近期发布的开源旗舰模型。在今天正式发布之前,它已于 2026 年 7 月 19 日在上海举办的世界人工智能大会上进行了预热。预览版变体 Qwen3.8-Max-Preview 已通过阿里云的 Token 计划以及 Qoder 和 QoderWork 提供,阿里巴巴表示计划于下周发布可下载的权重。
坦白而言的注意事项
截至 2026 年 8 月 3 日,那些引人注目的性能数据均来自阿里巴巴官方:其领先的基准测试声明源自内部评估,目前还没有来自 Artificial Analysis、LMArena 或任何可供检查的独立测试框架的数据。现有的外部信号非常有限 —— 仅有发布首日的 Arena.AI 排名(在文本模型中位列中国模型第一,在视觉榜单上全球第二)以及在 Code Arena 上的匿名预发布亮相。这些只是偏好排名,而不是公开了方法论的基准测试表。发布报道指出,该架构采用了混合专家(MoE)设计,每次请求激活 2.4 万亿参数中的约 950 亿参数,但目前仍未发布模型卡(model card)和许可证。这并不意味着该模型很弱,而是意味着阿里巴巴之外的任何人还无法告诉你它在你的实际工作负载中表现如何。
这正是你必须进行自主评估的原因。而真正的评估,正是上下文问题最先显现的地方。
为什么切换模型会重置你的上下文
模型端的记忆归服务商所有
每个厂商的记忆功能都仅限于该厂商自身。Claude 记住的关于你的信息会留在 Claude;ChatGPT 存储的信息会留在 ChatGPT。切换模型时,你并不是在迁移记忆 —— 按照设计,你是在重新开始。这种模式在每个发布周期都会重复,这也正是这一系列指南存在的原因:在切换到 Kimi K3、迁移到 Claude Opus 5 以及采用 DeepSeek V4 时,都发生过同样的重置。
开源权重自带零记忆
当 Qwen3.8-Max 的权重下周落地时,本地托管将成为一种选择 —— 此时有必要明确你到底得到了什么。权重只是一个推理引擎。没有账户、没有记忆存储、没有偏好层,也没有历史记录。本地运行的顶尖模型最纯粹地证明了:记忆并不是模型的一项功能,它要么是你额外附加的,要么就是不存在的。
路由让问题成倍增加
目前有趣的模式不是采用单一模型,而是编排 —— 用一个强大的模型引导更便宜的模型,以扩展额度并并行化工作。这在经济上是个好主意,但在连贯性上却很糟糕:每一次跳转都是一个全新的上下文,执行第四步的廉价模型根本不知道昂贵模型在第二步得出了什么结论。你最终不得不将项目描述发送到每一次调用中,或者接受每个参与者都在半盲状态下工作。关于这一点的通用版本,请参阅多智能体记忆。
人们尝试过的方法
粘贴上下文块
最普遍的第一步:在每个会话的顶部放上一段技术栈、规范和约束。它确实有效,但很快就会过时,而且你在测试的每个模型中的每一次请求都要为此付费。
信任上下文窗口
百万 Token 的窗口很容易让人诱导将上下文视为记忆。窗口只是模型在这一轮中可以读取的内容 —— 你仍然需要选择输入什么,每轮为此付费,并且下一次开始时依然空空如也。检索也无法弥补这一差距,具体原因非常值得一读:为什么 RAG 不是记忆。
绑定在单一厂商内
感觉最安全的选择:选择一个服务商,使用他们的记忆,永远不离开。这很有效,直到某一周竞争对手发布了一个拥有 2.4 万亿参数且价格只有一半的产品,而你为了探寻究竟而付出的代价,是花一个月的时间重新解释你的代码库。
解决方案:将上下文保留在模型无法带走的层中
持久的解决方案是停止将项目知识存储在当前领先的任何模型中。MemoryLake 将你的架构、决策和规范保存在一个统一的记忆层中,任何模型或智能体都可以通过 MCP 或 API 读取它 —— 包括本地托管的模型。
步骤 1:创建 API 密钥
生成密钥并在大约 30 秒内发出你的第一次请求。

步骤 2:上传你的第一批记忆
拖入承载你真实上下文的文档、图片和文件:架构说明、ADR、运行手册、API 规范、先前的评估结果,以及你一直在重复解释的决策。

步骤 3:连接你的 AI 和智能体
让 Claude、Codex、OpenClaw 以及你的其他智能体通过 MCP 或 API 访问该记忆 —— 并将你用于调用 Qwen3.8-Max 的任何工具指向同一层。现在,你组合中的每个模型都从相同的背景信息开始,这也是对它们进行公平比较的唯一方法。跨工具设置已在在 ChatGPT、Claude 和 Gemini 之间共享统一记忆中进行了介绍。

这在实践中带来了什么改变
估算一下你即将进行的评估成本。向新模型重新介绍你的项目需要 30 到 60 分钟的专注工作,加上后续每个会话开始时的几分钟。如果你的常驻上下文是 2,000 个 Token,并且每天在测试的模型中重发 20 次,那么每月大约有 120 万个 Token 的纯重复开销 —— 钱虽少,但摩擦感却很明显。
战略成本更大且更隐蔽:本可以从切换中受益的团队往往没有行动,因为重建上下文的“税收”让每次评估都显得代价高昂。当记忆是外部化的时候,在你的实际工作负载中尝试 Qwen3.8-Max 只需要一个下午,而不是一个月,如果它输了,放弃它也毫无成本。这种选择权比任何单一模型的基准测试数据都更有价值 —— 尤其是对于一个尚未经过独立验证的模型。
多模型世界中的最佳实践
在相同的记忆下评估每个模型
如果一个模型得到了详尽的手写背景介绍,而另一个模型只得到了匆忙的粘贴,那么你比较的是提示词,而不是模型。从同一个记忆层为两者提供输入,比较才会真正聚焦于模型本身。
存储决策,而非聊天记录
“聊天记录选用 Postgres 而非 Redis —— Redis 在队列模式工作节点下丢失了数据,于 2026-05 决定”是一个持久的事实。而产生这一决定的四十条消息则是噪音,且检索它们会消耗 Token。
保持记忆层与服务商无关
无论你使用什么来保存记忆,它都不应该是模型厂商可以为你废弃的东西。这同样适用于托管模型以及你下周可能运行的本地托管 Qwen 构建 —— 记忆的寿命应该比这两者都长。
结论
Qwen3.8-Max 是一个重磅发布:2.4 万亿参数、顶尖水平的宣称,并承诺在一周内提供权重。同时,截至 2026 年 8 月 3 日,该模型的核心数据仍来自其制造者,目前尚未发布模型卡或许可证 —— 这正是你需要亲自测试它的原因,而不是忽视它的理由。
无论如何,模型是可替换的部分。而你的架构、你的规范以及你的团队已经做出的决策则不是。将这些保留在任何模型都可以读取的记忆层中,切换到 Qwen3.8-Max —— 或者下个月切换走 —— 就会变成一次配置更改,而不是花一个月的时间去重新解释你早已知道的事情。