GPT-Live 改变了什么,又有哪些没有改变
GPT-Live 是 OpenAI 当前一代的语音模型,其背后的工程设计是真正的全新工作。它运行在全双工(full-duplex)架构上:模型可以同时听和说,在生成自身语音的同时处理输入的音频。OpenAI 的工程师描述称,他们移除了传统的“轮流检测器(turn detectors)”,取而代之的是一个持续流式传输音频的模型,并将更繁重的工作(如网页搜索、工具调用、更深层次的推理)委托给后台模型,从而使对话在这些工作进行时永远不会中断。在发布时,该后台模型为 GPT-5.5。
这一更新在 2026 年 7 月前陆续推送给 ChatGPT 用户,OpenAI 在 2026 年 8 月初发表了关于这次历时六个月重构的说明。自 2026 年 7 月 31 日起,通过 ChatGPT Voice 生成的受支持音频均带有 SynthID 水印,并配有公开的验证工具。
所有这些改变都发生在对话内部:延迟、打断、模型是否能在你说话时发出“嗯(mhmm)”的声音。但这些都与你挂断电话后能保留什么无关。一个在当下感觉像人类一样的语音技术栈,与一个在不同时刻之间承载知识的记忆层,是两个完全不同的问题,而这次重构只解决了其中一个。
为什么 ChatGPT 会遗忘你的语音对话
连贯性仅限于单个聊天,而不是针对你个人
其机制是基于位置的。转录文本会保存在你说话的那个聊天中,想要恢复对话意味着必须回到该聊天并再次点击语音图标。当你的工作是一个长期运行的单一线程时,这种方式运作良好。但一旦你的工作分布在多个对话中(例如每个客户一个、每个功能一个、每周一个)——而这正是大多数人实际使用 ChatGPT 的方式——它就会失效。
音频片段有有效期
来自 Live 和 Advanced Voice 对话的音频片段,以及来自 Advanced Voice 的视频片段,会与转录文本一起存储在你的聊天记录中,并保留 30 天。如果你删除某个聊天,相关的音频和视频也会在 30 天内被删除。你所说内容的记录并不是为了作为长期存档而设计的,将其视为长期存档最终会让你吃亏。
Memory 保留的是结论,而不是对话本身
ChatGPT 的跨聊天 memory 在 2026 年期间进行了重构,围绕一个后台合成过程展开。该过程会读取许多过去的聊天记录,并构建关于你的更高层次画像,而不是存储静态的事实列表。这对于个性化来说是一个真正的改进。但它不是一个转录文本存储库。它会记住你从事数据管道工作,但不会记住你因为 2024 年的数据回填而决定将部分退款的 settled_at 字段保持为可空(nullable),也不会记住你们商定的阈值是 400 毫秒而不是 500 毫秒。
语音是重新解释成本最高的模式
在文本聊天中,你可以直接粘贴一份规范然后继续。但在说话时你无法进行粘贴。语音是一种每次都必须通过口头叙述来建立上下文的交互界面,这正是为什么这里的断层比其他任何地方都更令人痛苦的原因——也是为什么一些专业人士反映在不同会话之间会丢失诸如字段名称和业务规则等精确的技术细节,然后不得不再次大声重新推导它们的原因。
人们尝试过的方法
将转录文本复制到文本聊天中。 这行得通,也是最常见的解决方法。结束语音对话,复制“语音通话已结束”卡片上方的转录文本,将其粘贴到文本聊天中,这样内容就变成了模型可以像读取其他任何消息一样读取的文本。代价是这是手动的、事后发生的,而且 40 分钟的发言会变成一大堆文本,你现在必须不断地重复粘贴。
生活在单一的永久线程中。 每个项目只保留一个聊天,并且始终在其中进行语音对话。连贯性是真实的,直到线程变得足够长,以至于早期的内容开始从工作上下文中掉落,回答质量悄然变差。
单独录音。 录音机加上转录工具可以给你一个持久的文件。但现在你拥有了一个 ChatGPT 无法看到的存档,除非你再次将其上传到每个需要它的对话中。
自定义指令和项目文件。 适用于稳定的偏好和参考文档。它们是静态的:由你编写,不会根据你昨天说的话自动增长。
以上每一种方法都是手动移动文本的方式。没有一种方法能让你从说出内容的地方之外的任何地方检索到它。
解决方法:在聊天之外为你的语音上下文安个家
结构性的解决方法是停止将聊天线程视为存储空间。将知识放在一个独立于任何单一对话之外的记忆层中,并让你使用的任何工具(无论是新的 ChatGPT 聊天、编程 Agent 还是团队成员的工具)都能从中读取。MemoryLake 正是为此而设计的:将记忆作为一个独立的层,可通过 MCP 或 API 访问,而不是埋在某个产品内部的功能。
你可以在几分钟内运行起来。
步骤 1:创建 API 密钥
生成密钥并在大约 30 秒内发出你的第一次请求。这是你的工具用来读取和写入记忆的凭证。

步骤 2:上传你的第一批记忆
放入你的语音工作不断涉及的产物——散步时粘贴的转录文本、数据字典、决策日志、规范 PDF、白板截图。文档、图像和其他文件都可以放在同一个地方。

步骤 3:连接你的 AI 和 Agent
通过 MCP 让 Claude、Codex、OpenClaw 和其他 Agent 访问该记忆。对于没有原生 MCP 客户端供消费者聊天的 ChatGPT,可以通过 API 检索相关记忆并在对话开始时注入——或者让你围绕 ChatGPT 构建的任何工具为你执行该检索。结果是,下一次语音对话开始时,无论在哪个聊天中,你的术语都已经加载完毕。

这在实践中改变了什么
显而易见的变化是每次会话的前两分钟。目前以“所以,记住,我们正在开发退款管道,该字段名为 settled_at,我们同意部分退款可以为空”开始的语音对话,现在可以直接以实际问题开始。
每天这样做五次,你每周就花近一个小时来叙述你已经确立的上下文。次级成本更糟糕:当重新解释变得繁琐时,人们会进行简化,导致模型最终根据它曾经完整拥有的决策的损耗性总结来工作——这就是为什么你会得到一个与你上周确定的内容悄然矛盾的答案。
还有一个持久性的论点。音频片段在 30 天内过期。聊天会被删除。账号会迁移。一个仅存在于单个线程内语音转录中的决策,是一个有保质期的决策。
语音优先工作的最佳实践
当天将语音转化为产物
在语音会话结束时,让 ChatGPT 总结决策和未决问题,然后将该总结推送到你的记忆层,而不是留在线程中。两分钟的整理就能将易逝的转录文本转化为持久的东西。
存储决策,而不仅仅是结果
“阈值为 400ms”是一个你会忘记原因的事实。“阈值为 400ms,因为 6 月份支付回调的 p95 为 380ms——如果该服务商发生变化,请重新评估”是一个在人员变动后仍能保留的事实。承载了原因的记忆才能阻止同样的争论再次发生。
将敏感部分排除在语音循环之外
语音对话会按照你无法控制的时间表被转录、存储和保留。在说话时使用代称——例如“第三季度升级中的客户”——而不是大声说出账号或个人数据,并将敏感细节保留在你的组织实际批准的系统中。
结论
在这一点上,ChatGPT Voice 比它的名声要好:在单个聊天中,它会保留转录文本并允许你恢复。但它也比大多数人想象的更为受限,因为这就是全部的保证。音频片段在 30 天后过期,memory 保留的是合成的结论而不是你口述的内容,并且你在一个线程中说过的任何内容在下一个线程中都无法使用。
GPT-Live 让与模型的对话感觉像真正的交谈。但它并没有让模型对该对话的记忆变得可移植。在语音上下文能够存在于发生对话的聊天之外的某个地方之前,每一次“边走边谈”都必须从重建上一次对话开始——而一个由你拥有的记忆层,才能将那 40 分钟变成你只需要说一次的内容。