GPT-Liveで変わったこと、変わらなかったこと
GPT-LiveはOpenAIの現世代の音声モデルであり、その背後にあるエンジニアリングは真に新しい成果です。これはフルデュプレックス(全二重)アーキテクチャで動作します。モデルは聞き取りと発話を同時に行うことができ、独自の音声を生成しながら入力音声の処理が可能です。OpenAIのエンジニアは、従来の「発話区間検出器(turn detectors)」を廃止し、音声を継続的にストリーミングするモデルを採用したこと、そしてウェブ検索、ツール呼び出し、より深い推論などの重い処理をバックグラウンドモデルに委任することで、それらの処理中も会話が途切れないようにしたことを説明しています。ローンチ時、そのバックグラウンドモデルはGPT-5.5でした。
この展開は2026年7月にかけてChatGPTユーザーに届き、OpenAIは2026年8月初旬にこの6ヶ月にわたる再構築の記録を公開しました。また、2026年7月31日以降、ChatGPT Voiceを通じて生成されたサポート対象の音声にはSynthIDのウォーターマーク(電子透かし)が埋め込まれ、公開検証ツールが提供されています。
これらはすべて、会話の「内部」に関するものです。レイテンシ、割り込み、あなたがまだ話している最中にモデルが「ふむふむ(mhmm)」と言えるかどうか、といった点です。通話を切った後に何が残るかについては、何一つ関係していません。その瞬間において人間らしく感じられる音声スタックと、瞬間と瞬間の間で知識を維持するメモリレイヤーは、まったく異なる2つの問題であり、再構築されたのはそのうちの1つだけです。
ChatGPTが音声会話を忘れてしまう理由
継続性はあなたではなく、1つのチャットにスコープされている
この仕組みは場所に基づいています。文字起こしはあなたが話したチャットに保存され、再開するにはそのチャットに戻って再び音声アイコンをタップする必要があります。これは、作業が1つの長期的なスレッドで完結している場合にはうまく機能します。しかし、クライアントごと、機能ごと、週ごとなど、作業が複数の会話に分散している場合(これがほとんどの人の実際のChatGPTの使い方です)には機能しません。
音声クリップには有効期限がある
LiveおよびAdvanced Voice会話の音声クリップ、およびAdvanced Voiceのビデオクリップは、チャット履歴の文字起こしと一緒に保存され、30日間保持されます。チャットを削除すると、関連する音声やビデオも30日以内に削除されます。あなたが話した内容の記録は、長期的なアーカイブとして設計されているわけではなく、そのように扱うといずれ痛い目を見ることになります。
メモリが保持するのは結論であり、会話そのものではない
ChatGPTのチャット間メモリは、2026年中に、静的な事実のリストを保存するのではなく、過去の多くのチャットを読み取ってユーザーの全体像を構築するバックグラウンド統合プロセスを中心に再構築されました。これはパーソナライズにおいては真の進歩です。しかし、文字起こしの保存場所ではありません。あなたがデータパイプラインに取り組んでいることは記憶しますが、2024年のバックフィルのために一部返金ではsettled_atをnullableのままにすることに決めたことや、合意したしきい値が500ミリ秒ではなく400ミリ秒であったことは記憶しません。
音声は、再説明のコストが最も高いモードである
テキストチャットでは、仕様を貼り付けて次に進むことができます。しかし、話している最中に貼り付けることはできません。音声は、毎回コンテキストを「声に出して」構築しなければならないインターフェースであり、だからこそここでのギャップが他のどこよりも痛手となるのです。一部のプロフェッショナルが、セッション間でフィールド名やビジネスルールなどの正確な技術的詳細を失い、毎回声に出して再定義していると報告しているのは、まさにこれが理由です。
人々が試みている対策
文字起こしをテキストチャットにコピーする。 これは機能し、最も一般的な解決策です。音声会話を終了し、「音声チャット終了」カードの上にある文字起こしをコピーしてテキストチャットに貼り付ければ、コンテンツはモデルが他のメッセージと同様に読み取るテキストになります。デメリットは、これが手動であり、事後に行う必要があり、40分間の会話が巨大なテキストの壁になり、それを何度も再貼り付けし続けなければならなくなる点です。
1つの巨大なスレッドで生きる。 プロジェクトごとに1つのチャットを維持し、常にその中で話します。継続性は保たれますが、スレッドが長くなりすぎると、初期の内容がワーキングコンテキストからこぼれ落ち、回答の質が静かに低下し始めます。
別で録音する。 ボイスレコーダーと文字起こしツールを使用すれば、永続的なファイルが得られます。しかし、これはChatGPTからは見えないアーカイブとなり、必要とするすべての会話に毎回アップロードし直さなければならなくなります。
カスタム指示(Custom instructions)とプロジェクトファイル。 固定された好みや参照ドキュメントには適しています。しかし、これらは静的です。あなたが作成するものであり、昨日話した内容から自動的に成長することはありません。
これらはすべて、手動でテキストを移動させる方法にすぎません。自分が話した内容を、それを話した場所以外から取り出せるようにするものではありません。
解決策:音声コンテキストにチャット外の「家」を与える
構造的な解決策は、チャットスレッドをストレージとして扱うのをやめることです。知識を単一の会話の外にあるメモリレイヤーに配置し、新しいChatGPTチャット、コーディングエージェント、チームメンバーのツールなど、使用しているあらゆるものからそれを読み取れるようにします。MemoryLakeは、まさにそのために構築されています。メモリを1つの製品に埋め込まれた機能ではなく、MCPやAPIを介してアクセス可能な独自のレイヤーとして提供します。
数分で使い始めることができます。
ステップ1:APIキーを作成する
キーを生成し、約30秒で最初のリクエストを送信できます。これは、ツールがメモリを読み書きするために使用する認証情報です。

ステップ2:最初のメモリをアップロードする
音声での作業で何度も立ち返るアーティファクト(散歩中にコピーした文字起こし、データ辞書、決定ログ、仕様書のPDF、ホワイトボードのスクリーンショットなど)を投入します。ドキュメント、画像、その他のファイルはすべて同じ場所に保存されます。

ステップ3:AIとエージェントを接続する
Claude、Codex、OpenClaw、その他のエージェントに、MCPを介してそのメモリへのアクセスを許可します。一般ユーザー向けのチャットにネイティブなMCPクライアントがないChatGPTの場合、APIを介して関連するメモリを取得し、会話の開始時に注入するか、ChatGPTを中心に構築したツールにその取得を自動で行わせます。その結果、どのチャットであっても、次の音声会話はすでにあなたの用語がロードされた状態で始まります。

実務における変化
測定可能な違いは、すべてのセッションの最初の2分間に現れます。現在、「ええと、覚えていると思うけど、返金パイプラインに取り組んでいて、フィールド名はsettled_atで、一部返金にはnullableでいいって合意したよね」という言葉で始まっている音声会話が、代わりに本題の質問から始まります。
これを1日に5回行うと、すでに確立したコンテキストを説明するためだけに、週に1時間近くを費やしていることになります。二次的なコストはさらに深刻です。再説明が面倒になると、人は説明を省略しがちになり、モデルはかつて完全に把握していた決定事項の、不完全な要約に基づいて動作することになります。その結果、先週決定したことと静かに矛盾する回答が生成されることになります。
耐久性の観点もあります。音声クリップは30日で期限切れになります。チャットは削除されます。アカウントは移行されます。1つのスレッド内の音声文字起こしにしか存在しない決定事項は、賞味期限のある決定事項です。
音声ファーストの作業におけるベストプラクティス
音声をその日のうちにアーティファクトに変換する
音声セッションの最後に、ChatGPTに決定事項と未解決の質問を要約させ、その要約をスレッドに残すのではなく、メモリレイヤーにプッシュします。2分間の整理を行うことで、消えやすい文字起こしを永続的なものに変換できます。
結果だけでなく、決定の背景も保存する
「しきい値は400ms」という事実は、いずれその理由を忘れてしまいます。「6月の決済コールバックのp95が380msだったため、しきい値は400msとする。プロバイダーが変更された場合は再検討する」という事実であれば、担当者が変わっても残ります。なぜそうなったのかという背景を持つメモリこそが、同じ議論が二度繰り返されるのを防ぎます。
機密性の高い部分は音声のループから除外する
音声会話は、あなたがコントロールできないスケジュールで文字起こし、保存、保持されます。口座番号や個人データを声に出して言うのではなく、「Q3のトラブル対応のクライアント」のように参照表現で話し、機密性の高い詳細は組織が実際に承認したシステムに保管してください。
結論
ChatGPT Voiceはこの点において、評判よりも優れています。単一のチャット内であれば、文字起こしを保持し、再開することができます。しかし、同時に多くの人が想定しているよりも制限されています。なぜなら、保証されているのはそれだけだからです。音声クリップは30日後に期限切れになり、メモリはあなたが指示した内容そのものではなく統合された結論を保持し、あるスレッドで話した内容は次のスレッドでは利用できません。
GPT-Liveは、モデルとの会話を本物の会話のように感じられるものにしました。しかし、その会話に関するモデルの記憶をポータブル(持ち運び可能)にしたわけではありません。音声コンテキストが、それが生み出されたチャットの外のどこかに配置されるまでは、歩きながらの会話は毎回、前回の内容を再構築することから始まります。あなたが所有するメモリレイヤーこそが、その40分間の会話を「一度言うだけで済むもの」に変えるのです。