GPT-Live完全解説|ChatGPTが「聴きながら話せる」全二重音声の仕組みと注意点
- ChatGPTの音声機能を仕事や学習で使っているユーザー
- GPT-LiveとAdvanced Voice Modeの違いを正確に理解したいエンジニア・PM
- 音声AIをアプリやサービスに組み込みたい開発者
「GPT-liveが今日ChatGPTにやってきた。魔法のようで、本物みたいだ。これまではタイピングのほうがAIとのやりとりに向いていると思っていたが、それが変わりそうだ」。2026年7月8日、GPT-Liveをいち早く試したOpenAI CEO サム・アルトマン自身がXにこう投稿した(Sam Altman, @sama, 2026年7月8日)。
GPT-Liveは、ChatGPTの音声機能をゼロから再設計したモデルだ。最大の変化は「全二重(フルデュプレックス)」アーキテクチャへの転換にある。相手の話が終わるのを待ってから返す従来方式から、話しながら同時に聴く方式へ。この一点の違いが、会話のリズムを根本から変えた。
全二重と半二重 — この差がなぜ大きいのか
電話やトランシーバーの世界では、「半二重」と「全二重」は古くからある概念だ。トランシーバーは半二重で、「送信ボタンを押して話し、離して聴く」のがルールだった。現代の通話は全二重で、話しながら相手の声も聴ける。
従来のChatGPT Advanced Voice Modeは、構造的には半二重に近かった。内部では音声活性化検出(VAD)が沈黙のタイミングを監視し、話し終わったと判断してから処理を開始する。この「エンドポイント検出→音声認識→LLM推論→音声合成」というパイプラインがトータルで約1700ミリ秒の遅延を生んでいた。ほぼ2秒、AIが返答し始める前の「待ち時間」だ。
GPT-Liveはこのパイプラインを捨てた。入力音声と出力音声を同時に流し続ける連続ストリームに切り替え、モデルが1秒間に何度も「今話すか、聴き続けるか、ユーザーに割り込まれたか」を判断し続ける。結果として初回応答遅延は200ミリ秒未満まで圧縮された(OpenAI, 2026年7月8日)。
| 指標 | Advanced Voice Mode(旧) | GPT-Live |
|---|---|---|
| アーキテクチャ | 半二重(逐次処理) | 全二重(並列処理) |
| 初回応答遅延 | 約1700ms | 200ms未満 |
| 相槌 | 不可 | 可(mhmm、なるほど等) |
| 割り込み検出 | VADによる外付け | モデル組み込み |
| リアルタイム翻訳 | なし | あり |
この変化が「会話している感覚」を変える理由は人間の認知にある。会話中の相手がこちらの話を聴きながら「うんうん」と頷く行動は、社会的に「あなたの話を理解している」というシグナルだ。これが欠けていると、どんなに返答が正確でも「機械と話している」感が抜けない。
GPT-Live-1とmini — 2つのモデルと賢さの設定
GPT-Liveは1種類ではない。2026年7月8日の公開時点で、有料プラン向けの「GPT-Live-1」と無料プラン向けの「GPT-Live-1 mini」の2モデルが存在する。
| 項目 | GPT-Live-1 | GPT-Live-1 mini |
|---|---|---|
| 対象プラン | Go・Plus・Pro | Free(段階展開中) |
| 重視する点 | 自然さ・表現力・低遅延 | 速度・コスト効率 |
| インテリジェンス設定 | Instant / Medium / High | 非公開 |
| バックグラウンドモデル | GPT-5.5 | GPT-5.5 |
| Web検索・メモリ | あり | あり |
GPT-Live-1の特徴は「インテリジェンス設定」だ。
- Instant:遅延を最小化した軽快な返答。雑談や素早いQ&Aに向く
- Medium:速度と思考の深さのバランス型
- High:より深い推論を行う。複雑な質問には向くが応答が少し遅くなる
この設定が面白いのは、同じ全二重アーキテクチャのまま「どれだけ考えるか」を変えている点だ。複雑な質問をしたときには、GPT-Live-1が裏側でGPT-5.5を呼び出して深い推論やウェブ検索を行い、表ではそれが終わるまで会話を続けて時間を稼ぎ、結果が出たら自然に組み込む、という設計になっている。
Hacker Newsのスレッドでは開発者から「バックグラウンドでGPT-5.5に質問を委譲できる点が最大の機能だ。数世代前の音声専用モデルに縛られなくなった」という声が上がった(Hacker News, 2026年7月9日)。ChatGPT製品責任者のAtty Eletiも「ウォーキング中に30〜40分間続けて話し続けた」と語り、短いクエリツールではなく長時間コンパニオンとしての使い方を示唆した(TechCrunch, 2026年7月8日)。
日本語と翻訳 — 特筆すべき改善
GPT-Liveの公式発表に付属する評価データを見ると、日本語の成績改善は特に顕著だ。単語誤り率(WER)が旧モデル比で10%以上低下したことが確認されている言語の一つに日本語が含まれており、韓国語・中国語・ベトナム語・ウルドゥー語なども同様に改善している(OpenAI, 2026年7月8日)。
加えて、GPT-Liveにはリアルタイム音声翻訳が標準搭載されている。日本語話者と英語話者が同じ会話に参加し、それぞれの言語で話しながら互いの言葉が翻訳される仕組みだ。重要なのは、これが別の翻訳モデルを経由せず単一モデルが音声→翻訳→音声を一括処理する点で、中間処理の遅延が最小化されている。
日本語ユーザーにとってこの改善は実感しやすいはずだ。以前のAdvanced Voice Modeは日本語の発音を誤認識したり、外来語交じりの会話で頻繁に止まったりする問題が指摘されていた。
Gemini Live・旧Voice Modeとの比較
プロアクティブ音声AIの競合として、GoogleのGemini Liveがある。2025年後半から段階的に提供され、スマートフォン特化の設計で日常会話や検索連携に強みを持つ。一方でGemini LiveはGoogle Workspaceとの連携が深く、ビジネスユーザーには使いやすい。
GPT-LiveとGemini Liveの最大の違いはバックエンドの柔軟性だ。GPT-Liveは「インテリジェンス設定」で思考の深さを変えられる。Gemini Liveは会話の自然さとGoogle製品の統合度に強みがあるが、音声モデル単体としての設定項目は少ない。
| 比較項目 | GPT-Live-1 | Gemini Live | 旧Advanced Voice Mode |
|---|---|---|---|
| アーキテクチャ | 全二重 | 全二重(推定) | 半二重 |
| 相槌 | あり | 部分的 | なし |
| リアルタイム翻訳 | あり | あり | なし |
| バックグラウンド推論 | GPT-5.5連携 | Gemini 2.5連携 | なし |
| 思考深さ設定 | Instant/Medium/High | なし(公開情報なし) | なし |
| 無料プラン対応 | miniあり | あり | 制限あり |
ある評価記事は「実用テストでは、ChatGPTの音声モードはGemini Liveを精度で毎回上回った」と記した(MakeUseOf, 2026年7月9日)。ただし開発者視点ではGemini LiveのAPIが「桁違いに安価」という指摘もあり、実際に組み込む用途でのコスト比較は別途検討が必要だ(Android Authority, 2026年7月9日)。音声AIの「精度・自然さ」と「Google製品との統合度・コスト」のどちらを優先するかで、選択は変わる。
なお、Appleは2026年6月9日のWWDC 2026でSiri AIをiOS 27と共に発表しており、こちらはOS統合の深さとオンデバイス処理による高いプライバシー保護が強みだ。WWDC 2026の全発表内容はそちらの記事で詳しく解説している。
光と影 — 使って分かったGPT-Liveの実態
実際に改善された点
GPT-Liveは確かに「会話している感覚」を変えた。MakeUseOfは「ChatGPTはGemini Liveがすでに持っていたものをついに手に入れた」と表現しており、Gemini Liveに対するキャッチアップが実現した形だ(MakeUseOf, 2026年7月9日)。
音声会話中にWeb検索を並行で実行し、結果を自然に組み込む機能は、旧Advanced Voice Modeからの最大の前進だ。以前は「何か調べて」と頼むと会話が止まった。GPT-Live-1 HighモードではGPT-5.5が裏で動きながら会話が続く。この仕組みはAndroid AuthorityやMakeUseOfなど複数のメディアレビューでも高く評価された(Android Authority, 2026年7月9日)。
ユーザーから上がっている不満点
ただし、OpenAIコミュニティフォーラムやX上では複数の問題点が報告されている。
1. 相槌が多すぎる問題: 「mhmm」「そうですね」を過剰に差し込むため、うるさいと感じるユーザーが続出した。「新しい形の割り込みだ」という批判もある(OpenAI Community, 2026年7月)。
2. 間を取ると割り込まれる: 考えながら話しているとき、1秒の沈黙で「話し終わった」と誤判断して割り込んでくることがある。思考中の自然な間が尊重されにくい。
3. ビデオが使えない: 画面共有やカメラ入力はGPT-Live移行後の現在も旧Advanced Voice Modeを使う必要がある。ビデオ対応の時期はOpenAIから公表されていない。
4. 笑い声のタイミング問題: 「まだ話しているのに笑ってきた」という報告もあり、ユーモアへの反応が早すぎるケースがある(BigGo Finance, 2026年7月)。
これらの問題は全二重の宿命でもある。話しながら聴いているからこそ、判断ミスも会話中に起きる。一方でClaudeの音声は現時点で全二重に未対応だ。Claude Sonnet 5の評価でも触れたが、音声領域ではOpenAIがリードを維持している。
開発者向け: gpt-realtime-2.1とは何か
ChatGPT上のGPT-Live-1モデルはまだAPI提供されていない(2026年7月時点)。ただし開発者向けには2026年7月6日に「gpt-realtime-2.1」と「gpt-realtime-2.1-mini」がすでに提供開始されており、同等の全二重音声を自分のアプリに組み込める。
| API | 音声入力コスト | 音声出力コスト | 用途 |
|---|---|---|---|
| gpt-realtime-2.1 | $32/100万トークン | $64/100万トークン | フル推論・ツール呼び出し |
| gpt-realtime-2.1-mini | $10/100万トークン | $20/100万トークン | 高速・大量処理 |
(出典: OpenAI Advancing Voice Intelligence, 2026年7月6日)
HackerNoonが4000セッションの実測値として報告した実際のコストは、キャッシュなし・ツール使用ありで1分あたり$0.18〜$0.46、キャッシュ最適化済みで$0.05〜$0.10だ(HackerNoon, 2026年)。コールセンター的な用途では、前払い人件費と比較した際のコスト試算が必要になる。
接続方式はWebSocketベースの双方向ストリームで、SIP電話との統合もサポートされている。OpenAI GPT Realtime APIの翻訳機能解説も参考にしてほしい。
GPT-Live-1のAPIへの問い合わせはOpenAI公式サイトのウェイトリストで受け付け中だ。
全二重への転換は、AIが「機械との対話」から「人との会話に近いもの」へ移行する最初の本格的な一手だ。相槌の過剰さやビデオ未対応など実用上の課題は残るが、フルデュプレックス音声はこれ以上後退することはない。今後のアップデートでどの問題点が解消されるかが、音声AIの普及スピードを左右する。
- 音声データの扱い: GPT-Liveはクラウド処理前提。マイクから話した内容はOpenAIのサーバーに送信される。機密情報を声に出して話すことは避けること
- プランを確認する: 無料プランはGPT-Live-1 mini(段階展開中)。GPT-Live-1を使うにはGoプラン($8/月)以上が必要
- ビデオは旧モードで: 画面共有・カメラを使いたい場合は、現時点でChatGPT設定から旧Advanced Voice Modeに戻す必要がある
- 相槌が気になる場合: 現時点では設定で頻度を変えることはできない。OpenAIコミュニティで改善要望が多く集まっている(フォーラム)
開発者向け: GPT Realtime APIを使いこなす
フルデュプレックス音声をアプリに組み込むためのgpt-realtime APIの仕組み・価格・実装パターンを解説しています。
関連記事
- GPT-5.6 Sol/Terra/Luna完全検証 — ベンチマーク不正とFable 5半額の現実
- OpenAI GPT Realtime APIで翻訳音声を実装する
- WWDC 2026全発表まとめ — Siri AI・iOS 27・Apple Intelligence
- Claude Sonnet 5の拒否率急増と料金トラップの実態
本記事の情報は2026年7月10日時点のものです。GPT-Live-1のAPI提供時期、プラン対象、機能範囲はOpenAIの発表によって変更される可能性があります。価格・仕様はOpenAI公式サイトでご確認ください。競合製品の情報は各社の公式発表および複数のメディアソースに基づいています。本記事の情報に基づいて行動した結果生じた損害について、当サイトは一切の責任を負いかねます。