メインコンテンツへスキップ
AI News 18分で読める

Gemini 3.8 Live 音声AI解説|GPT-Live-1の7分の1の価格で品質首位

「競合の7分の1の価格でベンチマーク首位。未経験からAIを使い始めた自分でも、これはさすがに驚いた」。日本語AIコミュニティで活動するまさお氏は2026年9月16日、note.comにそう書いた(出典:まさお@未経験からプロまでAI活用 on note.com)。

その「驚き」の震源は前日9月15日にGoogleが公開したGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingだ。音声AIの価格競争が本格的に始まった。

この記事はこんな人におすすめ
  • 音声AIアプリの開発コスト削減を検討しているエンジニア・PM
  • GPT-Live-1やGrok Voiceの代替を探している方
  • 日本語対応の音声エージェントを構築したい方
  • Gemini 3.8 FlashとLiveの違いを整理したいGoogle Cloud利用者
結論(忙しい人向け)

Gemini 3.8 Live(2026年9月15日リリース)は音声入力$0.005/分・音声出力$0.018/分で、GPT-Live-1の最大7分の1の価格。Extended Thinkingは品質ベンチマーク82.6%で首位。97言語対応、カメラ入力、会話中のAPI非同期実行に対応し、GPT-Live-1にはない機能を複数持つ。ただし標準モデルは品質5位(首位はExtended Thinking)、Extended Thinkingはエンタープライズプレビュー段階のため一般開発者はまだ利用できない。

Gemini 3.8 Live 2モデル構成と価格の数字

GoogleはGemini 3.8 Liveを「2つのモデルのセット」として発表した。

Gemini 3.8 Live(標準): 流暢な会話と視覚的な根拠付け(グラウンディング)に最適化されたモデル。音声入力$0.005/分、音声出力$0.018/分で提供される。1時間の通話(入力・出力それぞれ1時間換算)で$1.38の計算になる。

Gemini 3.8 Live Extended Thinking: 複雑な多段階タスクで高い推論能力を発揮する上位モデル。Artificial Analysisの「音声入力コスト/時」指標では$3.50/時で提供される。

競合との価格比較は下表の通りだ(出典:Artificial Analysis Speech-to-Speech Cost Benchmark, 2026年9月)。

モデルコスト(/時・入力音声基準)品質スコア(SS Quality Index)
Gemini 3.8 Live$0.845位
Gemini 3.8 Live Extended Thinking$3.5082.6%(1位)
Grok Voice Think Fast 2.0$4.8081.3%(3位)
GPT-Live-1 Astra$5.8381.5%(2位)

$0.84対$5.83。Gemini 3.8 Live標準モデルはGPT-Live-1の約7分の1の価格でリリースされた事実は重い。

公式の分単価で比べると差はさらに鮮明だ。音声入力単価は$0.005/分(Gemini)対$0.05/分(GPT-Live-1)で10分の1。OpenAIは9月10日にGPT-Live-1 APIをリリースし、$0.05/分でひと足先に市場を取りに来ていた(出典:OpenAI「Introducing GPT-Live-1 in the API」, 2026年9月10日)。しかし5日後のGoogle発表でその価格優位は瞬く間に失われた。

品質ベンチマークをExtended Thinkingが首位に置いた仕組み

Gemini 3.8 Live Extended ThinkingはArtificial Analysisの「Speech to Speech Quality Index」で82.6%を記録し、GPT-Live-1 Astra(81.5%)やGrok Voice Think Fast 2.0(81.3%)を抑えてトップに立った(出典:Artificial Analysis Speech-to-Speech Benchmark, 2026年9月)。

その理由はアーキテクチャにある。Extended Thinkingは背景推論と音声ストリームを並列で処理する。応答を開始しながら別のスレッドで推論を継続し、「少々お待ちください」「確認しますね」といった口語的なフィラー(充填表現)で時間を稼ぎながら、バックグラウンドでAPIコールを完了させてから結論を伝える。人間のオペレーターが通話しながら社内システムを調べるのに近いフローだ。

Googleの公式ブログはこの設計をこう説明する。「複雑なタスクを解決しながらリアルタイムの音声会話を維持するために必要な、思考とコミュニケーションを同時に行う能力を持つ」(出典:Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google Blog, 2026年9月15日)。

τ-Voiceというエージェント系音声ベンチマークでも68.6%でリードしている。このベンチマークは「複数ターンにわたって実際のタスクを完結させられるか」を測るため、単純な音声品質より実用的な指標として評価されている(出典:Artificial Analysis Speech-to-Speech Benchmark, 2026年9月)。

一方、標準のGemini 3.8 Live(Extended Thinkingなし)は品質ランキング5位と中位の位置付けだ。価格は最安クラスだが品質で首位にあるのはあくまでExtended Thinkingの方、という点は見落としやすいポイントだ。

GPT-Live-1には今もない機能

Gemini 3.8 Liveが競合に対して持つ機能差として、まずカメラ・画面共有による視覚入力がある。音声で話しかけながらカメラが映している場面や画面を同時に解析できる機能だ。GPT-Live-1のフルデュプレックスモード(送受信を同時に処理する全二重通信方式)は現時点でカメラや画面共有に非対応で、Grok VoiceとGeminiはどちらもカメラモードを持つ(出典:Gemini 3.8 Live vs GPT-Live-1: Full-Duplex vs Turn-Based — Orca Router, 2026年9月)。

次に会話中のAPI非同期実行だ。Gemini 3.8 Liveは音声ストリームを途切れさせることなくバックグラウンドでAPIコール・ツール実行を完了できる。予約確認、在庫照会、カレンダー書き込みを通話しながら並列実行させたい場合、音声を止めずに済む設計になっている。

97言語対応と会話中の言語切り替えも特筆点だ。日本語で話しかけて英語に切り替えて戻る、といった多言語ユーザーの自然な話し方に追随できる。コールセンターや訪日外国人向けサービスへの応用で特に有効な特性だ。

開発者エコシステムも即日に整っている。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsがローンチ当日からGemini 3.8 Live統合を提供し、「複雑なリアルタイムメディアストリーミングインフラを開発者が意識せずに高性能な音声インターフェースを構築できる」環境を用意した(出典:Unite.AI「Google Launches Gemini 3.8 Live」, 2026年9月15日)。

パートナー企業の声も公式ブログに掲載されている。医療AI企業のLumerisは「レイテンシ、流暢さ、ツール呼び出しの性能に感銘を受けている」と述べ、GensparkはGemini 3.8 Live Extended Thinkingを「コンシューマー向け音声エージェントへの統合に最適な水準に達した」と評価した(出典:Google Blog, 2026年9月15日)。

エコシステム面でも即日の整備が進んでいる。Agora(リアルタイム通信SDK)、LangChain(LLMオーケストレーション)、LiveKit・Pipecat(音声エージェント基盤)、Vercel(デプロイ)、Vision Agents(マルチモーダルエージェント)など7つのプラットフォームがローンチ当日から統合を提供し、複雑なリアルタイム通信インフラを開発者が意識せずに音声インターフェースを構築できる環境を整えた(出典:Unite.AI, 2026年9月15日)。

Gemini 3.8 Live 導入前に確認すべき制約と注意点

光の面だけ書いて終わるのはフェアではない。現時点で把握しておくべき制約を整理する。

Extended ThinkingはまだエンタープライズプレビューだけでGA(一般提供)していない。品質首位を取ったのはこちらのモデルだが、Gemini APIのエンタープライズアクセスを持つ組織のみが使えるプライベートプレビュー段階だ。一般開発者はGoogle AI Studioで標準モデル(品質5位)にしかアクセスできない。品質首位のモデルを今すぐ使いたい場合はGoogleのエンタープライズ申し込みが必要になる。

標準モデルは品質ランキング5位。ベンチマークで首位という主語をGemini 3.8 Liveシリーズに置くと正確ではなく、正しくはExtended Thinkingだけが首位だ。標準モデルはコスト最適化のトレードオフとして品質を落としている。コスト重視でExtended Thinkingなしの構成を選ぶと、$0.84/時で音声品質は中位圏になる。

価格はまだ変動する可能性がある。GeminiシリーズはGemini 3.8 Flashでも表面価格は据え置きながら思考トークンで実コストが増える構造があり、同じパターンがLiveにも波及するリスクがある(Gemini 3.8 Flash実コスト問題は別記事で詳述している)。現時点の価格が長期的に維持されるとは限らない点は頭に置いておきたい。

GPT-Live-1との絶対的な品質差は薄い。ベンチマーク首位とはいえ、Extended Thinking(82.6%)対GPT-Live-1(81.5%)の差は約1ポイント。実用上の体感差が明確に出るかどうかは用途次第だ。言語学習アプリ「Speak」がGPT-Live-1を使い間違った割り込みを80%削減したという実績が既にある(出典:GPT-Live-1 API解説 — EasternHerald, 2026年9月13日)。「品質首位」と「明確な品質差」は別物として考えるべきだ。

利用開始前のチェックリスト
  • Extended Thinkingを本番で使いたい場合: Googleエンタープライズアクセスの申し込みが必要
  • 標準モデルで十分か: 品質5位でも要件を満たすかユースケースで判断する
  • コスト試算: 通話1時間(入力・出力1:1想定)あたり$1.38(標準)、最大$7.00(Extended Thinking)
  • 競合比較: 同品質帯ならGrok Voice Think Fast 2.0($4.80/時)、高品質ならGPT-Live-1($5.83/時)
  • 視覚入力: GPT-Live-1は現在カメラ非対応のため、カメラ必須なら選択肢はGeminiかGrok Voiceに絞られる

関連記事


音声AIを実際に試したい方へ

Gemini 3.8 LiveはGoogle AI StudioとGemini APIで即時利用可能。標準モデルは無料枠内でのテストが可能です。

今すぐGemini APIで試す

免責事項: 本記事の価格・ベンチマーク数値は2026年9月17日時点の公開情報に基づく。APIの価格は予告なく変更される場合がある。実際の利用にあたっては各公式ドキュメントおよびGoogle Cloud料金ページで最新情報を確認すること。Speech-to-Speech Quality Indexおよびτ-VoiceベンチマークはArtificial Analysisの2026年9月時点の計測によるもので、各モデルのアップデートにより変動する。本記事はGoogleおよびOpenAI、xAIとの商業的提携関係に基づくものではない。

Share