powered by TechFeed
表示モード
Google

Googleの音声AI「Gemini 3.8 Live」、推論中も沈黙しない設計でSpeech品質ベンチマーク1位

9月20日、startuphub.aiが「Google ships voice AI that talks while it thinks」と題した記事を公開した。音声AIの長年の課題だった「考えている間の沈黙」を設計レベルで解消したモデル、Gemini 3.8 LiveをGoogleが正式リリースした。GPT-4oの音声モードやGrok Voiceが競合するリアルタイム音声AI市場において、Googleが真っ向から取り組んだのが「レイテンシと推論精度のトレードオフ」だ。

9月20日、startuphub.aiが「Google ships voice AI that talks while it thinks」と題した記事を公開した。音声AIの長年の課題だった「考えている間の沈黙」を設計レベルで解消したモデル、Gemini 3.8 LiveをGoogleが正式リリースした。GPT-4oの音声モードやGrok Voiceが競合するリアルタイム音声AI市場において、Googleが真っ向から取り組んだのが「レイテンシと推論精度のトレードオフ」だ。


会話を止めずに推論する

2026年9月15日、Google DeepMindはGemini 3.8 LiveおよびGemini 3.8 Live Extended Thinkingをリリースした。両モデルの最大の特徴は、「会話を止めない」ことだ。

従来の音声AIは、複雑な推論が必要な質問を受けると処理中に沈黙が発生しやすかった。GPT-4oの音声モードをはじめとする既存サービスでも、多段階の推論が必要な場面では数秒から十数秒の無音が生じることがある。音声UIにおいて沈黙は「応答なし」と受け取られやすく、ユーザー体験を大きく損なう。この問題はリアルタイム音声AIが実用サービスへ展開される際の最大の障壁のひとつとされてきた。

Googleはこれを設計上の問題として正面から取り組んだ。Gemini 3.8 Live Extended Thinkingは多段階推論を行いながら、「Let me check that…」のような言葉で進捗を逐次ナレーションし、思考中も音声出力を継続する。ユーザー側からは、AIが考えながら話しているように聞こえる設計だ。

一方、標準のGemini 3.8 Liveはスケールとコスト効率を重視してチューニングされており、流暢な対話とビジュアルグラウンディング(カメラ映像などの視覚情報との紐付け)に対応している。


ベンチマーク数値

Google DeepMindのTom Ouyang(Principal Engineer)とMalini Jaganathan(Member of Technical Staff)が公開した数値は以下の通りだ。

ベンチマーク スコア
Artificial Analysis' Speech to Speech Quality Index 82.6(1位)
τ-Voice 68.6%
Sierra's τ-Voice-banking 35.1%
Big Bench Audio 97.7%

Extended ThinkingはArtificial Analysis のSpeech to Speech Quality Index で1位を獲得。Gemini 3.8 LiveはSpeech Agent Arenaで2位に入った。

両モデルともServiceNowのEVA-Benchにおいて、精度と会話品質のバランスを示すPareto Frontier(パレートフロンティア)を前進させている。Pareto Frontierとは、あるトレードオフ関係にある複数の指標(ここでは推論精度と応答速度)において、どちらかを犠牲にせずに両方を改善した状態を指すML・最適化分野の用語だ。「精度を上げれば遅くなる」という従来の制約を超えた、という意味で使われている。


インフラとして何が必要だったか

このリリースの前提として、Googleは以下を既に整備していた。

  • Live API:音声・映像のニアリアルタイムストリーミング
  • 97言語対応:文の途中での言語切り替えにも対応
  • バックグラウンドでのツール呼び出し:会話を中断せずに外部API等を実行

分配チャネルとしては、Geminiアプリ、Google Workspace、Search Liveが対象だ。


デモで示されたユースケース

公開されているデモでは、実用性の高い場面が複数示されている。

  • カメラ映像を使ったビジュアルコンテキスト付きオンボーディング:画面に映るものを認識しながら音声で案内する
  • カメラ越しのチェスプレイ:盤面を視覚的に読み取り、指し手を音声でやり取りする
  • スケッチ→Reactコンポーネント変換:手書きのUIスケッチを撮影し、音声フィードバックを受けながらコードに変換する
  • 非同期ファンクションコールによる予約の連鎖実行:複数の外部サービスAPIを会話中断なしに順次呼び出す

特に開発者にとって注目度が高いのが最後の非同期ファンクションコールだ。従来の音声エージェントでは外部API呼び出しのたびに会話が止まるケースが多く、複数ツールを連鎖させるワークフローの実装が難しかった。Gemini 3.8 Liveはこれをバックグラウンドで処理することで、エージェント型アプリケーションの設計の幅を広げる。


現在の提供状況

両モデルは現在、Gemini APIおよびGoogle AI Studioで利用可能だ。

  • エンタープライズ向け:Gemini Enterpriseでプライベートプレビュー中。Customer ExperienceおよびGoogle Workspaceでのビジネスアクセスは近日公開予定
  • コンシューマー向け:Gemini 3.8 LiveはSearch Liveに搭載。Extended ThinkingはGoogle AI ProおよびUltraサブスクライバー向けのGemini Liveに加え、Docs Live、Gmail Live、Keep Liveに提供

開発者向けの位置付けとして、GoogleはGemini 3.8 Liveを「推論による遅延のない、低レイテンシ音声エージェント体験のデフォルト選択肢」として明示している。Extended Thinkingは精度が必要な場面向けの上位オプションという棲み分けだ。音声AIを本番サービスに組み込む開発者にとって、レイテンシと精度を用途に応じて選べる構成は実践的な選択肢になる。

詳細はGoogle ships voice AI that talks while it thinksを参照していただきたい。