powered by TechFeed
表示モード
Google

Googleの音声AIが「メルボルンのDJ風」の声をプロンプト一行で生成できるようになった — 2,000種類超のプリセットと声複製機能も搭載

9月23日、MarkTechPostが「Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With Prompt-Based Voice Design」と題した記事を公開した。Googleが新たにリリースしたテキスト読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」の機能と仕様について詳しく紹介されている。

9月23日、MarkTechPostが「Google Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With Prompt-Based Voice Design」と題した記事を公開した。Googleが新たにリリースしたテキスト読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」の機能と仕様について詳しく紹介されている。


「声をプロンプトで作る」という発想の転換

「メルボルンのDJ」と一行書くだけで、それらしい声質が生成される。冗談のような話だが、これがGemini 3.8 TTSの実際の動作だ。「単調なロボット」「日本の龍」といった記述からも対応する声を作れる。テキストプロンプトで新しい声を生成できるというこの仕組みは、100以上の言語・方言にわたって機能する。

従来のGemini TTSは30種類のプリセット音声を選ぶ方式だった。今回の3.8リリースはその発想を大きく転換し、自然言語による声のデザインを中心に据えた。「メルボルンのDJらしさ」をプリセット番号で指定する時代から、言葉で描写する時代への移行と言える。

加えて、2,000種類以上のプロダクション向けプリセット音声がライブラリとして提供される。メキシコ系スペイン語、ケベック・フランス語、スコットランド英語といった地域変種まで網羅している。生成したカスタム音声は保存・再利用でき、プロジェクト間での音質のばらつきも最小限に抑えられるとGoogleは説明している。

今後実装予定のボイスリミックス機能では、ライブラリ音声の音色・ピッチ・速度・アクセントをプロンプトで調整できるようになる。


2つのモデルの使い分け

リリースは用途別に2モデルに分かれている。

  • Gemini 3.8 Flash TTS:ゲーム、オーディオブック、ポッドキャスト、インタラクティブメディアなど、クリエイティブな用途向け。演技指示、ペーシング、方言切り替え、バックチャネリング(会話中の相槌や「うんうん」といった受け答え)まで細かく制御できる。
  • Gemini 3.8 Flash-Lite TTS:吹き替え、音声エージェントなど大量処理・コスト効率優先の用途向け。後述のHume AI総合品質指数では2位にランクイン。

APIのモデル識別子はそれぞれ gemini-3.8-flash-tts と gemini-3.8-flash-lite-tts。Gemini APIおよびGoogle AI Studioから利用できる。セルフホスティング向けのオープンウェイトは提供されない。


スクリプトに「演技指示」を書ける

両モデルとも、台本内に直接ステージディレクションを記述できる。

  • <laughs>、<sigh>、<gasp> といったタグで非言語的な表現を挿入できる(ボーカルバースト:笑い声・ため息・息をのむ音など言語化されない発声表現の総称)
  • |mhm|、|yeah| のような相槌で反応のタイミングやコメディのテンポを制御できる(バックチャネリング:聞き手が会話中に発する「うん」「そうですね」といった短い相槌のこと)
  • 1つのスクリプトで2話者の会話を生成するネイティブ2話者ステージングに対応
  • 数時間にわたる連続音声でも音質・ペーシング・音色が維持される長尺生成に対応

音声複製と安全対策

自分の声を複製する機能も搭載されている。30秒の音声サンプルと、声の所有者による口頭同意の録音が必要で、同意録音はリファレンス話者と照合される。なお、この機能はAI StudioではUK・EEA・インドを含む複数地域で利用不可となっている。

安全面では、Gemini Audioモデルが生成する全音声にSynthID(DeepMindが開発した、AI生成コンテンツに人間の耳には聞こえない形で埋め込まれる電子透かし技術)の電子透かしが付与される。複製音声にはさらにC2PA(Coalition for Content Provenance and Authenticity:Adobe・Microsoft・Googleらが参加するコンテンツの来歴・真正性を証明するためのオープン標準規格)コンテンツ認証情報も付与される。


ベンチマーク結果

Googleが公表している評価結果は以下の通りだ。

Hume AI Voice Design Benchmarkは、音声AIの声質デザイン能力を総合的に評価するベンチマークで、アクセントの正確さ・感情表現・音声の自然さなど複数の観点からスコアを算出する。スコアが高いほど人間の評価者による評価に近い声質を生成できることを示す。

  • Hume AI Voice Design Benchmark:Flash TTSがスコア71.4で総合1位
  • アクセントモデリング:Flash TTSがスコア60.8でトップ
  • Hume AI 総合品質指数:Flash TTSが1位、Flash-Lite TTSが2位
  • Voice Arena盲検評価:日本語、ブラジル系ポルトガル語、ベトナム語、現代標準アラビア語、メキシコ系スペイン語、ヒンディー語で両モデルが上位

詳細はGoogle Releases Gemini 3.8 Flash TTS and Flash-Lite TTS With Prompt-Based Voice Designを参照していただきたい。