powered by TechFeed
表示モード
主要ニュース

xAIの音声認識API「Grok Voice Transcribe 2.0」が精度2倍・価格据え置きで登場 — 公開ベンチマーク32モデル中1位を報告、テスラ車内の実音声で訓練

9月19日、Michal Sutterが「SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per Hour」と題した記事を公開した。イーロン・マスク率いるxAI(X.AI Corp)が音声認識API「Grok Voice Transcribe 2.0」をリリースし、前バージョン比で精度2倍・価格据え置きを主張している。本番環境の実音声データで訓練されたモデルが公開ベンチマークの首位を取ったとする内容は、競合ひしめくSTT市場で注目に値する。

9月19日、Michal Sutterが「SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per Hour」と題した記事を公開した。イーロン・マスク率いるxAI(X.AI Corp)が音声認識API「Grok Voice Transcribe 2.0」をリリースし、前バージョン比で精度2倍・価格据え置きを主張している。本番環境の実音声データで訓練されたモデルが公開ベンチマークの首位を取ったとする内容は、競合ひしめくSTT市場で注目に値する。

補足:xAI(X.AI Corp)はイーロン・マスクが2023年に設立したAI企業で、SpaceXとは別法人である。Grokはxが運営するXプラットフォーム(旧Twitter)に統合されたAIアシスタントとして広く知られているが、今回のAPIはxAIが独自に提供する開発者向けサービスだ。


精度2倍、価格据え置き——何が変わったのか

Grok Voice Transcribe 2.0は、xAIが公開した音声認識(STT: Speech-to-Text)APIの最新版だ。モデルIDはgrok-voice-transcribe-2.0で、元記事公開日(9月18日)よりAPIとして利用可能。オープンウェイトの公開はなく、APIとしてのみ提供される。

最大の変更点は多言語の短文認識精度だ。19言語を対象とした短フレーズ(車内コマンドなど)のWER(Word Error Rate:単語誤り率)が、20.6%から6.8%へと約67%改善されている。xAIはこれを「1.0からの最大の改善点」と位置づけている。

ベースとなるモデルは、すでにGrok音声アシスタントとしてテスラ車内で稼働しており、1日数万件のカスタマーサポート通話と数百万時間のビデオ書き起こしをこなしているという。テスラとxAIは別企業だが、GrokはテスラのAIアシスタント機能として車内に統合されており、そこで蓄積された本番環境のノイズの多い実音声データで訓練されている点がこのモデルの特徴だ。研究室で整備されたデータセットではなく、現実の通話や車内音声で鍛えられたという背景は、実用精度の面で重要な差別化ポイントとなりうる。


ベンチマーク結果

xAIは、公開ベンチマークArtificial Analysis Leaderboardのストリーミング部門で、32モデル中1位を報告している。このベンチマーク(AA-WER Streaming)は約8時間の音声データを使用し、AA-AgentTalk 50%・VoxPopuli 25%・Earnings22 25%の配分で集計される。

内部ベンチマークでは以下の4カテゴリを測定している:

  • Telephony(8 kHz):英語のカスタマーサポート通話
  • Conversational:Grokとの英語会話
  • Credentials:電話番号・メールアドレス・住所などの認証情報
  • Short phrases:19言語の音声アシスタント発話

全4カテゴリでバージョン1.0を上回り、特にTelephony分野では「テスト済みの全モデルをリードする」としている。ただし、内部結果はベンダー自己申告であり、第三者による独立検証は行われていない点は留意が必要だ。

STT市場にはOpenAI WhisperDeepgramAssemblyAIといった競合が存在するが、元記事ではこれらとの直接比較は示されていない。公開ベンチマークでの順位はあくまで参考指標として受け取るのが妥当だろう。


開発者向け機能一覧

同一APIに以下の機能がすべて含まれる(追加料金なし):

  • バッチ処理とリアルタイムストリーミング:ファイル・URLの書き起こし、またはWebSocket(wss://api.x.ai/v1/stt)経由のストリーミング
  • 単語レベルのタイムスタンプ:開始・終了時間と信頼スコア付き
  • 話者分離(Speaker Diarization):追加コストなし
  • マルチチャンネル対応:最大8チャンネルを独立して処理
  • キーワードバイアス:リクエストごとに最大100語・各50文字のドメイン固有語を指定可能
  • テキスト整形:数字・日付・通貨・電話番号・メールアドレスを整形済みで返却
  • フィラー除去:「um」「uh」などをデフォルトで除去
  • スマートターン検出:音声エージェント向けに発話終端をMLで予測

バッチエンドポイントは500 MBまでのファイルを12フォーマットで受け付ける。ストリーミングではOpusコーデックを使用することで、生PCM(24 kHz・約48 KB/s)に対して約4 KB/sに帯域を抑えられる。


料金体系

料金はバージョン1.0から変更なし。

モード 料金
バッチ $0.10/時間(約$1.67/1,000分)
ストリーミング $0.20/時間(約$3.33/1,000分)

話者分離・タイムスタンプ・キーワードバイアスはすべて料金に含まれる。


実装例

curl -X POST https://api.x.ai/v1/stt \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -F model=grok-voice-transcribe-2.0 \
  -F format=true \
  -F language=en \
  -F file=@audio.mp3

採用事例:Atlassian Loom

Atlassian LoomはGrok Voice Transcribe 2.0を採用し、全動画の書き起こしに使用している。xAIが紹介するワークフローは「録音→書き起こし→コード生成」の流れで、LoomでアクションプランをレコーディングしたあとトランスクリプトをCursorに流し込み、コード変更まで自動化するというものだ。AtlassianのSVP Sanchan Saxenaは「コンテキストからコードへのループを閉じる」と表現している。


詳細はSpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per Hourを参照していただきたい。