powered by TechFeed
表示モード
主要ニュース

AlibabaのリアルタイムAI音声モデルがGPT-Realtime-2の5分の1の価格で登場 — 「いつ話すか」を自律判断する262Kコンテキストのフルデュプレックス設計

9月29日、MarkTechPostが「Alibaba Qwen Releases Qwen-Audio-3.1-Realtime: A Full-Duplex Voice Model Trained to Think, Act, and Decide When to Speak」と題した記事を公開した。AlibabaのQwenチームが発表したフルデュプレックス音声モデル「Qwen-Audio-3.1-Realtime」の技術的な詳細と競合比較について詳しく紹介されている。GPT-Realtime-2と比べて入力は約5分の1、出力は約3分の1——262Kコンテキストのフルデュプレックス音声エージェントAlibabaのQwenチームがQwen-Audio-3.1をリリースした。ASR・TTS・リアルタイムインタラクションをカバーする5モデル構成のオーディオスタックで、その中核が**Qwen-Audio-3.1-Realtimeだ。スタックにはリアルタイム会話向けのRealtimeモデルのほか、オフラインの長時間文字起こし向けのQwen-Audio-3.1-ASR-Flash-Filetr...

9月29日、MarkTechPostが「Alibaba Qwen Releases Qwen-Audio-3.1-Realtime: A Full-Duplex Voice Model Trained to Think, Act, and Decide When to Speak」と題した記事を公開した。AlibabaのQwenチームが発表したフルデュプレックス音声モデル「Qwen-Audio-3.1-Realtime」の技術的な詳細と競合比較について詳しく紹介されている。

GPT-Realtime-2と比べて入力は約5分の1、出力は約3分の1——262Kコンテキストのフルデュプレックス音声エージェント

AlibabaのQwenチームがQwen-Audio-3.1をリリースした。ASR・TTS・リアルタイムインタラクションをカバーする5モデル構成のオーディオスタックで、その中核が**Qwen-Audio-3.1-Realtimeだ。スタックにはリアルタイム会話向けのRealtimeモデルのほか、オフラインの長時間文字起こし向けのQwen-Audio-3.1-ASR-Flash-Filetrans**も含まれる。後者はホットワード、話者分離、句読点付与、多言語・中国語方言認識をサポートし、入力$0.15・出力$0.47/1Mトークンという低価格で提供される。

エンジニアがまず気にするコスト面から整理する。

モデル 音声入力(1Mトークン) 出力(1Mトークン)
Qwen-Audio-3.1-Realtime-Plus $6.4 $24(テキスト+音声)
OpenAI GPT-Realtime-2 $32 $64
Google Gemini 3.8 Live $3.0 $12

GPT-Realtime-2と比較すると、音声入力で約5分の1、出力で約3分の1の価格になる。さらにQwenは旧バージョンから今回のリリースに合わせてRealtimeを約85%、TTSを約70%、ASRを最大95%値下げしている。

コンテキスト長も262K tokens(入力最大245K、出力最大16K)と、GPT-Realtime-2の128K、Gemini 3.8 Liveの131Kを大きく上回る。

デプロイ形態はWebSocket経由のマネージドAPIのみ。オープンウェイトの公開は現時点でアナウンスされていない。

「話すかどうか」を自分で決める——3層の訓練設計

このモデルの技術的な肝は、単なる音声入出力モデルではなく、「いつ話すか」を自律的に判断するフルデュプレックスシステムとして設計されている点だ。

ここで用語を整理しておく。フルデュプレックス(Full-Duplex)とは、送受信を同時に行える通信方式を指す。これに対しハーフデュプレックス(Half-Duplex)は送受信を交互にしか行えない。従来の多くの音声AIモデルはハーフデュプレックス的な動作——ユーザーの発話が終わるのを待ってから応答を生成する——を前提としていた。Qwen-Audio-3.1-Realtimeはユーザーの発話中でも並行して処理を行い、割り込みや聞き流しを自律的に判断できる点でアーキテクチャ上の差異がある。

内部では2つのモデルが協調動作する。1つ目のフルデュプレックス決定モデルが「聞き続ける・話す・止まる・再開する」の4状態を予測し、2つ目の音声→テキストモデルが応答内容をテキストとして生成する。その後、会話履歴・音声的文脈を条件としたレンダラーがストリーミング音声に変換する。

訓練はThink・Act・Speak and Coordinateの3層で構成される。

Think: M²-OPD

音声モデルをテキストLLMに再アンカリングするSFTを数百万時間規模のペアデータで実施後、オンポリシー蒸留(On-Policy Distillation)を適用する。事前に書かれた回答を模倣するのではなく、モデル自身の生成軌跡を教師モデルがトークン単位でスコアリングする手法だ。この手法はM²-OPD(Multi-Modal On-Policy Distillation)と呼ばれており、共感・語用論的意図・音響シーンの各ドメインエキスパートをGRPOで訓練し、最終的に1つのデプロイ可能なモデルに統合する。

Act: 実行可能環境でのツール使用訓練

各訓練ドメインにはツールプール、JSONデータベース、自然言語で記述されたビジネスポリシーが付属する。ドメインはオープンソースのツール定義およびMCPサーバー定義からシードされる。

タスクの結果は「書き込み成功・正当な拒否・未サポートリクエスト」の3種類のみ。評価は最終状態 → 許可された書き込み → 行動アサーションの順に行われ、流暢な返答は状態チェックの失敗を救えない。これはツール呼び出しの正確性を優先する設計思想だ。

GRPOによる報酬はダイアログ・マイルストーン・ターンの3レベルで与えられる。検索訓練では冗長なクエリにペナルティを課した結果、1回の検索呼び出しあたりの平均クエリ数が4.37から1.05に減少した。一方でトリガーF1は60.87%から58.61%にわずかに低下している。

Speak and Coordinate: 割り込み制御のトレードオフ

フルデュプレックス動作の評価にはFull-Duplex-Bench(音声AIの同時送受信能力を定量評価するベンチマーク)が用いられている。v1.5では、他者に向けた発話への不要な応答率が0.13から0.03に低下。フィラー率もv3.0で0.7590から0.2960に改善した。

ただしトレードオフも明示されている。割り込み後の不要な再開率は0.035から0.130に上昇。割り込み停止レイテンシは1.116秒で、GPT-Realtime-2の0.383秒を大きく下回る。リアルタイム性が重要な用途では課題になりえる数値だ。

ベンチマーク:全体的に改善、ただし人間評価ではGPTに劣る

前バージョン(Qwen-Audio-3.0)との比較では全体的に改善が見られる。

  • Audio MultiChallenge: 47.12 → 52.21
  • BBA 14言語平均: 81.7% → 88.1%
  • FLEURS WER(単語誤り率): 9.01 → 3.98

一方、50セッションの人間によるレッドチーム評価では**GPT-Realtime-2が96.00%に対してQwenは92.00%**。定量ベンチマークと人間評価のギャップは残っている。

なお記事中のτ-Voiceによる数値はハーフデュプレックスのspeech-to-text適応を使ったもので、公式のフルデュプレックス結果とは比較できない点が明記されている。

詳細はAlibaba Qwen Releases Qwen-Audio-3.1-Realtime: A Full-Duplex Voice Model Trained to Think, Act, and Decide When to Speakを参照していただきたい。