9月23日、The Decoderが「Alibaba launches Qwen Audio 3.1 with new models and slashes AI audio prices by up to 95 percent」と題した記事を公開した。AlibabaのAIチームQwenが音声AI新シリーズ「Qwen-Audio-3.1」を発表し、価格を最大95%削減した。生成AI分野では各社が性能競争を繰り広げているが、Alibabaは今回、性能と同時にコストという実務的な軸でも一気に攻勢をかけた格好だ。音声AIのAPIコストに悩む開発者にとって、看過できないリリースである。
なぜ今これが重要か
音声AIは近年、会議の書き起こし・カスタマーサポートの自動化・音声インターフェース搭載アプリなど、エンタープライズ用途での採用が急拡大している。その一方で、APIコストはスケールするほど重くのしかかる課題だ。OpenAIのWhisper APIはASRで音声1分あたり$0.006、TTSは100万文字あたり$15(標準モデル)という価格水準にある。GoogleのCloud Speech-to-Textも同様の価格帯で推移しており、いずれも大規模運用では無視できないコストになる。
Alibabaは今回、この構造に真正面から切り込んだ。**ASRで最大95%、Realtimeで約85%、TTSで約70%**という削減幅は、単なる値引きではなく、既存の価格前提そのものを崩しにかかる水準だ。
価格の大幅な引き下げ
今回のリリースにあわせて実施された値下げの内訳は以下のとおりだ。
- TTS(テキスト読み上げ):約70%削減
- Realtime(リアルタイム音声):約85%削減
- ASR(音声認識):最大95%削減
ASRの95%削減は特に大きい。音声認識APIのコストはアプリケーションの規模が拡大するほど効いてくるため、この価格水準はプロダクション運用の採用判断に直接影響する。競合サービスとの具体的な価格差は元記事に明示されていないが、この削減率が市場に与えるインパクトは、OpenAIやGoogleに対する明確な価格圧力になり得る。
5つのモデル構成
Qwen-Audio-3.1は用途別に5モデルで構成される。
ASR(音声認識)系
ASRは多言語・方言認識の精度を改善し、フィラーワード(「えー」「あの」など)や繰り返しを自動でクリーンアップする機能を持つ。書き起こし後の後処理コストを減らせる点は実用的だ。
ASR-Nextはさらに踏み込んだ機能を備える。複数話者の識別とタイムスタンプ付き出力に対応し、感情・環境音・機械ノイズの検出も行う。会議の議事録自動生成や、コールセンターの通話分析といった用途で使いやすい構成だ。話者分離とノイズ分類が1モデルで完結するため、複数のAPIを組み合わせていた既存パイプラインを簡略化できる可能性がある。
TTS(音声合成)系
TTSは多言語合成と、言語をまたいだ自然な音声変換(クロスランゲージ・ボイストランスファー)に対応する。感情・速度・スタイルはテキストプロンプトで制御できる。公式の例として挙げられているのが次の指示文だ。
"Read this with a sharp, commanding tone, demanding respect."
(「鋭く、威厳のあるトーンで、敬意を要求するように読め」)
自然言語で音声スタイルを指定できるこのアプローチは、パラメータ調整の手間を省き、非エンジニアでも音声トーンを制御しやすくする。
TTS-Nextは言語モデルと拡散モデル(Diffusionアプローチ)を組み合わせた構成で、音声・効果音・バックグラウンドオーディオを1回の推論で同時生成できる。拡散モデルとは、データにノイズを加えて壊す過程を学習し、その逆順(ノイズから目的の出力を復元する)で高品質なコンテンツを生成する手法だ。画像生成分野ではStable Diffusionなどで広く知られているが、音声合成への応用では音の質感や環境音の自然な合成に強みを発揮する。言語モデルが「何を話すか」の意味的な構造を担い、拡散モデルが「どのように聞こえるか」の音響的な品質を担う分業構造と理解するとわかりやすい。音声合成と効果音生成を別々のパイプラインで処理していた場合、この統合は工程を大きく簡略化できる。
Realtimeモデル
Realtimeモデルは話しながら聞く同時処理(全二重通信)と、即時の割り込み検知に対応する。低遅延の双方向音声会話が必要な音声エージェントやカスタマーサポートボットに向く構成だ。
特筆すべきは、会話相手の感情状態を推定し、応答スタイルをリアルタイムで適応させる機能だ。気分が落ち込んでいると判断した場合は応答速度を落として共感的なトーンに切り替えると説明されている。この機能は音声のピッチ・速度・沈黙の長さといった韻律的特徴から感情を推定し、応答生成のパラメータにフィードバックする仕組みと考えられる。メンタルヘルス支援アプリや、ユーザー離脱防止を重視するコンシューマー向け音声インターフェースでの応用が想定されるが、感情推定の精度や誤検知への対処は実装上の課題になり得る点にも注意が必要だ。
利用方法
モデルの利用はQwen Cloudから可能で、技術的な詳細はAlibabaの公式ブログにも掲載されている。
詳細はAlibaba launches Qwen Audio 3.1 with new models and slashes AI audio prices by up to 95 percentを参照していただきたい。




