Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル
アリババ Qwen の新世代 TTS モデル。タグで笑い・呼吸・怒りを制御でき、48kHz の映像級サウンド。Speech Arena で世界首位に立った実力を解説します。


Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル
アリババ Qwen の新世代 TTS モデル。タグで笑い・呼吸・怒りを制御でき、48kHz の映像級サウンド。Speech Arena で世界首位に立った実力を解説します。
2026 年 7 月 20 日、Alibaba の Qwen は新世代の音声合成大規模モデル Qwen-Audio-3.0-TTS を正式発表しました。このモデルが解決しようとしているのはもう「話せるかどうか」ではなく「表現できるかどうか」です。構造化された感情/トーンタグと自然言語による指示を使えば、いつ息を呑むか、いつ小さく笑うか、いつ怒るかを正確にコントロールできます。
公式が公表した 2 つの重要な成果を紹介します。まず、Qwen-Audio-3.0-TTS-Plus が Artificial Analysis Speech Arena で Elo 1236 を獲得し、世界首位に立ちました(2 位は Simba 3.2 の 1234)。また、リアルタイム対話向けの Flash バージョンも提供されており、初音レイテンシは約 300ms です。音声アシスタント、オーディオブック、ポッドキャストのナレーション、ゲーム NPC を作っているなら、現時点で最も試す価値のある中国発 TTS のひとつです。
2 つのバージョン、どちらを選ぶか
| バージョン | 位置づけ | レイテンシ | 適したシーン |
|---|---|---|---|
| Qwen-Audio-3.0-TTS-Flash | リアルタイム対話 | 初音 ~300ms | 音声アシスタント、カスタマーサポート、対話 Agent |
| Qwen-Audio-3.0-TTS-Plus | 高品質生成 | やや高め | オーディオブック、映像ナレーション、コンテンツ制作 |
シンプルな原則は、「即レス」が必要なら Flash、「音質」が必要なら Plus です。
コア機能:4 つのコントロール手法
1. 感情/トーンの構造化タグ
3.0 で最も直感的なアップグレードがこれです。テキスト中に角括弧のタグを直接挿入すると、モデルが対応する位置で感情表現をレンダリングします。
她猛地站起来[gasp],盯着屏幕看了很久。
"你居然真的做了……"[giggles] 那好吧,我服了。
这件事我忍了很久了[angry],今天必须说清楚。よく使うタグには [gasp](息を呑む)、[giggles](小さく笑う)、[angry](怒り)などがあり、泣く、笑う、ため息、間(ポーズ)といった感情動作をカバーします。小説のナレーションやストーリー仕立ての広告制作で特に威力を発揮します。
2. Free-style の自然言語指示
タグを覚えたくない場合は、感情を一文で描述すれば、モデルが自ら演じ分けてくれます。
(指令)请用一种又疲惫又自嘲的语气念这段话,每句话之间稍微停顿。
(文本)周一早上挤地铁,方案被打回三次,咖啡洒在白衬衫上……ショート動画の台本、広告のナレーションのように、正確な動作よりも「トーン」が求められるコンテンツに向いています。
3. 16 の言語 + 20 の方言
中国語、英語、日本語、韓国語など 16 の主要言語をカバーし、さらに 20 の方言(広東語、四川語、上海語など)に対応しています。多言語オーディオコンテンツや地域向けマーケティングでもモデルを切り替える必要がありません。
4. 48kHz 映像級の音質
サンプリングレートは 48kHz で、映像ポストプロダクションの標準に直接匹敵します。後段のノイズ除去やアップサンプリングが不要になり、そのまま編集ラインに載せられます。
導入方法:DashScope の 2 つの経路
Qwen-Audio-3.0-TTS は Alibaba Cloud の Model Studio(百煉プラットフォーム、DashScope)から提供されており、同じモデル名が WebSocket と HTTP の 2 つのプロトコルに同時対応しています。レイテンシ要件に応じて選びましょう。
経路 A:リアルタイム音声合成(WebSocket、低レイテンシ)
適したシーン:音声アシスタント、対話ボット、オンラインカスタマーサポート。
- プロトコル:WebSocket のストリーミング入出力
- エンドポイント:
wss://dashscope.aliyuncs.com/api-ws/v1/inference/ - ドキュメント:https://help.aliyun.com/zh/model-studio/realtime-tts-user-guide
呼び出しのイメージ(擬似コード):
import dashscope
from dashscope.audio.tts_v2 import SpeechSynthesizer
dashscope.api_key = "sk-xxx" # Model Studio(百煉)のコンソールで取得
synthesizer = SpeechSynthesizer(
model="qwen-audio-3.0-tts-flash", # リアルタイム用途は Flash
voice="Cherry", # 音色(ボイス)を選択
callback=your_callback, # ストリーミング用コールバック
)
synthesizer.streaming_call("她猛地站起来[gasp],盯着屏幕看了很久。")
synthesizer.streaming_complete()💡 ヒント:Flash バージョンの初音レイテンシは約 300ms で、対話レベルの体感に達しています。Agent に音声を喋らせたい場合は、Qwen LLM のストリーミング出力と組み合わせれば「考えながら喋る」動作が実現できます。
経路 B:非リアルタイム音声合成(HTTP、高品質)
適したシーン:オーディオブックの一括合成、オンライン教育のナレーション、動画のアフレコ。
- プロトコル:HTTP POST
- エンドポイント:
https://dashscope.aliyuncs.com/api/v1/services/audio/tts - モデル:
qwen-audio-3.0-tts-plus - ドキュメント:https://help.aliyun.com/zh/model-studio/non-realtime-tts-user-guide
curl -X POST 'https://dashscope.aliyuncs.com/api/v1/services/audio/tts' \
-H 'Authorization: Bearer sk-xxx' \
-H 'Content-Type: application/json' \
-d '{
"model": "qwen-audio-3.0-tts-plus",
"input": {
"text": "她猛地站起来[gasp],盯着屏幕看了很久。"
},
"parameters": {
"voice": "Cherry",
"format": "mp3",
"sample_rate": 48000
}
}'💡 ヒント:コンテンツの大量生産(本 1 冊まるごとの音声化など)では、HTTP + 非同期タスクを使うとメインスレッドをブロックせずに済みます。
カスタム音色:ボイスクローン
デフォルトの音色では足りない場合、Model Studio では**ボイスクローン(Voice Cloning)**機能も提供されています。数秒から数十秒の対象者の音声サンプルをアップロードすれば、再利用可能なカスタム音色を学習できます。ドキュメント:https://www.alibabacloud.com/help/zh/model-studio/voice-cloning-user-guide。
選び方:Doubao や歌歌 AI との違い
| モデル | ベンダー | 主な強み | 向いている人 |
|---|---|---|---|
| Qwen-Audio-3.0-TTS | Alibaba | 音声合成 + 感情タグ + 多言語 | ナレーション、オーディオブック、対話 Agent |
| Doubao 音声生成モデル 1.0 | ByteDance | 汎用オーディオ生成 | 効果音、環境音 |
| 歌歌 AI | サードパーティー | 音楽生成 | 作曲、BGM 制作 |
要するに、音声合成なら Qwen-Audio-3.0-TTS、効果音なら Doubao、音楽なら歌歌 AI という住み分けです。
クイックスタートチェックリスト
- Alibaba Cloud アカウントを登録し、Model Studio(百煉)を開通する:https://bailian.console.aliyun.com/
- 「API Key 管理」で Key を作成する
- 上のコード例をどれかコピーし、
sk-xxxを置き換えれば最初の 1 音が鳴らせます - 公式サンプルリポジトリ:https://github.com/aliyun/alibabacloud-bailian-speech-demo
よくある質問
- タグが効かず、文字そのまま読み上げられる? タグ対応のモデルバージョン(Plus / Flash 3.0)を使っているか確認してください。旧版の CosyVoice は構造化タグを認識しません。
- レイテンシが 300ms より大幅に高い? Flash モデル + WebSocket プロトコルを使っているか確認しましょう。HTTP モードではリアルタイム性は保証されません。
- 音がこもって聞こえる?
sample_rateを明示的に48000に設定し、デフォルトの 16kHz/24kHz に落ちないようにしてください。
関連リンク
- リアルタイム音声合成ドキュメント:https://help.aliyun.com/zh/model-studio/realtime-tts-user-guide
- 非リアルタイム音声合成ドキュメント:https://help.aliyun.com/zh/model-studio/non-realtime-tts-user-guide
- Python SDK リファレンス:https://help.aliyun.com/zh/model-studio/cosyvoice-tts-python-sdk
- 公式サンプルリポジトリ:https://github.com/aliyun/alibabacloud-bailian-speech-demo