Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル

·Toolin 編集部

アリババ Qwen の新世代 TTS モデル。タグで笑い・呼吸・怒りを制御でき、48kHz の映像級サウンド。Speech Arena で世界首位に立った実力を解説します。

Qwen-Audio-3.0-TTS:感情を表現できる音声合成モデル

2026 年 7 月 20 日、Alibaba の Qwen は新世代の音声合成大規模モデル Qwen-Audio-3.0-TTS を正式発表しました。このモデルが解決しようとしているのはもう「話せるかどうか」ではなく「表現できるかどうか」です。構造化された感情/トーンタグと自然言語による指示を使えば、いつ息を呑むか、いつ小さく笑うか、いつ怒るかを正確にコントロールできます。

公式が公表した 2 つの重要な成果を紹介します。まず、Qwen-Audio-3.0-TTS-Plus が Artificial Analysis Speech Arena で Elo 1236 を獲得し、世界首位に立ちました(2 位は Simba 3.2 の 1234)。また、リアルタイム対話向けの Flash バージョンも提供されており、初音レイテンシは約 300ms です。音声アシスタント、オーディオブック、ポッドキャストのナレーション、ゲーム NPC を作っているなら、現時点で最も試す価値のある中国発 TTS のひとつです。

2 つのバージョン、どちらを選ぶか

バージョン位置づけレイテンシ適したシーン
Qwen-Audio-3.0-TTS-Flashリアルタイム対話初音 ~300ms音声アシスタント、カスタマーサポート、対話 Agent
Qwen-Audio-3.0-TTS-Plus高品質生成やや高めオーディオブック、映像ナレーション、コンテンツ制作

シンプルな原則は、「即レス」が必要なら Flash、「音質」が必要なら Plus です。

コア機能:4 つのコントロール手法

1. 感情/トーンの構造化タグ

3.0 で最も直感的なアップグレードがこれです。テキスト中に角括弧のタグを直接挿入すると、モデルが対応する位置で感情表現をレンダリングします。

她猛地站起来[gasp],盯着屏幕看了很久。
"你居然真的做了……"[giggles] 那好吧,我服了。
这件事我忍了很久了[angry],今天必须说清楚。

よく使うタグには [gasp](息を呑む)、[giggles](小さく笑う)、[angry](怒り)などがあり、泣く、笑う、ため息、間(ポーズ)といった感情動作をカバーします。小説のナレーションやストーリー仕立ての広告制作で特に威力を発揮します。

2. Free-style の自然言語指示

タグを覚えたくない場合は、感情を一文で描述すれば、モデルが自ら演じ分けてくれます。

(指令)请用一种又疲惫又自嘲的语气念这段话,每句话之间稍微停顿。
(文本)周一早上挤地铁,方案被打回三次,咖啡洒在白衬衫上……

ショート動画の台本、広告のナレーションのように、正確な動作よりも「トーン」が求められるコンテンツに向いています。

3. 16 の言語 + 20 の方言

中国語、英語、日本語、韓国語など 16 の主要言語をカバーし、さらに 20 の方言(広東語、四川語、上海語など)に対応しています。多言語オーディオコンテンツや地域向けマーケティングでもモデルを切り替える必要がありません。

4. 48kHz 映像級の音質

サンプリングレートは 48kHz で、映像ポストプロダクションの標準に直接匹敵します。後段のノイズ除去やアップサンプリングが不要になり、そのまま編集ラインに載せられます。

導入方法:DashScope の 2 つの経路

Qwen-Audio-3.0-TTS は Alibaba Cloud の Model Studio(百煉プラットフォーム、DashScope)から提供されており、同じモデル名が WebSocket と HTTP の 2 つのプロトコルに同時対応しています。レイテンシ要件に応じて選びましょう。

経路 A:リアルタイム音声合成(WebSocket、低レイテンシ)

適したシーン:音声アシスタント、対話ボット、オンラインカスタマーサポート。

呼び出しのイメージ(擬似コード):

import dashscope
from dashscope.audio.tts_v2 import SpeechSynthesizer

dashscope.api_key = "sk-xxx"  # Model Studio(百煉)のコンソールで取得

synthesizer = SpeechSynthesizer(
    model="qwen-audio-3.0-tts-flash",  # リアルタイム用途は Flash
    voice="Cherry",                     # 音色(ボイス)を選択
    callback=your_callback,             # ストリーミング用コールバック
)
synthesizer.streaming_call("她猛地站起来[gasp],盯着屏幕看了很久。")
synthesizer.streaming_complete()

💡 ヒント:Flash バージョンの初音レイテンシは約 300ms で、対話レベルの体感に達しています。Agent に音声を喋らせたい場合は、Qwen LLM のストリーミング出力と組み合わせれば「考えながら喋る」動作が実現できます。

経路 B:非リアルタイム音声合成(HTTP、高品質)

適したシーン:オーディオブックの一括合成、オンライン教育のナレーション、動画のアフレコ。

curl -X POST 'https://dashscope.aliyuncs.com/api/v1/services/audio/tts' \
  -H 'Authorization: Bearer sk-xxx' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "qwen-audio-3.0-tts-plus",
    "input": {
      "text": "她猛地站起来[gasp],盯着屏幕看了很久。"
    },
    "parameters": {
      "voice": "Cherry",
      "format": "mp3",
      "sample_rate": 48000
    }
  }'

💡 ヒント:コンテンツの大量生産(本 1 冊まるごとの音声化など)では、HTTP + 非同期タスクを使うとメインスレッドをブロックせずに済みます。

カスタム音色:ボイスクローン

デフォルトの音色では足りない場合、Model Studio では**ボイスクローン(Voice Cloning)**機能も提供されています。数秒から数十秒の対象者の音声サンプルをアップロードすれば、再利用可能なカスタム音色を学習できます。ドキュメント:https://www.alibabacloud.com/help/zh/model-studio/voice-cloning-user-guide。

選び方:Doubao や歌歌 AI との違い

モデルベンダー主な強み向いている人
Qwen-Audio-3.0-TTSAlibaba音声合成 + 感情タグ + 多言語ナレーション、オーディオブック、対話 Agent
Doubao 音声生成モデル 1.0ByteDance汎用オーディオ生成効果音、環境音
歌歌 AIサードパーティー音楽生成作曲、BGM 制作

要するに、音声合成なら Qwen-Audio-3.0-TTS、効果音なら Doubao、音楽なら歌歌 AI という住み分けです。

クイックスタートチェックリスト

  1. Alibaba Cloud アカウントを登録し、Model Studio(百煉)を開通する:https://bailian.console.aliyun.com/
  2. 「API Key 管理」で Key を作成する
  3. 上のコード例をどれかコピーし、sk-xxx を置き換えれば最初の 1 音が鳴らせます
  4. 公式サンプルリポジトリ:https://github.com/aliyun/alibabacloud-bailian-speech-demo

よくある質問

  • タグが効かず、文字そのまま読み上げられる? タグ対応のモデルバージョン(Plus / Flash 3.0)を使っているか確認してください。旧版の CosyVoice は構造化タグを認識しません。
  • レイテンシが 300ms より大幅に高い? Flash モデル + WebSocket プロトコルを使っているか確認しましょう。HTTP モードではリアルタイム性は保証されません。
  • 音がこもって聞こえる? sample_rate を明示的に 48000 に設定し、デフォルトの 16kHz/24kHz に落ちないようにしてください。

関連リンク