toolin.ai logo
toolin.ai
首页
AI工具
AI技能包
AI资讯
精选推文
AI提示词
价格
提交AI工具提交
toolin.ai logo
toolin.ai

AI玩家的创作利器库,发现最佳AI工具组合,提升您的创作效率

AI工具1,376个
技能包11个
产品功能
  • AI工具
  • AI技能包
  • AI资讯
  • 精选推文
  • 提交AI工具
  • 价格
关于我们
  • 关于Toolin
  • 联系我们
  • 合作洽谈
  • 更新日志
关注我们
© 2025 toolin.ai. All rights reserved.
服务条款隐私政策

Qwen-Audio-3.0-TTS:能表达情绪的语音合成模型

2026/07/20
·toolin小编

阿里通义新一代 TTS 模型,用标签控制笑、喘气、愤怒,48kHz 影视级音质,登顶 Speech Arena 全球第一。

Qwen-Audio-3.0-TTS:能表达情绪的语音合成模型
Qwen-Audio-3.0-TTS:能表达情绪的语音合成模型
2026/07/20

Qwen-Audio-3.0-TTS:能表达情绪的语音合成模型

阿里通义新一代 TTS 模型,用标签控制笑、喘气、愤怒,48kHz 影视级音质,登顶 Speech Arena 全球第一。

两个版本,选哪一个核心能力:四种控制方式1. 情感/语气结构化标签2. Free-style 自然语言指令3. 16 种语言 + 20 种方言4. 48kHz 影视级音质怎么接入:DashScope 两条路径路径 A:实时语音合成(WebSocket,低延迟)路径 B:非实时语音合成(HTTP,高质量)自定义音色:声音复刻怎么选:和豆包、歌歌AI 的区别快速上手清单常见问题
AI产品

2026 年 7 月 20 日,阿里通义千问正式发布新一代语音合成大模型 Qwen-Audio-3.0-TTS。它要解决的不再是"能不能说话",而是"会不会表达"——通过结构化的情感/语气标签和自然语言指令,你可以精确控制什么时候抽气、什么时候轻笑、什么时候愤怒。

官方公布的两条关键成绩:Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena 以 Elo 1236 登顶全球第一,微超 Simba 3.2(1234);同时提供面向实时交互的 Flash 版本(首包延时约 300ms)。如果你做语音助手、有声书、播客配音或游戏 NPC,这是目前国产 TTS 里最值得上手的一档。

两个版本,选哪一个

版本定位延迟适合场景
Qwen-Audio-3.0-TTS-Flash实时交互首包 ~300ms语音助手、客服、对话 Agent
Qwen-Audio-3.0-TTS-Plus高质量生成较高有声书、影视配音、内容生产

简单原则:要"秒回"选 Flash,要"好听"选 Plus。

核心能力:四种控制方式

1. 情感/语气结构化标签

这是 3.0 最直观的升级。在文本中直接插入方括号标签,模型会在对应位置渲染情绪动作:

她猛地站起来[gasp],盯着屏幕看了很久。
"你居然真的做了……"[giggles] 那好吧,我服了。
这件事我忍了很久了[angry],今天必须说清楚。

常用标签包括 [gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等,覆盖哭、笑、叹气、停顿等情绪动作。写小说配音、剧情化广告时非常香。

2. Free-style 自然语言指令

不想记标签?用一句话描述情绪,模型会自行演绎:

(指令)请用一种又疲惫又自嘲的语气念这段话,每句话之间稍微停顿。
(文本)周一早上挤地铁,方案被打回三次,咖啡洒在白衬衫上……

适合短视频脚本、广告口播这类需要"调性"而非精确动作的内容。

3. 16 种语言 + 20 种方言

覆盖中文、英文、日文、韩文等 16 种主语言,外加 20 种方言(如粤语、四川话、上海话)。跨语种有声内容、地方化营销不用再换模型。

4. 48kHz 影视级音质

采样率 48kHz,直接对标影视后期标准。不再需要后期降噪或升频,可以直接进剪辑线。

怎么接入:DashScope 两条路径

Qwen-Audio-3.0-TTS 通过阿里云百炼平台(DashScope)对外提供,同一个模型名称同时支持 WebSocket 和 HTTP 两种协议,根据延迟要求选择。

路径 A:实时语音合成(WebSocket,低延迟)

适用场景:语音助手、对话机器人、在线客服。

  • 协议:WebSocket 流式输入/输出
  • 端点:wss://dashscope.aliyuncs.com/api-ws/v1/inference/
  • 文档:https://help.aliyun.com/zh/model-studio/realtime-tts-user-guide

调用思路(伪代码):

import dashscope
from dashscope.audio.tts_v2 import SpeechSynthesizer

dashscope.api_key = "sk-xxx"  # 百炼平台获取

synthesizer = SpeechSynthesizer(
    model="qwen-audio-3.0-tts-flash",  # 实时用 Flash
    voice



💡 提示:Flash 版本首包延时约 300ms,已达到对话级体感。如果想做 Agent 语音,配合 Qwen LLM 的流式输出,可以做"边想边说"。

路径 B:非实时语音合成(HTTP,高质量)

适用场景:有声书批量合成、在线教育配音、视频后期配音。

  • 协议:HTTP POST
  • 端点:https://dashscope.aliyuncs.com/api/v1/services/audio/tts
  • 模型:qwen-audio-3.0-tts-plus
  • 文档:https://help.aliyun.com/zh/model-studio/non-realtime-tts-user-guide
curl -X POST 'https://dashscope.aliyuncs.com/api/v1/services/audio/tts' \
  -H 'Authorization: Bearer sk-xxx' \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "qwen-audio-3.0-tts-plus",
    "input": {
      "text": "她猛地站起来[gasp],盯着屏幕看了很久。"
    },
    "parameters": {
      "voice": "Cherry",
      "format": "mp3",
      "sample_rate": 48000
    }
  }'

💡 提示:批量生产内容(如整本书的有声化)建议走 HTTP + 异步任务,避免阻塞主线程。

自定义音色:声音复刻

如果默认音色不够用,百炼平台还提供**声音复刻(Voice Cloning)**能力——上传几秒到几十秒目标人声样本,训练出可复用的自定义音色。文档:https://www.alibabacloud.com/help/zh/model-studio/voice-cloning-user-guide。

怎么选:和豆包、歌歌AI 的区别

模型厂商主打能力适合谁
Qwen-Audio-3.0-TTS阿里语音合成 + 情感标签 + 多语言配音、有声书、对话 Agent
豆包音频生成模型 1.0字节通用音频生成音效、环境声
歌歌 AI第三方音乐生成写歌、配乐

简而言之:TTS 找 Qwen-Audio-3.0-TTS,音效找豆包,音乐找歌歌。

快速上手清单

  1. 注册阿里云账号,开通百炼平台:https://bailian.console.aliyun.com/
  2. 在"API Key 管理"创建 Key
  3. 复制上面任一代码示例,替换 sk-xxx 即可跑通第一条语音
  4. 官方示例仓库:https://github.com/aliyun/alibabacloud-bailian-speech-demo

常见问题

  • 标签没生效,读成了字面量? 检查是否使用了支持标签的模型版本(Plus / Flash 3.0),旧版 CosyVoice 不识别结构化标签。
  • 延迟比 300ms 高很多? 确认使用的是 Flash 模型 + WebSocket 协议,HTTP 模式无法保证实时性。
  • 音质发闷? 把 sample_rate 显式设为 48000,避免降到默认 16kHz/24kHz。

相关链接

  • 实时语音合成文档:https://help.aliyun.com/zh/model-studio/realtime-tts-user-guide
  • 非实时语音合成文档:https://help.aliyun.com/zh/model-studio/non-realtime-tts-user-guide
  • Python SDK 参考:https://help.aliyun.com/zh/model-studio/cosyvoice-tts-python-sdk
  • 官方示例仓库:https://github.com/aliyun/alibabacloud-bailian-speech-demo
所有文章

作者

avatar for toolin小编
toolin小编

分类

  • AI产品
两个版本,选哪一个核心能力:四种控制方式1. 情感/语气结构化标签2. Free-style 自然语言指令3. 16 种语言 + 20 种方言4. 48kHz 影视级音质怎么接入:DashScope 两条路径路径 A:实时语音合成(WebSocket,低延迟)路径 B:非实时语音合成(HTTP,高质量)自定义音色:声音复刻怎么选:和豆包、歌歌AI 的区别快速上手清单常见问题

相关文章

AI长视频生成:两大开源框架对比评测
AI产品

AI长视频生成:两大开源框架对比评测

VideoClaw和JoyAI-Echo两大开源框架同日发布,分别用多智能体协作和跨模态记忆库解决AI长视频一致性问题,本文对比两者技术方案。

avatar for toolin小编
toolin小编
2026/06/08
ChatGPT记忆系统全面升级:Dreaming V3上线
AI产品

ChatGPT记忆系统全面升级:Dreaming V3上线

OpenAI发布全新Dreaming V3记忆架构,ChatGPT会在后台「做梦」整理你的信息,首次向十亿免费用户开放,Plus/Pro记忆容量翻倍。

avatar for toolin小编
toolin小编
2026/06/08
Cloudflare集成Claude托管代理:开发者实战指南
AI产品

Cloudflare集成Claude托管代理:开发者实战指南

Cloudflare新增对Claude Managed Agents的支持,开发者可以在Cloudflare平台上运行Claude代理,连接私有系统,实现安全的AI代理部署。

avatar for toolin小编
toolin小编
2026/06/08
=
"Cherry"
,
# 选择音色
callback=your_callback, # 流式回调
)
synthesizer.streaming_call("她猛地站起来[gasp],盯着屏幕看了很久。")
synthesizer.streaming_complete()