阿里通义新一代 TTS 模型,用标签控制笑、喘气、愤怒,48kHz 影视级音质,登顶 Speech Arena 全球第一。


阿里通义新一代 TTS 模型,用标签控制笑、喘气、愤怒,48kHz 影视级音质,登顶 Speech Arena 全球第一。
2026 年 7 月 20 日,阿里通义千问正式发布新一代语音合成大模型 Qwen-Audio-3.0-TTS。它要解决的不再是"能不能说话",而是"会不会表达"——通过结构化的情感/语气标签和自然语言指令,你可以精确控制什么时候抽气、什么时候轻笑、什么时候愤怒。
官方公布的两条关键成绩:Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena 以 Elo 1236 登顶全球第一,微超 Simba 3.2(1234);同时提供面向实时交互的 Flash 版本(首包延时约 300ms)。如果你做语音助手、有声书、播客配音或游戏 NPC,这是目前国产 TTS 里最值得上手的一档。
| 版本 | 定位 | 延迟 | 适合场景 |
|---|---|---|---|
| Qwen-Audio-3.0-TTS-Flash | 实时交互 | 首包 ~300ms | 语音助手、客服、对话 Agent |
| Qwen-Audio-3.0-TTS-Plus | 高质量生成 | 较高 | 有声书、影视配音、内容生产 |
简单原则:要"秒回"选 Flash,要"好听"选 Plus。
这是 3.0 最直观的升级。在文本中直接插入方括号标签,模型会在对应位置渲染情绪动作:
她猛地站起来[gasp],盯着屏幕看了很久。
"你居然真的做了……"[giggles] 那好吧,我服了。
这件事我忍了很久了[angry],今天必须说清楚。常用标签包括 [gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等,覆盖哭、笑、叹气、停顿等情绪动作。写小说配音、剧情化广告时非常香。
不想记标签?用一句话描述情绪,模型会自行演绎:
(指令)请用一种又疲惫又自嘲的语气念这段话,每句话之间稍微停顿。
(文本)周一早上挤地铁,方案被打回三次,咖啡洒在白衬衫上……适合短视频脚本、广告口播这类需要"调性"而非精确动作的内容。
覆盖中文、英文、日文、韩文等 16 种主语言,外加 20 种方言(如粤语、四川话、上海话)。跨语种有声内容、地方化营销不用再换模型。
采样率 48kHz,直接对标影视后期标准。不再需要后期降噪或升频,可以直接进剪辑线。
Qwen-Audio-3.0-TTS 通过阿里云百炼平台(DashScope)对外提供,同一个模型名称同时支持 WebSocket 和 HTTP 两种协议,根据延迟要求选择。
适用场景:语音助手、对话机器人、在线客服。
wss://dashscope.aliyuncs.com/api-ws/v1/inference/调用思路(伪代码):
import dashscope
from dashscope.audio.tts_v2 import SpeechSynthesizer
dashscope.api_key = "sk-xxx" # 百炼平台获取
synthesizer = SpeechSynthesizer(
model="qwen-audio-3.0-tts-flash", # 实时用 Flash
voice
💡 提示:Flash 版本首包延时约 300ms,已达到对话级体感。如果想做 Agent 语音,配合 Qwen LLM 的流式输出,可以做"边想边说"。
适用场景:有声书批量合成、在线教育配音、视频后期配音。
https://dashscope.aliyuncs.com/api/v1/services/audio/ttsqwen-audio-3.0-tts-pluscurl -X POST 'https://dashscope.aliyuncs.com/api/v1/services/audio/tts' \
-H 'Authorization: Bearer sk-xxx' \
-H 'Content-Type: application/json' \
-d '{
"model": "qwen-audio-3.0-tts-plus",
"input": {
"text": "她猛地站起来[gasp],盯着屏幕看了很久。"
},
"parameters": {
"voice": "Cherry",
"format": "mp3",
"sample_rate": 48000
}
}'💡 提示:批量生产内容(如整本书的有声化)建议走 HTTP + 异步任务,避免阻塞主线程。
如果默认音色不够用,百炼平台还提供**声音复刻(Voice Cloning)**能力——上传几秒到几十秒目标人声样本,训练出可复用的自定义音色。文档:https://www.alibabacloud.com/help/zh/model-studio/voice-cloning-user-guide。
| 模型 | 厂商 | 主打能力 | 适合谁 |
|---|---|---|---|
| Qwen-Audio-3.0-TTS | 阿里 | 语音合成 + 情感标签 + 多语言 | 配音、有声书、对话 Agent |
| 豆包音频生成模型 1.0 | 字节 | 通用音频生成 | 音效、环境声 |
| 歌歌 AI | 第三方 | 音乐生成 | 写歌、配乐 |
简而言之:TTS 找 Qwen-Audio-3.0-TTS,音效找豆包,音乐找歌歌。
sk-xxx 即可跑通第一条语音sample_rate 显式设为 48000,避免降到默认 16kHz/24kHz。相关链接

VideoClaw和JoyAI-Echo两大开源框架同日发布,分别用多智能体协作和跨模态记忆库解决AI长视频一致性问题,本文对比两者技术方案。

OpenAI发布全新Dreaming V3记忆架构,ChatGPT会在后台「做梦」整理你的信息,首次向十亿免费用户开放,Plus/Pro记忆容量翻倍。

Cloudflare新增对Claude Managed Agents的支持,开发者可以在Cloudflare平台上运行Claude代理,连接私有系统,实现安全的AI代理部署。