火山引擎发布 Doubao-Seed-Audio 1.0,把对白、配乐、音效和环境声压进一条 Prompt 一次性直出,支持多角色对白、2 分钟长程一致与参考音色续写,被称为语音模型的 Seedance 时刻。


火山引擎发布 Doubao-Seed-Audio 1.0,把对白、配乐、音效和环境声压进一条 Prompt 一次性直出,支持多角色对白、2 分钟长程一致与参考音色续写,被称为语音模型的 Seedance 时刻。
做一段十几秒的有声剧,传统流程是先生成角色 A 的台词,再生成角色 B,再找 BGM,叠脚步声、风声、金属打击声,最后拖进剪辑软件一层层对齐。豆包音频生成模型 1.0(Doubao-Seed-Audio 1.0)想干掉的就是这条流水线——你把"谁在说、什么情绪、什么场景、中间该有什么声响"写进一段提示词,它直接吐出一段能交付的成片级音频。
火山引擎今天在火山方舟上开放了 Seed-Audio 1.0 的体验与 API 邀测,个人用户享有 30 分钟创作额度,后续也会接入剪映、即梦、番茄等产品。如果你做过有声小说、播客、短剧配音,这个模型最值得试的就是它不再只是"像人说话",而是能用声音导演一段戏。

一次前向就把多角色对白、配乐、音效、环境声打包成一段成片级音频。
名字的变化藏着最大的转向。上一版还叫"豆包语音合成模型 2.0",这次直接跳到"音频生成模型 1.0"——从"合成一句像人的话"升级成"生成一段完整的戏"。三个能力是这次的关键:
@ 可引用多段音频实现多人多音色对白、非语言表达(笑声/叹息/停顿/方言)、音乐音效全部一体化生成。
模型已上线火山方舟体验中心,入口在文末。提示词不需要写得多花哨,把四样东西说清楚就够:
访问火山方舟音频生成 1.0 体验页:
https://ark.volcengine.com/region:cn-beijing/experience/voice?model=doubao-seed-audio-1-0以一段三人古风漫剧为例,把旁白(青年男)、长老(老年男)、少年三个角色的台词、语气,连同古筝、大鼓、灵剑出鞘、人群哄笑等声效直接写进同一条 Prompt。模型会按角色分音色输出,背景声与人声统一在一个场景里,不会出现"两个人不在同一空间"的割裂感。
💡 提示:想让对话像在同一个空间里发生,关键是把环境描述写进 Prompt,而不是只写台词。比如"长老公堂问话,少年殿前怒斥,背景有钟鸣和远处的脚步摩擦"。

艾莎放大招那段特效音的提示词只写了一句"能量骤然爆发的轰的闷响 + 冰晶炸开坠地的清脆碎裂声"。
文本输入框里用 @ 引用一段已有音频,可以锁定音色继续往后生成。实测里那个出圈的设计师独白(语音合成 2.0 生成),就是被当作参考音频扔进去,让 1.0 续上了后续 1 分钟的剧情——甲方老板被吵醒的睡意、电话挂断后的三秒死寂、忙音都一次生成。
可以 @ 多段音频,实现多人多音色对话。
单次输出 2 分钟。如果第一版人物状态对了,把这 2 分钟当参考继续延,可以做出几十分钟的有声书或播客,音色、语气、环境保持一致——这是过去最难手工修音的环节。
延长模式下,前后几十分钟的角色声音由模型一次性交付,不需要逐段比对反复修音。
实测覆盖了三种典型场景,效果差别明显:
另外测了纯安静的 case——李白《将进酒》。长程延长一致性在这里最明显:很多模型读长句会"漂",前后声音不像同一个人;1.0 单次 2 分钟内音色、情绪起伏保持稳定。
💡 提示:参考音频生成是这次最实用、也最容易被忽略的能力。你已经手头有的、用旧版语音合成产出的优质音色片段,不必重做——上传当参考,让 1.0 续写新剧情即可。
体验入口:火山方舟音频生成 1.0 体验中心(点击原文直达)。API 已开放邀测,面向音频创作者即将上线剪映、即梦、番茄。

开源微信命令行工具wechat-cli,支持11个命令操作本地微信数据,可导出聊天记录、搜索消息、统计分析,专为AI Agent集成设计。

Anthropic 推出 Managed Agents,企业提供需求即可在云端运行 AI 智能体,基础设施全包按用量收费,0.08美元/会话小时

开源Agent客户端Codepilot支持Claude、OpenAI、国产模型Codeplan,提供Skills/MCP/IM远程连接/生成式UI等完整功能,附详细安装配置教程