即梦AI视频
当前位置:首页>AI模型>Qwen-Audio-3.0-TTS:阿里推出的新一代实时语音合成大模型

Qwen-Audio-3.0-TTS:阿里推出的新一代实时语音合成大模型

Qwen-Audio-3.0-TTS是什么

Qwen-Audio-3.0-TTS 是阿里通义千问团队推出的新一代实时语音合成(TTS)大模型,于 2026 年 7 月 20 日发布。它在多语种与方言覆盖、自然语言指令控制、细粒度标签控制以及复杂声学环境鲁棒性四个方向实现系统性升级,官方将其定位为让合成语音从"能说话"走向"会表达"。模型提供两个版本:Flash 面向实时交互,首包延迟约 300ms;Plus 面向高质量生成,在自然度和音色还原度上表现更佳。官方表示,在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 斩获冠军。两款模型已上线阿里云百炼平台,对开发者开放调用。

Qwen-Audio-3.0-TTS:阿里推出的新一代实时语音合成大模型

Qwen-Audio-3.0-TTS的核心能力

  • 多语种精准合成: 覆盖中文、英文、日语、韩语、德语等 16 种语言,并针对全球多语种场景专项优化。据官方数据,Qwen-Audio-3.0-TTS 系列在 16 种语言中有 10 种取得最佳 WER/CER 表现,Flash 版平均 WER/CER 低至 3.87、Plus 版为 3.96(评测基于 CV3-Eval multilingual benchmark,官方自测)。
  • 音色还原能力强: 官方数据显示,Plus 版在全部 16 种语言的说话人相似度(SS)上均排名第一,平均达 82.75;Flash 版为 80.44(评测基于 CV3-Eval multilingual benchmark,官方自测)。
  • 20 种中文方言: 通过更高质量方言数据与专门的方言强化训练阶段,缓解通用语音强化学习中的"方言特色弱化"问题,支持广东、重庆、东北、甘肃、贵州、浙江、河北、河南、湖北、湖南、江西、宁波、宁夏、青岛、陕西、山西、山东、上海、四川、云南等 20 种方言,在韵律、声调和口语化表达上更接近母语者。
  • Free-style 自由指令: 支持用自然语言直接"导演"声音,无需专业声学或标注知识,即可通过自然语言定义情绪、角色、场景、语速等维度,并支持上下文驱动的语气选择——同一句文本在不同场景下可读出不同情绪。
  • 细粒度标签控制: 可在文本中直接嵌入 [gasp](吸气)、[giggles](轻笑)、[angry](愤怒)等结构化标签,对语气、情绪和呼吸类细节进行精准调控,支持耳语、笑场、情绪转折等表达,标签可灵活组合构建复杂情感。
  • 复杂声学鲁棒性: 通过真实声学仿真训练将语音增强能力原生注入复刻流程,在高混响、高噪声等复杂环境下自动"过滤干扰、保留音色",即使参考音频条件不佳,合成语音依然保持高质量。
  • 双版本与长音频: Flash 首包延迟约 300ms 适配实时交互,Plus 侧重高质量生成;音频输出品质从 24kHz 跃升至 48K,单次语音合成支持长达 3 分钟,满足长文本播报需求。

Qwen-Audio-3.0-TTS的适用场景

  • 有声书与数字人: 自然语言指令与标签控制配合,实现同一文本内多情绪、多角色的表达切换,一人可分饰多角,声音更接近真实说话,适合有声书、播客和数字人口播。
  • 游戏与影视配音: 细粒度标签精确到呼吸和情绪转折,适合需要精确控制非语言细节的叙事、游戏和影视配音场景。
  • 实时语音交互: Flash 版本约 300ms 首包延迟,适合智能助手、实时语音对话、客服语音等对延迟敏感的场景,角色化表达可覆盖电台主持、心理咨询、科幻 AI 等风格。
  • 出海与下沉市场: 16 种语言加 20 种方言覆盖,兼顾出海多语种业务与下沉市场的本地化听觉体验。
  • 复杂环境语音克隆: 抗噪与抗混响能力,让开发者可基于普通录音条件下采集的参考音频复刻音色。

Qwen-Audio-3.0-TTS的产品定价

Qwen-Audio-3.0-TTS Flash 与 Plus 两款模型通过阿里云百炼平台按调用计费,具体价格以阿里云百炼官网为准。

如何使用Qwen-Audio-3.0-TTS

  1. 开通百炼服务: 登录阿里云百炼平台,开通模型服务并获取 API Key。
  2. 选择模型版本: 根据场景选择 Flash(实时交互)或 Plus(高质量生成)版本。Plus 直达:bailian.console.aliyun.com/.../qwen-audio-3.0-tts-plus;Flash 直达:bailian.console.aliyun.com/.../qwen-audio-3.0-tts-flash
  3. 编写合成文本: 用 Free-style 自然语言指令定义情绪、角色、场景、语速,或在文本中插入 [gasp]、[giggles]、[angry] 等标签控制细节,并指定语言、方言与音色。
  4. 调用 API 生成: 通过 DashScope SDK 或 API 调用模型,获取合成音频,支持流式与非流式输出。
  5. 集成到业务: 将生成音频接入有声书、数字人、游戏、影视配音、语音助手等业务流程。

常见问题

Q:Qwen-Audio-3.0-TTS Flash 和 Plus 有什么区别?

A:Flash 面向实时交互,首包延迟约 300ms,适合智能助手、实时语音对话等低延迟场景;Plus 面向高质量生成,在自然度和音色还原度上表现更佳,且在 Artificial Analysis 榜单中夺冠,适合有声书、配音等对质量要求高的内容制作。

Q:它是开源模型吗?

A:本次发布的 Qwen-Audio-3.0-TTS Flash 与 Plus 是通过阿里云百炼平台调用的闭源 API 模型。此前 Qwen 团队曾在 2026 年初开源过 Qwen3-TTS 系列,两者是不同产品线,请注意区分。

Q:Free-style 指令和标签控制有什么区别?

A:Free-style 是用自然语言整体描述想要的情绪、角色、场景和语速,无需专业知识;标签控制是在文本具体位置嵌入 [gasp]、[giggles]、[angry] 等结构化标记,精确到某个词句的呼吸和情绪细节。两者可配合使用,前者定基调、后者抠细节。

Q:支持哪些语言和方言?

A:覆盖中文、英文、日语、韩语、德语等 16 种语言,中文方言支持广东、重庆、东北、甘肃、贵州、浙江、河北、河南、湖北、湖南、江西、宁波、宁夏、青岛、陕西、山西、山东、上海、四川、云南共 20 种。

Q:48kHz 音质和方言音色现在都能用吗?

A:部分方言、小语种精品音色及 48K 高清音频输出正在阿里云百炼平台陆续上线中,其中 48K 功能预计于 2026 年 7 月 24 日正式开放,具体以控制台实际展示为准。

Q:语音克隆需要很干净的录音吗?

A:不需要。新模型通过真实声学仿真训练,将语音增强融入复刻流程,在高混响、高噪声环境下也能过滤干扰、保留目标音色。

豆包AI助手
©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。