即梦AI视频
当前位置:首页>AI资讯>从"能说话"到"会表达":阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型

从"能说话"到"会表达":阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型

2026年7月20日,阿里通义千问团队正式发布新一代实时语音合成大模型 Qwen-Audio-3.0-TTS,官方以"从能说话到会表达"概括本次升级的核心方向。新模型围绕开发者在生产环境中真正会遇到的问题展开优化,在更广的语言覆盖、更自然的指令控制、更精细的标签控制以及参考音频不清晰时的鲁棒性四个维度实现系统性提升。据官方披露,在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 位列冠军。

本次发布包含两个版本,分别面向不同的落地需求。Flash 版本主打实时交互,首包延迟控制在 300 毫秒左右,适配对响应速度敏感的场景;Plus 版本则侧重高质量生成,在自然度和音色还原度上表现更佳。在多语种能力方面,模型覆盖中文、英文、日语、韩语、德语等 16 种语言,官方数据显示其在 16 种语言中有 10 种取得了最佳的 WER/CER 表现,Flash 版平均 WER/CER 低至 3.87、Plus 版为 3.96;在说话人相似度指标上,Plus 版在全部 16 种语言中均排名第一,平均达到 82.75,Flash 版为 80.44,上述评测均基于 CV3-Eval multilingual benchmark。中文方言方面,模型通过更高质量的方言数据与专门的强化训练阶段,支持广东、四川、上海、陕西、东北等 20 种高质量方言,在韵律、声调和口语化表达上更贴近母语者。

在实际应用中,Qwen-Audio-3.0-TTS 提供了两套并行的声音控制方式。例如,内容团队可以使用 Free-style 自然语言指令,无需专业声学或标注知识,直接用自然语言描述情绪、角色、场景和语速,让客服的温和、直播的热情或有声书的角色代入自然呈现;配音与叙事场景则可以在文本中嵌入 [gasp]、[giggles]、[angry] 等结构化标签,精确到某个词句的呼吸和情绪细节,构建复杂情感表达;出海与下沉市场的开发者可以借助 16 种语言与 20 种方言覆盖,为不同地区用户提供融入当地语境的听觉体验;而面对真实业务中常见的嘈杂参考音频,模型通过真实声学仿真训练将语音增强原生注入复刻流程,在高混响、高噪声环境下也能过滤干扰、保留目标音色,保障复杂条件下的克隆质量。

面向严肃创作场景,Qwen-Audio-3.0-TTS 将音频输出品质从 24kHz 跃升至 48K,达到录音棚及影视配音级规格,单次语音合成支持长达 3 分钟,满足长文本播报需求。配套的精品音色库也将模型能力沉淀为开箱即用的资源,覆盖指令风格音色、20 种方言音色、细粒度控制音色以及 14 款以上小语种音色。

可用性方面,Qwen-Audio-3.0-TTS Flash 与 Plus 两款模型已上线阿里云百炼平台,对开发者开放调用,具体价格以百炼官网为准。需要注意的是,部分方言、小语种精品音色及 48K 高清音频输出功能仍在陆续上线中,其中 48K 功能预计于 7月24日 正式开放,具体以控制台实际展示为准。

整体来看,Qwen-Audio-3.0-TTS 的升级重心不在"是否能合成语音",而在"能否精准表达"。自然语言指令与结构化标签的双控制体系、20 种方言的深度覆盖,以及复杂环境下的鲁棒克隆,都指向有声书、游戏、影视配音、数字人等对表达力要求更高的场景。相比阿里年初开源的 Qwen3-TTS 系列,本次的 3.0 版本走的是闭源 API、更高音质规格的托管路线,两者在"可自部署"与"高质量托管"之间形成互补,共同拓宽语音合成的落地边界。

豆包AI助手
©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。