-
从"能说话"到"会表达":阿里发布 Qwen-Audio-3.0-TTS 语音合成大模型
2026年7月20日,阿里通义千问团队正式发布新一代实时语音合成大模型 Qwen-Audio-3.0-TTS,官方以"从能说话到会表达"概括本次升级的核心方向。新模型围绕开发者在生产环境中真正会遇到的问题展开优化,在更广的语言覆盖、更自然的指令控制、更精细的标签控制以及参考音频不清晰时的鲁棒性四个维度实现系统性提升。据官方披露,在全球第三方权威榜单 Artificial Ana…- 1.6k
- 0
-
Qwen-Audio-3.0-TTS:阿里推出的新一代实时语音合成大模型
Qwen-Audio-3.0-TTS 是阿里通义千问新一代实时语音合成大模型,支持自然语言指令与标签控情绪、16 种语言 20 种方言、48kHz 影视级音质与复杂环境语音克隆,Plus 版登顶 Artificial Analysis 榜单。- 932
- 0
-
Xiaomi MiMo-V2-TTS:小米语音合成大模型,自然语言控制情感风格,支持方言、角色扮演与歌声合成
Xiaomi MiMo-V2-TTS 是小米自研的语音合成大模型,基于自研 Audio Tokenizer 和多码本语音-文本联合建模架构,经超亿小时语音数据预训练与多维度强化学习。支持自然语言指令定制说话风格、多粒度情感控制、非语言声学事件生成(咳嗽、叹气、笑声)、方言、角色扮演,以及说话与唱歌统一模型,现已开放 API 接入。- 4.6k
- 0
-





