产品发布 · 小互解读

通义发布 Qwen-Audio-3.0-TTS 语音模型,一段参考音能说 16 种语言和 20 种方言

说话人相似度在 16 个语种上全部排第一,参考音带噪声也能克隆;这次只开放 API,不放权重。
一分钟速览
  • 克隆一个人的嗓子,让它改用另一种语言念,出来的音色常常就变了人;参考音只要带点噪声或回声,效果又会塌。
  • 通义实验室发布 Qwen-Audio-3.0-TTS,分 Flash 和 Plus 两档,Flash 首包延迟 300 毫秒级,走阿里云百炼 API 调用。
  • 同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
  • 念得准不准这项没有全拿:平均字错率 3.87(Flash)和 3.96(Plus),16 个语种里 10 个最低,剩下 6 个被别家压住。
  • 文本里直接写 [angry][giggles] 这类标签就能控制情绪和拟声,官方文档公开了 31 个;但这一代不放权重,要本地跑只能用今年 1 月开源的 Qwen3-TTS。
这是产品发布页,跑分和对比数据由发布方自己给出,评测集与对手由他们选定。本文另查了阿里云 API 文档、arXiv 论文和 HuggingFace 模型库补充资料,出处在文末。
发布

通义发布了一个会说 16 种语言的语音模型

通义实验室 7 月 20 日发布了语音合成模型 Qwen-Audio-3.0-TTS。

它分成两档卖:Flash 追求快,首包延迟做到 300 毫秒级(从发出请求到第一个字开始出声的等待),给语音助手、客服这类需要边说边出声的场景用;Plus 追求好听,音色还原和语气自然度优先,给有声书、配音这类场景用。
🎙为什么值得听一下:同一段参考音,让它去念 16 种语言,说话人相似度在全部 16 个语种上都排第一,平均 82.75。另外它覆盖 20 个中文方言区,一次能连续合成 3 分钟长文。

先听效果。下面这组是同一把嗓子跨语言念:参考音是一句中文,然后让它分别去念英语、日语、韩语。听的时候不用管念得对不对,注意听还是不是同一个人在说话。

同一把声音,换三种语言
参考音 中文,就给这么一句
加菲迪曾经代表巴西国家足球队。
生成 · 英语
Many Christians are well-educated, but cannot rise to positions of responsibility.
生成 · 日语
歴史的世界においては、過去は単に過ぎ去ったものではない、プラトンのいう如く非有が有である。
生成 · 韩语
가을철 들면서부터 덕호는 읍의 출입이 잦아졌다.
音频取自发布页 Cross-lingual In-context Generation 段落,为便于国内加载已转码为 mp3。

支持的 16 种语言里,有 7 种是这一代新加的,集中在东南亚和中东:

16 种语言 · 标星的 7 种为本代新增
中文 · 英语 · 日语 · 韩语
德语 · 法语 · 西班牙语 · 意大利语
俄语 · 葡萄牙语 ★
阿拉伯语 ★ · 印尼语 ★ · 马来语 ★
泰语 ★ · 越南语 ★ · 菲律宾语 ★

新增的这几种此前那套开源模型都不支持,做东南亚市场的产品这次才有得选。

换语言不变声这件事,难点在于音色和发音习惯是缠在一起的。模型学一个人的嗓子,学到的往往连他的母语口音一起打包了,换到另一种语言就得重新组织发音方式,音色容易跟着一起漂。

方言

它能说 20 个地方的方言

这一项对国内读者最好判断真假,因为你多半能听出哪句不对味。给一段方言参考音,让它用同一把嗓子念另一段方言文本。

粤语
参考音
生成
乜部手机又窒下窒下噉嘅?揿嚟揿去都冇反应,真系迟早畀佢激死!
上海话
参考音
生成
今朝银行扣房贷了,每个月工资大半侪拨了伊拉。迭个日子阿里一天是个头啊?
发布页给了 20 个方言区各一组样本,这里各取一组。文本内容是发布页原样,写的都是日常抱怨,不是新闻播报体。

发布页列出的 20 个方言区覆盖到这个范围:

东北
东北话
华北
河北话 · 山西话
山东话 · 青岛话
西北
陕西话 · 甘肃话
宁夏话
华中
河南话 · 湖北话
湖南话
华东
上海话 · 杭州话
宁波话 · 江西话
西南
四川话 · 重庆话
贵州话 · 云南话
华南
粤语
脏参考音

参考音里有噪声,它也能克隆

现实里能拿到的参考音很少是录音棚水准。用手机在办公室录一段,背景有空调声和键盘声;在会议室录,房间回声压在人声上。这两种情况过去都会让克隆效果塌下来。

旧的处理办法是加一道前置工序:先跑降噪把参考音洗干净,再送进克隆链路。问题是降噪算法在抹掉噪声的同时也会磨掉音色特征,洗得越干净,人声越像被磨过一遍,克隆出来反而不像本人了。

旧做法

脏参考音 → 降噪模块洗一遍 → 克隆。降噪是独立一步,它不知道后面要保住音色,抹噪声时会连音色细节一起抹。

这次的做法

训练时就用带噪声、带混响的参考音喂模型,让语音增强直接长在克隆链路里。调用时不用单独开降噪档,模型自己把混响和噪声压掉,同时保住音色。

下面这组能听出差别。参考音是一段带明显噪声的中文,三条输出分别来自本模型和对照模型。

带噪参考音的克隆效果
参考音 带噪声
Qwen-Audio-3.0-TTS
帆船在平静的海面上缓缓移动,白色的帆被夕阳染成了金色。船员们站在甲板上,沉默地望着远处逐渐清晰的海岸线。
CosyVoice 3.0-1.5B 对照
对照样本由发布方选定,取自发布页 Acoustic Robustness 段落的 noisy·zh 一组。

发布页测的退化情形有三类:噪声、混响,以及听不清的参考音(电话带宽、高频被切掉那种)。

可控性

你可以用大白话指挥它怎么念

控制语气这件事,过去要调一堆声学参数:基频、语速系数、能量包络。这一代给了两层控制,都不用碰参数。

第一层:自然语言指令
用一句话描述你要的角色、情绪、场景、语速,管整段的基调。中英文指令都吃。
第二层:写进文本的标签
在文本里插一个方括号标签,管从这个位置往后的语气,或者在这个位置插一声笑、一次吸气。

用一句话描述你要的效果

指令可以写得很随意,也可以写得结构化。发布页给的样例里,中文指令有 请用温柔、缓慢的语速,像讲睡前故事一样朗读。 这种日常说法,也有 角色:女性早间电台音乐节目主持。场景:节目开场,气氛活泼但克制。风格:清亮、有亲和力、节奏轻盈。语速:偏快。 这种分条设定;还接受 JSON 写法,例如 {"speed": "fast", "volume": "loud", "rhythm": "urgent"}

指令:请用温柔、缓慢的语速,像讲睡前故事一样朗读
参考音 原本的说话方式
按指令生成
孩子,睡吧。月亮婆婆已经出来了。窗外的风轻轻地吹,像在唱着摇篮曲。

在文本里插标签,控制某一处

指令管的是整段基调,标签管的是具体位置。标签分两种:控制标签设定情绪或风格,从它出现的位置一直生效到下一个控制标签出现,或者到这句话因为太长被自动断开为止;拟声标签在当前位置插一个声音效果,不影响前后的情绪。

标签:[excited]
参考音
带标签的文本生成
[excited] 哇!快看外面的雪!积雪已经有十几厘米厚了,我们赶紧下楼去堆雪人、打雪仗吧!
可以直接抄

阿里云 API 文档公开了完整标签表:24 个控制标签 + 7 个拟声标签,一共 31 个。发布页写的是这一代新增 86 个细粒度标签,两个数字对不上,差额部分文档里没有列出,发布页也没有说明。

控制标签(管后续语气)含义
[sad] [crying]悲伤 / 哭腔
[angry] [shouting]愤怒 / 喊叫
[deep and loud shouting]低沉的大声喊叫
[excited] [amazed]兴奋 / 惊叹
[panicked] [trembling]惊慌 / 颤抖
[sarcastic] [scornful]讽刺 / 轻蔑
[curious] [serious]好奇 / 严肃
[bored] [tired]无聊 / 疲惫
[empathetic] [reluctantly]共情 / 不情愿
[mischievously]调皮
[whispers] [asmr]耳语 / ASMR 轻声
[singing]唱腔
[like dracula]吸血鬼式的低沉阴森
[very slowly] [very fast]很慢 / 很快的语速
拟声标签(在当前位置插一声)含义
[gasp]倒吸一口气
[sighing]叹气
[clears throat]清嗓子
[giggles]轻笑
[laughing]大笑
[cough]咳嗽
[snorts]嗤笑(鼻音)
两种标签混用的写法
[excited]What a beautiful day today![laughing]Let's go out and have fun together!
一段文本里切换情绪
[serious]Please pay attention to the safety precautions.[excited]Alright, let's get started now!

有一条限制要留意:标签功能只在单向流式模式下可用。单向的意思是文本一次性发过去、音频流式吐回来;如果你要的是边打字边出声那种双向实时对话,标签用不了。

机制

它是怎么做到又快又稳的

让它跑得快的那个部件是上一代留下的,这一代新做的是训练流程。两件事分开看。

一秒钟切成 12.5 块

模型生成语音要分两道工序:先把语音切成一小块一小块的离散单位,再一块一块往外生成,最后还原成声波。切的密度叫帧率。帧率越高,一秒语音要生成的块数越多,生成就越慢;帧率降下来,步数少了,速度自然快。这一代用的是 12.5 Hz,一秒钟切 12.5 块。

打个比方

像把一段录音做成定格动画:一秒钟用 25 张画面还是 12 张画面。画面少了画起来快,但每张画面得装下更多信息,不然动作就会跳。降帧率的难点就在这里,块少了容易丢内容和音色。

每张画面装更多信息,具体是这么装的:每一块上叠 16 层编码,用深度换密度,靠层数把降帧率丢掉的细节接住。这个切分器不是这次才有的,今年 1 月的 Qwen3-TTS 就已经在用,而且当时随模型一起开源了,技术报告里给的首包时间是 97 毫秒。

同样一秒语音,切成多少块 较高帧率 生成步数多 12.5 Hz 这一代用的 1 秒 块数少一半,模型要生成的步数就少一半
示意图,用来说明帧率与生成步数的关系。上排取常见的 25 Hz 量级作对照,下排是这一代实际用的 12.5 Hz。

分五步把损失补回来

降帧率省下的速度,要靠训练流程把内容准确度和音色稳定度补回来。这一代新做的就是这套流程。先分清两个部件:LM 负责根据文字决定该说出哪些语音单位,FM 负责把这些单位还原成能听的声波。一个是照着谱子决定弹哪几个音,一个是真正把音弹出声。

五步的主线是「先各练各的,再接起来一起练,最后回头分别修各自的短板」。前两步打底子,后三步是针对性补课:LM 的短板是念错字和语气僵,FM 的短板是遇到脏参考音就垮、音色还原不够像。

1
LM 和 FM 各自预训练
两个部件先分开各练各的,不互相牵制。
2
联合训练,末尾用高质量数据退火
两个部件接起来一起练,最后一段改喂高质量数据,把整体水准往上收。
修:整体协同
3
LM 强化学习
专门修念得准不准、语气自然不自然。
针对:念得准 · 语气自然
4
FM 鲁棒性训练
拿带噪声、带混响的参考音练,让它在脏输入下也能出干净声音。
修:脏参考音
5
FM 强化学习
修声音本身的质感和音色还原度。
修:音质 · 音色保真

除了这五步,发布页还提到两项配套能力:一套可复现的说话人微调流程,用来把模型适配到某个指定嗓音;以及声码器超分,用来输出 48 kHz 采样率的音频。发布说明里 48 kHz 输出标的是即将上线;覆盖 16 种语言的预置音色库列在本次已发布的内容里,不用先克隆就能直接挑一个音色用。

评测

跑分上它赢了谁,输在哪里

评测跑在 CV3-Eval 上,16 个语种各测一遍,对手是 MiniMax-Speech-2.8-HD-API、ElevenLabs-v3-API、DotsTTS-SOAR(采样 10 步)、VoxCPM2,以及自家今年 1 月开源的 Qwen3-TTS-1.7B-Base。两张雷达图,越靠外圈越好。

CV3-Eval 上 16 个语种的字错率雷达图
内容准确度(字错率,径向刻度由内圈 16 向外降到 1.45,越靠外越低越好)。红色粗线是 Qwen-Audio-3.0-TTS,多数语种贴近最外圈,但有若干语种被深蓝色的 MiniMax 压在外侧,两者在好几个轴上差距极小、肉眼难分。紫色 DotsTTS 和黄绿色 Qwen3-TTS 有多条边塌向圆心,对应它们不支持的语种。图片来源:发布页。
CV3-Eval 上 16 个语种的说话人相似度雷达图
说话人相似度(径向刻度由内圈 60 向外升到 90.76,越靠外越像本人)。红线在全部 16 个语种上都是最外圈。绿色的 ElevenLabs 全程贴着最内那圈黑色基准线走,说明它的得分落在图表显示范围的下限或更低,发布页没有说明这一项的测试条件。图片来源:发布页。
两张图的六条线分别是谁
Qwen-Audio-3.0-TTS(红色粗线)
MiniMax-Speech-2.8-HD-API
ElevenLabs-v3-API
DotsTTS-SOAR(采样 10 步)
VoxCPM2
Qwen3-TTS-1.7B-Base(自家上一代)
3.87
Flash 的平均字错率,16 个语种里 10 个最低
3.96
Plus 的平均字错率
82.75
Plus 的平均说话人相似度,16 个语种全部第一
80.44
Flash 的平均说话人相似度

音色还原是它拉开差距的地方,16 项全拿。念得准不准这项,发布页给的说法是 Flash 和 Plus 两档合起来在 16 个语种中的 10 个拿到最低字错率,剩下 6 个不是第一。要注意上面这张图里只画了一条 Qwen-Audio-3.0-TTS 的线,没有按两档分开,所以图上数不出这个 10 比 6,两者对不上号。

第三方竞技场怎么排的

上面两张图是发布方自己跑的。第三方评测站 Artificial Analysis 也有一份榜单,用的是真人盲听两两对比打分,算成 Elo 分数排名。7 月 14 日的这份「提供商自带音色」分榜上,Qwen-Audio-3.0-TTS-Plus 排在第一。

Artificial Analysis 文字转语音竞技场榜单前 15 名
Artificial Analysis 的文字转语音竞技场榜单(提供商自带音色分榜)前 15 名。第一名 1236 分与第二名 Simba 3.2 的 1234 分只差 2 分,两者的排名区间都标着 1-2,误差线互相重叠。图片来源:Artificial Analysis 官方账号 2026-07-14。

这个第一要看清楚它的分量:1236 比第二名 Simba 3.2 的 1234 只高 2 分,两条误差线是重叠的,榜单自己把两者的排名区间都标成 1-2。往下才是 Google 的 Gemini 3.1 Flash TTS(1214)和 Cartesia 的 Sonic 3.5(1207)。ElevenLabs 的 Eleven v3 排在第 12 位,1174 分。

同一份榜单还给了两项发布页没有提的数据,一项是生成速度,一项是价格。

模型Elo生成速度价格(每百万字符)
Qwen-Audio-3.0-TTS-Plus123616 字符/秒$27.59
Simba 3.2(SpeechifyAI)123430.2 字符/秒$10.00
Gemini 3.1 Flash TTS(Google)121427 字符/秒$18.31
Sonic 3.5(Cartesia)1207120 字符/秒$39.00

生成速度这一栏它垫底:16 字符每秒,Simba 是它的将近两倍,Sonic 3.5 是它的七倍半。价格上它比 Simba 贵一倍多,比 Gemini 贵五成,比 Sonic 便宜三成。所以这个第一是拿质量分换来的,速度和价格都不占优。

怎么用

你现在能怎么用它

调用走阿里云百炼,模型名是 qwen-audio-3.0-tts-flashqwen-audio-3.0-tts-plus,走 WebSocket 协议,官方给了 Python、Java、Go、C#、PHP、Node.js 六种语言的示例代码。

有一个地方容易看错。今年 1 月通义开源过一整套 Qwen3-TTS,权重挂在 HuggingFace 上可以下载本地跑;这次的 Qwen-Audio-3.0-TTS 并没有跟着开源,HuggingFace 上搜不到这个名字下的任何模型。两代的关系是这样:

 Qwen3-TTSQwen-Audio-3.0-TTS
发布时间2026 年 1 月2026 年 7 月
拿到方式HuggingFace 下载权重只开放 API
许可Apache 2.0按云服务条款
规格0.6B / 1.7B 两个尺寸Flash / Plus 两档服务
语言10 种16 种,另加 20 个中文方言区
适合谁要本地部署、要改模型、在意数据不出门的要现成效果、要方言和多语言覆盖、能接受调云端的

想本地跑,现在能下载的仍然是 1 月那套。它的 1.7B-CustomVoice 版本在 HuggingFace 上下载量已经超过 200 万次,社区还做了 GGUF、MLX 等各种量化版本。

🧰 上手卡 · Qwen-Audio-3.0-TTS
价格Plus 每百万字符 27.59 美元(第三方评测站数据)
门槛需要阿里云账号,模型名填 qwen-audio-3.0-tts-flash 或 qwen-audio-3.0-tts-plus;不提供权重下载,想本地跑用 1 月开源的 Qwen3-TTS

还有一步文章前面的演示没体现:合成请求里不能直接塞一段参考音。想用自己的嗓子,得先走声音复刻功能把音频注册成一个自定义音色,拿到音色 ID,再在合成时把 voice 填成那个 ID。直接调用时 voice 填的是系统预置音色名。

1
先注册音色
用声音复刻功能上传参考音频,得到一个音色 ID。
2
合成时填这个 ID
voice 参数设成音色 ID,model 设成对应的模型名。
3
要方言就写进指令
克隆出来的音色想说某地方言,在指令里直接写,例如「请用河南话表达」。
来源
Qwen-Audio-3.0-TTS通义实验室 Qwen Audio / Token Foundry 团队·发布页·2026-07-20
本站说明
两张雷达图取自发布页,图上只有一条 Qwen-Audio-3.0-TTS 线、未按 Flash 与 Plus 分开,因此发布说明里「16 个语种中 10 个字错率最低」这个按两档整体给出的结论,无法在图上逐轴数出来,本文对图的描述只依据图上实际画出的这一条曲线。竞技场榜单图与 Elo、生成速度、价格三项数据取自 Artificial Analysis 官方账号 2026-07-14 的发布。31 个标签的完整清单、单向流式的限制说明、API 模型名来自阿里云文档;两代开源状况的对比由本站查 HuggingFace 模型库核对。帧率对照图是本站画的示意图,用于说明机制,上排的 25 Hz 是取常见量级作参照。音频样本取自发布页,为便于国内加载转码成了 mp3。