通义发布 Qwen-Audio-3.0-TTS 语音模型,一段参考音能说 16 种语言和 20 种方言
- 克隆一个人的嗓子,让它改用另一种语言念,出来的音色常常就变了人;参考音只要带点噪声或回声,效果又会塌。
- 通义实验室发布 Qwen-Audio-3.0-TTS,分 Flash 和 Plus 两档,Flash 首包延迟 300 毫秒级,走阿里云百炼 API 调用。
- 同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
- 念得准不准这项没有全拿:平均字错率 3.87(Flash)和 3.96(Plus),16 个语种里 10 个最低,剩下 6 个被别家压住。
- 文本里直接写
[angry]、[giggles]这类标签就能控制情绪和拟声,官方文档公开了 31 个;但这一代不放权重,要本地跑只能用今年 1 月开源的 Qwen3-TTS。
通义发布了一个会说 16 种语言的语音模型
通义实验室 7 月 20 日发布了语音合成模型 Qwen-Audio-3.0-TTS。
先听效果。下面这组是同一把嗓子跨语言念:参考音是一句中文,然后让它分别去念英语、日语、韩语。听的时候不用管念得对不对,注意听还是不是同一个人在说话。
支持的 16 种语言里,有 7 种是这一代新加的,集中在东南亚和中东:
新增的这几种此前那套开源模型都不支持,做东南亚市场的产品这次才有得选。
换语言不变声这件事,难点在于音色和发音习惯是缠在一起的。模型学一个人的嗓子,学到的往往连他的母语口音一起打包了,换到另一种语言就得重新组织发音方式,音色容易跟着一起漂。
它能说 20 个地方的方言
这一项对国内读者最好判断真假,因为你多半能听出哪句不对味。给一段方言参考音,让它用同一把嗓子念另一段方言文本。
发布页列出的 20 个方言区覆盖到这个范围:
山东话 · 青岛话
宁夏话
湖南话
宁波话 · 江西话
贵州话 · 云南话
参考音里有噪声,它也能克隆
现实里能拿到的参考音很少是录音棚水准。用手机在办公室录一段,背景有空调声和键盘声;在会议室录,房间回声压在人声上。这两种情况过去都会让克隆效果塌下来。
旧的处理办法是加一道前置工序:先跑降噪把参考音洗干净,再送进克隆链路。问题是降噪算法在抹掉噪声的同时也会磨掉音色特征,洗得越干净,人声越像被磨过一遍,克隆出来反而不像本人了。
脏参考音 → 降噪模块洗一遍 → 克隆。降噪是独立一步,它不知道后面要保住音色,抹噪声时会连音色细节一起抹。
训练时就用带噪声、带混响的参考音喂模型,让语音增强直接长在克隆链路里。调用时不用单独开降噪档,模型自己把混响和噪声压掉,同时保住音色。
下面这组能听出差别。参考音是一段带明显噪声的中文,三条输出分别来自本模型和对照模型。
发布页测的退化情形有三类:噪声、混响,以及听不清的参考音(电话带宽、高频被切掉那种)。
你可以用大白话指挥它怎么念
控制语气这件事,过去要调一堆声学参数:基频、语速系数、能量包络。这一代给了两层控制,都不用碰参数。
用一句话描述你要的效果
指令可以写得很随意,也可以写得结构化。发布页给的样例里,中文指令有 请用温柔、缓慢的语速,像讲睡前故事一样朗读。 这种日常说法,也有 角色:女性早间电台音乐节目主持。场景:节目开场,气氛活泼但克制。风格:清亮、有亲和力、节奏轻盈。语速:偏快。 这种分条设定;还接受 JSON 写法,例如 {"speed": "fast", "volume": "loud", "rhythm": "urgent"}。
在文本里插标签,控制某一处
指令管的是整段基调,标签管的是具体位置。标签分两种:控制标签设定情绪或风格,从它出现的位置一直生效到下一个控制标签出现,或者到这句话因为太长被自动断开为止;拟声标签在当前位置插一个声音效果,不影响前后的情绪。
[excited] 哇!快看外面的雪!积雪已经有十几厘米厚了,我们赶紧下楼去堆雪人、打雪仗吧!阿里云 API 文档公开了完整标签表:24 个控制标签 + 7 个拟声标签,一共 31 个。发布页写的是这一代新增 86 个细粒度标签,两个数字对不上,差额部分文档里没有列出,发布页也没有说明。
| 控制标签(管后续语气) | 含义 |
|---|---|
[sad] [crying] | 悲伤 / 哭腔 |
[angry] [shouting] | 愤怒 / 喊叫 |
[deep and loud shouting] | 低沉的大声喊叫 |
[excited] [amazed] | 兴奋 / 惊叹 |
[panicked] [trembling] | 惊慌 / 颤抖 |
[sarcastic] [scornful] | 讽刺 / 轻蔑 |
[curious] [serious] | 好奇 / 严肃 |
[bored] [tired] | 无聊 / 疲惫 |
[empathetic] [reluctantly] | 共情 / 不情愿 |
[mischievously] | 调皮 |
[whispers] [asmr] | 耳语 / ASMR 轻声 |
[singing] | 唱腔 |
[like dracula] | 吸血鬼式的低沉阴森 |
[very slowly] [very fast] | 很慢 / 很快的语速 |
| 拟声标签(在当前位置插一声) | 含义 |
|---|---|
[gasp] | 倒吸一口气 |
[sighing] | 叹气 |
[clears throat] | 清嗓子 |
[giggles] | 轻笑 |
[laughing] | 大笑 |
[cough] | 咳嗽 |
[snorts] | 嗤笑(鼻音) |
[excited]What a beautiful day today![laughing]Let's go out and have fun together!
[serious]Please pay attention to the safety precautions.[excited]Alright, let's get started now!
有一条限制要留意:标签功能只在单向流式模式下可用。单向的意思是文本一次性发过去、音频流式吐回来;如果你要的是边打字边出声那种双向实时对话,标签用不了。
它是怎么做到又快又稳的
让它跑得快的那个部件是上一代留下的,这一代新做的是训练流程。两件事分开看。
一秒钟切成 12.5 块
模型生成语音要分两道工序:先把语音切成一小块一小块的离散单位,再一块一块往外生成,最后还原成声波。切的密度叫帧率。帧率越高,一秒语音要生成的块数越多,生成就越慢;帧率降下来,步数少了,速度自然快。这一代用的是 12.5 Hz,一秒钟切 12.5 块。
像把一段录音做成定格动画:一秒钟用 25 张画面还是 12 张画面。画面少了画起来快,但每张画面得装下更多信息,不然动作就会跳。降帧率的难点就在这里,块少了容易丢内容和音色。
每张画面装更多信息,具体是这么装的:每一块上叠 16 层编码,用深度换密度,靠层数把降帧率丢掉的细节接住。这个切分器不是这次才有的,今年 1 月的 Qwen3-TTS 就已经在用,而且当时随模型一起开源了,技术报告里给的首包时间是 97 毫秒。
分五步把损失补回来
降帧率省下的速度,要靠训练流程把内容准确度和音色稳定度补回来。这一代新做的就是这套流程。先分清两个部件:LM 负责根据文字决定该说出哪些语音单位,FM 负责把这些单位还原成能听的声波。一个是照着谱子决定弹哪几个音,一个是真正把音弹出声。
五步的主线是「先各练各的,再接起来一起练,最后回头分别修各自的短板」。前两步打底子,后三步是针对性补课:LM 的短板是念错字和语气僵,FM 的短板是遇到脏参考音就垮、音色还原不够像。
除了这五步,发布页还提到两项配套能力:一套可复现的说话人微调流程,用来把模型适配到某个指定嗓音;以及声码器超分,用来输出 48 kHz 采样率的音频。发布说明里 48 kHz 输出标的是即将上线;覆盖 16 种语言的预置音色库列在本次已发布的内容里,不用先克隆就能直接挑一个音色用。
跑分上它赢了谁,输在哪里
评测跑在 CV3-Eval 上,16 个语种各测一遍,对手是 MiniMax-Speech-2.8-HD-API、ElevenLabs-v3-API、DotsTTS-SOAR(采样 10 步)、VoxCPM2,以及自家今年 1 月开源的 Qwen3-TTS-1.7B-Base。两张雷达图,越靠外圈越好。
音色还原是它拉开差距的地方,16 项全拿。念得准不准这项,发布页给的说法是 Flash 和 Plus 两档合起来在 16 个语种中的 10 个拿到最低字错率,剩下 6 个不是第一。要注意上面这张图里只画了一条 Qwen-Audio-3.0-TTS 的线,没有按两档分开,所以图上数不出这个 10 比 6,两者对不上号。
第三方竞技场怎么排的
上面两张图是发布方自己跑的。第三方评测站 Artificial Analysis 也有一份榜单,用的是真人盲听两两对比打分,算成 Elo 分数排名。7 月 14 日的这份「提供商自带音色」分榜上,Qwen-Audio-3.0-TTS-Plus 排在第一。
这个第一要看清楚它的分量:1236 比第二名 Simba 3.2 的 1234 只高 2 分,两条误差线是重叠的,榜单自己把两者的排名区间都标成 1-2。往下才是 Google 的 Gemini 3.1 Flash TTS(1214)和 Cartesia 的 Sonic 3.5(1207)。ElevenLabs 的 Eleven v3 排在第 12 位,1174 分。
同一份榜单还给了两项发布页没有提的数据,一项是生成速度,一项是价格。
| 模型 | Elo | 生成速度 | 价格(每百万字符) |
|---|---|---|---|
| Qwen-Audio-3.0-TTS-Plus | 1236 | 16 字符/秒 | $27.59 |
| Simba 3.2(SpeechifyAI) | 1234 | 30.2 字符/秒 | $10.00 |
| Gemini 3.1 Flash TTS(Google) | 1214 | 27 字符/秒 | $18.31 |
| Sonic 3.5(Cartesia) | 1207 | 120 字符/秒 | $39.00 |
生成速度这一栏它垫底:16 字符每秒,Simba 是它的将近两倍,Sonic 3.5 是它的七倍半。价格上它比 Simba 贵一倍多,比 Gemini 贵五成,比 Sonic 便宜三成。所以这个第一是拿质量分换来的,速度和价格都不占优。
你现在能怎么用它
调用走阿里云百炼,模型名是 qwen-audio-3.0-tts-flash 和 qwen-audio-3.0-tts-plus,走 WebSocket 协议,官方给了 Python、Java、Go、C#、PHP、Node.js 六种语言的示例代码。
有一个地方容易看错。今年 1 月通义开源过一整套 Qwen3-TTS,权重挂在 HuggingFace 上可以下载本地跑;这次的 Qwen-Audio-3.0-TTS 并没有跟着开源,HuggingFace 上搜不到这个名字下的任何模型。两代的关系是这样:
| Qwen3-TTS | Qwen-Audio-3.0-TTS | |
|---|---|---|
| 发布时间 | 2026 年 1 月 | 2026 年 7 月 |
| 拿到方式 | HuggingFace 下载权重 | 只开放 API |
| 许可 | Apache 2.0 | 按云服务条款 |
| 规格 | 0.6B / 1.7B 两个尺寸 | Flash / Plus 两档服务 |
| 语言 | 10 种 | 16 种,另加 20 个中文方言区 |
| 适合谁 | 要本地部署、要改模型、在意数据不出门的 | 要现成效果、要方言和多语言覆盖、能接受调云端的 |
想本地跑,现在能下载的仍然是 1 月那套。它的 1.7B-CustomVoice 版本在 HuggingFace 上下载量已经超过 200 万次,社区还做了 GGUF、MLX 等各种量化版本。
还有一步文章前面的演示没体现:合成请求里不能直接塞一段参考音。想用自己的嗓子,得先走声音复刻功能把音频注册成一个自定义音色,拿到音色 ID,再在合成时把 voice 填成那个 ID。直接调用时 voice 填的是系统预置音色名。
voice 参数设成音色 ID,model 设成对应的模型名。声音克隆:从换一种语言就变了人 → 同一段参考音说 16 种语言
通义实验室发布 Qwen-Audio-3.0-TTS,一页带图讲完它做了什么、快慢差多少、哪里没赢。
↓ 一页读完 · 有一张会动的图
这类模型干的活叫语音合成:给它一段文字,它念出来。再给它一小段某人说话的录音(叫参考音),它就能用这个人的嗓子念,这一步叫声音克隆。听起来已经很成熟了,但有两处一直不好使。
7 月 20 日发布的 Qwen-Audio-3.0-TTS 分两档:Flash 求快,从发请求到第一个字出声约 300 毫秒;Plus 求好听。一段参考音能跨 16 种语言念(其中 7 种是新加的,集中在东南亚和中东),另外覆盖 20 个中文方言区,从粤语、上海话到甘肃话、青岛话。带噪声的参考音不用先降噪,模型训练时就拿脏录音练过,压噪和保音色一起做。
控制语气的方式也换了。以前要调声学参数,现在直接把标签写进文本里,写在哪儿从哪儿生效:
调一组听不懂的数值,改完还得试听
大白话指令管整段,方括号标签管某一处
阿里云文档公开了 31 个这样的标签(24 个管语气、7 个插声音),发布页则说新增了 86 个,差额没有说明。这些好处成立的前提是它得跑得够快、念得够稳,这两件事靠下面这套东西。
小互录了一段自己说中文的参考音,想让它改念日语。模型的做法是先把语音切成一小块一小块,再一块一块往外生成,最后合成声波。一秒钟切几块,决定了它要生成多少步,这是快慢的总开关。
把「多少字符每秒」换成一件具体的事:让它念一篇 3000 字的稿子,各家要等多久。
不是他
的声音
- × 换一种语言念,音色就漂成另一个人
- × 参考音带点噪声或回声,克隆效果就塌
20 个方言
Qwen-Audio-3.0-TTS 落地
直接念
日语韩语
16 个语种全部排第一
Hz
切 12.5 块
修念错字 → 修脏参考音 →
修音色质感
字符/秒
最快那家
是它七倍半
阿里云的 API。想在自己机器
上跑,用 1 月开源的 Qwen3-TTS。