製品リリース · 小互解説

通義が音声モデル Qwen-Audio-3.0-TTS を公開、参考音声ひとつで 16 言語と 20 の方言を話す

話者類似度は 16 言語すべてで首位。ノイズ混じりの参考音声でもクローンできます。今回は API のみの提供で、重みは公開されません。
1 分で概要
  • ある人の声をクローンして別の言語で読ませると、声色が別人になってしまう。参考音声に少しでもノイズや反響が入ると、品質はさらに崩れます。
  • 通義実験室が Qwen-Audio-3.0-TTS を公開。Flash と Plus の 2 グレードで、Flash の初回応答は 300 ミリ秒級。Alibaba Cloud Model Studio(百炼)の API 経由で利用します。
  • 同じ参考音声のまま 16 言語を読ませても声色がぶれません。CV3-Eval では話者類似度が 16 言語すべてで首位、Plus は平均 82.75 点(100 点満点で、100 に近いほど本人に近い)。
  • 読み間違いの少なさは完勝ではありません。平均文字誤り率は 3.87(Flash)と 3.96(Plus)。16 言語のうち 10 言語で最小、残り 6 言語は他社に譲っています。
  • テキストに [angry][giggles] といったタグを直接書くだけで感情や擬音を制御できます。公式ドキュメントで公開されているのは 31 個。ただし今世代は重みを公開しないため、ローカル実行には今年 1 月にオープンソース化された Qwen3-TTS を使うしかありません。
これは製品リリースページであり、ベンチマークと比較データは公開元自身が提示したもの。評価セットと比較対象も先方の選定です。本記事では Alibaba Cloud の API ドキュメント、arXiv 論文、HuggingFace のモデルリポジトリを別途確認して補足しました。出典は文末にあります。
リリース

通義が 16 言語を話す音声モデルを公開

通義実験室は 7 月 20 日、音声合成モデル Qwen-Audio-3.0-TTS を公開しました。

提供は 2 グレード。Flash は速度重視で、初回応答は 300 ミリ秒級(リクエスト送信から最初の音が出るまでの待ち時間)。音声アシスタントやカスタマーサポートのように、話しながら音を出す用途向けです。Plus は音質重視で、声色の再現と話し方の自然さを優先。オーディオブックやナレーションなどに向きます。
🎙聴いてみる価値がある理由:同じ参考音声で 16 言語を読ませて、話者類似度が 16 言語すべてで首位、平均 82.75。さらに中国語の方言 20 地域をカバーし、一度に 3 分の長文を連続合成できます。

まずは実際の音から。以下は同じ声で言語をまたいだ例です。参考音声は中国語 1 文だけ。それを使って英語、日本語、韓国語を読ませています。読みの正確さは一旦置いて、同じ人が話しているかどうかに注目してください。

同じ声で 3 言語
参考音声 中国語、これ 1 文だけ
加菲迪曾经代表巴西国家足球队。
生成 · 英語
Many Christians are well-educated, but cannot rise to positions of responsibility.
生成 · 日本語
歴史的世界においては、過去は単に過ぎ去ったものではない、プラトンのいう如く非有が有である。
生成 · 韓国語
가을철 들면서부터 덕호는 읍의 출입이 잦아졌다.
音声はリリースページの Cross-lingual In-context Generation 節から。読み込みやすさのため mp3 に変換しています。

対応する 16 言語のうち 7 言語は今世代で新たに加わったもの。東南アジアと中東に集中しています。

16 言語 · ★ の 7 言語が今世代の新規
中国語 · 英語 · 日本語 · 韓国語
ドイツ語 · フランス語 · スペイン語 · イタリア語
ロシア語 · ポルトガル語 ★
アラビア語 ★ · インドネシア語 ★ · マレー語 ★
タイ語 ★ · ベトナム語 ★ · フィリピン語 ★

新規のこれらは従来のオープンソース版では未対応でした。東南アジア市場向けのプロダクトにとって、ようやく選択肢が生まれた形です。

言語を変えても声が変わらない——この難しさは、声色と発音の癖が絡み合っている点にあります。モデルがある人の声を学ぶとき、その人の母語のなまりまで一緒に取り込んでしまう。別の言語に切り替えれば発音の組み立て方を作り直すことになり、声色もつられて漂います。

方言

中国語の方言 20 地域を話せる

この項目は中国語圏の読者なら真偽を判断しやすいはずです。どの一文が「らしくない」かは耳でわかります。方言の参考音声を与え、同じ声で別の方言テキストを読ませています。

広東語
参考音声
生成
乜部手机又窒下窒下噉嘅?揿嚟揿去都冇反应,真系迟早畀佢激死!
上海語
参考音声
生成
今朝银行扣房贷了,每个月工资大半侪拨了伊拉。迭个日子阿里一天是个头啊?
リリースページは方言 20 地域それぞれにサンプルを 1 組ずつ掲載。ここでは各 1 組を抜粋しました。テキストはリリースページそのままで、内容はいずれも日常の愚痴。ニュース読み上げ調ではありません。

リリースページが挙げる方言 20 地域はこの範囲をカバーします。

東北
東北方言
華北
河北 · 山西
山東 · 青島
西北
陝西 · 甘粛
寧夏
華中
河南 · 湖北
湖南
華東
上海 · 杭州
寧波 · 江西
西南
四川 · 重慶
貴州 · 雲南
華南
広東語
ノイズ入り参考音声

ノイズ混じりでもクローンできる

現実に手に入る参考音声が録音スタジオ品質であることは、まずありません。オフィスでスマホ録音すればエアコンやキーボードの音が入り、会議室なら部屋の反響が声にかぶさります。従来はどちらもクローン品質を崩す要因でした。

これまでの対処は前処理を 1 段はさむ方式でした。まずノイズ除去で参考音声をきれいにし、それからクローン処理へ回す。問題は、ノイズ除去アルゴリズムがノイズを消すと同時に声色の特徴まで削ってしまうこと。きれいにするほど声が磨り減り、クローン結果はかえって本人らしくなくなります。

従来の方式

ノイズ入り参考音声 → ノイズ除去モジュールで洗浄 → クローン。ノイズ除去は独立した工程で、後段が声色を守りたいことを知りません。ノイズを消すときに声色の細部まで一緒に削ります。

今回の方式

学習の段階からノイズ・残響入りの参考音声を与え、音声強調をクローン処理そのものに組み込みました。呼び出し時にノイズ除去を別途オンにする必要はなく、モデル自身が残響とノイズを抑えつつ声色を保ちます。

次の組で違いが聴き取れます。参考音声は明らかなノイズが乗った中国語で、出力 3 本は本モデルと比較対象モデルのものです。

ノイズ入り参考音声でのクローン結果
参考音声 ノイズあり
Qwen-Audio-3.0-TTS
帆船在平静的海面上缓缓移动,白色的帆被夕阳染成了金色。船员们站在甲板上,沉默地望着远处逐渐清晰的海岸线。
CosyVoice 3.0-1.5B 比較対象
比較サンプルは公開元の選定によるもの。リリースページ Acoustic Robustness 節の noisy·zh 一組から取りました。

リリースページが検証している劣化条件は 3 種類。ノイズ、残響、そして聴き取りにくい参考音声(電話帯域で高域が切られたようなもの)です。

制御性

読み方を普通の言葉で指示できる

話し方の制御は、これまで音響パラメータをいじる作業でした。基本周波数、話速係数、エネルギー包絡。今世代は制御が 2 層になり、どちらもパラメータに触れずに済みます。

第 1 層:自然言語の指示
ほしい役柄、感情、シーン、話す速さを 1 文で書く。段落全体の基調を決めます。中国語でも英語でも通ります。
第 2 層:テキストに書き込むタグ
テキスト中に角括弧のタグを挿入。その位置から先の話し方を決めたり、その場所に笑い声や息継ぎを 1 つ入れたりします。

ほしい効果を 1 文で書く

指示はかなり自由に書けますし、構造化して書くこともできます。リリースページのサンプルには 请用温柔、缓慢的语速,像讲睡前故事一样朗读。(優しくゆっくり、寝る前のお話のように読んで)のような日常的な言い回しもあれば、角色:女性早间电台音乐节目主持。场景:节目开场,气氛活泼但克制。风格:清亮、有亲和力、节奏轻盈。语速:偏快。(役柄:朝のラジオ音楽番組の女性 DJ/シーン:番組冒頭、活発だが抑制的/スタイル:明るく親しみやすく軽快/話速:やや速め)のような箇条書きの設定もあります。{"speed": "fast", "volume": "loud", "rhythm": "urgent"} のような JSON 記法も受け付けます。

指示:優しくゆっくり、寝る前のお話のように読んで
参考音声 元の話し方
指示どおりの生成
孩子,睡吧。月亮婆婆已经出来了。窗外的风轻轻地吹,像在唱着摇篮曲。

テキストにタグを挿し、特定箇所を制御する

指示が決めるのは段落全体の基調、タグが決めるのは具体的な位置です。タグは 2 種類。制御タグは感情やスタイルを設定し、出現した位置から次の制御タグが現れるまで、あるいは文が長すぎて自動分割されるまで効き続けます。擬音タグはその位置に音の効果を 1 つ挿入するもので、前後の感情には影響しません。

タグ:[excited]
参考音声
タグ付きテキストからの生成
[excited] 哇!快看外面的雪!积雪已经有十几厘米厚了,我们赶紧下楼去堆雪人、打雪仗吧!
そのまま使える

Alibaba Cloud の API ドキュメントは完全なタグ一覧を公開しています。制御タグ 24 個 + 擬音タグ 7 個、合わせて 31 個。リリースページには今世代で細粒度タグを 86 個追加したとありますが、2 つの数字は合いません。差分はドキュメントに記載がなく、リリースページにも説明はありません。

制御タグ(以降の話し方を決める)意味
[sad] [crying]悲しみ / 泣き声
[angry] [shouting]怒り / 叫び
[deep and loud shouting]低く大きな叫び
[excited] [amazed]興奮 / 驚嘆
[panicked] [trembling]動転 / 震え
[sarcastic] [scornful]皮肉 / 侮蔑
[curious] [serious]好奇 / 真面目
[bored] [tired]退屈 / 疲労
[empathetic] [reluctantly]共感 / しぶしぶ
[mischievously]いたずらっぽく
[whispers] [asmr]ささやき / ASMR の小声
[singing]歌うように
[like dracula]吸血鬼風の低く不気味な声
[very slowly] [very fast]とても遅い / とても速い話速
擬音タグ(その位置に音を 1 つ挿入)意味
[gasp]息をのむ
[sighing]ため息
[clears throat]咳払い
[giggles]くすくす笑い
[laughing]大笑い
[cough]
[snorts]鼻で笑う
2 種類のタグを混ぜた書き方
[excited]What a beautiful day today![laughing]Let's go out and have fun together!
1 つのテキスト内で感情を切り替える
[serious]Please pay attention to the safety precautions.[excited]Alright, let's get started now!

注意すべき制限が 1 つ。タグ機能は単方向ストリーミングモードでのみ使えます。単方向とは、テキストを一度に送り、音声をストリーミングで返す方式のこと。入力しながら音を出す双方向のリアルタイム対話では、タグは使えません。

仕組み

速さと安定を両立させた方法

速さを支える部品は前世代から引き継いだもの。今世代が新しく作ったのは学習の流れです。2 つに分けて見ていきます。

1 秒を 12.5 個に切る

モデルが音声を生成する工程は 2 段階。まず音声を細かい離散単位に切り分け、それを 1 個ずつ生成して、最後に音波へ戻します。切る密度をフレームレートと呼びます。フレームレートが高いほど 1 秒あたりに生成する個数が増え、生成は遅くなる。下げればステップ数が減り、当然速くなります。今世代は 12.5 Hz、1 秒を 12.5 個に切ります。

たとえるなら

録音をコマ撮りアニメにするようなもの。1 秒を 25 枚で描くか、12 枚で描くか。枚数が少なければ描くのは速いけれど、1 枚あたりに詰める情報を増やさないと動きが飛びます。フレームレートを下げる難しさはここ。個数が減ると内容や声色が抜け落ちやすいのです。

1 枚に多くを詰める具体的なやり方はこうです。1 個ごとに 16 層の符号を重ね、深さで密度を稼ぐ。層数でフレームレート低下による細部の欠落を受け止めます。この切り分け器は今回登場したものではなく、今年 1 月の Qwen3-TTS ですでに使われていました。しかも当時はモデルと一緒にオープンソース化されており、技術報告書での初回応答時間は 97 ミリ秒です。

同じ 1 秒の音声を何個に切るか 高フレームレート 生成ステップ多 12.5 Hz 今世代の採用値 1 秒 個数が半分なら、生成ステップも半分
フレームレートと生成ステップ数の関係を示す概念図。上段は比較用に一般的な 25 Hz 級、下段は今世代が実際に使う 12.5 Hz です。

5 段階で損失を取り戻す

フレームレートを下げて稼いだ速度は、学習の流れで内容の正確さと声色の安定を取り戻さなければ成立しません。今世代が新たに作ったのがこの流れです。まず 2 つの部品を区別します。LM は文字をもとにどの音声単位を出すかを決める担当、FM はその単位を聴ける音波へ戻す担当。片方は楽譜を見てどの音を弾くか決める役、もう片方は実際に音を鳴らす役です。

5 段階の筋書きは「まず個別に鍛え、つないで一緒に鍛え、最後にそれぞれの弱点を戻って直す」。前半 2 段階が土台作り、後半 3 段階が弱点別の補習です。LM の弱点は読み間違いと話し方の硬さ、FM の弱点はノイズ入り参考音声で崩れることと声色の再現不足です。

1
LM と FM を個別に事前学習
2 つの部品を分けて別々に鍛え、互いに足を引っ張らせません。
2
結合学習、最後は高品質データでアニーリング
2 つをつないで一緒に鍛え、最終段では高品質データに切り替えて全体の水準を引き上げます。
補強:全体の連携
3
LM の強化学習
読みの正確さと話し方の自然さを重点的に直します。
対象:読みの正確さ · 自然な話し方
4
FM のロバスト性学習
ノイズ・残響入りの参考音声で鍛え、汚れた入力でもきれいな音を出せるようにします。
補強:ノイズ入り参考音声
5
FM の強化学習
音そのものの質感と声色の再現度を直します。
補強:音質 · 声色の忠実度

この 5 段階のほか、リリースページは付随する能力を 2 つ挙げています。1 つは再現可能な話者ファインチューニングの手順で、モデルを指定の声に適応させるもの。もう 1 つはボコーダー超解像で、48 kHz サンプリングレートの音声を出力します。リリースノートでは 48 kHz 出力は近日提供と表示。16 言語をカバーするプリセット音色ライブラリは今回公開済みの内容に含まれ、クローンせずに音色を選んですぐ使えます。

評価

ベンチマークで勝った相手、負けた項目

評価は CV3-Eval 上で 16 言語それぞれ実施。相手は MiniMax-Speech-2.8-HD-API、ElevenLabs-v3-API、DotsTTS-SOAR(サンプリング 10 ステップ)、VoxCPM2、そして自社が今年 1 月にオープンソース化した Qwen3-TTS-1.7B-Base です。レーダーチャート 2 枚、外側にあるほど良好です。

CV3-Eval における 16 言語の文字誤り率レーダーチャート
内容の正確さ(文字誤り率。半径目盛りは内周 16 から外へ 1.45 まで下がり、外側ほど低く良好)。赤い太線が Qwen-Audio-3.0-TTS で、多くの言語で最外周に近い位置。ただし一部の言語では濃紺の MiniMax が外側に来ており、両者は複数の軸でごくわずかな差、肉眼では判別しにくい状態です。紫の DotsTTS と黄緑の Qwen3-TTS は複数の辺が中心へ落ち込み、未対応の言語に対応します。画像出典:リリースページ。
CV3-Eval における 16 言語の話者類似度レーダーチャート
話者類似度(半径目盛りは内周 60 から外へ 90.76 まで上がり、外側ほど本人に近い)。赤線は 16 言語すべてで最外周。緑の ElevenLabs は最内周の黒い基準線に沿って推移しており、スコアがチャート表示範囲の下限かそれ以下に落ちていることを示します。この項目の測定条件についてリリースページに説明はありません。画像出典:リリースページ。
2 枚のチャートの 6 本の線
Qwen-Audio-3.0-TTS(赤い太線)
MiniMax-Speech-2.8-HD-API
ElevenLabs-v3-API
DotsTTS-SOAR(サンプリング 10 ステップ)
VoxCPM2
Qwen3-TTS-1.7B-Base(自社の前世代)
3.87
Flash の平均文字誤り率。16 言語中 10 言語で最小
3.96
Plus の平均文字誤り率
82.75
Plus の平均話者類似度。16 言語すべてで首位
80.44
Flash の平均話者類似度

差をつけたのは声色の再現で、16 項目を総取り。読みの正確さについては、リリースページは Flash と Plus の 2 グレード合計で 16 言語中 10 言語の文字誤り率が最小、残り 6 言語は 1 位ではないとしています。注意したいのは、上のチャートに描かれた Qwen-Audio-3.0-TTS の線は 1 本だけで、2 グレードに分かれていないこと。したがってチャート上で 10 対 6 を数えることはできず、両者は対応しません。

第三者アリーナの順位

上の 2 枚は公開元自身が測ったものです。第三者評価サイトの Artificial Analysis にもランキングがあり、こちらは人間による盲聴の 2 者比較を Elo スコアに換算した順位。7 月 14 日時点の「プロバイダー提供音色」部門では、Qwen-Audio-3.0-TTS-Plus が 1 位でした。

Artificial Analysis のテキスト読み上げアリーナ上位 15 位
Artificial Analysis のテキスト読み上げアリーナ(プロバイダー提供音色部門)上位 15 位。1 位の 1236 点と 2 位 Simba 3.2 の 1234 点は差が 2 点しかなく、順位レンジはどちらも 1-2 と表示、誤差範囲が重なっています。画像出典:Artificial Analysis 公式アカウント 2026-07-14。

この 1 位は重みを見極める必要があります。2 位 Simba 3.2 の 1234 点に対し 1236 点、わずか 2 点差。誤差範囲は重なり、ランキング側も両者の順位レンジを 1-2 と表示しています。以下は Google の Gemini 3.1 Flash TTS(1214)、Cartesia の Sonic 3.5(1207)と続きます。ElevenLabs の Eleven v3 は 12 位で 1174 点です。

同じランキングには、リリースページが触れていないデータが 2 項目あります。生成速度と価格です。

モデルElo生成速度価格(100 万文字あたり)
Qwen-Audio-3.0-TTS-Plus123616 文字/秒$27.59
Simba 3.2(SpeechifyAI)123430.2 文字/秒$10.00
Gemini 3.1 Flash TTS(Google)121427 文字/秒$18.31
Sonic 3.5(Cartesia)1207120 文字/秒$39.00

生成速度の欄では最下位。16 文字/秒で、Simba は約 2 倍、Sonic 3.5 は 7.5 倍です。価格は Simba の倍以上、Gemini より 5 割高く、Sonic より 3 割安い。つまりこの 1 位は品質点で勝ち取ったもので、速度も価格も優位ではありません。

使い方

いま使うには

呼び出しは Alibaba Cloud Model Studio 経由。モデル名は qwen-audio-3.0-tts-flashqwen-audio-3.0-tts-plus、プロトコルは WebSocket です。公式は Python、Java、Go、C#、PHP、Node.js の 6 言語のサンプルコードを用意しています。

1 つ誤解しやすい点があります。今年 1 月、通義は Qwen3-TTS 一式をオープンソース化し、重みは HuggingFace からダウンロードしてローカル実行できました。しかし今回の Qwen-Audio-3.0-TTS はオープンソース化されておらず、HuggingFace でこの名前のモデルは見つかりません。2 世代の関係はこうです。

 Qwen3-TTSQwen-Audio-3.0-TTS
公開時期2026 年 1 月2026 年 7 月
入手方法HuggingFace で重みをダウンロードAPI のみ
ライセンスApache 2.0クラウドサービス規約に準拠
規模0.6B / 1.7B の 2 サイズFlash / Plus の 2 グレード
言語10 種16 種、加えて中国語方言 20 地域
向く人ローカル配備したい、モデルを改造したい、データを外に出したくないすぐ使える品質がほしい、方言と多言語をカバーしたい、クラウド呼び出しを許容できる

ローカルで動かしたいなら、いまダウンロードできるのは 1 月の一式のままです。その 1.7B-CustomVoice 版は HuggingFace でダウンロード数が 200 万回を超え、コミュニティが GGUF や MLX など各種の量子化版を作っています。

🧰 導入カード · Qwen-Audio-3.0-TTS
価格Plus は 100 万文字あたり 27.59 米ドル(第三者評価サイトのデータ)
条件Alibaba Cloud アカウントが必要。モデル名は qwen-audio-3.0-tts-flash または qwen-audio-3.0-tts-plus。重みの配布はなく、ローカル実行したい場合は 1 月公開の Qwen3-TTS を使用

記事前半のデモでは触れていない手順が 1 つあります。合成リクエストに参考音声を直接同梱することはできません。自分の声を使うには、まず音声複製機能で音声を独自音色として登録し、音色 ID を取得。合成時に voice にその ID を指定します。直接呼び出す場合、voice にはシステムのプリセット音色名が入ります。

1
まず音色を登録
音声複製機能で参考音声をアップロードし、音色 ID を取得します。
2
合成時にその ID を指定
voice パラメータに音色 ID、model に対応するモデル名を設定します。
3
方言は指示に書く
クローンした音色に方言を話させたいときは、指示文に直接書きます。例:「河南方言で話して」。
出典
Qwen-Audio-3.0-TTS通義実験室 Qwen Audio / Token Foundry チーム·リリースページ·2026-07-20
本サイトの注記
レーダーチャート 2 枚はリリースページから引用。図中には Qwen-Audio-3.0-TTS の線が 1 本あるだけで Flash と Plus に分かれていないため、リリースノートの「16 言語中 10 言語で文字誤り率が最小」という 2 グレード合計の結論は、チャート上で軸ごとに数えて確認できません。本記事の図に関する記述は、実際に描かれているこの 1 本の曲線のみに基づきます。アリーナのランキング画像と Elo・生成速度・価格の 3 項目は Artificial Analysis 公式アカウント 2026-07-14 の投稿から。31 個のタグの完全な一覧、単方向ストリーミングの制限、API モデル名は Alibaba Cloud のドキュメントによります。2 世代のオープンソース状況の比較は、本サイトが HuggingFace のモデルリポジトリで照合しました。フレームレート比較図は本サイト作成の概念図で、仕組みの説明用。上段の 25 Hz は一般的な水準を参照値として置いたものです。音声サンプルはリリースページから取得し、読み込みやすさのため mp3 に変換しています。