
- Hugging FaceがTTSモデル向けの客観指標リーダーボードを公開した
- 明瞭性・速度・話者類似度を指標化し、評価時間を数週間から数時間に短縮
- 多言語・音声クローニング・ストリーミングも比較、人間の選好評価は置き換えない
何が公開されたのか
Hugging Faceは2026年9月30日、テキスト読み上げ(TTS)モデルを評価する「Open TTS Leaderboard」を公開した。TTSモデルのリリースは速いペースで続いている一方、評価は断片化し標準化されていないと同社は指摘する。従来の基準はMOSやMUSHRAのような人間の選好スコアだった。
このリーダーボードは、人間の選好による評価を置き換えるのではなく、客観指標で補完することを狙う。Hugging Faceによれば、指標ベースにすることでモデル1件の評価時間は投票収集の数週間から数時間に短縮されるという。
目的はリリースの速さに追いつくことだけではない。コミュニティとともに評価を形作ることを意図しており、今後評価スクリプトをオープンソース化し、GitHubのIssueやPRを通じてフィードバックを受け付ける予定だとしている。
4つの評価軸
明瞭性は、読み上げ文と生成音声の文字起こしの間の単語誤り率(WER)および文字誤り率(CER)で測る。文字起こしにはQwen3 ASRを使用しており、これはOpen ASR Leaderboardで最上位に位置するオープンソースモデルだと説明されている。
速度は2つの指標で評価する。H200 GPU上でのバッチオフライン推論におけるRTFxと、H200 GPUおよびCPU上でのストリーミング(バッチサイズ1)における最初の音声までの時間(TTFA)だ。
話者類似度は、生成音声と参照クリップから取り出したWavLM話者埋め込みのコサイン類似度(SIM)で計算する。ただしHugging Faceは、WERは明瞭性の代理指標、SIMは声の同一性保持の推定にとどまり、自然さや表現力、聴取者の選好を直接測るものではないと明記している。
アリーナ型との違い
アリーナ型のリーダーボードは、2つのモデルの出力を提示してユーザーに選ばせ、十分な投票が集まった後にEloスコアを計算して順位付けする。一般的にはBradley–Terryモデルが使われ、コミュニティの参照点として定着している。
しかし投票の収集はリリースの速さに追いつけない。2026年9月30日時点でArtificial Analysisに掲載された92モデルのうちオープンウェイトは16のみで、Voice Arenaでも同様の偏りがあるという。APIモデルはAPIキーがあれば追加できるのに対し、オープンモデルは運営側がホストして配信する必要があることなどが背景とみられる。
もう一つの限界は投票者の一貫性だ。同じ投票者が同じ「より良い」という基準で長期にわたり評価し続けられる保証はなく、個人の選好も時間とともに変わると指摘し、ヘラクレイトスの言葉を引いている。
多言語・クローニング・配信
既定の表示では、Seed TTS Evalの英語スプリットとCV3 Eval(zero shot)のマクロ平均WERでランク付けされる。英語WERの上位はhexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-proで、WER・バッチ推論(RTFx)・モデルサイズのバランスはParetoプロットで可視化される。
言語は切り替えられ、多言語性能で順位を確認できる。Seed TTS Evalは英語と中国語の音声しか持たないため、それ以外の言語はCV3 Eval(zero shot)のスコアになる。中国語・日本語・韓国語は文字ベースの言語のためCERで報告され、「Average WER」は言語間のマクロ平均だ。多言語で強いモデルとしてk2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512が挙げられている。
ボイスクローニングを切り替えると、対応モデルを比較できる。表にSIM列が追加され、SIMとバッチ推論、サイズのトレードオフを示すParetoプロットも2つ加わる。bosonai/higgs-tts-3-4bやopenbmb/VoxCPM2は、参照音声を渡す音声クローニング時に平均WERが改善するという。
ストリーミングタブはTTFAで順位付けし、音声エージェントなど対話型アプリでの待ち時間を把握できるようにする。ストリーミングモデルは最初の音声チャンクが届くまでの時間、非ストリーミングモデルは発話全体の生成が終わるまでの時間を測る。CV3-Evalの同一の50の英語プロンプトを、同一ハードウェア・既定の声・バッチサイズ1で実行し、最初の3回をウォームアップとして除外したうえで中央値を報告する。既定はH200 GPUで、CPUの結果も小規模ながら用意されている。kyutai/pocket-ttsはGPUとCPUの両方でストリーミングに適したモデルだとしている。
限界と参加方法
Hugging Faceは、人間の選好が最終的な判断基準であるという立場を変えていない。客観指標は自然さや表現力、聴取者の好みを測らないため、そうした観点は引き続き別途確認する必要がある。
Listenタブでは、指標の裏側にある生成音声を実際に聴き比べられる。気に入ったモデルに投票でき、投票にはHugging Faceアカウントでのログインが必要で、スパムやボットの排除が目的とされている。集まった投票は今後リーダーボードに反映される可能性があるという。
評価スクリプトはOpen ASR Leaderboardと同様に近日オープンソース化される予定だ。どのデータセット、モデル、指標を見たいかをコミュニティから募集しており、要望はGitHubのIssueやPRで受け付けるとしている。
| 項目 | アリーナ型 | Open TTS Leaderboard |
|---|---|---|
| 評価手法 | 人間の投票による選好比較 | WER・CER・RTFx・TTFA・SIMの客観指標 |
| 評価にかかる時間 | 数週間(投票収集) | 数時間 |
| オープンウェイトの扱い | Artificial Analysisでは92モデル中16のみ | オープンソースモデルを重視 |
| 順位付けの方法 | Eloスコア(Bradley–Terryモデル) | 指標ごとのランキング(マクロ平均WERなど) |
Importantly, the Open TTS Leaderboard does not replace human preference ranking. ASR-based WER provides a proxy for intelligibility, while speaker similarity estimates voice identity preservation.
重要な点として、Open TTS Leaderboardは人間の選好によるランキングを置き換えるものではない。ASRベースのWERは明瞭性の代理指標であり、話者類似度は声の同一性の保持を推定するものだ。
今後の見通し
今後は評価スクリプトのオープンソース化が予定されており、データセットやモデル、指標に対するコミュニティの要望が反映されていく見込みだ。Listenタブに集まった投票がリーダーボードに掲載される可能性も示唆されている。多言語評価は現状CV3 Eval(zero shot)への依存が大きく、このデータセットが拡充されるかどうかが、日本語を含む非英語圏の評価精度を左右するとみられる。CPU向けTTFAの対象モデルがどこまで増えるかも、オンプレミスやエッジでの利用を検討する際の判断材料になりそうだ。
日本の開発者・IT企業にとっての意味
日本語の音声合成モデルを選ぶ際、これまでは商用APIの比較か、限られた聴感テストに頼る場面が多かった。Open TTS Leaderboardは単語・文字誤り率や話者類似度、推論速度、最初の音声までの遅延を同じ条件で並べるため、日本語を含む多言語の候補を客観指標で絞り込む材料になる。特に音声エージェントのように応答の速さが体験を左右する用途では、TTFAやRTFxの比較が設計判断に直結する。一方で自然さや表現力は測れないため、最終的な選定では実際に音声を聴く工程が残る。自社でモデルをホストする場合のGPU・CPU性能の目安としても参考になるが、CPU結果はまだ対象モデルが少ない点は留意したい。
気になる点
- 日本語のTTSモデルも評価対象になるのか
- なるとみられる。リーダーボードでは言語を切り替えて順位を確認でき、日本語は文字ベース言語のため文字誤り率(CER)で報告される。ただし英語と中国語はSeed TTS Evalの音声が使える一方、それ以外の言語はCV3 Eval(zero shot)のスコアのみで評価される点には注意が必要だ。
- 音声クローニングの品質はどう測るのか
- 話者類似度(SIM)で測る。生成音声と参照クリップから取り出したWavLM話者埋め込みのコサイン類似度を計算し、ボイスクローニングを有効にすると表にSIM列とParetoプロットが追加される。ただしSIMは声の同一性の保持を推定するもので、自然さや表現力は測っていない。
- 自分で評価に参加したり、投票したりできるのか
- Listenタブで生成音声を聴き比べて投票できる。投票にはHugging Faceアカウントでのログインが必要で、スパムやボットの排除が目的とされている。評価スクリプトは現時点では未公開だが、Open ASR Leaderboardと同様に近日オープンソース化される予定で、GitHubのIssueやPRで要望を出せるようになる。
用語解説
- WER(Word Error Rate)
- 正解の文字起こしと、生成音声を音声認識にかけた結果を比べた単語単位の誤り率。低いほど聞き取りやすい。
- CER(Character Error Rate)
- 文字単位の誤り率。中国語や日本語、韓国語など文字ベースの言語の評価に使われる。
- RTFx(Inverse Real-Time Factor)
- バッチ処理で音声をどれだけ速く生成できるかを示す倍率。値が大きいほど高速。
- TTFA(Time To First Audio)
- リクエストしてから再生可能な最初の音声が得られるまでの時間。ストリーミングの体感遅延を表す。
- 話者類似度(SIM)
- 生成音声と参照音声の話者埋め込みのコサイン類似度。声の同一性が保たれているかを推定する。
- MOS / MUSHRA
- 人間が音声を聴いて品質を段階評価する主観評価手法。TTS評価の従来の基準とされる。
出典
Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する