英文原标题:Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning
本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗
- Hugging Face Hub 上开源 TTS 模型已超 8K,但评估仍碎片化、缺乏标准,现有 arena 式榜单(TTS Arena v2、Artificial Analysis、Voice Arena)依赖人工投票,难以跟上模型发布速度。
- Open TTS Leaderboard 采用客观指标:用 Qwen3 ASR 计算 WER/CER 衡量可懂度,用 RTFx 和 TTFA 衡量速度,用 WavLM 说话人嵌入余弦相似度衡量音色相似度,评估时间从数周缩短到数小时。
- 榜单支持多语言和语音克隆评估,默认按 Seed TTS Eval 英文集与 CV3 Eval 零样本集的宏平均 WER 排名;Kokoro-82M、supertonic-3、s2-pro 在英文 WER 领先,OmniVoice、s2-pro、Fun-CosyVoice3 多语言表现强。
- 提供 Listen 标签页供用户试听并投票,Streaming 标签页按 TTFA 比较流式性能,pocket-tts 在 GPU 和 CPU 上流式表现突出。
- 作者强调客观指标不能替代人类偏好,不直接衡量自然度、表现力或听众喜好,但可辅助投票式榜单选择模型;评估脚本将开源,社区可通过 GitHub 反馈。
关键数据
- 截至 2026 年 9 月 30 日,Hugging Face Hub 上有超过 8K 个 TTS 模型。
- Artificial Analysis 的 92 个模型中仅 16 个是开放权重。
- 评估时间从收集投票的数周缩短到数小时。
- 流式评估使用 CV3-Eval 的 50 条英文提示,丢弃前 3 次预热运行,报告其余运行的中位 TTFA。
引语
- A man cannot step into the same river twice
为什么值得看:该榜单用可扩展的客观指标补充人工投票式评估,聚焦开源和多语言 TTS,有助于跟上模型发布速度并推动社区共建评估标准。