英文原标题:Introducing Falcon ASR

本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗

  • TII 在阿布扎比发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点面向阿拉伯语,尤其是阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语。
  • 在六个阿拉伯语测试集上,Falcon-ASR 平均词错误率(WER)为 20.92%,优于所参考排行榜快照中最佳公开结果 23.17%,领先 2.25 个百分点。
  • 在 TII 内部阿联酋方言评测中,模型取得 22.73% WER 和 10.19% CER,在所比较系统中均为最低,WER 比次优的 Qwen3-Omni 低 4.07 个百分点。
  • 模型支持词级时间戳,将每个转写词与音频中的位置对应;训练数据涵盖阿联酋方言、MSA、其他海湾及阿拉伯方言和英语,并加入背景噪声、重叠语音、音乐、混响、电话效应及语速音高变化等条件。
  • 在 Hugging Face Open ASR Leaderboard 的七个公开英语测试集上,同一套权重取得平均 WER 5.74%;五种语言共用同一权重,无需语言标记,输出为所讲语言的转写文本。

关键数据

  • 参数规模:1.6B
  • 六个阿拉伯语测试集平均 WER:20.92%
  • 排行榜快照最佳公开结果:23.17%
  • 领先幅度:2.25 个百分点
  • 内部阿联酋方言评测:WER 22.73%,CER 10.19%
  • 比 Qwen3-Omni 低 4.07 个百分点
  • 英语七个公开测试集平均 WER:5.74%
  • 支持语言:阿拉伯语、英语、法语、西班牙语、葡萄牙语

为什么值得看:Falcon-ASR 在阿拉伯语及阿联酋方言识别上取得优于公开排行榜最佳结果的词错误率,并以单一权重支持五种语言,为方言语音转写提供了新的开源选择。

站内导航