Open ASR Leaderboard 新增首个全球南方语言评测集
Hugging Face 联合 Voice Arena 在 Open ASR Leaderboard 中上线 Monsoon 印地语与印度英语语音评测集。该数据集包含 4,888 位说话人及 12 项人口统计学元数据,涵盖公有与私有切分,支持按地区、年龄和设备等多维度排查识别错误。
Hugging Face 联合 Voice Arena 在 Open ASR Leaderboard 中上线 Monsoon 印地语与印度英语语音评测集。该数据集包含 4,888 位说话人及 12 项人口统计学元数据,涵盖公有与私有切分,支持按地区、年龄和设备等多维度排查识别错误。
Hugging Face 针对语音识别模型刷榜和基准过拟合现象提出三种量化测试,并评估了 11 个主流开源 ASR 模型。实测显示部分基准高分模型会直接复现参考文本里的历史标注错误,在音频数字被静音时仍有 30% 至 40% 的概率猜出被抹去的数字,甚至依赖背景声学线索切换不同数据集的拼写习惯。
推荐理由:该研究量化了语音模型利用声学线索迎合测试集的过拟合行为,为评估模型真实泛化能力提供了实用检测方法。
语音 AI 基准 Real World VoiceEQ 正式发布,基于超过 100 万项人类真实评分,全面评测 40 多款主流专有及开源语音模型的实际交互质量。
Google Research 联合非洲机构推出开源语音数据集 WAXAL,覆盖 26 个以上国家超 1 亿人使用的 27 种子撒哈拉非洲语言。该资源采用 CC-BY-4.0 许可开源,包含约 1,846 小时用于 ASR 的自然无脚本转录语音数据,以及超 565 小时用于 TTS 的高保真录音数据,旨在支持开发全双工对话系统并促进低资源语音技术研发。