数据集 / google / WaxalNLP

google / WaxalNLP

非洲语言的多语种语音数据,用于语音识别与合成

作者
google
规模
167.3万行 · 3.5 TB
模态
多模态
任务
语音识别 / 语音合成
授权
cc-by-sa-4.0 · 许可标注允许商用
语种
ach / aka / amh / bau / dag / dga / ewe / fat / ful / hau / ibo / kik / kpo / lin / lug / luo / mas / mlg / nyn / orm / pcm / sid / sna / sog / swa / tir / twi / wal / yor
下载
35,070
收藏
246

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

项目方资料核对

数据集以CC-BY-4.0许可发布,适合非洲语言语音技术研发,但ASR部分为图像提示语音,领域覆盖有限,且官方来源间语言数与时长统计存在版本差异,采用前需确认实际覆盖范围。

  • 非洲语言自动语音识别模型训练与评估
  • 非洲语言语音合成模型训练
  • ASR数据为图像提示的自然语音(image-prompted natural speech),语音内容局限于图像描述场景,非开放域日常对话,领域覆盖偏窄,可能影响模型在通用对话场景下的表现
  • 官方论文与官方博客对覆盖语种数、数据时长的统计不一致:论文称24语种/约1250小时ASR与235小时TTS,博客称27语种/约1846小时ASR与565小时TTS,采用前需确认实际版本对应的数据规模

截至 2026-07-22

观测时间线