数据集 / KRAFTON / Raon-OpenTTS-Pool

KRAFTON / Raon-OpenTTS-Pool

多个公开英语语音语料库聚合而成的TTS训练数据集

作者
KRAFTON
规模
8.46亿行 · 19.7 TB
模态
多模态
任务
语音合成
授权
other · 许可待核
语种
en
下载
10,226
收藏
25

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

项目资料与外部反馈

“mixed-per-dataset”许可意味着各子集权利条款可能互不兼容,直接用于商用或再分发存在合规隐患,且原始池需经模型过滤后(如导出 Raon-OpenTTS-Core)才适合训练,不能直接当“即用”训练集。

  • 开放 TTS 的语音数据池构建与可复现训练研究
  • 数据集许可标记为“mixed-per-dataset”,每个子数据集的许可条款可能不同甚至互斥,下游使用存在权利不确定性。
  • 该数据集仅包含英语语音,无法覆盖多语种 TTS 训练场景。
  • 论文明确指出需要用模型过滤管线对 Raon-OpenTTS-Pool 做清洗才能得到 Raon-OpenTTS-Core,说明原始池中存在质量参差、不适合直接训练的数据。
  • 有研究指出数据在再分发过程中,原始数据与再分发子集之间的法律权利常出现不一致,对于“mixed-per-dataset”这类池化数据集尤其值得警惕。

截至 2026-07-22

观测时间线