数据集 / HuggingFaceFW / fineweb

HuggingFaceFW / fineweb

从CommonCrawl清洗去重后的英文网页文本数据集

作者
HuggingFaceFW
规模
524.54亿行 · 117.4 TB
模态
文本
任务
文本生成
授权
odc-by · 许可标注允许商用
语种
en
下载
625,610
收藏
2,954

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

独立证据与社区反馈

社区将其视为 RefinedWeb 的开放复现与增强版,用于 LLM 预训练阶段替代 C4、The Pile 等旧有网页语料集,基准测试中模型表现优于同类数据集,且因处理脚本完全公开而受到好评。

  • 提供大规模(15T token)ODC-By 许可的英文网页预训练语料,替代 C4、The Pile 等旧数据集用于 LLM 预训练
  • 模型在 FineWeb 上训练后在基准测试中优于 RefinedWeb、C4、Dolma-v1.6、The Pile、SlimPajama
  • 数据处理脚本完整公开,可复现可审查
  • 全量数据约 25,000 个 parquet 文件,社区实测处理全量预估约需 13 天,实际使用门槛较高

截至 2026-07-22

观测时间线