数据集 / HuggingFaceFW / fineweb

HuggingFaceFW / fineweb

从CommonCrawl清洗去重后的英文网页文本,用于语言模型预训练

HF 源仓库 ↗本站资料更新 2026-08-20

关键规格

作者
HuggingFaceFW
规模
524.54亿行 · 117.4 TB
模态
文本
任务
文本生成
授权
odc-by · 许可标注允许商用
语种
en
HF 热度407,892 下载 · 3,238 收藏观测于 2026-08-20
源仓库更新2025-07-11

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

采用判断

独立证据与社区反馈 · 3 个来源 · 核验于 2026-07-22

社区将其视为 RefinedWeb 的开放复现与增强版,用于 LLM 预训练阶段替代 C4、The Pile 等旧有网页语料集,基准测试中模型表现优于同类数据集,且因处理脚本完全公开而受到好评。[1][2]

适合用来

  • 提供大规模(15T token)ODC-By 许可的英文网页预训练语料,替代 C4、The Pile 等旧数据集用于 LLM 预训练[1]
  • 模型在 FineWeb 上训练后在基准测试中优于 RefinedWeb、C4、Dolma-v1.6、The Pile、SlimPajama[1]
  • 数据处理脚本完整公开,可复现可审查[2]

采用前注意

  • 全量数据约 25,000 个 parquet 文件,社区实测处理全量预估约需 13 天,实际使用门槛较高[3]

历史记录

7 次历史卡片 · 2026-05-22 至 2026-08-20

研究依据

以下论文与本条目存在经人工复核的直接关系。论文本身不构成对它的推荐。