HuggingFaceFW / fineweb
从CommonCrawl清洗去重后的英文网页文本数据集
仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。
独立证据与社区反馈
社区将其视为 RefinedWeb 的开放复现与增强版,用于 LLM 预训练阶段替代 C4、The Pile 等旧有网页语料集,基准测试中模型表现优于同类数据集,且因处理脚本完全公开而受到好评。
- 提供大规模(15T token)ODC-By 许可的英文网页预训练语料,替代 C4、The Pile 等旧数据集用于 LLM 预训练
- 模型在 FineWeb 上训练后在基准测试中优于 RefinedWeb、C4、Dolma-v1.6、The Pile、SlimPajama
- 数据处理脚本完整公开,可复现可审查
- 全量数据约 25,000 个 parquet 文件,社区实测处理全量预估约需 13 天,实际使用门槛较高
来源
FineWeb: the new Pile for LLMs?FineWeb: Decanting the web for the finest text data at scale | Hacker NewsGitHub - lmmx/bbcfw: Exploring the BBC News subset of the FineWeb dataset
截至 2026-07-22