数据集 / HuggingFaceFW / fineweb-edu

HuggingFaceFW / fineweb-edu

从FineWeb过滤得到的教育类网页数据。

作者
HuggingFaceFW
规模
34.97亿行 · 6.2 TB
模态
文本
任务
文本生成
授权
odc-by · 许可标注允许商用
语种
en
下载
335,034
收藏
1,214

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

项目资料与外部反馈

高质量英语教育类网页文本,ODC-By许可但受CommonCrawl条款约束,去重仅限dump内且提升有限,适合教育领域预训练但有许可和去重注意点

  • 英语教育类网页文本的大规模预训练
  • MMLU、ARC、OpenBookQA等推理与知识密集型benchmark的预训练数据
  • ODC-By v1.0许可,且使用受CommonCrawl条款约束,存在双重许可限制
  • 去重仅在各CommonCrawl dump内部进行,不同dump之间不做比对,文档称去重后性能提升微乎其微
  • 仅包含英语数据,非英语内容已被分离用于FineWeb-2
  • 教育质量评分依赖Llama-3-70B-Instruct生成的合成标注,分类器本身由合成数据训练

截至 2026-07-22

观测时间线