数据集 / opencsg / chinese-fineweb-edu

opencsg / chinese-fineweb-edu

中文教育类网页语料,基于CommonCrawl过滤去重,约300GB,已弃用

HF 源仓库 ↗本站资料更新 2026-06-15

关键规格

作者
opencsg
规模
8463.8万行 · 588.5 GB
模态
文本
任务
文本生成
授权
apache-2.0 · 许可标注允许商用
语种
zh
中文
含中文
HF 热度5,648 下载 · 111 收藏观测于 2026-06-15
源仓库更新2025-12-12

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

编辑部补充

为什么值得关注

作为中文教育类预训练数据的早期开源参考,规模适中且可商用,适合快速原型验证或与新版V2.1进行对比实验

主要亮点

  • 采用与FineWeb-Edu类似的教育价值分类器对CommonCrawl进行筛选,聚焦中文教育内容
  • 规模约300GB、约9000万文本片段,适合中文预训练或继续预训练
  • Apache-2.0许可,理论上支持商业使用
  • 提供技术报告(arxiv 2501.08197)详细说明筛选流程

数据质量

  • 去重:README提及经过去重流程,但未说明去重粒度(文档级/段落级)及具体方法
  • 评分模型训练数据量小('a small amount of data'),可能引入分类偏差,影响教育价值判断的稳定性
  • 未声明是否包含合成数据,在敏感场景下需额外验证
  • 基于CommonCrawl原始数据,可能存在低质或噪声文本,过滤器的泛化能力需复现验证

限制与取舍

  • 当前版本已deprecated,官方明确推荐使用新版FineWeb-Edu-Chinese-V2.1
  • 未公开数据污染检测结果与合成数据比例,需用户自行评估
  • 仅含网页文本,缺少代码或结构化数据,领域覆盖可能不均衡

采用判断

项目资料与外部反馈 · 3 个来源 · 核验于 2026-06-20

2024年登上HuggingFace Trending,中文教育语料规模突出,但v2已被官方推荐用v2.1替代。

适合用来

  • 提供大规模中文教育领域预训练语料(1.88亿条、约420B token),覆盖预训练教育大模型、智能辅导等场景

采用前注意

  • 使用须遵守OpenCSG Community License,商用需核查许可条款
  • v2已非最新版本,数据集卡片明确建议改用Fineweb-edu-chinese-v2.1

历史记录

1 次历史卡片 · 2026-06-15