opencsg / chinese-fineweb-edu
中文教育类网页语料,基于CommonCrawl过滤去重,约300GB,已弃用
关键规格
HF 热度5,648 下载 · 111 收藏观测于 2026-06-15
源仓库更新2025-12-12
仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。
编辑部补充
为什么值得关注
作为中文教育类预训练数据的早期开源参考,规模适中且可商用,适合快速原型验证或与新版V2.1进行对比实验
主要亮点
- 采用与FineWeb-Edu类似的教育价值分类器对CommonCrawl进行筛选,聚焦中文教育内容
- 规模约300GB、约9000万文本片段,适合中文预训练或继续预训练
- Apache-2.0许可,理论上支持商业使用
- 提供技术报告(arxiv 2501.08197)详细说明筛选流程
数据质量
- 去重:README提及经过去重流程,但未说明去重粒度(文档级/段落级)及具体方法
- 评分模型训练数据量小('a small amount of data'),可能引入分类偏差,影响教育价值判断的稳定性
- 未声明是否包含合成数据,在敏感场景下需额外验证
- 基于CommonCrawl原始数据,可能存在低质或噪声文本,过滤器的泛化能力需复现验证
限制与取舍
- 当前版本已deprecated,官方明确推荐使用新版FineWeb-Edu-Chinese-V2.1
- 未公开数据污染检测结果与合成数据比例,需用户自行评估
- 仅含网页文本,缺少代码或结构化数据,领域覆盖可能不均衡
编辑部依据
- chinese-fineweb-edu-v2 - 数据集详情页 ↗modelscope.cn
- FineWeb-Edu: Quality Educational Web Data ↗emergentmind.com
- How did the OpenCSG Chinese open source dataset team build 188 ... ↗medium.com
采用判断
项目资料与外部反馈 · 3 个来源 · 核验于 2026-06-20
2024年登上HuggingFace Trending,中文教育语料规模突出,但v2已被官方推荐用v2.1替代。
适合用来
- 提供大规模中文教育领域预训练语料(1.88亿条、约420B token),覆盖预训练教育大模型、智能辅导等场景
采用前注意
- 使用须遵守OpenCSG Community License,商用需核查许可条款
- v2已非最新版本,数据集卡片明确建议改用Fineweb-edu-chinese-v2.1
本段综合依据
- opencsg/chinese-fineweb-edu-v2 · Datasets at Hugging Face ↗huggingface.co
- 重磅升级| OpenCSG开源中文版fineweb edu v2数据集 ↗developer.volcengine.com
- What Datasets Are Available for Chinese Large Models? Here's Our ... ↗medium.com