Jackrong / GLM-5.1-Reasoning-1M-Cleaned
GLM-5.1生成的多领域推理数据,清理为SFT格式,含四个子集
仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。
项目方资料核对
该数据集为完全模型蒸馏的合成数据,自身统计显示存在 incomplete_output、repeated_paragraph 等质量问题,且合成数据来源本身存在基准污染风险,直接用于训练需谨慎评估。
- 数据集自身统计记录了 incomplete_output(PHD-Science 33 条、Multilingual-STEM 88 条)、repeated_paragraph(PHD-Science 19 条、Multilingual-STEM 116 条)及 unparseable_output(Multilingual-STEM 19 条)等质量问题
- 该数据集完全由 GLM-5.1 模型蒸馏生成,属于合成数据;已有研究指出 LLM 生成的合成数据可能无意中引入基准污染,使模型在受污染 benchmark 上得分虚高
- 数据集为 Kassadin88/GLM-5.1-1000000x 的再加工版本,本身不含人工标注或人工校验,所有内容均为模型输出
来源
Jackrong/GLM-5.1-Reasoning-1M-Cleaned · Datasets at Hugging FaceRethinking Benchmark and Contamination for Language ...
截至 2026-07-22