数据集 / Jackrong / GLM-5.1-Reasoning-1M-Cleaned

Jackrong / GLM-5.1-Reasoning-1M-Cleaned

GLM-5.1生成的多领域推理数据,清理为SFT格式,含四个子集

HF 源仓库 ↗本站资料更新 2026-06-05

关键规格

作者
Jackrong
规模
57.2万行 · 44.2 GB
模态
文本
任务
文本生成 / 问答
授权
apache-2.0 · 许可标注允许商用
语种
en / zh
中文
含中文
HF 热度9,755 下载 · 252 收藏观测于 2026-06-05
源仓库更新2026-04-19

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

采用判断

项目方资料核对 · 2 个来源 · 核验于 2026-07-22

该数据集为完全模型蒸馏的合成数据,自身统计显示存在 incomplete_output、repeated_paragraph 等质量问题,且合成数据来源本身存在基准污染风险,直接用于训练需谨慎评估。[1][2]

采用前注意

  • 数据集自身统计记录了 incomplete_output(PHD-Science 33 条、Multilingual-STEM 88 条)、repeated_paragraph(PHD-Science 19 条、Multilingual-STEM 116 条)及 unparseable_output(Multilingual-STEM 19 条)等质量问题[1]
  • 该数据集完全由 GLM-5.1 模型蒸馏生成,属于合成数据;已有研究指出 LLM 生成的合成数据可能无意中引入基准污染,使模型在受污染 benchmark 上得分虚高[1][2]
  • 数据集为 Kassadin88/GLM-5.1-1000000x 的再加工版本,本身不含人工标注或人工校验,所有内容均为模型输出[1]

历史记录

2 次历史卡片 · 2026-05-21 至 2026-06-05