数据集 / allenai / dolma3_dolmino_mix-100B-1125

allenai / dolma3_dolmino_mix-100B-1125

100B token合成混合,专为Olmo 3第二阶段退火训练设计,覆盖数学/代码/推理

HF 源仓库 ↗本站资料更新 2026-06-21

关键规格

作者
allenai
规模
319.5 GB
授权
odc-by · 许可标注允许商用
语种
en
HF 热度29,943 下载 · 20 收藏观测于 2026-06-21
源仓库更新2026-02-23

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

编辑部补充

为什么值得关注

若需要快速获取一批针对数学、代码、推理等能力的合成训练/微调样本,本数据集可直接加载text字段使用,无需额外清洗。

主要亮点

  • 由AllenAI为OLMo 3 32B中期训练筛选的高质量合成数据池,目标提升数学、代码、QA、指令理解与思考能力
  • 包含12种以上不同来源的合成数据(如TinyMATH、CraneCode、Nemotron QA等),覆盖较广的技能维度
  • 采用ODC-BY开源许可,可商用途经署名即可使用

数据质量

  • 合成数据占比100%,存在模式化和伪相关风险,尤其数学和推理数据可能高度模板化
  • 未公开去重策略及重复率,同一来源内部可能存在近重复样本
  • 数据来源为多管道生成,噪声水平不一(如网络爬取部分经过STEM筛选,但合成QA质量依赖提示设计)
  • 数据集曾用于Olmo 3训练,若直接用于评测存在潜在泄漏(需确认时间和任务范围)

限制与取舍

  • 全部为合成数据,缺乏自然文本多样性,在真实场景泛化上可能受限
  • 仅包含英文,不支持多语言任务
  • ODC-BY许可要求明确署名,需注意合规性

采用判断

项目资料与外部反馈 · 3 个来源 · 核验于 2026-07-22

该数据集是面向中训练阶段的合成数据混合体,HF 加载失败、内部版本不完全一致、商业用途表述模糊,采用前需验证实际可用性与许可范围。[2][3]

适合用来

  • 用于语言模型的中训练/退火阶段,针对性提升数学、代码、问答、指令遵循和推理能力。[2]

采用前注意

  • HF 数据集查看器因 schema 不匹配(CastError)直接失败,影响通过 datasets 库直接加载和浏览。
  • 合成数据占比极高,几乎所有类别均标注为 synth,仅少量 Common Crawl 网页部分为非合成数据。
  • 仓库说明称 HF 版本为"最接近的最终数据集",暗示与内部 Ai2 实际使用版本存在差异。[2]
  • 数据集卡标注 ODC-By 许可,但同时又写明"intended for research and educational use",商业使用边界不明确。
  • 论文承认部分性能提升可能来自数据污染,最终退火对比用了去污版本,但发布的混合版本未明确标注是否已完成去污。[3]

相关数据集

正式取代关系

历史记录

1 次历史卡片 · 2026-06-21