allenai / dolma3_dolmino_mix-100B-1125
100B token合成混合,专为Olmo 3第二阶段退火训练设计,覆盖数学/代码/推理
仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。
- 由AllenAI为OLMo 3 32B中期训练筛选的高质量合成数据池,目标提升数学、代码、QA、指令理解与思考能力
- 包含12种以上不同来源的合成数据(如TinyMATH、CraneCode、Nemotron QA等),覆盖较广的技能维度
- 采用ODC-BY开源许可,可商用途经署名即可使用
为什么值得用若需要快速获取一批针对数学、代码、推理等能力的合成训练/微调样本,本数据集可直接加载text字段使用,无需额外清洗。
- 合成数据占比100%,存在模式化和伪相关风险,尤其数学和推理数据可能高度模板化
- 未公开去重策略及重复率,同一来源内部可能存在近重复样本
- 数据来源为多管道生成,噪声水平不一(如网络爬取部分经过STEM筛选,但合成QA质量依赖提示设计)
- 数据集曾用于Olmo 3训练,若直接用于评测存在潜在泄漏(需确认时间和任务范围)
- 全部为合成数据,缺乏自然文本多样性,在真实场景泛化上可能受限
- 仅包含英文,不支持多语言任务
- ODC-BY许可要求明确署名,需注意合规性
项目资料与外部反馈
该数据集是面向中训练阶段的合成数据混合体,HF 加载失败、内部版本不完全一致、商业用途表述模糊,采用前需验证实际可用性与许可范围。
- 用于语言模型的中训练/退火阶段,针对性提升数学、代码、问答、指令遵循和推理能力。
- HF 数据集查看器因 schema 不匹配(CastError)直接失败,影响通过 datasets 库直接加载和浏览。
- 合成数据占比极高,几乎所有类别均标注为 synth,仅少量 Common Crawl 网页部分为非合成数据。
- 仓库说明称 HF 版本为"最接近的最终数据集",暗示与内部 Ai2 实际使用版本存在差异。
- 数据集卡标注 ODC-By 许可,但同时又写明"intended for research and educational use",商业使用边界不明确。
- 论文承认部分性能提升可能来自数据污染,最终退火对比用了去污版本,但发布的混合版本未明确标注是否已完成去污。
来源
allenai/dolma3_dolmino_mix-100B-1125 · Datasets at Hugging FaceGitHub - allenai/dolma3 · GitHubOlmo 3
截至 2026-07-22