数据集 / 归档 / 2026-06-08

2026-06-08 收录的数据集(7)

本页记录当日收录项目。

nvidia / Nemotron-Personas-Vietnam

基于越南人口分布生成的合成人物画像数据集

10.0万行 · 123 MB

  • 多模态
  • 文本生成
  • cc-by-4.0 · 许可标注允许商用

3个月前更新

项目方资料核对

  • 为越南及东南亚的本地化/主权AI开发提供开放可商用的数据基础
  • 数据集为合成(synthetic)生成,非真实人群采样,在真实场景中的分布代表性未经独立验证

3 个来源 · 截至 2026-06-20

Nerfgun3 / bad_prompt

用于稳定扩散的负面提示词嵌入训练数据集

1 行 · 14 MB

  • 图像
  • creativeml-openrail-m · 许可标注允许商用

3年前更新

项目方资料核对

  • 将负面提示词统一为单个嵌入词,简化负面提示编写
  • 会完全改变画面艺术风格,非纯质量增强型嵌入

3 个来源 · 截至 2026-06-20

allenai / dolma

用于语言模型预训练研究的大规模英文开放语料库

6.1 TB

  • 文本生成
  • odc-by · 许可标注允许商用

2年前更新

已被取代 Dolma 3 Dolmino · Dolma v1 已被 Dolma 3 Dolmino 取代,后者是 OLMo 3 第二阶段退火训练使用的高质量数据池。

项目方资料核对

  • 提供可公开获取、可审计的预训练数据,使研究者能间接研究闭源模型的训练数据构成
  • 使用 AI2 Impact License 而非标准开放许可

4 个来源 · 截至 2026-06-20

databricks / databricks-dolly-15k

由Databricks员工生成的指令跟随数据集,涵盖多种任务类别

1.5万行 · 267 MB

  • 文本
  • 问答
  • 摘要
  • cc-by-sa-3.0 · 许可标注允许商用

3年前更新

项目方资料核对

  • 提供明确允许商用的开源指令微调数据集许可
  • Cleanlab清洗版分析显示原始数据存在毒性评分高达0.99、非英语内容评分达0.91等质量问题

3 个来源 · 截至 2026-06-20

roneneldan / TinyStories

使用小词汇量由GPT-3.5和GPT-4生成的短故事数据集

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 许可标注允许商用

2年前更新

项目方资料核对

  • 让极小参数模型(低于5M)产出连贯英文文本
  • 数据集为GPT-3.5/GPT-4合成生成,非真实语料

4 个来源 · 截至 2026-06-20

tatsu-lab / alpaca

由OpenAI引擎生成的指令和示范数据集,用于指令微调

5.2万行 · 319 MB

  • 文本
  • 文本生成
  • cc-by-nc-4.0 · 许可明确限制商用

3年前更新

项目方资料核对

  • 提供了可复现的指令微调基线,52K 条合成数据即可让 7B 模型在 Self-Instruct 评测上接近 text-davinci-003
  • 数据存在明显的拼接/格式错误,部分样本中多条 instruction-response 被错误合并

3 个来源 · 截至 2026-06-20

tiiuae / falcon-refinedweb

从CommonCrawl过滤去重构建的大规模英文网络文本数据集

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 许可标注允许商用

3年前更新

项目方资料核对

  • Apache 2.0 许可,商用无额外限制
  • CommonCrawl 快照停留在 2013 年,数据时效性远落后于后续网页数据集

4 个来源 · 截至 2026-06-20

← 前一日 2026-06-07 · 后一日 2026-06-09 →