数据集 / 归档 / 2026-05-24

2026-05-24 收录的数据集(6)

本页记录当日收录项目。

Nerfgun3 / bad_prompt

用于Stable Diffusion的负向提示嵌入向量。

1 行 · 14 MB

  • 图像
  • creativeml-openrail-m · 许可标注允许商用

3年前更新

项目方资料核对

  • 将常用的负向提示词骨架训练为单一嵌入,省去每次手写长负面 prompt 的麻烦
  • 与某些环境组合时触发 torch.cuda.HalfTensor 类型不匹配的 RuntimeError

4 个来源 · 截至 2026-06-20

allenai / dolma

包含3万亿token的英文语料,用于语言模型预训练研究。

6.1 TB

  • 文本生成
  • odc-by · 许可标注允许商用

2年前更新

项目方资料核对

  • 提供了可公开获取的大规模预训练语料,使研究者能间接研究甚至审查闭源模型的训练数据构成
  • 采用 AI2 Impact License 而非标准开放许可(如 CC),商用存在限制

3 个来源 · 截至 2026-06-20

roneneldan / TinyStories

由GPT-3.5/4生成的短篇故事,词汇量小。

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 许可标注允许商用

2年前更新

项目方资料核对

  • 为小规模语言模型训练与实验提供可控、低资源需求的合成文本数据

4 个来源 · 截至 2026-06-20

tatsu-lab / alpaca

由OpenAI text-davinci-003生成的指令和演示数据。

5.2万行 · 319 MB

  • 文本
  • 文本生成
  • cc-by-nc-4.0 · 许可明确限制商用

3年前更新

项目方资料核对

  • 提供了 52K 条 Self-Instruct 生成的指令跟随数据,降低了指令微调研究的复现门槛
  • 合成数据存在指令与回复拼接错误等标注噪声

3 个来源 · 截至 2026-06-20

databricks / databricks-dolly-15k

Databricks员工生成的指令跟随数据,覆盖多种任务类别。

1.5万行 · 267 MB

  • 文本
  • 问答
  • 摘要
  • cc-by-sa-3.0 · 许可标注允许商用

3年前更新

项目方资料核对

  • 提供了首个开源、可商用的真人标注指令微调数据集,填补了空白
  • 原始数据存在 PII、毒性内容、非正式语言等质量问题,社区已有 Cleanlab 清洗版

4 个来源 · 截至 2026-06-20

tiiuae / falcon-refinedweb

从CommonCrawl过滤去重得到的大型英文网页数据集。

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 许可标注允许商用

3年前更新

项目方资料核对

  • Apache 2.0 许可,商用友好
  • 样本中存在大量低质量网页噪音,如博客评论、无效短文本、断句碎片

4 个来源 · 截至 2026-06-20

← 前一日 2026-05-23 · 后一日 2026-05-25 →