数据集 / roneneldan / TinyStories

roneneldan / TinyStories

GPT-3.5/4 生成的短篇故事,仅用少量词汇

HF 源仓库 ↗本站资料更新 2026-08-22

关键规格

作者
roneneldan
规模
214.2万行 · 17.3 GB
模态
文本
任务
文本生成
授权
cdla-sharing-1.0 · 许可标注允许商用
语种
en
HF 热度92,937 下载 · 1,120 收藏观测于 2026-08-22
源仓库更新2024-08-12

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

安全扫描

HF 安全扫描标记可疑(pickle)· 查看报告自行判断查看报告

采用判断

项目资料与外部反馈 · 3 个来源 · 核验于 2026-07-23

全合成英文数据集,许可证为 CDLA-Sharing-1.0(需以相同方式共享),原版含 GPT-3.5 生成的较低质量文本,官方已在同仓库提供 GPT-4 独占的 V2 版本。[2]

适合用来

  • 提供合成短篇故事用于训练小型语言模型,研究极小模型在受限词汇下的语言连贯性。[1][2]

采用前注意

  • 数据集全部由 GPT-3.5 和 GPT-4 合成生成,非真实人类写作,官方 README 指出 GPT-3.5 生成的故事质量较低。[2]
  • 数据集仅包含英文文本,语言覆盖单一,无法用于多语言场景。
  • 数据集许可证为 CDLA-Sharing-1.0(共享方式相同许可),要求修改后分发须以相同方式共享;模型页声明的自由商用条件仅适用于模型权重,不适用于数据集本身,需注意两者授权条款的差异。[3]
  • 官方 README 指出同仓库中已有 TinyStoriesV2-GPT4-train.txt,仅使用 GPT-4 生成且规模更大,含 GPT-3.5 生成内容的原版在质量上已被视为旧版。

历史记录

7 次历史卡片 · 2026-05-24 至 2026-08-22

研究依据

以下论文与本条目存在经人工复核的直接关系。论文本身不构成对它的推荐。