数据集

来自 HuggingFace · 能训练、能接地的数据集 · 最近 14 天 · 共 37 个数据集

2026-07-23
2026-07-22

wikimedia / wikipedia

所有语言的维基百科文章,已清理标记和无关章节。

6161.5万行 · 1.4 TB

  • 文本
  • 文本生成
  • 掩码填充
  • cc-by-sa-3.0 · 许可标注允许商用
  • 含中文

下载 229k · 收藏 1.3k · 2年前更新

独立证据与社区反馈

Wikipedia 被社区视为不可或缺的公共知识基础设施,界面干净无广告追踪,但面临 AI 摘要导致的流量下滑和偶发的安全事件挑战。

  • 提供无广告、无追踪、无恶意软件的干净信息获取体验
  • 作为免费公共知识资源向所有人开放
  • 曾因恶意用户脚本导致全站只读锁定,存在账户安全与自动化恶意编辑风险
  • AI 搜索摘要正在减少 Wikipedia 的直接访问流量

截至 2026-06-20

FreedomIntelligence / medical-o1-reasoning-SFT

基于医疗可验证问题的推理链SFT数据,蒸馏自Deepseek-R1。

9.0万行 · 680 MB

  • 文本
  • 问答
  • 文本生成
  • apache-2.0 · 许可标注允许商用
  • 含中文

下载 11k · 收藏 1.2k · 1年前更新

项目方资料核对

HuatuoGPT-o1 的 SFT 训练数据集,由 GPT-4o 生成的带复杂思维链的医疗问答题,Apache 2.0 许可,社区主要将其用于医疗 LLM 推理能力微调。

  • 医疗推理 SFT 训练数据开源,附带 GPT-4o 生成的复杂思维链(Complex CoT)与答案
  • Apache 2.0 许可,允许商用
  • 中英双语医疗问答覆盖(en/zh 各约 2 万条)
  • 数据完全由 GPT-4o 合成生成,推理质量与医学准确性受限于生成模型,未经人工校验的合成数据可能包含幻觉或错误推理

截至 2026-06-20

HuggingFaceFW / fineweb-edu

从FineWeb过滤得到的教育类网页数据。

34.97亿行 · 6.2 TB

  • 文本
  • 文本生成
  • odc-by · 许可标注允许商用

下载 335k · 收藏 1.2k · 1年前更新

独立证据与社区反馈

社区认可其开放透明(脚本完整公开)与教育子集的高质量,认为技术报告为预训练数据构建提供了宝贵参考

  • 预训练数据构建过程不透明:多数大模型厂商不公开数据细节,该数据集完整公开了所有处理脚本
  • 大规模高质量开源预训练数据的获取:15万亿token规模且质量超越同类数据集

截至 2026-06-20

gsdf / EasyNegative

用于Stable Diffusion的负面嵌入向量,训练自Counterfeit模型。

3 行 · 3.9 GB

  • 图像
  • other · 许可待核

下载 15k · 收藏 1.2k · 3年前更新

独立证据与社区反馈

SD 1.5 生态中广泛使用的负向嵌入,对抑制单色、重复图案有效,但与 SDXL/Pony/Illustrious 不兼容且会大幅改变画面风格。

  • 抑制单色、重复图案及怪异输出,减少画面出现灰度化或纹理重复的问题
  • 仅适用于 SD 1.5 模型,与 SDXL、Pony、Illustrious 等模型不兼容,强行使用无效
  • 可能大幅改变画面整体风格,并非所有场景都适合无脑加入

截至 2026-06-20

togethercomputer / RedPajama-Data-1T

LLaMa数据集的完全开源复现。

172.6万行 · 39.5 GB

  • 文本
  • 文本生成

下载 1.6k · 收藏 1.2k · 2年前更新

项目资料与外部反馈

RedPajama-1T是LLaMA训练数据配方的早期开源复现,已被RedPajama-V2取代

  • 原始web数据存在HTML转文本伪影、低质量来源和内容偏差,不宜直接用于LLM训练
  • 已被RedPajama-V2取代,v2提供30T token、40+预计算质量标注和去重,RPv1代码已归档至rp_v1分支

截至 2026-06-20

已被取代 RedPajama-Data-V2 · V2 将规模从 1.2T 扩展到 30T tokens,覆盖 84 个 CommonCrawl 快照,是官方推荐的后续版本

2026-07-21

MCG-NJU / VideoChat3-Academic2M

学术视频指令数据,用于视频字幕、问答和动作理解

1.9万行 · 173.1 GB

  • 多模态
  • video-text-to-text
  • apache-2.0 · 许可标注允许商用

下载 2.0k · 收藏 20 · 3天前更新

项目方资料核对

该数据集为合成管线生成、Apache 2.0 许可,标注质量依赖合成管线而非人工校验;Hugging Face 查看器可能需要额外配置。

  • 视频多模态大模型训练,覆盖通用视频理解、长视频推理、时序定位与流式视频场景
  • 该数据集通过数据合成管线生成,论文描述为 'scalable video data synthesis pipeline',标注为机器合成而非人工标注。
  • Hugging Face 数据集页面提示查看器需要额外配置才能正常使用('Need help to make the dataset viewer work?'),可能影响数据浏览与探索。

截至 2026-07-22

HuggingFaceFW / fineweb

从CommonCrawl清洗去重后的英文网页文本数据集

524.54亿行 · 117.4 TB

  • 文本
  • 文本生成
  • odc-by · 许可标注允许商用

下载 626k · 收藏 3.0k · 1年前更新

独立证据与社区反馈

社区将其视为 RefinedWeb 的开放复现与增强版,用于 LLM 预训练阶段替代 C4、The Pile 等旧有网页语料集,基准测试中模型表现优于同类数据集,且因处理脚本完全公开而受到好评。

  • 提供大规模(15T token)ODC-By 许可的英文网页预训练语料,替代 C4、The Pile 等旧数据集用于 LLM 预训练
  • 模型在 FineWeb 上训练后在基准测试中优于 RefinedWeb、C4、Dolma-v1.6、The Pile、SlimPajama
  • 数据处理脚本完整公开,可复现可审查
  • 全量数据约 25,000 个 parquet 文件,社区实测处理全量预估约需 13 天,实际使用门槛较高

截至 2026-07-22

codeparrot / github-code

来自GitHub的代码文件,覆盖32种编程语言

669.9 GB

  • 文本
  • 文本生成
  • other · 许可待核

下载 5.7M · 收藏 406 · 3年前更新

项目资料与外部反馈

该数据集存在已知的重复问题且已有官方清理版本,仓库声明许可证与实际内容权利可能不一致,不建议直接用于新项目而不做额外去重与合规审查。

  • 支持按语言和许可证过滤的流式访问,适合大规模代码语料加载
  • 重复文件严重影响模型性能,官方博客明确指出 duplicates 问题
  • 非去重版本的 HumanEval 基准测试存在泄漏(291–338 条),去重后降至 0
  • 仓库声明的许可证与实际内容权利可能不一致,论文标题直接指出'Do Not Trust Licenses You See'
  • 存在官方清理版本 codeparrot/github-code-clean,移除了 3.39M 文件(占 2.94%)
  • Lance 格式的第三方子集需要写权限,无法在 Kaggle Kernels 上直接使用

截至 2026-07-22

已被取代 codeparrot/github-code-clean · 同一团队发布的清理版本,移除了 3.39M 低质量文件,已有多个模型基于此版本训练

Anthropic / hh-rlhf

人类偏好数据,用于训练帮助性和无害性奖励模型

16.9万行 · 4.1 GB

  • 文本
  • mit · 许可标注允许商用

下载 32k · 收藏 1.8k · 3年前更新

独立证据与社区反馈

作为 RLHF 早期开源基准被广泛引用,但社区实际使用中发现标注质量参差不齐,部分样本的偏好标签存在明显错误。

  • 提供大规模人类偏好数据用于安全对齐(safety-focused alignment)训练
  • 数据格式简单(每行一对 chosen/rejected 文本),可直接用于偏好模型训练
  • 提供 train/test 划分,方便复现评估
  • 标注存在噪声:部分样本中 rejected 回复质量实际优于 chosen 回复,可能是人工标注失误所致

截至 2026-06-20

Open-Orca / OpenOrca

增强的FLAN指令数据集,用于对齐训练

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 许可标注允许商用

下载 17k · 收藏 1.6k · 1年前更新

独立证据与社区反馈

OpenOrca 是微软 Orca 论文思路的开源复现,用 GPT-4 生成指令数据训练小模型,社区反馈模型能力有提升但会「以为自己是 ChatGPT」。

  • 提供了一套可公开获取的 GPT-4 质量指令微调数据,降低复现 Orca 方法的门槛
  • 使较小参数量的开源模型在推理任务上获得可感知的提升
  • 作为基座数据与其他模型(如 Platypus2、OpenChat)合并后能产生优于各自单独使用的效果
  • 用该数据集训练的模型可能产生身份混淆,自称 ChatGPT 或表现出「妄想」行为

截至 2026-06-20

OpenAssistant / oasst1

多语言人类助手对话数据集,包含质量评分

8.9万行 · 398 MB

  • 文本
  • apache-2.0 · 许可标注允许商用
  • 含中文

下载 18k · 收藏 1.6k · 3年前更新

项目资料与外部反馈

社区众包收集的大规模对话数据集,带有人工质量/毒性/创意等多维标注,但项目已于2023年10月终止,被oasst2取代。

  • 提供了带人工多维标注(质量、毒性、幽默、创意等)的大规模开源对话数据
  • 可在自有硬件上运行基于该数据集训练的模型
  • 2023年4月发布的版本过滤了'不安全'内容,非原始完整采集数据
  • 基于LLaMA的模型存在许可证问题,需通过XOR方式分发
  • 项目已于2023年10月终止,被oasst2取代
  • LLaMA模型权重文件曾出现全为零的情况

截至 2026-06-20

已被取代 oasst2 · oasst1 为 2023 年 4 月的中期快照,oasst2 为数据收集结束后的最终版本

fka / prompts.chat

AI提示词(prompts)的社交平台镜像数据集

2,049 行 · 29 MB

  • 文本
  • 问答
  • 文本生成
  • cc0-1.0 · 许可标注允许商用

下载 32k · 收藏 9.8k · 2天前更新

项目资料与外部反馈

由 awesome-chatgpt-prompts 演进而来的开源提示词集合,社区视其为从静态列表升级为可自托管工具的延续

  • 提供免费、开源、可自托管的提示词收集与分享工具
  • 以 Hugging Face 数据集形式提供,便于程序化访问与集成
  • 从原有 awesome-chatgpt-prompts 仓库升级为端到端工具
  • 提示词内容存在持续增删维护,部分旧提示词被移除或改写,稳定性一般

截至 2026-06-20

2026-07-20

openai / gsm8k

小学数学应用题,需多步算术推理。

1.8万行 · 12 MB

  • 文本
  • 文本生成
  • mit · 许可标注允许商用

下载 926k · 收藏 1.4k · 4个月前更新

项目资料与外部反馈

GSM8K 测试集已被多篇论文证实存在数据污染与模型过度拟合,GSM1k 已作为其无污染替代版本发布,继续使用 GSM8K 作为评测基准存在高估模型能力的风险。

  • GSM8K 的测试数据已被部分 LLM 的训练过程污染,EMNLP 2024 论文指出 LLM 训练中常存在不同程度的测试集泄漏,GSM8K 是受影响的数学推理基准之一。
  • 多个模型家族在 GSM8k 上表现出系统性过度拟合,相比无污染的 GSM1k 副本得分更高,表明 GSM8k 的基准评测结果已被高估,不能准确反映模型推理能力。
  • GSM1k 已作为 GSM8k 的无污染复制版本被创建,专门用于揭示模型在 GSM8k 上的过度拟合问题,可直接替代 GSM8k 进行更可靠的数学推理评测。

截至 2026-07-22

2026-07-18
2026-07-17

nvidia / Open-SWE-Traces

软件工程智能体指令微调的agent轨迹数据集

20.7万行 · 165.5 GB

  • 文本
  • cc-by-4.0 · 许可标注允许商用

下载 8.0k · 收藏 53 · 5天前更新

2026-07-16
2026-07-15
2026-07-14

Glint-Research / Fable-5-traces

Fable 5 编程智能体轨迹数据,用于策略学习与推理动作蒸馏

4,665 行 · 84 MB

  • 文本
  • 文本生成
  • agpl-3.0 · 许可标注允许商用

下载 74k · 收藏 604 · 23天前更新

独立证据与社区反馈

唯一公开捕获了 Fable-5 绕过反蒸馏分类器的思维链痕迹的数据集,但仅覆盖约 4 天窗口期的 4659 条编码轨迹,规模有限。

  • 提供了唯一一份绕过 Fable-5 API 端反蒸馏分类器的明文思维链编码轨迹
  • 支撑了从 Fable-5 向 Qwen3.6 的知识蒸馏(Qwable-v1),单卡 H200 约 14 小时完成
  • 捕获了 SWE-bench Pro 80.3% 水平模型的 agentic coding 行为样本
  • 源模型因美国出口管制指令被全球暂停,数据集衍生物可能面临监管与合规风险
  • 反蒸馏分类器在 API 端实时删减思维块,数据集仅包含漏网之鱼,存在选择性偏差
  • 仅 4659 条轨迹,覆盖窗口约 4 天,规模与多样性有限,且源模型定价 $50/M output tokens,用户群体可能存在偏差

截至 2026-06-20

armand0e / claude-fable-5-claude-code

Claude Fable 5 智能体原始轨迹,与 Fable-5-traces 内容相同

63 行 · 103 MB

  • 文本
  • 文本生成

下载 18k · 收藏 305 · 1个月前更新

独立证据与社区反馈

社区普遍认为 Fable 5 在编程任务上仅处于中游水平,并非 Anthropic 所宣传的颠覆性突破。

  • 在部分网络安全任务上相比前代模型有所提升
  • 生成速度慢
  • 会生成不安全的代码
  • 安全护栏容易被绕过
  • 存在基准测试刷分嫌疑(被社区称为 shameless cheater)

截至 2026-06-20

openbmb / UltraX-Preview

UltraX 函数调用精炼框架的预览数据集,用于预训练数据自适应编辑

486.9 GB

  • 文本
  • 文本生成
  • apache-2.0 · 许可标注允许商用

下载 651 · 收藏 22 · 10天前更新

scholarweave / arxiv-latex

arXiv 论文 LaTeX 源文件全量语料,预处理格式化为 Parquet

305.9万行 · 485.5 GB

  • 文本
  • 文本生成
  • 特征提取
  • other · 许可待核

下载 33k · 收藏 72 · 9天前更新

2026-07-13
2026-07-12
2026-07-11

netflix / Vera-Layered-Video-Dataset

用于分层扩散视频编辑的内容保持视频数据集

9.0万行 · 220.6 GB

  • 视频
  • 文生视频
  • apache-2.0 · 许可标注允许商用

下载 12k · 收藏 20 · 23天前更新

项目方资料核对

训练集合成数据占比极高(约 87.7%),且测试集与训练集同源,存在明显的测试集泄漏风险,采用前需谨慎评估合成数据对真实场景的泛化能力。

  • 用于视频编辑模型(如背景替换、物体添加)的合成数据训练与评估
  • 训练集约 87.7% 为合成数据(synthetic-bg-change 及 synthetic-obj-add 共 9,842 条),真实数据仅约 12.3%(共 1,384 条),以合成数据为主的训练集可能导致模型在真实视频上泛化不足
  • 测试集明确标注来自训练集同源数据('The test set is sourced from the training sources above'),无法独立评估模型在未见数据上的表现,存在测试集泄漏风险

截至 2026-07-22

Qwen / AgentWorldBench

基于真实环境轨迹的语言世界模型评估基准

2,170 行 · 402 MB

  • 文本
  • 文本生成
  • apache-2.0 · 许可标注允许商用

下载 2.2k · 收藏 76 · 18天前更新

2026-07-10

IlyaGusev / habr

俄罗斯IT博客habr.com的帖子与评论数据

30.2万行 · 10.8 GB

  • 文本
  • 文本生成

下载 528 · 收藏 72 · 3个月前更新

ProCreations / grug-think

使用grug简短思考风格的Agent对话数据

10.1万行 · 4.4 GB

  • 文本
  • 文本生成
  • apache-2.0 · 许可标注允许商用

下载 301 · 收藏 15 · 13天前更新

项目方资料核对

该数据集由合成数据构成且已有 v2 版本,建议直接采用 v2 版本

  • 数据集样本来自 glaive 生成的合成工具调用数据,合成数据占比高,存在标注噪声和质量风险
  • ProCreations/grug-think-v2-10k 已发布,原版本可能已不再维护或已被取代

截至 2026-07-22

已被取代 grug-think-v2-10k · 同名 v2 版本已发布,原数据集应被取代

ASLP-lab / WSC-Train

大规模四川话语料,带丰富标注的语音数据集

3.3 GB

  • apache-2.0 · 许可标注允许商用

下载 432 · 收藏 142 · 15天前更新

2026-07-09

Syn4D / Syn4D

合成4D多视角视频、深度与物体跟踪数据集

1.7 TB

  • cc-by-4.0 · 许可标注允许商用

下载 14k · 收藏 11 · 14天前更新

查看全部数据集 归档 →