jasperai / monet
经过多阶段过滤和重标注的图文对数据集
仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。
项目资料与外部反馈
数据集声明的许可存在内部矛盾(CC BY 4.0 与 Apache 2.0 并存),且源素材自带独立许可,商用前需做权利审查;标注全部为 VLM 合成文本而非人工撰写。
- 官方不同出处对许可说法不一致:资源页标注 CC BY 4.0,论文标注 Apache 2.0。
- 数据行中显示源素材来自 cc12m 且带有 google-permissive 许可,与数据集层面宣称的许可不完全一致,存在下游权利冲突风险。
- 所有 caption 均由视觉语言模型(VLM)重写生成,属于合成标注,并未经过人工校对或清洗。
- 数据集包含由合成方式生成的额外样本,并非全部来自真实采集的图像。
来源
MONET datasetjasperai/monet · Datasets at Hugging FaceA Massive, Open, Non-redundant and Enriched Text-to-image dataset
截至 2026-07-22