数据集 / allenai / olmOCR-bench

allenai / olmOCR-bench

包含1403个PDF文件和7010个测试用例,评估OCR系统转换PDF为markdown的能力。

作者
allenai
规模
439 MB
模态
文本
授权
odc-by · 许可标注允许商用
语种
en
下载
5,929
收藏
243

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

项目资料与外部反馈

该基准面向英文数字印刷文档,数据集许可附带研究与教育用途限制;单位测试同时用于训练监督与评分,存在过拟合与分数膨胀风险;社区指其对比方法有缺陷。

  • 评估英文数字印刷文档的OCR质量
  • 数据集许可为ODC-BY-1.0,附带AI2负责任使用指南,限定研究与教育用途
  • 社区反馈指该基准的对比方法存在缺陷,对marker产品的评估结果不可靠
  • 官方论文明确指出单位测试既用于训练监督又用于评分,模型可能针对测试过度优化
  • 官方确认使用合成文档管线生成训练数据,合成数据占比不透明
  • 官方明确限定为英文数字印刷文档,不含手写、非英语或多语种场景

截至 2026-07-22

观测时间线