allenai / olmOCR-bench
包含1403个PDF文件和7010个测试用例,评估OCR系统转换PDF为markdown的能力。
仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。
项目资料与外部反馈
该基准面向英文数字印刷文档,数据集许可附带研究与教育用途限制;单位测试同时用于训练监督与评分,存在过拟合与分数膨胀风险;社区指其对比方法有缺陷。
- 评估英文数字印刷文档的OCR质量
- 数据集许可为ODC-BY-1.0,附带AI2负责任使用指南,限定研究与教育用途
- 社区反馈指该基准的对比方法存在缺陷,对marker产品的评估结果不可靠
- 官方论文明确指出单位测试既用于训练监督又用于评分,模型可能针对测试过度优化
- 官方确认使用合成文档管线生成训练数据,合成数据占比不透明
- 官方明确限定为英文数字印刷文档,不含手写、非英语或多语种场景
来源
allenai/olmOCR-bench · Datasets at Hugging FaceI'm a fan of the team of Allen AI and their work. Unfortunately, ...olmOCR 2: Unit test rewards for document OCR | Ai2GitHub - allenai/olmocr: Toolkit for linearizing PDFs for LLM datasets/training · GitHub
截至 2026-07-22