模型 / Unlimited-OCR (Baidu)

Unlimited-OCR (Baidu)

3B 视觉语言 OCR 模型,文档解析与 Markdown 转换

作者 sahilchachra

~1.8GB 4-bit许可 可商用任务 视觉理解最近核对 2026-07-12
格式
4-bit
文件
~1.6GB
运行内存
~1.8GB–2.3GB
运行时
llama.cpp
下载
28,228

Hugging Face 源仓库 ↗

适合与不适合

入选理由
百度Unlimited-OCR的GGUF量化版,多语言文档OCR可本地运行,支持Markdown和边界框输出。需编译特定llama.cpp分支。
对位
对位 DeepSeek-OCR 3B / GOT-OCR2.0
适合
文档 OCR 转 Markdown(带布局/框) / 多语言长文档解析
不适合
通用视觉对话或复杂推理

独立证据与社区反馈

3 个独立来源最近验证 2026-07-12

社区对 Unlimited-OCR 持观望期待态度,认为对本地 AI 场景有潜力,但实际落地反馈尚少

  • 开源的 3B MoE 模型,仅 500M 活跃参数,适合本地部署
  • 基于 DeepSeek OCR 构建,替换了 decoder 注意力层
  • 支持一次性长文本解析(one-shot long-horizon parsing)
  • 有做图像 OCR 的开发者表示这正是其常见工作流
  • 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议
  • 对长对话场景的适用性尚不明确
  • HN 讨论量有限,缺乏大规模实际使用反馈

可信度HuggingFace 28k 下载,50 赞,基于 Baidu/Unlimited-OCR 量化

完整规格

规模
3B · 下载 ~1.6GB · 显存最低 ~1.8GB · 推荐 ~2.3GB · 4-bit(估算)
授权
MIT · 可商用
框架
llama.cpp
血统
量化自 Unlimited-OCR
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 67.2k → 71.5k

观测时间线