PixelRAG
把网页渲染成截图再检索,跳过 HTML 解析直接让视觉模型读页面
UC Berkeley SkyLab 联合 Princeton、EPFL、Databricks 出品的视觉 RAG 系统。不走「HTML 解析→文本分块→向量检索」的传统管线,而是用 Playwright 把网页和 PDF 渲染成截图分块,经 LoRA 微调的 Qwen3-VL-Embedding-2B 编码为向量存入 FAISS 索引,检索时直接返回截图块给视觉语言模型阅读。附带 Claude Code 插件 pixelbrowse,让 Claude 截图页面后以视觉方式理解图表、表格和排版。托管版索引了 8.28M 篇 Wikipedia 文章,提供免费搜索 API,支持文本、图片及混合查询。论文自测在 SimpleQA 上达 78.8% 准确率(文本 RAG 基线 71.6%),agent 场景下 token 消耗约为文本检索的十分之一。
社区实测
PixelRAG 在多项基准测试中准确率优于文本型 RAG,适合视觉信息敏感的场景
- 视觉信息敏感场景下准确率优于纯文本 RAG 方案
- 降低 AI agent 的 token 消耗
来源
PixelRAG beats text parsers on accuracy and cuts AI agent token costs 10x | VentureBeatPixelRAG Reviews - 2026
截至 2026-08-09
pip install pixelrag pip install 'pixelrag[all]' uv tool install pixelrag && claude plugin marketplace add StarTrail-org/PixelRAG && claude plugin install pixelbrowse@pixelrag-plugins