工具 / PixelRAG

PixelRAG

  • rag
  • vision
  • agent

把网页渲染成截图再检索,跳过 HTML 解析直接让视觉模型读页面

UC Berkeley SkyLab 联合 Princeton、EPFL、Databricks 出品的视觉 RAG 系统。不走「HTML 解析→文本分块→向量检索」的传统管线,而是用 Playwright 把网页和 PDF 渲染成截图分块,经 LoRA 微调的 Qwen3-VL-Embedding-2B 编码为向量存入 FAISS 索引,检索时直接返回截图块给视觉语言模型阅读。附带 Claude Code 插件 pixelbrowse,让 Claude 截图页面后以视觉方式理解图表、表格和排版。托管版索引了 8.28M 篇 Wikipedia 文章,提供免费搜索 API,支持文本、图片及混合查询。论文自测在 SimpleQA 上达 78.8% 准确率(文本 RAG 基线 71.6%),agent 场景下 token 消耗约为文本检索的十分之一。

社区实测

PixelRAG 在多项基准测试中准确率优于文本型 RAG,适合视觉信息敏感的场景

  • 视觉信息敏感场景下准确率优于纯文本 RAG 方案
  • 降低 AI agent 的 token 消耗

截至 2026-08-09

pip install pixelrag

← 返回工具库