PixelRAG:用像素级视觉检索重新定义RAG的未来

2026年6月29日

51

205

PixelRAG:用像素级视觉检索重新定义RAG的未来

检索增强生成(RAG)技术近年来在企业知识库和 AI 应用中得到了广泛采用,然而传统 RAG 系统存在一个根本性的局限:为了进行文本检索,系统必须将网页或文档解析为纯文本格式。这一解析过程往往伴随着严重的视觉信息丢失——表格结构、图表布局、信息图表的层次关系、版式设计所传递的语义信息,都在这一步化为乌有。对于需要理解结构化内容的场景而言,这种信息损耗直接制约了检索质量和应用效果。

概述

伯克利 SkyLab 团队开源的 PixelRAG 彻底颠覆了这一范式。与其费力解析视觉内容再进行文本检索,不如让 AI 直接「看」页面——将任意网页渲染为高分辨率截图,在像素级别进行向量检索。这一创新思路使得文档的视觉结构得以完整保留,表格、图表、排版信息不再丢失。上线不到一个月,该项目已在 GitHub 斩获 3000+ Star,并完成了近 800 万篇文章的预索引,标志着视觉检索时代的正式开启。

核心技术架构

PixelRAG 的技术架构围绕四个核心模块展开。第一个模块是像素级截图渲染引擎 pixelshot,它使用 Chrome DevTools Protocol 原生 WebSocket 控制浏览器,无需依赖 Playwright 即可完成页面捕获。系统将长页面按 8192px 高度切片为多个 JPEG 瓦片,每个瓦片再切分为 1024px 的块供后续处理。该模块还提供了 Turbo 加速路径,通过定制版 Chrome、共享内存与并行 JPEG 压缩实现吞吐量翻倍。

检索的未来,是看而不是读。

“技术社区”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

视觉语义嵌入与向量检索

第二个核心模块是基于 LoRA 微调的 Qwen3-VL-Embedding-2B 视觉嵌入模型。项目团队在 SimpleQA 测试集上进行了针对性优化,将 QA Score 从基础模型的 0.715-0.730 提升至 0.785,显著增强了模型理解视觉内容的能力。嵌入流水线采用 Last-token pooling + L2 归一化生成最终向量,支持 vLLM 和 SGLang 两种推理后端。第三个模块是基于 FAISS IVF 索引的向量搜索引擎,目前预索引了 828 万 Wikipedia 文章,约 2810 万个截图块,单次搜索延迟仅约 42ms。

生态整合与开源资源

除了核心检索能力,PixelRAG 还提供了丰富的生态整合。pixelshot 作为 Claude Code 插件发布,让 AI Agent 能够直接「看」网页并理解图表、表格等视觉内容。开发者可以通过 pip 一键安装完整依赖,并利用预索引数据通过简单的 curl 命令进行搜索。所有训练数据、LoRA 适配器及完整源码均以 Apache-2.0 许可证开源,项目团队还附上了详细的学术论文和训练曲线复现文档,便于研究者深入理解技术细节。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI