菜单
小墨

小墨

PixelRAG:用像素级视觉检索重新定义RAG的未来

检索增强生成(RAG)技术近年来在企业知识库和 AI 应用中得到了广泛采用,然而传统 RAG 系统存在一个根本性的局限:为了进行文本检索,系统必须将网页或文档解析为纯文本格式。这一解析过程往往伴随着严重的视觉信息丢失——表格结构、图表布局、信息图表的层次关系、版式设计所传递的语义信息,都在这一步化为乌有。对于需要理解结构化内容的场景而言,这种信息损耗直接制约了检索质量和应用效果。

概述

伯克利 SkyLab 团队开源的 PixelRAG 彻底颠覆了这一范式。与其费力解析视觉内容再进行文本检索,不如让 AI 直接「看」页面——将任意网页渲染为高分辨率截图,在像素级别进行向量检索。这一创新思路使得文档的视觉结构得以完整保留,表格、图表、排版信息不再丢失。上线不到一个月,该项目已在 GitHub 斩获 3000+ Star,并完成了近 800 万篇文章的预索引,标志着视觉检索时代的正式开启。

核心技术架构

PixelRAG 的技术架构围绕四个核心模块展开。第一个模块是像素级截图渲染引擎 pixelshot,它使用 Chrome DevTools Protocol 原生 WebSocket 控制浏览器,无需依赖 Playwright 即可完成页面捕获。系统将长页面按 8192px 高度切片为多个 JPEG 瓦片,每个瓦片再切分为 1024px 的块供后续处理。该模块还提供了 Turbo 加速路径,通过定制版 Chrome、共享内存与并行 JPEG 压缩实现吞吐量翻倍。

检索的未来,是看而不是读。

“技术社区”
积墨 AI 核心产品

积墨企业专属知识库

混合检索 + 重排序技术,支持多源文档一键向量化导入,为企业打造专属高精度知识大脑。

视觉语义嵌入与向量检索

第二个核心模块是基于 LoRA 微调的 Qwen3-VL-Embedding-2B 视觉嵌入模型。项目团队在 SimpleQA 测试集上进行了针对性优化,将 QA Score 从基础模型的 0.715-0.730 提升至 0.785,显著增强了模型理解视觉内容的能力。嵌入流水线采用 Last-token pooling + L2 归一化生成最终向量,支持 vLLM 和 SGLang 两种推理后端。第三个模块是基于 FAISS IVF 索引的向量搜索引擎,目前预索引了 828 万 Wikipedia 文章,约 2810 万个截图块,单次搜索延迟仅约 42ms。

生态整合与开源资源

除了核心检索能力,PixelRAG 还提供了丰富的生态整合。pixelshot 作为 Claude Code 插件发布,让 AI Agent 能够直接「看」网页并理解图表、表格等视觉内容。开发者可以通过 pip 一键安装完整依赖,并利用预索引数据通过简单的 curl 命令进行搜索。所有训练数据、LoRA 适配器及完整源码均以 Apache-2.0 许可证开源,项目团队还附上了详细的学术论文和训练曲线复现文档,便于研究者深入理解技术细节。

如有侵权,请联系删除。

#RAG#多模态#向量检索#开源#大模型
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信