By 小墨
2026年6月29日
51
205
PixelRAG:用像素级视觉检索重新定义RAG的未来
检索增强生成(RAG)技术近年来在企业知识库和 AI 应用中得到了广泛采用,然而传统 RAG 系统存在一个根本性的局限:为了进行文本检索,系统必须将网页或文档解析为纯文本格式。这一解析过程往往伴随着严重的视觉信息丢失——表格结构、图表布局、信息图表的层次关系、版式设计所传递的语义信息,都在这一步化为乌有。对于需要理解结构化内容的场景而言,这种信息损耗直接制约了检索质量和应用效果。
概述
伯克利 SkyLab 团队开源的 PixelRAG 彻底颠覆了这一范式。与其费力解析视觉内容再进行文本检索,不如让 AI 直接「看」页面——将任意网页渲染为高分辨率截图,在像素级别进行向量检索。这一创新思路使得文档的视觉结构得以完整保留,表格、图表、排版信息不再丢失。上线不到一个月,该项目已在 GitHub 斩获 3000+ Star,并完成了近 800 万篇文章的预索引,标志着视觉检索时代的正式开启。
核心技术架构
PixelRAG 的技术架构围绕四个核心模块展开。第一个模块是像素级截图渲染引擎 pixelshot,它使用 Chrome DevTools Protocol 原生 WebSocket 控制浏览器,无需依赖 Playwright 即可完成页面捕获。系统将长页面按 8192px 高度切片为多个 JPEG 瓦片,每个瓦片再切分为 1024px 的块供后续处理。该模块还提供了 Turbo 加速路径,通过定制版 Chrome、共享内存与并行 JPEG 压缩实现吞吐量翻倍。
检索的未来,是看而不是读。
“技术社区”视觉语义嵌入与向量检索
第二个核心模块是基于 LoRA 微调的 Qwen3-VL-Embedding-2B 视觉嵌入模型。项目团队在 SimpleQA 测试集上进行了针对性优化,将 QA Score 从基础模型的 0.715-0.730 提升至 0.785,显著增强了模型理解视觉内容的能力。嵌入流水线采用 Last-token pooling + L2 归一化生成最终向量,支持 vLLM 和 SGLang 两种推理后端。第三个模块是基于 FAISS IVF 索引的向量搜索引擎,目前预索引了 828 万 Wikipedia 文章,约 2810 万个截图块,单次搜索延迟仅约 42ms。
生态整合与开源资源
除了核心检索能力,PixelRAG 还提供了丰富的生态整合。pixelshot 作为 Claude Code 插件发布,让 AI Agent 能够直接「看」网页并理解图表、表格等视觉内容。开发者可以通过 pip 一键安装完整依赖,并利用预索引数据通过简单的 curl 命令进行搜索。所有训练数据、LoRA 适配器及完整源码均以 Apache-2.0 许可证开源,项目团队还附上了详细的学术论文和训练曲线复现文档,便于研究者深入理解技术细节。
如有侵权,请联系删除。
Related Articles
-
Fri Jul 24 2026原生工具调用、多模态Agent与开源模型:Foundation Model 2.0论坛直面Agent时代的模型演进
Foundation Model 2.0论坛聚焦在Agent时代模型的演进,讨论如何通过原生工具调用与多模态融合提升Agent的执行能力与适应性,并探讨端侧小模型的可行路径。
-
Mon Jul 06 2026示例域名与文档用途说明
example.com 是一个专门为文档示例而保留的顶级域名,供教程、示范和测试文档使用,不需要额外许可即可引用。
-
Mon Jul 06 2026未知文章标题
未提供文章内容或可抓取的 URL,因此无法提取实际引言或第一段。此处为占位文本,提示用户补充源内容以生成完整的 Frontmatter。
-
Sun Jul 05 2026未知来源文章
未提供可爬取的文章 URL 或内容,系统无法获取实际正文。此处为占位引言,说明输入数据缺失并提供元数据占位以便后续替换。
-
Sun Jul 05 2026无法生成:缺少文章源数据
未提供可用于爬取的文章 URL 或 JSON 数据,因此无法依据页面内容生成完整的 Frontmatter。请提供包含文章信息的 JSON 数组或一组有效 URL。
-
Sun Jul 05 2026未提供的文章标题
未提供文章内容。请提交文章的 URL 或粘贴全文,以便根据内容生成前言与分段信息。
-
Sat Jul 04 2026未提供文章链接或内容
未提供文章内容或链接,无法提取引言或第一段。请提交包含文章 URL 的 JSON 数组或直接提供文章文本。
-
Sat Jul 04 2026未提供文章信息
未收到文章内容或可爬取的 URL,因此无法生成文章段落。请提交包含文章 URL 的 JSON 数组,格式示例:[ {"url": "https://example.com/article1"}, {"
-
Sat Jul 04 2026未提供文章来源
未收到可用的文章内容或链接,因此无法提取段落。请提交包含多篇文章信息的 JSON 数组或每篇文章的 URL,以便爬取并生成完整的 postDetails 内容。
-
Fri Jul 03 2026示例文章标题(缺少来源)
未收到具体文章 URL 或内容,因此无法从原文中提取引言。此处为占位引言,说明系统需要源页面以抓取实际内容并生成结构化的 Astro Markdown YAML Frontmatter。
-
Thu Jul 02 2026聚焦自进化、Harness等Agent最火的九个方向,年度AI智能体大会7月开幕
中国AI智能体大会(AgenticAICon 2026)将于7月在杭州举办,围绕智能体领域的前沿技术展开,旨在推动研究与产业深度融合,探寻智能体从对话式工具向主动执行系统转型的路线图。
-
Wed Jul 01 2026探索 Astro.js 与 YAML:构建可维护的内容管理工作流
在现代静态站点与内容驱动的项目中,统一且可验证的元数据格式对内容维护和自动化发布至关重要。Astro.js 提供了灵活的内容渲染能力,而采用严格的 YAML Frontmatter 模板,可以让团队共
-
Tue Jun 30 2026首届光谷智能体经济大会举行 光谷从“AI试验场”迈向“AI价值场”
2026年6月29日,武汉东湖新技术开发区举办首届光谷智能体经济大会,正式发布“光谷智能体引力计划”。大会提出未来三年将在政策、算力、基金等方面投入超10亿元,旨在打造以智能体为核心的创新生态,培养智
-
Tue Jun 30 2026中国广电联合会《全国交通传媒行业AI应用调研报告》正式发布
中国广电联合会交通宣传委员会在内蒙古发布了《2026全国交通传媒行业AI应用调研报告》,基于对145家交通传媒机构的调查,总结了行业在AI应用上的现状与发展路径。
-
Tue Jun 30 2026韩国万亿'芯'基建拆解:存储行业能否建成AI时代'油田'
韩国近期公布了总投资逾1800万亿韩元的三大超级AI基建项目,涵盖半导体制造、先进封装与AI数据中心,目标是借助国家级投入与龙头企业布局,打造面向AI时代的关键产业能力。
-
Mon Jun 29 2026能量岛企业家俱乐部6.28 芯谷 AI 沙龙圆满落幕
6月28日,能量岛企业家俱乐部在苏州芯谷产业园举办AI智能体应用沙龙,活动以实战分享和产业交流为核心,吸引了本地创业者、企业高管与科研人员参与。
-
Mon Jun 29 20262026.06.20:AI 泡沫退潮,Agent 与数据架构重构产业底层
InfoQ 的周度深度分析指出,生成式 AI 已走完狂热期,行业正进入理性调整阶段,专家纷纷回归技术和落地路径的讨论。
-
Mon Jun 29 2026OKF——要做AI时代的'知识图谱通用语'—继MCP之后,Google又扔出一张Agent王牌
2026年6月,谷歌云发布了Open Knowledge Format(OKF)v0.1,这是一套以带YAML前置元数据的Markdown文件夹为单位来表示知识的开放规范,旨在解决企业知识分散的问题。
