多模态Agent记忆:为什么不能简单等同于升级版RAG?

2026年7月8日

83

443

多模态Agent记忆:为什么不能简单等同于升级版RAG?

在构建多模态Agent系统时,许多开发者倾向于将记忆模块理解为“升级版的多模态RAG”:上传图片、图表或PDF后,抽取内容进行embedding,存入向量库;用户提问时用query检索,将命中的相关内容塞入上下文交给大模型。这种做法在系统初期看似可行,但随着记忆积累到数十个会话、数千份文件后,问题便会接踵而至。

长期记忆与单次理解:两种截然不同的场景

核心问题在于:系统往往“不加选择地将所有原始模态信息灌给大模型”。这导致两种典型失败场景——一方面,“召回过多证据”使得关键图片被大量语义相近但无关的内容淹没;另一方面,许多只需读取文字摘要就能回答的问题,系统仍然强行渲染原始图片或PDF页面,白白消耗大量token。

M3 Proctor:显式决策与成本感知级联

M3 Exam论文区分了“单次视觉理解”与“长期多模态记忆”两个场景。单次理解关注的是“这张图片里有什么”、“图表最高值是多少”,而长期记忆则需要回答“我之前上传的报告里,哪一页能解释这张图”、“这张照片与上次提到的训练材料有什么关系”。在单次场景中保留原始视觉信息是必要的,但在长期记忆中继续沿用同样策略,就会导致决定性证据被无关视觉内容淹没,查询的token预算也被显著抬高。

先用足够便宜的表示,只有不够时才为更贵的表示付费。

“M3 Proctor”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

文本代理与模态标签的妙用

M3 Proctor的核心思路是将“是否需要查看原图”变成一个显式决策。索引阶段为原始内容生成“文本代理”(textual surrogate):图片配caption,图表表格生成包含坐标轴、数据系列和具体数值的转写,文档页保留文本层并添加摘要。同时,每个chunk挂载模态标签(图片/文档/图表),便于后续过滤。检索阶段采用三步级联策略:首先用模态偏置检测判断题目依赖何种模态;然后用模态感知重排校正候选排序;最后才决定是否需要升级到原始视觉源。系统遵循“先用足够便宜的表示,只有不够时才为更贵的表示付费”的原则——只有置信度不足或明确需要原始视觉信息时,才会触发第二阶段。

底层存储:支撑按需读取的四大能力

支撑这种按需读取模式,底层向量数据库需要具备相应能力。其一,同一条记忆需能挂载多种表示——文本代理、视觉embedding、图表转写等围绕同一entity管理,而非分散拼接,Milvus 3.0的EmbList正好承接这一需求。其二,检索时能利用metadata过滤——模态标签、session_id、file_type等字段应在候选进入上下文前就完成筛选。其三,系统需支持异步补齐——caption可立即生成,OCR稍后完成,视觉embedding更晚就绪,Milvus 3.0的可空向量字段允许记忆条目先以部分表示参与检索,逐步补齐其他表示。其四,读取必须是列级或字段级的——Stage 1只需文本代理就不应读取原始视觉内容,Milvus 3.0的Storage V3正是以列存格式实现按需读取。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI