为AI Agent装上记忆系统:Hermes与MemOS的深度融合体验

2026年8月3日

96

930

为AI Agent装上记忆系统:Hermes与MemOS的深度融合体验

当大模型的能力边界不断被突破,一个被忽视的问题正在浮出水面:你与AI Agent共同工作的成果,真的被沉淀下来了吗?每次开启新会话,那些反复确认的项目规范、踩过的坑、验证过的方法,是否需要重新来过一遍?记忆——这个看似基础的能力,正在成为衡量Agent成熟度的关键指标。

为什么Agent需要记忆系统

近期,一款名为MemOS的开源记忆托管平台引起了开发者的关注。它将自己定位为"记忆操作系统",旨在为AI应用和Agent提供长期记忆能力。更值得关注的是,MemOS同时开源了OmniMemEval评测框架,试图为混乱的Agent Memory评测建立统一标准。在这场记忆系统的评测中,MemOS展现了令人印象深刻的表现。

OmniMemEval:记忆系统的标准化评测

当前的AI Agent市场呈现出百花齐放的态势,各家产品都配备了不同程度的记忆能力,但设计理念差异显著。以主流产品为例:Claude Code采用Markdown文件存储项目经验,由用户和Claude共同维护;ChatGPT通过平台内部记忆状态实现跨会话的个性化;OpenClaw建立了可审计的知识库体系,支持Agent主动生成梦境记忆;Hermes则采用Agent自主管理模式,但其原生记忆容量存在明显瓶颈——MEMORY.md仅2200字符,USER.md仅1375字符。对于需要深度协作的专业用户而言,这种容量限制严重制约了记忆系统的实用价值。

真正的记忆系统,不是把信息存起来,而是让经验持续生长为能力。

“技术观察”
🦞

JimoClaw — 桌面 AI Agent 工作台

让 AI 处理本地资料、操控浏览器,最终交付可直接使用的文档、表格与 PPT,而不只是一段回答。

下载桌面版

Agent Memory:让编程助手越用越聪明

MemOS团队开源的OmniMemEval评测框架做了一件关键的事:将14款主流Memory产品拉到同一条赛道上进行统一评测,统一benchmark、统一模型配置、统一prompt、统一评判标准。在User Memory(面向个人用户的长期记忆能力)评测中,MemOS云服务在LoCoMo和LongMemEval两个数据集上分别达到92.34和93.40的分数,刷新行业SOTA。更值得关注的是其上下文token效率——MemOS并非通过"塞更多上下文"来提升分数,而是通过优化的记忆检索和路由机制,用更少的token实现更好的效果。这意味着更低的API调用成本、更快的响应速度,以及更少的模型幻觉风险。

从记忆存储到能力进化

在Agent Memory评测中,MemOS Local Plugin的表现更为亮眼。测试覆盖了AgentBench的五大核心任务域:信息检索(BrowseComp-Plus)、数学推理(OmniMath)、软件工程(SWE-Bench)、代码实现(LiveCodeBench)和知识工作(GDPVal)。集成MemOS后,OpenClaw在五项测试中拿下四项第一;而在Hermes平台上,SWE-Bench(软件工程基准)的任务完成率从37.18%飙升至52.56%,提升幅度超过15个百分点。这种结构性能力增强是单纯优化prompt无法实现的——它来自于长期记忆系统对项目经验、编码规范、调试模式的系统性沉淀。

🛡️

积墨 AI 安全隐患巡检系统

任务一键下达 · 隐患 AI 识别 · 整改全程留痕 · 报告一键生成。让安全巡检真正看得见、管得住、能闭环。

了解方案

如有侵权,请联系删除。

Related Articles

联系我们 试用咨询
小墨 AI