菜单
小墨

小墨

Agent超强记忆评测新标杆:AML榜单如何重塑行业标准

近年来,随着大语言模型技术的快速发展,AI Agent的记忆能力成为行业关注的焦点。然而,长期以来,业界对于Agent记忆系统的评测缺乏统一标准——不同研究团队自选模型、自选数据集、自选评判标准,导致评测结果往往难以横向比较。一些产品虽然宣称“突破基线、刷新SOTA”,但仔细深究便会发现,其优异表现可能源于下游推理能力的增强,而非记忆系统本身的进步。这种评测乱象不仅困扰着技术社区,也让资本方在尽调和投资决策时缺乏可信的参考依据。

AML的评测创新:构建公正透明的评价体系

为解决这一困境,一个由全球近30所高校及机构联合发起的首个Agent记忆系统统一评测榜单——Agent Memory Leaderboard(AML)应运而生。该榜单于2026年8月12日正式发布首期评测结果,涵盖开源榜与工业榜两大类别。据统计,榜单页面上线不到两周便吸引了超过20万次访问,全球136个团队提交注册,最终67个代表性记忆框架完成完整盲测与复核,并在Hugging Face Trends总榜上冲入前十,引发了国内外AI社区的广泛讨论。

从总分到能力图谱:更精细化的评估维度

AML的核心创新在于其严格的评测机制设计。与传统评测不同,AML强制统一Answer(答案生成)与Eval(评估)模型,将参评系统的权限严格锁定在Add(写入)与Search(检索)两个维度。这意味着所有参评系统在获取信息后,必须使用同一套模型和评分标准完成评估,从而在明确的边界内实现真正的可比性与公信力。此外,AML的成绩与Git Commit和镜像版本绑定,确保结果公开透明、可追溯。这一机制有效防止了参评方通过使用更强大的推理模型或更精巧的Prompt模板来“作弊”,真正检验的是记忆系统本身的能力。

AML回答的,不仅仅是成绩排名先后的结果,更是“不同记忆系统在哪些任务上更具有竞争力,而这个结论又凭什么成立”。

“技术观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

首期榜单:MemoraX断层领跑,行业格局初现

传统榜单的另一大痛点在于往往用单一总分定输赢。然而在实际应用中,不同的记忆系统各有所长,单一分数往往掩盖了真实的能力差异。AML创新性地推出文本7维能力图谱与代码2维赛道,让各记忆系统的优势与短板一目了然。这种设计回答的不仅是“谁更强”的问题,更是“不同系统在哪些任务上更具竞争力,而这个结论凭什么成立”的深层问题。

技术解析:MemoraX的制胜之道

在工业榜中,MemoraX以58.02分的综合得分强势登顶,更令人瞩目的是,它包揽了全部7个考试科目的第一名,展现出全面领先的技术实力。紧随其后的是MemOS,稳居第二。值得注意的是,Tencent DB Memory、Mem0、Supermemory等热度较高的框架也均有上榜,但各在不同子类上展现特色。开源榜方面,竞争更为胶着——InvMem以45.06分拔得头筹,Refind和ActiveMemoryIndex紧随其后,三者分别代表了混合检索、迭代式搜索和双重记忆表示三种不同技术路线的竞争优势。

如有侵权,请联系删除。

#AI Agent#评测榜单#记忆系统#大模型#技术标准
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信