为AI Agent装上记忆系统:Hermes与MemOS的深度融合体验
当大模型的能力边界不断被突破,一个被忽视的问题正在浮出水面:你与AI Agent共同工作的成果,真的被沉淀下来了吗?每次开启新会话,那些反复确认的项目规范、踩过的坑、验证过的方法,是否需要重新来过一遍?记忆——这个看似基础的能力,正在成为衡量Agent成熟度的关键指标。
为什么Agent需要记忆系统
近期,一款名为MemOS的开源记忆托管平台引起了开发者的关注。它将自己定位为"记忆操作系统",旨在为AI应用和Agent提供长期记忆能力。更值得关注的是,MemOS同时开源了OmniMemEval评测框架,试图为混乱的Agent Memory评测建立统一标准。在这场记忆系统的评测中,MemOS展现了令人印象深刻的表现。
OmniMemEval:记忆系统的标准化评测
当前的AI Agent市场呈现出百花齐放的态势,各家产品都配备了不同程度的记忆能力,但设计理念差异显著。以主流产品为例:Claude Code采用Markdown文件存储项目经验,由用户和Claude共同维护;ChatGPT通过平台内部记忆状态实现跨会话的个性化;OpenClaw建立了可审计的知识库体系,支持Agent主动生成梦境记忆;Hermes则采用Agent自主管理模式,但其原生记忆容量存在明显瓶颈——MEMORY.md仅2200字符,USER.md仅1375字符。对于需要深度协作的专业用户而言,这种容量限制严重制约了记忆系统的实用价值。
真正的记忆系统,不是把信息存起来,而是让经验持续生长为能力。
“技术观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
Agent Memory:让编程助手越用越聪明
MemOS团队开源的OmniMemEval评测框架做了一件关键的事:将14款主流Memory产品拉到同一条赛道上进行统一评测,统一benchmark、统一模型配置、统一prompt、统一评判标准。在User Memory(面向个人用户的长期记忆能力)评测中,MemOS云服务在LoCoMo和LongMemEval两个数据集上分别达到92.34和93.40的分数,刷新行业SOTA。更值得关注的是其上下文token效率——MemOS并非通过"塞更多上下文"来提升分数,而是通过优化的记忆检索和路由机制,用更少的token实现更好的效果。这意味着更低的API调用成本、更快的响应速度,以及更少的模型幻觉风险。
从记忆存储到能力进化
在Agent Memory评测中,MemOS Local Plugin的表现更为亮眼。测试覆盖了AgentBench的五大核心任务域:信息检索(BrowseComp-Plus)、数学推理(OmniMath)、软件工程(SWE-Bench)、代码实现(LiveCodeBench)和知识工作(GDPVal)。集成MemOS后,OpenClaw在五项测试中拿下四项第一;而在Hermes平台上,SWE-Bench(软件工程基准)的任务完成率从37.18%飙升至52.56%,提升幅度超过15个百分点。这种结构性能力增强是单纯优化prompt无法实现的——它来自于长期记忆系统对项目经验、编码规范、调试模式的系统性沉淀。
如有侵权,请联系删除。
