当前位置: 首页 > news >正文

每日热门skill-炸裂开源!华为诺亚放大招:MindMemOS 让 AI Agent 真正「不忘事」,LoCoMo 跑出 94.03 分碾压同级

一份来自 2026 年 8 月 3 日的「AI Agent 记忆操作系统」深度报告 Skill:MindMemOS | 作者:华为诺亚方舟实验室 | 协议:MIT GitHub:GitHub - mindscale-noah/MindMemOS · GitHub | 官网:https://mindmemos.cn


一句话总结

MindMemOS 是华为诺亚方舟实验室刚开源的「AI Agent 记忆操作系统」。它把记忆从单一 Agent 中剥离,用「实体—属性—时间」三维结构重建长期记忆,并首创「Dreaming 离线整理」+「Feedback 反馈强化」+「Skill 自演进」三大机制,让 AI 在跨会话、跨应用、跨框架的情境下还能记住你是谁、踩过什么坑、擅长做什么事。

在公认难的 LoCoMo 长对话记忆基准上拿下94.03 分 SOTA,PersonaMem 长期个性化70.63%,比同期最强基线还高几个身位。


一、为什么是 MindMemOS?——Agent 用了都说「健忘」的故事

上周三凌晨 12 点,我给 Claude Code 连续提了 8 个任务:

  • 第 1 个:帮我建一个 Python 工程模板,配 pytest、ruff、uv
  • 第 3 个:在模板里加上 SQLAlchemy + Alembic
  • 第 5 个:把 pytest 改成 asyncio 模式
  • 第 7 个:再加一个 FastAPI demo
  • 第 8 个:「上次你帮我建的那个工程模板,能加上 Redis 缓存吗?」

AI 一脸懵:「抱歉,我没有之前的上下文,请告诉我项目结构。」

我直接裂开——上一秒它还在帮我写 alembic,下一秒就失忆了。

这不是我一个人遇到的问题。在 quantum bit(量子位)最近的开发者调研里,78.4% 的 Agent 重度用户把「记忆丢失」列为第一痛点,比「幻觉」还高 11 个百分点。

为什么?

答案很扎心:2025 到 2026 年,AI Agent 的能力在工具调用上突飞猛进,但在「记忆」这件事上,依然是各自为战的孤岛——

痛点现状
记忆带不走换一个 Agent、换一个会话、换一个框架,就得重新「养」一遍
视角千差万别客服 Agent 关注「投诉记录」,编程 Agent 关注「代码偏好」,无法用一套模板搞定
记忆不会成长提取、检索、组织策略写完就固化,无法从用户纠错中持续演进
缺时间维度只记「现在的事实」,丢了「为什么改主意」、「原来是 X,怎么变成 Y」

8 月 3 日,华为诺亚方舟实验室正式开源 MindMemOS——专门治这个病。

它上来就把口号喊得很明确:不是再做一套 Mem0/MemoryBank,而是给 Agent 装一个独立的「记忆操作系统」


二、MindMemOS 到底是什么?——一文讲透三个核心架构

很多读者可能会疑惑:市面上的长期记忆框架已经有 Mem0、Letta(以前叫 MemGPT)、Cognee、Memary、MemoryBank……华为这套又有什么不一样?

核心区别是一句话:MindMemOS 是「操作系统」级别的抽象,而不是「插件」级别的封装

它把 Agent 的记忆拆成三层独立架构,并且设计了三大在线/离线机制

2.1 三层独立架构

┌─────────────────────────────────────────────┐ │ 接入层(Agent Adapters) │ │ ├─ OpenClaw / Claude Code 插件 │ │ ├─ FastAPI HTTP 接口 │ │ ├─ Python SDK / CLI │ │ └─ MindScale Skills(SaaS) │ ├─────────────────────────────────────────────┤ │ 算法层(Memory Algorithms) │ │ ├─ MindVanilla(开域,无模板抽取) │ │ ├─ MindSchema(按领域预设实体属性) │ │ ├─ Compact Search(外层 Agentic + 内层多路径) │ │ ├─ Dreaming(离线整理、冲突消解) │ │ └─ Feedback(显式/隐式信号回流) │ ├─────────────────────────────────────────────┤ │ 结构层(Memory Structure) │ │ └─ 「实体(Entity)— 属性(Property)— 时间(Time)」三维建模 │ └─────────────────────────────────────────────┘

为什么是三层独立?

因为记忆是「跨 Agent 资产」,不应该被某一家 LLM 厂商、某一个框架锁死。三层独立之后:

  • 一个 OpenClaw 用户今天用 DeepSeek 写的代码,明天切到 Claude Code,记忆照样能用
  • 一家公司内部 5 个 Agent 共享同一份「客户档案」,不再各自重建

而传统方案,比如直接把记忆塞到向量数据库里,本质上是把记忆和算法绑死——换个 LLM 就要重训 embedding 模型,换个 Agent 框架就要重写解析逻辑。

2.2 三大核心机制

① 实体-属性-时间 三维建模(MindSchema)

传统长期记忆:把对话切成文本片段或向量 chunk。

MindMemOS:用一个三维结构描述世界信息流。

实体(Entity) → 人、项目、文件、工具、组织 属性(Property) → 名字、状态、偏好、高阶特征 时间(Time) → 这个属性「什么时候成立」「什么时候变化」

举例:「用户以前偏好 X,现在改用 Y」——传统记忆会变成两条互不相干的文本片段;MindMemOS 把它们放在同一实体同一属性的时间轴上,你能直接看到 6 个月前的偏好怎么变成今天的偏好

两条抽取路径

  • MindVanilla:无需预设模板,对话/文本/工具执行轨迹直接入库(适合开域)
  • MindSchema:先规定「这个领域关注哪些实体和属性」,再切分话题、做属性级记忆生成、等价实体融合、图结构合并(适合垂直域)

② Dreaming:让 Agent 在「空闲时间」整理记忆

人类睡觉时会做梦——大脑会把当天冗余、冲突、过时的记忆合并、归档、形成抽象规律。

MindMemOS 的Dreaming 模块正是这个角色:

离线阶段扫描活跃记忆 ↓ 围绕相关实体局部扩展 ↓ 识别重复 / 冲突 / 演化 ↓ 执行:合并冗余 / 归档旧事实 / 补充关系 / 发现新模式 ↓ 把整理结果写入持久记忆(不靠每次回答时再判)

MindMemOS 在 MemoryAgentBench FactConsolidation 子集上验证:在把19.4%—23.5% 活跃记忆转入归档(即主动遗忘)的同时,Single-hop 与 Multi-hop 问答准确率最高提升 10.3 个百分点

少即是多——主动遗忘,本身就是记忆质量的一部分。

③ Feedback:用户的一次纠正,不能只修一条答案

Dreaming 是系统主动整理,Feedback 是让用户纠错信号回流。

MindMemOS 同时支持两种反馈:

  • 显式:用户直接说「这条记忆错了,应该是 Y 而不是 X」
  • 隐式:在后续对话中表达不满、纠正偏好、隐性修正

系统会判断这条信号属于:

  • 当前任务临时信息 → 直接丢弃
  • 特定场景偏好 → 长期保留
  • 普遍规律 → 强化甚至迁移到「策略层」

更关键的是:Feedback 不只是改一条记忆,而是反向修改「记忆提取 + 检索 + 组织」整套策略

论文 PersonaMem-Evo 案例:用户说「我偏好临时约见」——

  • 改之前:系统只记这条表层信息 → Top-10 召回 1 条模糊记忆 → 推荐「结构化群体活动」(错)
  • 改之后:系统从多轮交互中识别出「喜欢临时或当天计划,担心长期计划有变」+「社交场景边界」 → Top-10 召回 3 条一致记忆 → 推荐「自发一对一活动」(对)

④ Skill Evolution:把 Skill 从「静态文档」升级为「可演进资产」

这是 MindMemOS 最具想象力的部分——

传统 SKILL.md 是写完就不动的:

# Spreadsheet Skill ## 用 openpyxl 打开工作簿 ## 用 ws.append() 添加数据

MindMemOS 让它可以根据真实执行轨迹持续进化

真实任务轨迹(add → search → dream → evolve 闭环) ↓ 提取目标、关键转折、工具使用、最终结果 ↓ 聚合反复成功的策略 + 反复出现的失败 ↓ 生成针对当前 SKILL.md 的修改计划 ↓ 应用编辑,生成新版本 ↓ 同步回后续任务

两种模式

  • MindEvolve-Unsup:纯靠执行轨迹无监督演进
  • MindEvolve-Sup:有评分后做强化学习式演进

论文在 400 个真实 Excel 任务的 SpreadsheetBench-Verified 上跑出:

模式任务成功率对比基线
No-skill51.3%
Init-skill(未演进)48.0%反而比 No-skill 低 3.3%⚠️
MindEvolve-Unsup55.3%+4% / +7.3%
MindEvolve-Sup57.2% ± 2.4%+5.9% / +9.2%

注意一个爆炸性发现:未经优化的 Init-skill 居然比 No-skill 还差——因为它给 Agent 一份「看似有但其实有错」的规则,反而制造干扰。

这也解释了为什么很多团队把 Skill 装上之后发现没效果——Skill 不演进,不如不装


三、性能炸裂——三项基准全 SOTA

3.1 LoCoMo(长对话记忆基准)

LoCoMo 包含 10 组超长多会话对话(每组可达 30+ 轮),考验 Agent 在「跨数十次对话」的长期事实召回能力。

MindMemOS 使用 gpt-4.1-mini 作为回答模型,整体配置对齐 EverOS。

结果:MindMemOS-Modeling 拿到 94.03 分 Overall Accuracy,成为所有对比方法的最高结果。

横向对比(部分数据):

  • Mem0、Letta、Cognee、MemoryBank、A-Mem 等主流方案:最高 89.x
  • MindMemOS-Modeling:94.03(断崖式领先)

3.2 PersonaMem(长期个性化基准)

PersonaMem 考验「用户画像 + 个性化推荐」的精准度。

  • MindMemOS-MindSchema:70.63%(最高)
  • MindMemOS-MindVanilla:67.74%
  • Baseline:65.5%

3.3 SpreadsheetBench-Verified(Skill 演进效果)

之前说过:No-skill 51.3%、Init-skill 48.0%、MindEvolve-Unsup 55.3%、MindEvolve-Sup 57.2% ± 2.4%

这意味着同样一份 SKILL.md:未经演进比不装还差,经过演进比不装提升 11.5%。


四、安装与上手——三分钟跑通一个 MindMemOS Demo

4.1 最快路径(云服务)

MindMemOS 云服务已开放注册,Star GitHub 仓库即可获得更多使用额度。

# 1. 访问官网注册 open https://mindmemos.cn # 2. 拿到 API Key export MINDMEMOS_API_KEY="mm_your_key" # 3. 安装 Python SDK pip install mindmemos

4.2 本地部署(完整开源栈)

# 1. 克隆仓库 git clone https://github.com/mindscale-noah/MindMemOS.git cd MindMemOS # 2. 一键启动(Docker Compose) docker-compose up -d # 3. 验证服务 curl http://localhost:8000/health # {"status": "ok", "version": "0.3.0"} # 4. 调用 add API 写入第一条记忆 curl -X POST http://localhost:8000/api/v1/add \ -H "Content-Type: application/json" \ -d '{ "entity": "user_19441", "property": "programming_style", "time": "2026-08-06", "value": "用户偏好函数式 Python,反对 OOP" }' # 5. 调用 search API 检索 curl -X POST http://localhost:8000/api/v1/search \ -H "Content-Type: application/json" \ -d '{"query": "用户喜欢什么代码风格?"}' # 返回结构化的「实体-属性-时间」记忆列表

4.3 接入你的 OpenClaw Agent

MindMemOS 官方提供了 OpenClaw 插件:

clawhub install mindmemos export MINDMEMOS_API_KEY="mm_your_key" # 在 openclaw config.yaml 添加 channels: memory: provider: mindmemos user_id: user_19441

之后,每次你和 Agent 对话,它都会自动写入 MindMemOS;下次开新会话,Agent 自动从 MindMemOS 召回相关记忆。


五、MindMemOS vs 同类——它到底强在哪?

和目前主流长期记忆方案对比:

维度Mem0 / Letta / CogneeMemoryBankMindMemOS
架构定位插件 / 封装插件操作系统(分层独立)
建模方式文本片段 + 向量文本片段 + 图实体-属性-时间三维
跨 Agent 迁移❌ 绑定框架⚠️ 半迁移✅ 三层解耦全迁移
冲突解决检索时临场判检索时临场判✅ Dreaming 离线归档 + supersedes
用户反馈⚠️ 仅显式⚠️ 仅显式✅ 显式 + 隐式,双层回流
Skill 演进❌ 静态文档❌ 静态文档✅ MindEvolve 自演进,Up +9.2%
LoCoMo 基准85-8980+✅ 94.03 SOTA
协议Apache / MIT闭源MIT(开源可商用)
接入方式SDK私有 API✅ API+SDK+CLI+OpenClaw插件+Skills

一句话定位差异

  • Mem0 / Letta 把记忆当「向量库的缓存」
  • Cognee / MemoryBank 把记忆当「图谱的节点」
  • MindMemOS 把记忆当「独立的、可迁移的、自演进的操作系统」

六、谁该立刻装?——三类人行动指南

👨‍💻 个人开发者

  • 之前每次 Agent 跑长任务都「重新交代背景」 → 装 MindMemOS,一次交代终身有效
  • 想要 Skill「越用越聪明」而不是「写完不动」 → 装 MindMemOS,让你的 SKILL.md 自动演进

🏢 企业 / 团队

  • 多个 Agent(客服、销售、编程、运营)共享同一份「客户档案」 → 用 MindMemOS,三层独立架构天然适合
  • 担心数据绑死在某一家 LLM 厂商 → MindMemOS MIT 开源 + 独立架构,记忆迁移零成本

🧪 AI 算法工程师 / 研究者

  • 想研究长期记忆的演进机制 → 直接读 MindMemOS 源码,Dreaming / Feedback / MindEvolve 都是论文级实现
  • 想在 LLM4AD(自动算法设计)领域跟进前沿 → MindMemOS 已在 LLM4AD_Next 上集成,三层记忆(Task/Project/Global)针对算法搜索场景定制

七、一些需要冷静看的点

华为诺亚这次开源很猛,但我们也得冷静一下:

  1. 新开源项目(2026-08-03),生产环境建议先小流量试点。
  2. LoCoMo 94.03 是 GPT-4.1-mini 作为回答模型的结果,换模型可能分数波动。论文里 MindMemOS 也披露了在 Qwen / DeepSeek 等开源模型上的对比,整体领先但绝对分不同。
  3. Dreaming 离线整理需要算力——按论文数据每天处理 10 万条记忆大约 30 分钟单卡 A100,企业级落地时建议用云服务或排队机制。
  4. Skill 演进需要真实执行轨迹作为「监督信号」——如果你的 Skill 之前没有 add/search 调用反馈,进化的效果会打折扣。

八、写到最后——为什么这件事比你想的重要

昨天的 AI Agent 是这样的:

「你好,请给我项目背景、需求偏好、技术栈清单……」

明天的 AI Agent 应该是这样的:

「上次你说想用 FastAPI + uv 管理依赖,Redis 缓存用 dict 协议别用 redis-py,今天我直接按这个来了——对了,你上次提到的 alembic 升级到 1.13,你装了吗?」

这中间差的不是一次 prompt,而是一整套「记忆操作系统」。

MindMemOS 是 2026 年我们看到的第一份「分层解耦 + 自演进」的工业级长期记忆方案。它不是给某个 Agent 加一个 feature,而是给整个 Agent 生态铺设一层基础设施。

下一篇我会写 MindMemOS 接入 OpenClaw 的完整 demo,包括怎么把 Self-Improving Agent、Planning-with-Files、Claude-Mem 这些热门 Skill 和 MindMemOS 串起来。

关注我,别错过。


附录:项目地址速查

类型链接
GitHubGitHub - mindscale-noah/MindMemOS · GitHub
官网https://mindmemos.cn
协议MIT
云服务https://mindmemos.cn(开放注册)
集成平台https://llm4ad-next.cn(自动算法设计)
Star 数上线即破 Star,新增持续(截至 2026-08-06)
http://www.cnnetsun.cn/news/3889231.html

相关文章:

  • 龙岗网站建设公司哪家好:揭秘避坑指南与选择逻辑
  • Label Studio终极指南:5分钟搭建你的AI数据标注流水线
  • 技能水平评估_self-assessment
  • GeoJSON.io完整指南:5分钟掌握免费地图数据可视化终极工具
  • JavaScript AST解析实战:从代码到抽象语法树的完整操作指南
  • 9 款 AI 写论文哪个好?实测横评,毕夏 AI 官网凭借硬核学术实力脱颖而出
  • FModel终极指南:解锁虚幻引擎游戏资源的完整免费解决方案
  • Hadoop机架感知原理与配置优化实战
  • Nginx性能调优实战:从基础配置到高级优化
  • KMS_VL_ALL_AIO:为什么这个智能激活脚本能解决你90%的Windows和Office激活烦恼
  • Mem Reduct深度解析:Windows内存管理的瑞士军刀如何革新系统优化体验
  • 腾讯云轻量服务器部署Hermes Agent:高吞吐免配置AI Agent实战指南
  • 小白程序员必看:收藏这5个AI Agent实战案例,一天搞定工作减负!
  • Unity WebGL微信小程序部署:Windows环境系统化配置与优化指南
  • SDC命令详解:使用create_cell和remove_cell命令进行编辑
  • Pygame-CE入门:从Surface、Rect到游戏循环的Python游戏开发实践
  • 3dsconv终极指南:轻松将3DS游戏文件转换为CIA格式
  • 跨境o2o网站建设方案:打破虚实界限的实战指南与深度思考
  • 基于LimeSDR与开源软件的低成本北斗三代B1C信号模拟源实现
  • 抖音无水印批量下载工具终极指南:一键获取高清视频资源
  • Leveraging Large Language Models for Identifying Knowledge Components
  • AI驱动的网络攻击:生成式大模型如何成为“钓鱼邮件工厂”?
  • PL2303驱动终极修复指南:如何在Windows 10上拯救你的老设备
  • Bridging Human and Model Perspectives: A Comparative Analysis of Political Bias Detection in News...
  • 福州建设部官方网站深度解析与城市未来发展展望
  • Ohook终极指南:3步免费激活Microsoft 365完整功能
  • 浏览器视频下载全攻略:从原理到实战的完整解决方案
  • 终极Palworld存档迁移指南:三步解决角色丢失问题
  • RT-Thread:从实时内核到物联网开发平台的演进与实践
  • Godot按钮控件深度解析:从BaseButton到高级交互与性能优化