2026年9大AI Agent持久化记忆系统横评:选型与成本指南
2026年构建AI Agent必看的9大持久化记忆系统深度评测。本文从控制粒度、检索能力、部署适配度及2026年8月最新核实定价出发,全面对比Mem0、Perplexity Brain、Hindsight与Zep等核心方案,助你选对记忆架构。

如果你正自研 AI Agent,Mem0 是最稳妥的默认持久化记忆系统;若追求免开发的即用方案,Perplexity Brain 则是最佳选择。Perplexity 官方披露的一组最新业务指标极具参考价值:在需要历史上下文的 Computer 任务中,其正确率提升了 25%,召回率提高了 16%,同时成本降低了 13%。
核心结论:如何快速选出适合你的持久化记忆系统?
如果需要在自己的产品内部署记忆 API,并希望获得一条从免费原型平滑过渡到托管生产服务的清晰路径,请选 Mem0。如果你的 Agent 本身就运行在 Perplexity Computer 中,核心诉求是免除重复沟通且无需自行搭建记忆底层设施,请选 Perplexity Brain。如果 Agent 必须跨越动态变化的事实与漫长历史进行逻辑推理,请选择 Hindsight;若系统设计以可治理的时序知识图谱为核心,则选 Zep。
榜单中的其余方案则针对更垂直的场景:Supermemory 最适合需要将对话、文档与业务连接器统一整合为多模态上下文层的场景;Cognee 适合希望在本地运行或部署到自有云端(BYOC)的图-向量-关系混合引擎团队;Claude Managed Agents memory stores 是 Anthropic 托管运行时内审计优先的极简文件方案;Letta 是代码 Agent 的高可移植性首选,能让 Agent 身份独立于底层模型迭代;LangMem 则是基于 LangGraph 构建、希望完全自主把控存储与策略的库优先选项。
下述价格均已于 2026 年 8 月 28 日核实。“免费”可能指托管免费层、开源自建路径,或本身免费但需自行承担模型与算力开销的应用。它们的实际经济账截然不同,各章节将拆解具体账单。
这份排名特意避开了基准测试排行榜的形式。一套记忆系统哪怕检索指标极高,若无法满足你的删除策略、租户隔离、延迟目标或运维架构,依然是错误的采购。最优秀的系统,永远是其持久化边界与你想要记住的事物高度吻合的那一款。
若觉得这句话抽象,请遵循这条决策法则:如果托管产品的月度溢价低于你自行维护提取、合并、检索、纠错和删除工程所需的人力成本,直接购买托管产品;若数据合规边界或特定记忆行为不可妥协,则坚持自建自持。 这一规则对选型的影响远胜过几个点的基准测试差距。
购买 AI Agent 持久化记忆系统,你究竟在为什么买单?
持久化记忆绝非“更大的 Prompt”。上下文窗口决定了模型单次推理能看多少内容;Checkpoint(检查点)能让工作流从中断处恢复状态;持久记忆(Durable memory)则决定了什么信息该保留、该如何演进,以及在未来的会话中提取哪一小部分切片;而受控的知识层,又为这些记忆补充了所有权、溯源溯因、保留期与删除合规策略。
这些层级对应着不同的系统故障。如果 Agent 崩毁后只需恢复到确切步骤,请用 Checkpoint;如果需要记住客户上个月变更了结算联系人,请使用具备时间有效性的持久记忆;如果必须证明回答中为何出现该联系人,需要添加源链接或不可变版本;如果一个客户的数据绝不能泄露至另一客户的执行中,多租户隔离就是记忆系统的内在部分,而非事后补丁。
由此引发的财务隐患是上下文重载账单(Context reload bill):模型因反复发送旧内容而消耗的 Input Token、人工重复同步背景耗费的时间,以及过时或矛盾上下文导致的业务错误。Perplexity 为这一问题提供了量化数据。其 Brain 发布报告 指出,在需要历史上下文的 Computer 任务中,Brain 在早期测试中使单次任务成本降低了 13%,同时回答正确率提升 25%,召回率提高 16%。虽然这只是厂商在其自有产品上的评测结果而非通用基准,但它印证了正确的经济学目标:减少重复调用和冗余上下文,同时提升答案质量。
业内优秀的系统主要通过以下方式削减这笔开支:
- 选择性检索:仅提取高度相关的极小切片,而非无脑重放全部历史。
- 合并提炼(Consolidation):合并重复事实,将反复出现的模式归纳为更精简的工作模型。
- 时序推理:明确区分“过去为真”与“当前为真”。
- 动态纠错:允许用户或宿主程序在错误记忆引发连锁反应前及时修正。
- 溯源保证(Provenance):让每一条提取的记忆都可查证,而非仅仅“听起来合理”。
- 租户控制:将记忆严格隔离至用户、项目、Agent 或企业组织级别。
这也解释了为什么单靠向量数据库无法构成完整的记忆系统。向量数据库擅长存储 Embedding 并返回相似片段,但它不会自动判断事实是否已被覆写、纠错是否该重写旧观察、过期来源是否该物理删除,也无法界定某项偏好究竟属于个人、Agent 实例还是整个组织。Hindsight、Zep、Mem0、Supermemory 和 Cognee 等系统在检索之上封装了策略与结构;而 Claude memory stores 和 Letta 的上下文仓库则以文件原生方式提供了另一种完全可透视的状态管理机制。
持久化边界的重要性远高于接口形式。Perplexity Brain 记录的是 Computer 内部的工作流,并非面向 SaaS 产品的通用 API;Claude memory stores 专注于 Managed Agents 内部的小型持久化文件,并非全自动知识图谱;Mem0 和 Supermemory 是应用级服务,仍需业务方定义何时写入、查询与遗忘;Cognee 和 Graphiti 赋予了更大的掌控权,但随之而来的是沉重的底层运维职责。

这正是记忆与 Agent Skills(技能)的分水岭。Skill 通常是关于如何执行工作的持久化指令;记忆则是关于发生了什么、改变了什么以及当下何者关键的学习状态。在权衡持久化 Agent Skills 与学习型上下文时,这一边界尤为重要。稳定的业务规则应写入 Skill 或系统配置,客户最新的临时约束则应进入记忆。混淆二者会导致审计灾难。
选型前的成本算账:别被计费单位误导
如果不仔细核对计费单位,记忆系统的定价极具欺骗性。有的厂商按保留的 Input Token 计费,有的按嵌入的唯一 Token 收费,有的按处理的数据量计费,还有的按细粒度的 Episode 收取费用。脱离这些物理单位对比“每百万 Token 多少美元”是毫无意义的伪精度。
以一次 1,000 万 Token 的典型数据摄入任务为例:
- Hindsight 以每百万 $10 的费率收取 $100 的 Retain 费用。如果这 1,000 万 Token 在 30 天宽限期后继续留存,每月将额外产生 $2.50 的存储费。Recall 检索 1,000 万 Output Token 需花费 $7.50(不过合理设计的系统读取量应远低于存储量)。
- Supermemory 对其记忆图谱中 1,000 万普通唯一 SM Token 计费 $50($0.005/1,000 Token)。富文本则需 $100。关键修饰词是“唯一”:重复和未更改的内容不会二次计费。
- Cognee Standard 处理 1,000 万 Token 需支付 $25($2.50/MTok)。若额外增加 3 个工作区需加收 $15,该业务量下的模型月成本约为 $40。
这些数字绝不代表 Cognee 比 Hindsight 便宜四倍。Hindsight 的 Retain 包含特定的事实提取与记忆构建;Supermemory 计量的是其去重后的专有 Token;Cognee 测算的是引擎流转处理的 Token。这是作用在三种完全不同工作流上的计费仪表。

Zep 的阶梯分界线非常直观。Flex 套餐为 $125,内含 50,000 credits,后续每 10,000 credits 收费 $25。加购 10 次后账单达 $375,总额度为 150,000 credits。而 Flex Plus 定价直接就是 $375,却内含 200,000 credits。这意味着,一旦月度预估额度超过 150,000 credits,在尚未计入更高限额与更长结转期的优势前,Flex Plus 就已经比 Flex 加购更划算。 在 160,000 credits 时,Flex 需花费 $400,而 Flex Plus 仍只需 $375。
Perplexity 则是纯席位制模式而非 API 模式。个人 Max 为 $200/month 或 $2,000/year。10 个席位按月付一年需 $24,000,按年付为 $20,000,每年差价达 $4,000。Enterprise Max 为 $325/seat/month 或 $3,250/seat/year,10 个席位年付可省下 $6,500/year。只有当团队在实践中验证了 Brain 能显著降低重复沟通与返工成本时,年付承诺才有商业合理性。
Claude 展示了另一层成本杠杆。Sonnet 5 的定价为 Input $2/MTok、Output $10/MTok。在没有任何其他运行时费用的情况下,一次消耗 1,000 万 Input Token 和 100 万 Output Token 的调用混合需耗资 $30。如果跨 100 次会话无脑重复发送 100,000 Token 的项目简报,将产生 1,000 万 Input Token,在不考虑缓存机制的官方公开费率下价值 $20。挂载记忆存储虽无法让读取完全免费,但它赋予了 Agent 仅按需提取关联文件的能力,避免每次都把整个简报灌进开场 Prompt 中。
因此,技术采购的核心问题不是“哪家起步价最低”,而是“系统里的一个记忆单元对应什么、读写频次如何、一旦出现错误由谁承担纠错成本”。应将写入路径、检索路径、留存存储、模型推理及人工纠错分开核算,再叠加托管服务的溢价或运维开源方案所需的研发工时。
评选标准与入选依据
入选的 9 款系统均具备真实的持久化机制与不可替代的采购理由。筛选基于以下 6 项标准:
- 持久化边界(Persistence boundary): 在进程重启、新建会话、更换模型或应用重新部署后,状态是否仍能完好保存?状态的主权归属于谁?
- 检索质量(Retrieval quality): 系统能否融合语义、词法、图谱与时序信号,还是仅提供初级的近邻相似度搜索?
- 纠错与可追溯性(Correction and provenance): 能否清晰审计某项记忆生成的原因,能否安全更新、追踪版本并按需物理擦除?
- 多租户与控制粒度(Tenancy and control): 能否将数据严格隔离至用户、项目、Agent 及企业级?是否支持私有化部署、BYOC 或只读挂载?
- 运维开销(Operating work): 团队是否仍需自行搭建提取、合并、评测、监控、数据留存与安全防护链条?
- 计费模型(Bill shape): 厂商是按席位、请求数、Token、Episode、存储周期还是底层算力资源收费?
本文提及的所有价格、层级、额度及命名功能,均基于 2026 年 8 月 28 日对第一方定价页面、官方文档、开源仓库或产品公告的核验。由于并未针对本次撰文进行全套个人实机重测,文章标题不包含“实测”字样。厂商测试指标均明确注明为官方发布,不作为第三方独立结论。
被排除的类别同样关键:纯向量数据库未被纳入完整记忆系统,因其基础存储与相似度检索无法涵盖记忆的全生命周期;缺少持久化记忆层的通用 Agent 框架被剔除;无法被审计、设定范围或集成的消费级聊天记忆也被过滤,除非它能构成实质性的 Agent 工作流(这正是 Perplexity Brain 入选而普通个性化开关被排除的原因)。
该排名的指导思想是“决策实用性高于范式纯洁度”。Perplexity Brain、Letta 与 Mem0 的 API 确实不在同一产品维度,但对于买方而言,它们解答了同一个预算诉求:是自建记忆层、直接采用托管工作区,还是选用内建记忆的 Agent 运行时?将它们并列对比,能让“自研 vs 采购”的权衡一目了然。
1. Mem0:产品团队的首选默认记忆 API
对于需要在跨会话中沉淀记忆,且不愿过早绑定到时序图谱、文件原生系统或单一厂商生态的产品团队而言,Mem0 是最稳妥的默认之选。例如客服 Agent 可按客户和会话 Run 进行多级租户隔离,在应答前精准召回少量相关偏好,并支持后续修正或过期剔除。其托管平台提供了开源版所欠缺的自动合并与时序排序功能。不过,其套餐升级断层明显:$19 的 Starter 额度偏紧,而多数团队所需的生产级特性直接落在了 $249 的 Pro 档位。

Mem0 的托管版与开源版共享基础核心操作:add、search、get、list、update、delete、delete-all 以及 history。两端均支持 user_id、agent_id 与 run_id 的多级作用域控制、实体感知排序、多模态输入、过期机制、重排(Reranking)、自定义提取指令、Python/JS SDK 及 REST 接口。这一稳固的核心使开源方案不仅仅是个 Demo,更让企业拥有了摆脱云端锁定的真实可行路径。
官方的平台与开源对比文档对其边界毫不避讳。托管 Platform 独占了 app_id 租户体系、组织架构、项目、项目级事件流(Event feed)、原生 Graph Memory、记忆衰减(Memory Decay)、时序推理(Temporal Reasoning)以及 Dream 后台合并机制;同时还封装了 Webhooks、分类标注、基于 Schema 的数据导出、反馈收集、自动摘要以及最高 1,000 条记忆的批量更新/删除。
开源 OSS v3 的功能边界同样鲜明:不包含可直接查询的 Graph Memory、记忆衰减、时序推理、Dream、Webhooks、项目事件流、记忆导出、托管反馈、摘要及批量操作。你依然能构建出优秀的记忆系统,但必须自行解决向量库、模型接入、Embedding、底层运维以及上述缺失的高级策略。开源换取的是完全控制权,而非免费获取与商业版完全一致的交钥匙功能。
最佳适用: 需要在 SaaS 或企业内网应用中为用户、Agent 和特定会话嵌入记忆的产品研发团队。
核心亮点: 托管与自建环境共享一套核心 API,在需要时可平滑升级至托管图谱、记忆衰减、时序排序与异步合并。
定价方案: Hobby 版免费,每月提供 10,000 次 add、1,000 次 retrieval 及 1 个项目。Starter 为 $19/month,提供 50,000 次 add、5,000 次 retrieval 及 1 个项目。Pro 为 $249/month,提供 500,000 次 add、50,000 次 retrieval、不限项目数,并包含 Graph Memory、Dream、数据分析与专属 Slack 支持。Enterprise 为定制方案,提供不限请求数与项目数、SLA 保证、本地化私有部署、审计日志、SSO 及定制集成。价格已于 2026 年 8 月 28 日在 Mem0 定价页 核实。
免费试用: 托管 Hobby 档位永久免费且无需信用卡;开源版可直接自建。
- 托管版与自建开源版遵循相同的底层读写闭环逻辑。
- 支持基于 User、Agent、Run 及应用 ID 的清晰多租户隔离。
- 托管专属的 Graph Memory、衰减、时序排序和 Dream 覆盖了核心生产需求。
- 套餐额度界定明确,便于早期精确核算容量模型。
- 支持数据导出、Webhooks、反馈机制和事件流,完美贴合运维监控需求。
- Starter 套餐仅限 1 个项目且每月仅 5,000 次检索额度,极其局促。
- 从 $19 Starter 跨越到 $249 Pro 的价格跳跃过大。
- OSS v3 移除了许多买方看重的图谱和后台合并特性。
- 单纯的 API 依然需要业务层自行封装保留策略、知情同意、效果评测与删除机制。
Mem0 生产落地的起步范式
最稳妥的落地实践是避免“记住一切”,而是圈定单一维度的持久化事实,保留原始文本与时间戳,并度量检索是否切实优化了重复工作流。
明确单一记忆契约
先从单一数据实体切入,如“已确认的客户偏好”、“已敲定的账户约束”或“团队代码规范”。明确定义允许存储的内容、归属方、失效条件,以及绝对禁止写入的敏感边界。
强制每笔写入的作用域隔离
在写入记忆时,必须挂载明确的 User、Agent 及 Run 标识。仅当业务租户真正需要时才启用托管平台的
app_id。缺失的作用域不是日后能清理的技术债,而是严重的数据隔离缺陷。在高成本动作发生前精准检索
仅在即将执行收益明确的业务决策前触发记忆检索,且仅将高相关的精简结果传递给模型。切忌在每个交互 Prompt 中无脑注入全部记忆列表。
闭环纠错与过期清理通道
为宿主系统提供显式的接口以更新、删除或标记失效事实。在 Platform 上,利用反馈通道和事件流监控检索表现;在 OSS 上,需在封装层自行实现这套遥测能力。
基于数据证据决定升级
保持在 Hobby 或 Starter 阶段,直到请求配额、项目隔离或图谱合并成为明确的性能与业务瓶颈。只有当特定业务能消化 $230 的月度溢价时才升级至 Pro,切莫因“产品上线”而盲目买单。
总结评价:Mem0 是最稳妥的通用首选,但其核心的高级记忆特性正是让 $19 尝鲜变成 $249 商业承诺的门槛。 若仅需记录少量静态偏好,Starter 或 OSS 足矣;若需要时间有效性、记忆合并、项目级操作与图谱感知排序,在付款前请务必将其 Pro 档与 Hindsight 及 Zep 进行横向对比。
2. Perplexity Brain:免开发的最佳即用型工作记忆
如果工作流本就依托 Perplexity Computer 运行,且业务方希望在免除系统研发的前提下实现工作记忆持久化,Perplexity Brain 是最优解。战略负责人可在数周后重新拉起一个客户项目,由 Computer 自动找回过去的决策脉络、文件、关联干系人、历史纠错与待办事项。Brain 会在后台持续刷新这一工作模型,并将每个记忆节点溯源至原始出处。其最大短板是缺乏可移植性:它只是付费 Max 套餐内的一项 Research Preview 功能,而非面向外部软件的通用记忆 API。

Brain 于 2026 年 6 月 18 日作为 Computer 的自进化记忆系统发布。根据其发布公告,它能够从 Computer 执行的工作中构建上下文图谱,并在夜间等间歇期自动刷新内部维护的 LLM Wiki。其信息来源包括历史会话、数据连接器抓取结果、工作成果(Artifacts)、文档变动以及用户的人工纠错。相较于传统聊天机器人简单的偏好设置字段,它更像是一个面向复杂脑力工作的“外挂操作系统记忆”。
最新的 Brain 官方文档 提供了几项至关重要的可信控制机制:所有词条均附带原始链接;概念(Concepts)、实体(Entities)和工作流(Workstreams)被整理为可视化 Wiki 与图谱;用户可以直接编辑或彻底删除词条,纠错结果会直接同步至下一次后台维护流程中;Brain 会自动巩固依然有效的事实,更新发生变化的节点,并将过时信息打上 Stale 标签,而非将所有陈年旧事一视同仁。
在隐私方面,系统建立了明确的产品隔离边界:Brain 仅基于当前订阅者自身的行为演进,自动跳过无痕会话(Incognito);提供独立的功能开关,企业管理员也可针对员工集中禁用;Perplexity 声明其引入了 AI 过滤机制以降低凭证及敏感信息录入记忆的风险,且明确 Enterprise 数据绝不用于模型训练。需要注意的是,过滤只能降低隐患,绝不能作为在源材料中随意放置密钥的借口。
关于官方宣称的亮眼数据,需理性看待其语境。Perplexity 报告称,在 Computer 曾处理过的任务测试中,对于依赖历史上下文的场景,Brain 带来了 25% 的回答正确率提升、16% 的召回率提升 以及 13% 的成本下降。帮助页面并未公开底层测试设计与完整评估集,因此这代表了一次极具潜力的商业化成果,但不足以作为 Brain 在 API 维度碾压其他系统的通用证据。
最佳适用: 已在 Perplexity Computer 中深度处理高复频脑力工作的高管、分析师、运营人员及项目团队。
核心亮点: 后台静默演进的工作记忆,能将碎片会话、文档、连接器、交付物、决策及纠错串联成附带源溯源的可视化图谱。
定价方案: Brain 目前处于 Research Preview 阶段,仅限 Consumer Max($200/month 或 $2,000/year)与 Enterprise Max($325/seat/month 或 $3,250/seat/year)使用。Enterprise Pro 定价为 $40/seat/month 或 $400/seat/year,但无法使用 Brain。Consumer Max 每月包含 10,000 点 Computer credits;Enterprise Max 包含 15,000 点;未使用点数当月作废不可结转。价格数据于 2026 年 8 月 28 日核验自 Perplexity 的 套餐说明、企业版定价 及 点数规则指南。
免费试用: Enterprise Pro 与 Enterprise Max 均不提供免费试用;必须订阅对应的付费 Max 方案方可使用 Brain。
- 免去了自行设计提取、存储、检索以及记忆可视化后台的工程研发负担。
- 来源引注、手动编辑、物理删除、过期标注及纠错机制让内部记忆极度透明可审计。
- 学习范围穿透多轮会话、数据源连接器、文件资产及项目沉淀,而非仅停留在偏好层。
- 官方实测的质量与成本收益指标展现了切实的实际业务优化潜力。
- 仅作为 Research Preview 开放给昂贵的 Max 和 Enterprise Max 套餐。
- 深度绑定在 Perplexity Computer 封闭环境,无法作为标准 API 导出集成至自建应用。
- 对低频用户而言席位单价极其昂贵,且 Computer credits 构成了额外的用量消耗门槛。
- 敏感信息过滤并非绝对可靠,依然存在核心机密被纳入记忆池的操作风险。
项目归属权限是另一笔需要严格规划的账目。Perplexity 会将项目维度的 Brain 运行开销全额记在项目创建者账上,哪怕有大量协作者参与该项目。对于共享研究或客户业务流,应指定明确负责人,合理配置自动化刷新与手动触发策略,在扩充协作者前密切监控点数消耗。
年付优惠只有在团队确立使用习惯后才有意义。10 个 Consumer Max 席位按年付比按月付整年可节省 $4,000;10 个 Enterprise Max 席位可节省 $6,500。建议设立 30 天的试跑期,确认团队确实在复用历史成果、减少了人工校准且降低了历史上下文消耗后,再签署年费合同。
总结评价:Perplexity Brain 是消除 AI 遗忘、构建可溯源工作记忆最快捷的途径,但你购买的是一整套专有工作空间,而非通用的可移植记忆组件。 如果你的最终交付就在 Computer 里,果断选用它;如果记忆必须服务于你的自建产品、自有数据平面或特定模型路由,请绕道。
3. Hindsight:深层时序召回与反思推理的最佳选择
如果你的业务要求记忆不仅仅是抓取一段“相似文本”,Hindsight 是最强大的武器。调研类 Agent 能借此持久化带有时间戳的发现、联结人物与实体、归纳关键观察,并在后续跨期分析两段时间线之间的差异。其独创的 TEMPR 检索机制整合了四维信号,而非将所有筹码押在单薄的 Embedding 上。其代价是计费账单复杂度较高,且相比基础偏好记忆具有更强的系统侵入性。

Hindsight 将完整的记忆闭环清晰地拆解为三大原生操作:Retain 负责抽取客观事实、实体及时间维度数据并灌入记忆库(Memory bank);Recall 采用并行混合策略精准召回关联记忆;Reflect 则允许 Agent 在该记忆库设定的目标(Mission)、指令(Directives)与性格(Disposition)约束下,对留存素材进行更高维度的归纳与反思。这种拆分非常科学,因为底层存储、实时检索与深度推理在成本与延迟表现上完全属于不同的量级。
其内部信息层级同样规整严密:最底层是原始世界事实(Raw world facts)与经历事实(Experience facts);中间层是带有证据链的结构化“观察(Observations)”;顶层则是为高频提问专门生成的“心智模型(Mental Models)”。系统会优先查找心智模型,未命中再检索观察层,最后才下探至底层事实,使成熟的记忆库能直接回应周期性疑问,避免在每次调用时都从零聚合全部历史。
TEMPR 代表了 Hindsight 并行跑通的四大检索路由:语义相似度(Semantic similarity)、BM25 关键词检索、知识图谱关联网络(Graph connections)以及时序推理(Temporal reasoning)。唯一 ID 依赖关键词精准匹配,关联协作链路依靠图谱遍历,而诸如“上个月业务发生了哪些变化”等命题则必须依靠时序感知。这正是它拉开与普通向量封装库差距的核心所在。
官方的基准评测数据亮眼,但建议理性参考。Hindsight 公开的 BEAM 测试结果 显示:在 1,000 万 Token 的测试档位中,其得分达到 64.1%,而次名仅为 40.6%(官方称其优势达 58%);在 100 万和 50 万 Token 档位,其得分分别为 73.9% 与 71.1%。尽管榜单公开,但本文并未复现其实测环境,建议读者将其作为厂商宣传指标,在自有业务样本上重新组织 Eval。
最佳适用: 深度研报、大客户情报追踪、个人专属 Agent 以及对时间敏感度、矛盾推演与多层反思有极高要求的长周期系统。
核心亮点: TEMPR 四模融合检索,配合将原始事实沉淀为实证观察与心智模型的层级化递进架构。
定价方案: 开源自建版无授权软件费。Hindsight Cloud 按量付费(Pay-As-You-Go)标准:Retain 为 $10/MTok input,Recall 为 $0.75/MTok output,Reflect 为 $0.05/次调用,Retrieve Model 为 $0.25/MTok output,Refresh Model 为 $0.05/次调用,Iris 文件转换解析为 $7.50/MTok output,存留超过 30 天的冷数据收取 $0.25/MTok/month 存储费。支持购买 $10、$25、$50 或 $100 的额度包(亦支持 $5 至 $1,000 的自定义充值,1 credit = $1)。Enterprise 采用合同账单制并提供阶梯折扣。费率已于 2026 年 8 月 28 日在 Hindsight 计费页 确认。
免费试用: 开源自建完全免费;官方云计费页显示为纯 Pay-As-You-Go 模式,未设有时限免费试用。
- 语义、关键词、图谱与时序四合一检索,精准攻克各类死角缺陷。
- 观察机制与心智模型大幅消除了重复计算带来的算力浪费。
- 颗粒度极细的操作级计费,方便团队对写入、读取、反思及存储独立精细建账。
- 提供开源自建路径,为具备运维能力的企业保留了底层主权。
- Enterprise 档位提供企业级 SSO、强制 MFA、审计日志及事件流导出支持。
- 多维度的按操作计费模型远比一刀切的固定调用配额更难预测成本。
- Retain 操作单价高达 $10/MTok input,在海量摄入场景下账单极易激增。
- 超出 30 天后的长期存储费会转为持续固化成本,必须主动管理生命周期。
- 宣传中大幅领先的基准跑分属于官方口径,必须在团队私有数据场景下严谨验证。
2026 年 7 月 6 日的定价调整让网络上许多过往测评失效:Retain 资费已从每百万 Token $15 降至 $10;Reflect 与 Refresh Model 从按 Token 计费转为固定的 $0.05/次;同时新增了针对 30 天以上数据的 $0.25/MTok/month 存储计费线。这意味着直接照搬春季的成本模型计算当下的架构必将失真。
针对一个 1,000 万 Token 的历史语料库:首次 Retain 写入需 $100,宽限期后长期存储每月仅需 $2.50。100 次 Reflect 调用只需额外增加 $5。这表明在此计费体系下,后期归纳提炼的成本远低于初始注入成本,但高频重复重新摄入(Re-ingestion)将导致账单飞涨。务必在调用 Retain 之前在业务层做好去重与版本控制,切勿把记忆系统当作脏数据清洗池。
总结评价:当问题答案高度依赖时间推移和多层归纳时,Hindsight 庞杂的系统复杂度物有所值;但若你的 Bot 仅仅需要记住用户的称呼和交谈语气,它显然大材小用。 只有在 Eval 评测集确凿证明时序与反思机制能实质改善输出时才选它,不要仅仅被四模检索的理论光环所吸引。
4. Zep and Graphiti:受控时序知识图谱的最佳实践
对于追求企业级合规治理与时序知识图谱深度融合的团队,Zep 是首选的托管方案;而 Graphiti 则是愿意自行操刀整套外围架构的开发者的强大开源引擎。客户成功 Agent 能将企业组织的变动以带时间戳的事实形式凝固下来,精准废弃不再成立的事实,并在不破坏历史全貌的前提下检索全量关联脉络。Zep 在该图谱外层封装了用户体系、会话线程、日志追踪、访问鉴权策略、留存策略及云端弹性伸缩。其痛点在于数据接入采用独特的 Credit 换算计费,且首档托管商业版的门槛高达 $125/month。

官方的 Zep vs Graphiti 对比指南 清晰勾勒出了二者的功能边界。开源的 Graphiti 能够为每个主体构建专属的上下文图谱(Context Graph),可无缝挂接在 Neo4j、FalkorDB 或 Amazon Neptune 上运行。它原生支持双时间(Bi-temporal)事实建模,具备自动淘汰失效事实的能力,并有机融合了向量、全文与图拓扑检索。这套内核极为出色,但底层部署、多租户划分、指标监控、安全加固及性能调优均需业务团队全权自理。
托管版 Zep 则将 Graphiti 置于其专属的 Context Lake 内部运维,同时注入了专有的信息提取模型、观察层沉淀、排序优化、专用 Embedding、用户/线程专属存储、图谱可视化看板、调试日志与完整 API 审计日志。在安全合规维度,Zep 覆盖了针对人员团队的 RBAC、面向 Agent 执行维度的 ABAC、合规审计、自动留存策略、物理租户隔离以及用户自持密钥加密(BYOK)。部署模式支持公共云、BYOK 或面向 Enterprise 的 BYOC 私有云托管。Zep 宣称其具备支撑大规模流量、延迟低于 200ms 的智能检索表现;在自身拓扑和网络区域复现之前,建议仅将其视作厂商标称性能。
Zep 的计费基石是 Episode,它可以是一条对话、一段 JSON 负载或纯文本块。单个小于或等于 350 字节的 Episode 扣除 1 credit;之后每多出 350 字节(或不足 350 字节的零头)均需递增扣除 1 credit。接收一次 Webhook 消耗八分之一 credit。值得注意的是:日常检索、基础存储、线程维护、用户档案及图谱存储在当前计费模型下均完全免费(0 credit)。这意味着可变成本被高度集中在数据摄取(Ingestion)和写入处理阶段,而非读取端。
最佳适用: 需要精准把控事实演进、深度依赖实体拓扑关系且面临严苛合规审计的中大型 Agent 系统。
核心亮点: 具备明确“开源内核至企业级托管”升级路径的双时序知识图谱,辅以成熟的企业级权限治理体系。
定价方案: 免费版内含 10,000 credits/month、2 个项目、1 个 Memory MCP Server 席位及 5 个自定义实体/边类型,不支持额度结转与自动充值。Flex 档位为 $125/month,含 50,000 credits(额外增购 $25/10,000 credits),支持 30 天额度结转与 5 个项目。Flex Plus 档位为 $375/month,含 200,000 credits(额外增购 $75/40,000 credits),支持 60 天结转与 10 个项目。Enterprise 支持定制用量配额、SLA 承诺、无限项目、1 年日志保留,并开放公有云、BYOK 与 BYOC 部署。价格于 2026 年 8 月 28 日在 Zep 定价页 确认。
免费试用: 免费层每月提供 10,000 credits,但存在动态速率限制、处理优先级较低,且额度月底清零不可结转。
- 双时序(Bi-temporal)与自动废止机制高度适配瞬息万变的企业与客户动态数据。
- Graphiti 提供了货真价实的开源内核,绝非仅供导出的半成品玩具。
- 托管版 Zep 配套了完善的 RBAC、ABAC、行为审计、留存策略及租户物理隔离。
- 检索与图谱常驻存储不额外消耗 Credits,大幅降低读取端计费压力。
- 套餐间的经济分界点极为明确,可通过 Episode 字节大小与 Webhook 量精准推演。
- 351 字节的数据就会被直接判定为消耗 2 credits,Payload 结构的微小膨胀极易导致费用倍增。
- Flex 基础商业档起步价即达 $125/month,远高于大部分通用记忆 API。
- 免费版的执行性能和功能可用性容易受到全局服务负载的动态波动干扰。
- 官方宣称的高速排序与低延迟表现仍需在特定生产语料中单独压测。
进行成本核算时,必须从“字节数”而非单纯的“对话轮数”推演。Zep 官方测算模型给出了参考:15,000 条平均大小为 700 字节的 Episode 将消耗 30,000 credits,叠加 20,000 次 Webhook 消耗的 2,500 credits,单月合计 32,500 credits,完美落在 Flex 基础配额内。若业务端在可以用轻量事件解决的场景下无脑推送长篇冗余上下文,极易造成摄入 Credit 凭空翻倍,却对记忆质量毫无实质提升。
跨套餐的临界线发生在月预估消耗突破 150,000 credits 之际。Flex 基础费加上 10 次增购的总支出恰好等于 Flex Plus 的 $375,但后者直接覆盖了 200,000 credits。当达到 160,000 credits 时,Flex 方案将花费 $400,而 Flex Plus 保持 $375 的同时还留有 40,000 credits 的安全冗余。这是一个采购团队能够设立监控看板的明确量化阈值。
总结评价:Graphiti 属于希望彻底把控时序图谱的技术极客;Zep 属于需要对其施加企业级合规治理的正规军。 如果你的应用记忆绝大多数是扁平孤立的偏好和文本摘要,图谱架构与 $125 的起步底价纯属浪费;但若业务答案高度依赖随时间推移而演变的多维实体网络,且必须向审计员出示清晰的数据隔离与流转边界,Zep 的溢价物有所值。
5. Supermemory:多模态上下文与数据连接器集成的利器
对于需要打破对话流水、静态文档、用户画像与各业务 SaaS 连接器之间壁垒的 Agent,Supermemory 提供了绝佳的统一上下文底座。个人助理类 Agent 可借此直接摄取一段对话记录,将其关联至公司规范文档,并在日后精准召回相关事实片段与该用户动态演进的偏好画像。依托其针对 SM Token 的去重计量,未变更的内容在重复同步时不会被二次计费。其复杂之处在于:记忆即时写入、连接器支持、团队权限以及私有化控制等功能被打散在不同的套餐层级与操作用量费率中。

根据 Supermemory 快速上手文档,系统围绕单个 containerTag 构建了三大并行的检索产物:Document 检索返回基础的分块源片段(供标准 RAG 使用);Memory 检索负责在抽取的客观事实及其延伸的图拓扑边上进行穿梭;Profile 则提供一份稳定且融合了近期动态的浓缩画像,无需对底层全量语料发起搜索即可直接挂载。这种设计使得宿主应用能根据诉求,在事实论据、关联记忆与紧凑画像之间自如切换。
数据摄取属于异步模式。默认的“动态梦境(Dynamic dreaming)”模式会对关联文档进行自动批处理,以确保提炼出的记忆在全局语义上高度一致。如果将模式强制设为“即时(Instant)”,文档在建索引完毕后会立即完成记忆固化,但这需要针对单篇文档额外扣除一次 Operation 费用。Instant 适合环境搭建、系统调试或对即时可见性有硬性要求的场景;若在日常生产写入中全量开启,将引发不必要的调用账单膨胀。
租户设计的重中之重是保持 Tag 和 Key 的稳定。同一个 containerTag 必须贯穿用户的整个读写生命周期。Supermemory 提供的受限 API 密钥机制(Scoped API keys) 能将某个 Key 的权限死死锁定在特定容器内,完全屏蔽账单、全局设置或新增密钥等敏感权限。这对于下发给第三方 Agent 执行具有极高的安全价值,但宿主系统仍需负责安全处理好密钥的生成、轮换、作废与映射管理。
对于持续增量同步的工作流,其计费规则十分友好。SM Token 严格计量 Supermemory 实际解析并执行 Embedding 嵌入的“非重复 Token”。重新上传相同文件或持续同步无改动的内容,绝不重复计收这部分 Token 费用。记忆图谱的基础摄入费率为 $0.005/1,000 SM tokens,富文本为 $0.010/1,000;SuperRAG 纯文本检索为 $0.001/1,000 tokens,富文本为 $0.002/1,000;带图谱的联合搜索为 $0.005/1,000 查询,基础记忆操作为 $0.10/1,000 次。
最佳适用: 需要有机串联日常聊天记忆、本地文件、富媒体、多维用户 Profile 以及 SaaS 外部源的综合型 Agent。
核心亮点: 在单一租户作用域下并行提供三种检索形态,辅以去重 Token 计量机制与广泛的现成连接器生态。
定价方案: Free 档 $0/month,内含约 $5 综合用量。Pro 档 $19/month,内含约 $20 用量,提供无限存储与用户数、2 个协作者席位,并打通 Google Drive、Notion 及 OneDrive。Max 档 $100/month,内含约 $130 用量,新增 Gmail 与 Granola 连接器。Scale 档 $399/month,内含约 $600 用量,支持最高 10 名协作者、全部官方连接器(含 GitHub、S3 与 Web Crawler)、消费硬封顶保护、SOC 2、HIPAA BAA 及私有化部署。Enterprise 采用非公开定制,支持全物理隔离(Air-gapped)部署。用量费率如前所述。价格已于 2026 年 8 月 28 日在 Supermemory 定价页 核验。
免费试用: Free 套餐每月附赠约 $5 使用额度,无需绑定信用卡;符合条件的新创团队与科研人员可申请为期 3 个月的 Scale 档免费扶持。
- 对话、静态文档、关联图谱与用户动态 Profile 统一共享同一个上下文底座。
- 针对非重复 Token 的专属计量法则,彻底避免了重复同步无改动数据时的冗余扣费。
- 广泛覆盖个人与企业知识库的主流 SaaS 连接器生态。
- 容器级作用域密钥为在严格租户边界内委派 Agent 权限提供了强力工具。
- Scale 档支持设置消费硬顶与自建部署,Enterprise 更支持完全物理离线运行。
- 固定套餐月费与底层的精细用量计费需要建立双重模型进行预测。
- Instant 即时梦境模式会针对每一份文档产生额外的一次 Operation 扣费。
- Free 档额度耗尽后会直接挂起停机,而付费档在未设限情况下自动扣费可能带来失控风险。
- 部分关键企业级数据连接器与安全控制策略被锁定在昂贵的 Max 或 Scale 档位。
按照现行费率,1,000 万纯文本 SM Token 导入记忆图谱仅需 $50;富文本内容为 $100。与模型推理相比这看似微不足道,但若面对的是海量碎片化小记录且开启了 Instant 梦境模式,费用重心会瞬间向 Operation 操作线偏移。必须将 Token 总量与文档个数拆开核算——由 10 个大型文件构成的 100 万 Token,与切碎为 10,000 个独立事件的 100 万 Token,在财务模型上完全不可同日而语。
订阅所包含的信用额度每月刷新重置,额外单独购买的充值额度则永久有效不会过期。免费版额度用尽即暂停,付费版支持自动充值,而 Scale 档位提供了硬性花费封顶(Spend caps)。因此,最稳妥的生产配置是:为更新内容维护固定的 customId、对常规流水采用默认的 Dynamic 模式、仅在时效敏感链路上开启 Instant,并在开启自动充值前死死卡紧配额上限。
总结评价:Supermemory 是广泛多模态上下文接入的高手,而非形态极简的单一记忆 API。 当富文本、第三方应用数据同步、多维 Profile 及免重复扣费是你的业务刚需时,选它绝不会错;若系统处理的仅是短小纯文本,且更容易被小型专注的 API 或既有关系数据库消化,引入它只会平添复杂性。
6. Cognee:面向 BYOC 架构的开源知识引擎之选
对于希望将记忆体系横跨沉淀在知识图谱、向量数据库与关系型存储中的团队,Cognee 是表现极佳的开源知识引擎。学术科研或内网分析 Agent 能利用它解析输入文档、抽取本体架构(Ontology)、淘汰清洗过时关系,并通过图谱或词法混合路径检索出保留严密溯源论据的答案。其内嵌的文件存储让本地原型的验证极其轻快。但这也带来了一定的架构复杂度:一套完整的知识引擎所涉及的数据模型规范、推理模型选择、多底层数据库维护与评测考量,远多于普通轻量偏好记忆系统。

Cognee 的记忆处理管线被明确划分为四大阶段:add 负责源数据接入;cognify 执行包含文档分类、权限检验、分块提取、模型辅助抽取实体与关系、生成摘要、生成 Embedding 并向图拓扑提交边关系等六步核心流程;memify 负责剔除孤立与失效节点、强化高频关联路径、重新平衡边权重,并沉淀高阶衍生事实(Derived facts);search 则穿透这套精细组织的数据结构执行精准抓取。
这套存储栈印证了其作为“知识引擎”的技术深度。Cognee 将图数据库、向量数据库与关系数据库熔于一炉。本地环境默认采用基于文件的轻量方案:Kuzu、LanceDB 与 SQLite,使得开发者在一台笔记本上无需拉起复杂的容器集群就能跑通原型;而在生产级规模下,文档明确支持切换至 Neo4j、FalkorDB、Neptune、Qdrant、pgvector、Redis、DuckDB、Pinecone、ChromaDB 及 PostgreSQL。
系统内建了多达 14 种检索模式,全面覆盖图补全(Graph completion)、原始切片、词法匹配、文本摘要、时序定位、原生 Cypher 查询、面向代码的逻辑规则,乃至自动分流选择器。这种丰富性为同一知识库应对不同提问场景提供了极大便利,但也带来了沉重的评测包袱:工程团队必须清晰掌握哪种检索路由能在特定问题上给出最高保真的答案,绝不可盲目迷信内置的“自动模式”永远最优。
多租户控制横跨 pgvector、Neo4j、Kuzu 及 LanceDB 得以实现。这种深度的底层支持至关重要,因为数据隔离经常会在 Agent 逻辑层以下穿透失效:哪怕 Prompt 里声明的用户 ID 毫无破绽,一旦底层搜索发起时未对共用的图谱施加范围约束,数据越权便不可避免。针对隔离性的测试必须覆盖每一种所选后端的写入、读取、物理删除以及衍生事实生成环节。
最佳适用: 正在构建特定行业垂直知识引擎、必须落地 BYOC(自持云设施),或需要将形式化本体(Ontologies)与 Agent 持久记忆深度结合的团队。
核心亮点: 严格遵循 add、cognify、memify、search 全生命周期闭环,底层穿透图谱、向量与关系多模态存储。
定价方案: 托管 Free 档 $0/month,含 100 万 tokens、1 个工作区、不限用户数及 API 访问,免绑信用卡。Standard 档按处理量计费,每 100 万处理 Token 计费 $2.50,每个额外工作区加收 $5/month,提供 Slack、Notion、Linear 及 Google Drive 官方连接器。Enterprise 价格非公开,采用 BYOC 深度交付模式,划分为 Startup、6 个月、12 个月及 24 个月周期,部署在客户自有云端,配备专属架构支持与商业 SLA。开源版本自建部署完全免除软件许可费。数据已于 2026 年 8 月 28 日在 Cognee 定价页 核实。
免费试用: 托管 Free 档永久免费无需绑定信用卡;开源核心引擎支持本地无限期部署调试。
- 本地基于文件的轻量默认存储,将初期搭建全套架构的门槛压到最低。
- 图、向量、关系三维一体,原生赋能拓扑感知与血缘可溯的记忆网络。
- memify 机制使记忆维护与高阶事实推演成为系统中显式的标准生命周期。
- 14 种检索路由能从容适配差异极大的查询模式。
- 开源与企业级 BYOC 部署路径为数据隐私边界提供了绝对的物理掌控力。
- 若仅仅用于保存少许用户偏好或简单的对话总结,该架构过度设计且极其沉重。
- 庞杂的检索模式对团队的数据评估与参数调优提出了极高的工程门槛。
- Standard 模式下增设工作区会直接产生固定的月度叠加成本。
- Enterprise 完全属于定制级大客户交付,缺少公开透明的自助式购买入口。
在中等 Token 吞吐下,其云端处理账单非常诱人。在 Standard 档位下处理 1,000 万 Token 仅需 $25;若额外挂载 3 个独立工作空间,追加 $15,单月账单模型仅为 $40。但这绝不包含调用大模型本身的 Token 开销、工程人员工时或私有化基础设施本身的算力开销。切勿将 Cognee 极低的 Token 费率等同于系统的全部拥有成本(TCO)。
最佳的选型契机是遇到“本体驱动”的业务场景。如果你的 Agent 需要反复回答诸如“哪家供应商的停产会牵连哪些终端产品,且有哪些现行履约条款发生过变更”等典型的多跳(Multi-hop)复杂命题,Cognee 的结构化深度能彻底消化这套复杂度;但若每次记忆提取仅靠用户 ID 拉取一段平铺直叙的偏好,Mem0 或自研的轻量持久库能让你更快看到成效。
总结评价:Cognee 是为立志梳理知识秩序的团队打造的记忆引擎,而非仅仅记录闲聊记录的工具。 当图谱架构与严格的数据驻留边界是不可妥协的刚性要求时,选它;如果寻找“开源”只是为了省掉 $19 的托管月费,且团队中根本无人愿意长线接盘这套底座,请果断放弃。
7. Claude Managed Agents 记忆存储:极简可审计的文件原生方案
当你的 Agent 已经在 Anthropic 的托管 Agent 运行时中流转,且希望业务持久化状态以小体积、人类可读、具备严格版本控制的文件形式呈现时,Claude Managed Agents memory stores 是最契合的选型。财务合规 Agent 可以挂载一个只读的全局规章存储区,同时搭配一个可读写的专属项目存储区,既能随时增补决策备忘录,又能留下绝对不可篡改的版本变更链。这种基于文件系统的模式极其自然,Agent 使用常规 Bash 与文件工具即可检索操作,宿主系统也能方便地在带外发起全量审计。其制约在于:该功能尚处于公开公测(Public beta)阶段,单文件体积上限极其严苛,且官方尚未公布独立的存储计费明细。

Managed Agents 的会话生命周期在默认情况下完全是短暂易失的(Ephemeral)。而 Memory store(记忆存储) 则是限定在 Workspace 作用域内、可跨越会话持久驻留的文本文件集合。当通过 Session 资源将其注入挂载后,它会在环境中的 /mnt/memory/<store-name>/ 路径下呈现。Agent 可以直接沿用标准的读取、写入、编辑、正则搜索及 Shell 命令行工具,无需调用任何专有的记忆 API 算子。
这本质上是一套强持久的工作文档,而非全自动的认知语义记忆。宿主系统可以预先在存储区中灌入企业行为准则或特定项目背景;单个会话既能以只读也能以读写模式完成挂载;会话中发生的所有写入动作都会被实时落盘至存储区;更为关键的是,每一次状态突变都会自动沉淀为一个带有操作记录的不可变版本(Immutable version),从而完美支持全流程审计、任意时间点回滚以及合规脱敏擦除;同时,系统提供的乐观并发控制机制能有效避免多个并发写入者相互覆盖更新。
各项物理约束直接决定了架构的设计形态:单个记忆文档的体积被严格限制在 100KB 以内;单个 Session 最多同时挂载 8 个独立 Stores,且 Stores 只能在会话初始化建立的瞬间静态绑定;归档(Archiving)操作是绝对不可逆的——一旦归档,该 Store 将被永久置为只读,禁止挂载至任何新建的会话中(尽管存量会话的连接不受影响),且系统不支持解除归档。这些边界迫使开发者必须采用高度模块化、小体积、专用的小型文件集合,而非丢入一整个庞大的记忆文件。
官方的技术安全警告十分严厉且极具参考价值:严禁将访问凭证、API 密钥或鉴权 Token 写入记忆存储区。因为落盘的内容会在后续任何重新挂载该存储的会话中原原本本地被输出读取。Anthropic 明确要求开发者采用环境变量形式的保险库来注入凭据。一旦不慎有密钥混入记忆,仅仅在当前最新版本中执行文件删除是徒劳的,必须对该文件关联的所有不可变历史版本执行深度 Redact 擦除。
最佳适用: 基于 Anthropic 托管 Agent 体系构建,需要跨会话维护极度透明、带完整审计链路的项目、规章或用户文档的应用。
核心亮点: 直观的人类可读文件系统挂载,附带原生不可变版本追踪、时间点回滚、敏感擦除及只读/读写权限隔离。
定价方案: 查验的公开 Beta 文档中,Anthropic 尚未公布独立的记忆存储资费。计费直接挂钩常规的模型调用与运行时资源消耗。Claude Sonnet 5 费率为 Input $2/MTok、Output $10/MTok;Claude Opus 4.8 费率为 Input $5/MTok、Output $25/MTok。价格已于 2026 年 8 月 28 日从 Anthropic 官方 Sonnet 5 发布声明 核实。
免费试用: 该特性在 managed-agents-2026-04-01 请求头下处于 Public beta 公测阶段;官方尚未公布单独的存储免费额度或限时试用通道。
- 纯文本文件形态对人类工程师和 AI Agent 均具备无可比拟的直观透明度与可读性。
- 原生不可变版本链条天然满足最严苛的企业级审计、版本回滚与靶向合规擦除。
- 读写分离的挂载机制,从物理上隔绝了公共参考记忆被特定业务 Agent 污染的风险。
- Workspace 级记忆持久长青,而 Agent 自身的系统配置可独立实施版本迭代。
- 基于标准的底层文件工具交互,彻底摆脱对专有私有记忆算子的技术绑定。
- 仍处于 Public beta 阶段且需显式依赖 Beta Header,面临潜在的接口更迭风险。
- 单文件 100KB 及每会话最多 8 个 Store 的严格物理配额,对文档切分提出极高要求。
- 存储必须在会话创建阶段强行绑定,无法在运行时依据对话走向动态热插拔。
- 不属于全自动的内容抽取、关系图谱提炼或语义聚合型记忆服务。
- 缺乏独立的存储定价披露,导致大规模落地时的全局持有成本透明度不足。
该方案的成本收益并非来自“免费的存储”,而是源于对文件的按需精准抓取。按照 Sonnet 5 的公开费率,若在 100 次会话中无脑全量重发 100,000 Token 的上下文,将产生 1,000 万 Input Token,在没有缓存优化的情况下成本即达 $20。通过挂载 Store,Agent 可以自主通过 Grep 仅读取最相关的一篇小笔记;但若业务指令写得不够克制,诱导 Agent 在开局盲目把目录下所有文件全部打开,成本优势将荡然无存。务必在典型的业务测试集中精确剖析 Agent 的实际读文件行为。
在系统架构中,必须将 Agent 实例与记忆存储严格解耦。Anthropic 官方技术总览 指出:带版本标记的 Agent 配置只需创建一次即可跨会话复用,而存储区沉淀的是动态演进的学习或项目状态。修改 System Prompt 应当产出一个全新的 Agent 版本;而修正客户的业务事实则应当直接修改存储中的记忆文件。这种泾渭分明的解耦让所有性能回退与数据纠错均有据可查。
总结评价:Claude memory stores 是一套极其优秀的、受控的工作文件持久系统,但它绝非开箱即用的自动化认知记忆系统。 当透明可审计性和纯正的文件系统交互能带来降维打击时,选它;一旦记忆库的体量膨胀到仅凭文件遍历和普通正则搜索无法驾驭的阶段,请在前端为其接入专门的语义抽取与检索层。
8. Letta:为编程 Agent 而生的跨模型可移植记忆方案
当业务诉求是让代码 Agent 的记忆、工作习惯与人格资产跨越底层模型的变迁而长期存续时,Letta 是最佳选择。负责代码库的 Agent 能够从当前仓库背景以及过往的 Claude Code 或 Codex 会话中直接初始化记忆,在工作推进中动态提炼经验,并在日后无缝切换底层驱动模型而不丢失既有身份。其全新技术演化完全倒向了开放、中立且面向文件的原生路径。但其当前面临的隐患在于转型震荡期:Letta 正在大刀阔斧地淘汰多项陈旧的服务端记忆模式,这导致网络上的旧版教程与集成方案极易失效。

根据 Letta Code 应用发布声明,系统既可以空白启动,也能在终端输入 /init 直接完成记忆冷启动,将当前代码工程上下文及以往零散的编码会话直接熔炼为初始记忆。后台的记忆子 Agent(Subagents)会定期复盘历史会话、重写上下文并精炼关键记忆;而 /doctor 指令则负责对日积月累产生的信息冗余进行重构清理。这些主动维护能力至关重要,因为缺乏修剪机制的记忆系统,最终只会不可逆地退化为一个又臭又长且充斥着噪音的低效 Prompt。
高度的可移植性是该产品的立足之本。Letta 将 Agent 的记忆与身份资产同底层模型供应商彻底解耦,用户甚至可以在单次会话进行中随时热切换底层推理模型,而上下文、记忆与特定人格设定丝毫不受干扰。该客户端支持接入用户自持的 API Key 或受支持的 Coding 订阅套餐;其客户端已完整适配 macOS、Windows 及 Linux,让其成为一款触手可及的本地生产力利器,而非仅仅停留在纸面概念的 SDK。
理解其当下的技术范式演进比纠结于其早期的架构记忆要重要得多。在 Letta 的下一阶段技术战略宣言 中,记忆体系正从以往专有的数据库读写工具,全面转向基于 Git 版本控制的上下文仓库文件(名为 MemFS);通用的文件系统命令行正在全面接替陈旧的服务端专有记忆指令;客户端的 Skills 与子 Agent 机制也在逐步废除过去的硬编码服务端逻辑。这使得整套记忆系统更加透明、可审计且利于迁移,但也必然带来老版本系统的迁移重构成本。
Letta 官方明确指出:旧版服务端记忆工具已被标记废弃并逐步下线,早期模板系统与初代文件系统原计划于 2026 年 4 月中旬彻底弃用。生产级评测必须严格基于当前全新的 Code 架构与上下文仓库规范开展,切忌直接套用过往依赖 core_memory_replace 或服务端后台睡眠 Agent 的过时范例。哪怕终极技术构想再美妙,这场重构阵痛依然是架构选型时必须权衡的负面因素。
最佳适用: 需要让技术知识沉淀、代码规范、独特人格与历史经验跨越模型更迭而长久存续的开发与编程 Agent。
核心亮点: 基于 Git 版本管理的上下文仓库,搭配内建的记忆子 Agent、/init 和 /doctor 维护工具,封装在高度模型中立的 Agent 框架内。
定价方案: Letta Code 客户端允许免费起步,支持直连自备的模型 API Key 或特定编程套餐;底层模型推理费用与私有部署算力开销需自理。于 2026 年 8 月 28 日核验其官方定价链接时显示为 404,因此目前无法发布任何受官方背书的托管云套餐费率。根据其官方技术文档,官方提供了 Letta Cloud 托管通道以及可完全自主掌控的开源 App Server 本地运行时。
免费试用: 客户端与开源运行时完全免费开放;由于官方定价页异常,此处不作任何限时云端商业试用的背书。
- 记忆底座与 Agent 身份完全独立于具体的大模型供应商,彻底摆脱单一模型锁定。
- /init 能够基于现有代码工程与过往零散编程会话一键完成记忆初始化。
- 专业的记忆子 Agent 与 /doctor 维护指令让记忆的生命周期清洗成为标准化流程。
- 基于 Git 追踪的文件系统直观可审、高度便携,天生契合开发者的工作流直觉。
- 桌面客户端全面横跨 macOS、Windows 和 Linux,开箱即用。
- 整体架构正处于淘汰陈旧服务端特性的剧烈重构期,技术迭代动荡。
- 核验定价链接返回 404,导致其云端托管服务的商业定价缺乏公开透明度。
- “应用免费”不等于零成本,自带模型 API 的计费与云端算力消耗依然需要自行买单。
- 深度垂直于编程代码场景,在通用多租户商业 SaaS 的记忆场景下适配度不及竞品。
当团队对“模型自主选择权”极其看重时,选用 Letta 的经济账才最划算。若研发团队每季度都会换用最新的顶尖模型,保留单一 Agent 积累的团队开发习惯、系统拓扑图及历史排错教训能避免无休止的重新调教;但若企业早已标准化接入了某一商业 Agent 大厂,需要的是严苛的多租户数据隔离 API,那么这种可移植性的吸引力显然比不上 Mem0 的应用集成模式或 Claude 的工作空间控制。
对待上下文仓库应当像对待生产环境代码一样敬畏:审查每一次 Diff 变更、死守敏感信息底线、指派专人裁决有争议的事实修正,并清晰界定哪些核心文件允许 Agent 自主重写。Git 的历史虽然记录了完备的痕迹,但它无法凭空变出知情同意合规、自动留存与多租户隔离策略。一个缺少明确删除机制的可移植记忆库,同样是企业数据安全的潜在定时炸弹。
总结评价:若想构建一个能从容对抗大模型迭代洗牌的代码 Agent,Letta 是最令人信服的记忆架构;但由于正处于战略转型期,保持对官方版本规划的高度敏锐是选型的必修课。 请务必拥抱全新的文件原生路径,坚决远离任何依赖已被官方判处死刑的旧版服务端特性的设计方案。
9. LangMem:面向 LangGraph 架构的库优先原生记忆组件
对于基于 LangGraph 构建 Agent 且希望全权把控记忆流转策略而非采购第三方托管黑盒的团队,LangMem 是最优雅的以开发库优先的方案。Agent 可以在活跃交互中即时读取与写入瞬时记忆,而后由后台管理器异步提取、归纳并整合为长效知识。其内核与底层存储彻底解耦,能无缝对接 LangGraph 现有的 Store 基础设施。然而,一个极其隐蔽的技术陷阱在于:官方极简入门 Demo 中使用的内存级 Store 在系统重启后数据会彻底灰飞烟灭,构建具备工业级持久度的生产级系统,仍需自主补齐持久化数据库与严密的运维规范。

LangMem 官方仓库 交付的是高度可组合的底层功能原语,而非封装完备的开箱即用型托管云。在实时调用链路(Hot path)上,它提供了专业工具让 Agent 在交谈中自行决策何时记录或检索记忆;在后台链路上,异步管理器负责从对话中抽离核心事实、合并重复节点、更新既有认知,甚至反哺优化系统 Prompt。该库天然支持与 LangGraph 原生 Store 及各类主流存储介质结合。
灵活性是拥抱它的首要动机。工程团队可以随心所欲地为用户事实定义语义记忆(Semantic memory)、为交互轨迹定义情境记忆(Episodic memory),并通过 Prompt 或运行策略的演进沉淀程序性记忆(Procedural memory),全然无需迁就第三方厂商僵化的预设字段结构。同时,它还能优雅地将繁重的记忆提取剥离出延迟敏感的对话主链路。其代价则是团队必须亲自解决数据 Schema 演进、模型调用损耗、检索调优、异步合并定时调度、质量评测、底层存储维保以及合规物理删除等一系列重型脏活。
在官方示例中赫然标注着严肃的生产级警示:InMemoryStore 仅将数据保存在内存进程中,一旦进程崩溃或重启所有数据归零。文档明确建议在生产环境切换为 AsyncPostgresStore 或等效的外部持久化存储组件。一个在单一进程生命周期内通过两次调用展示“记住了上文”的 Demo,根本不代表通过了跨会话持久性考验。必须在验收测试中显式加入杀掉进程并重新拉起的严苛测试用例。
最佳适用: 采用 LangGraph 栈作为核心运行时,对定制化记忆行为有极致要求,且已拥有完备数据库基础设施与评测闭环的团队。
核心亮点: 严格解耦的热路径瞬时记忆工具与后台异步提取/归纳流程,能完美嵌入任何兼容的底层持久化存储介质。
定价方案: LangMem 软件本身采用 MIT 开源协议,永久免费。可选的 LangSmith 开发者版为 $0/seat/month(含 1 个席位与 5,000 条基础追踪额度,超出按量计费);Plus 档位为 $39/seat/month(支持无限购买席位,含 10,000 条基础追踪额度与 1 个小型 Serverless 部署,超出按量计费);Enterprise 采用私有定制,支持私有化与混合部署。LangSmith 超额计量标准为 $1.50/LCU 与 $1.00/LSU。价格已于 2026 年 8 月 28 日在 LangChain 定价页 核验。
免费试用: 核心库完全开源免费;可选的配套 LangSmith 平台提供永久免费的 $0 开发者套餐,而非限时试用。
- 与 LangGraph 生态深度共生,能无缝插拔兼容的各类底层存储介质。
- 将热路径即时响应与冷路径异步提炼清晰解耦,兼顾端到端交互延迟。
- 团队对数据 Schema、实体提取、Prompt 模板及持久化生命周期拥有绝对控制权。
- 宽松友好的 MIT 开源协议,没有任何软件许可采购成本。
- 可无缝接入 LangSmith 获得全套链路追踪与托管部署能力,且该配套并非强制绑定。
- 入门 Demo 中的 InMemoryStore 重启即丢数据,绝不可直接当作生产级持久化方案。
- 完全没有开箱即用的多租户控制、合规删除机制或全托管合并运维服务。
- 背后的大模型处理费、数据库算力、部署网络及全局监控开销完全脱离于该免费库之外。
- 可选的配套设施 LangSmith Plus 基础月费即达 $39/seat,5 人团队起步成本已达 $195/month。
唯有当团队早已构建起完备的外围支撑能力时,LangMem 才是最省钱的方案。该开源包的直接采购费确实是 $0,但一个高可用的 Postgres 集群、数据库迁移演化工具、后台异步任务调度器、提取调用的模型 Token 消耗、链路 Tracing 监控以及应对故障的 On-call 研发人力成本,每一项都需要真金白银的支出。务必将这部分人力物力与直接购买 Mem0 Starter 或 Pro 进行客观横向对比。一个 5 人团队哪怕仅仅配置基础的 LangSmith Plus 辅助排错,在未计入实际计算、存储与模型消耗前,每月的起步固定开销就已达 $195。
该库天生适合与那些既需要回顾历史经验、又必须紧跟外部实时客观动态的复杂 Agent 配合。LangMem 能够精准锁死过往的决策定论,但诸如实时的商品报价、政策法规、航班时刻与外部突发事件,则必须交由外部检索层提供支撑(详见这篇面向自主 Agent 的 2026 顶尖 AI 搜索 API 选型指南)。记忆负责调取上次的决策推演及其预设前提,搜索 API 则负责校验现实世界的这些前提如今是否依然成立。
总结评价:LangMem 交付的是一组极为锋利、可高度编排的底层记忆原语,而非帮你大包大揽运维脏活的交钥匙工程。 如果“极致定制”是你的系统底色,且 LangGraph 早已是不可撼动的技术底座,果断用它;但若团队只是想要一个省心稳定的服务级结果,却误把单进程内存 Demo 当成了生产级持久化方案,你很快会迎来架构反噬。
场景选型决策指南
最快速的决策往往取决于你的业务流程边界,而非死扣各个维度的抽象评分。
纯工作区知识类岗位:果断选 Perplexity Brain
当你的分析师、初创创始人或客户策略团队早已日常在 Perplexity Computer 中处理工作,且工作本身就是在重复推进相同的项目时,请直接配置 Brain。它能瞬间免去团队手动重复灌输背景与查找历史资料的无谓内耗,免除了底层架构研发工作。但只要你的核心场景是给自有商业应用增加持久记忆能力、数据流转需要跨越特定厂商边界,或必须向外暴露标准 API 时,请立刻转向其他方案。
通用商业应用自研默认:首推 Mem0
当你在自研一套 SaaS 或企业内网应用,需要对每个独立用户、每个特定 Agent 实例实施严密的数据隔离,且产品研发团队希望保留“初期托管快捷验证,后期必要时可平滑退回自建私有化”的退路时,Mem0 是无可争议的默认首选。在时序因果推理、企业级复杂图谱、多源外部连接器同步或基于文件的原生审计成为压倒性刚需之前,它始终是最佳选择。唯一需要密切盯防的是从 $19 跃升至 $249 的价格分水岭,务必确保托管独占的高级特性切实跑出了业务增量。
强依赖时间线变迁与深度反思:选择 Hindsight
对于横跨漫长周期、专有名词高度特定、实体网状交织、事实随时间高频反转且严重依赖高阶规律提炼的深度业务场景,请使用 Hindsight。如果严格的代表性评测数据集明确暴露出普通的语义向量召回频频漏掉发生变动的事实,或是无法有效归纳模式时,它是强有力的破局者。相反,若业务根本用不上高阶 Reflect 抽象推演,它带来的决策优化不足以抵扣 Retain 写入与长期留存的成本模型时,请迅速回归 Mem0 或更小巧的存储系统。
强监管受控时序图谱:选 Zep 与 Graphiti
当你渴望完全自持并掌控复杂的双时序图谱引擎时,选 Graphiti;当你身处严苛合规要求下,RBAC、ABAC、行为审计、自动化留存策略、租户物理隔离与多云部署是硬性指标时,选 Zep。从财务模型上看,一旦月度预估消耗稳定跨越 150,000 credits 门槛,Zep Flex Plus 将在经济性上彻底超越频繁加购的 Flex。但若业务记忆的核心诉求并非网状实体,轻量的扁平偏好根本无需复杂的时序关系图谱来表达,请果断避开它。
复杂多模态及外部 SaaS 上下文整合:选 Supermemory
当你的记忆语料库由日常聊天、本地静态文件、富媒体图片、多维用户画像以及同步的第三方 SaaS 数据杂糅而成时,Supermemory 是首选。针对未变更内容免重复计费的 SM Token 计量方式,对于高频增量数据同步场景具有极高的性价比。但如果你的文件吞吐量极大,碎片文档与 Instant 即时写入机制带来的额外操作用量开销,反倒超过了多模态聚合带来的收益,请及时回归功能更聚焦的狭义记忆 API。
业务本身即以“本体架构”为核心:选 Cognee
当实体拓扑关系、严格的论据血缘追溯、BYOC 客户自持云架构与多样化的多模态检索是系统的核心卖点时,请选 Cognee。它专为具备强大工程实力、能够独立把控图数据库与关系数据库协同演进的成熟技术团队量身打造。若你的研发组织根本没有设立专人来对数据本体的演进、检索精度的评测及底层混合数据库进行长效运维,请及时抽身,拥抱托管记忆 API。
要求绝对可审计的人类可读文件:选 Claude 记忆存储
如果业务场景运行在 Anthropic 托管 Agent 体系内,且希望系统学习到的持久化状态全部沉淀为带有完整版本控制、支持读写权限切分、具备任意历史回滚与敏感数据擦除能力的人类可读纯文本时,请采用 Claude Managed Agents memory stores。一旦文档规模膨胀至常规文件系统遍历与文本搜索无法高效处理的量级,且实体间充斥着错综复杂的关系需要分析时,请适时在其上层引入语义记忆服务。
要求在模型洗牌中保持独立身份的编程 Agent:选 Letta
当你的核心诉求是让 Agent 在一个或多个代码工程中习得的规范认知、项目拓扑底牌、行为风格与会话经验能够毫发无伤地跨越底层基础大模型的更迭时,选 Letta。但若企业早已全面锁定了某一大型商业化托管生态,将标准化的多租户隔离接口置于首位,或者团队根本无力跟进 Letta 当前剧烈的底层技术范式大迁徙,请果断剔除该选项。
LangGraph 架构下的极客定制派:选 LangMem
当团队的技术栈早已在 LangGraph 生态扎根,渴望从零由己方工程师严谨定义每一种记忆的存留形态、写入策略、抽取合并逻辑及底层数据库选型时,选 LangMem。如果这种完全自主的技术探索对于你的产品核心竞争力并无实质加成,反而沦为转嫁给研发团队的沉重附带运维枷锁,请直接采购成熟的标准化商业服务。
全局选型的决策准则其实非常简明:当采购商业服务的月度溢价低于团队长期自行兜底记忆基础设施运维与合规风险所需的工程人力成本时,托管方案必胜;当数据驻留物理边界、全流程透明审计或底层记忆特异性逻辑不可妥协时,自建与开源方案必胜。 永远不要把纠错成本从账单中抹除——一个检索费率看似极其廉价,但每周都要研发人员为每个客户擦屁股排查一小时脏数据的系统,注定是全场总拥有成本最高的灾难之选。
必须坚决避开的陷阱
不要因为看到宣传材料中写着“Memory”就冲动采购,必须严格施加持久性真实度测试:一套合格的系统必须在经历一次全新的会话开启或底层进程意外崩毁重启后毫发无伤地留存数据,能根据上下文完成选择性精准回溯,接受人工直接干预修正,并在法定的租户边界内严格支持物理彻底删除。以下是最容易在上述测试中当场翻车的几大典型大坑。
将 LangGraph 的 InMemoryStore 直接丢进生产环境
InMemoryStore 仅用于 LangMem 编写教学示例或在本地执行极简单元调试。LangMem 官方技术文档明确提示其内部存储在进程重启后瞬间化为乌有。切勿将其实施在任何需要真实持久留存的生产环境中,哪怕它在本地单次交互中看似能流畅答出上文。必须配置类似 AsyncPostgresStore 等由实体数据库承托的持久化层,并在验收测试中强制模拟杀掉底层进程。
把 Pinecone、Qdrant 等向量数据库吹嘘成完整的“记忆系统”
它们是极其出色的底层存储与相似度检索基石,但严禁盲目声称“接入了 Embedding 就等于给 Agent 搞定了记忆”。一套工业级的完备记忆系统,必须在此之上补齐事实抽取、时间有效性推演、逻辑矛盾消解、多租户强隔离、动态纠错介入、事实来源追溯、冷热数据留存以及彻底的物理删除机制。你可以选择在向量库外层亲手把这些层级一行行码出来,或者直接采购原生具备这些机制的现成系统。
把 Perplexity Brain 硬塞进多租户可移植的商业 SaaS 中
Brain 在 Computer 内部的表现极其抢眼,但它绝不是为你自家 SaaS 产品充当记忆底座的通用组件。它缺少面向外部业务的租户密钥体系、灵活的模型路由逻辑与策略导出接口。席位费采购的是一个高度封闭且集成的端到端脑力工作空间,千万不要赶鸭子上架,逼着一个即用型的免开发工作区去承担底层开发者平台的硬核职责。
无人负责运维就盲目私有化自建 Graphiti
Graphiti 确实赋予了企业掌控先进时序知识图谱内核的自由,但它丝毫不会免除你搭建图存储集群、调优查询索引、监控系统负载、加固网络防护、横向弹性扩容以及持续评估检索召回精度的沉重技术负担。若团队内部根本没有专职的资深工程师对整套服务的可用性全权负责,千万不要仅仅为了逃避 Zep Flex 档位 $125 的月费而盲目选择自建。
照搬网络上早已过时的 Letta 服务端记忆旧教程
坚决远离任何围绕 core_memory_replace、初代虚拟文件系统机制或服务端异步睡眠 Agent 等已被判死刑的技术展开的架构设计。Letta 官方已通过技术博客清晰宣布了对这些旧特性的弃用与下线计划。所有新的架构评估,必须无条件建立在 Letta Code、基于 Git 的上下文仓库(MemFS)、通用文件系统工具以及官方最新的 SDK 规范之上。
引入没有任何纠错与物理删除治理责任人的记忆系统
哪怕一个系统底层技术再先进,只要没有明确的人类角色对垃圾记忆的清理负责,系统早晚会彻底崩塌。未经管制的自动化合并机制,极易把某一次微小的幻觉或错误事实强化归纳为看似坚不可摧的高维心智模型。在全量铺开之前,必须在业务规章中落实:究竟由谁来审计来源出处、谁有权订正扭曲事实、谁负责对误入的敏感机密执行脱敏擦除、谁来执行注销租户的物理清除,并负责验证所有下游派生副本是否彻底消亡。若某家厂商在底层技术上完全无法配合上述全生命周期操作,在核心业务链路上请坚决将其一票否决。
下周一的落地行动指南
周一上班后,切忌冲动地试图在一天之内把整座企业知识库囫囵吞枣地强推上马。挑选一个对历史背景有明确强依赖的高复频业务节点作为试点——例如每周一生成的大客户周报备忘、跨日接续的技术代码重构,或是严格贯彻某位重要客户既定偏好的自动化运营管线。
- 白纸黑字拟定记忆契约。 严格界定仅允许系统持久化记录哪一类事实数据,清晰定义其挂载的租户键、来源标定规则、失效过期机制,以及绝对严禁记录的涉密红线。将机密安全阻绝于系统之外。
- 搭建旁路影子系统(Shadow path)。 让当前线上的旧 Agent 照常应答,选中的候选记忆系统在旁路并行执行记忆召回。持久化记录其召回的上下文碎片及最终输出,严禁在初期盲目干预生产环境的决策逻辑。
- 针对性编写 20 个历史上下文尖刀用例。 用例必须刻意包含事实被动态颠覆的场景、精确字符串匹配、新旧决策矛盾冲突、用户发起物理遗忘诉求,以及一道故意埋入的错误干扰事实。任何通用的行业基准 Benchmark 都无法取代这套业务评测。
- 紧盯并度量四大核心业务结果。 全程量化追踪:回答事实正确率(Correctness)、底层消耗的 Token 或 Credits 额度、人工重复铺垫背景所耗费的工时,以及后期的人工纠错率。可以将接口响应延迟纳入监控,但绝不可为了追求毫秒级响应而向错误的答案低头。
- 在极端边界下全流程演练数据生命周期。 彻底杀掉底层服务进程模拟崩毁重启、开启全新独立会话、在线修改某条底层源事实、强制作废吊销某个测试租户、执行物理行删除,并严格查验是否有失效过期的陈旧拷贝依然在下游以僵尸状态被召回。
- 基于稳态模型反推真实财务总账。 严格套用选定厂商的底层物理计费仪表,带入单月预估的写入量、检索频次、长期存储留存周期、额外操作数、席位规模以及预期的业务膨胀率。若选择开源路线,务必把负责长期维护的工程师工时薪酬作为显性成本计入。
- 提前锚定明确的套餐升级阈值。 提前在技术管理规范中写明:究竟是在何种用量瓶颈、合规管控要求或检索准确率门槛被触发时,系统才被允许升级至下一档昂贵套餐,或是向另一种架构范式迁徙。
对于 Mem0,这个阈值可能是当图谱记忆、Dream 异步合并机制或高并发写入配额能够切实消化每月多出的 $230 溢价时,由 Starter 果断跳升至 Pro;对于 Zep,这个阈值是月度预估额度稳定突破 150,000 credits、Flex Plus 显露出绝对成本优势的物理分界线;对于 Perplexity,这个阈值是日常高频的 Computer 任务能否真正换回 $200 或 $325 席位月费的工时价值;而对于 LangMem,这个阈值则是团队内部是否真正下定决心全权自持数据库集群与记忆演进策略,而非把免费开源软件天真地当成零运维成本的避风港。
在试点周的尾声,仅正式上线并推广那一个被数据证实成功的工作流即可。一次成功的记忆架构选型,从来不在于你向存储池中一次性灌入了多么惊世骇俗的海量语料;而在于即便面对极其琐碎的一套反复执行的任务,系统能做到干净利落地接续上文、大幅挤压重复冗余的上下文开销、显著降低人工介入纠错的频率,并在宿主系统下达擦除指令的瞬间,毫不犹豫地彻底遗忘。
常见问题
GitHub 上有哪些开源的 AI Agent 记忆系统可用?
Mem0、Hindsight、Graphiti、Cognee、Letta Code 与 LangMem 均提供了公开的开源代码实现路径。然而开源并不意味着享有与商业托管版绝对对等的功能:Mem0 在开源版 v3 中移除了诸如平台专有的高级排序、衰减与图谱运维功能;Graphiti 仅提供图谱核心,外围治理体系需全额自研;而 LangMem 更是将持久化存储介质的维保与策略封装全权交由开发者自理。
什么是 AI Agent 记忆框架?
Agent 记忆框架是专门负责仲裁 Agent 应当沉淀什么数据、这些状态在底层如何被有机组织与纠错更新,以及在未来的全新会话中挑选哪些高度关联的信息切片并回传给大模型的架构控制层。它通常深度融合了持久化存储、特征抽取、多模检索以及全生命周期治理策略,绝非简单地把原始聊天记录打包追加进数据库。
仅靠一个向量数据库,足够解决 AI Agent 的记忆问题吗?
完全不够,单靠它无法构成独立的记忆系统。向量数据库擅长存储高维 Embedding 并在数学层面提供快速的近似近邻相似度搜索,但工业级 Agent 的记忆体系,还必须在此之上构建租户隔离、时间有效性建模、事实矛盾处理、溯源追踪、人工介入纠错、数据留存期管理以及物理级删除策略。向量数据库只能充当一整套完备记忆系统中的基础底层存储切片。
上下文窗口越来越大,会彻底淘汰持久化记忆系统吗?
绝不可能。更大的上下文窗口仅仅意味着模型在单次推理执行中能塞入更多素材,但它根本无法裁决在开启一次全新会话后哪些信息应当保留、哪些事实早已过期失效、某项数据的合规归属权属于谁,以及如何依法对其执行删除。此外,基于持久记忆实施的选择性精准提取,还能有效避免在每一次调用中无脑重发整段冗长的全量历史,大幅降低 Input 账单。
什么情况下应该选择 Mem0,而不是 Hindsight 或 Zep?
如果你的业务需要一套面向通用自研商业应用、开箱即用且支持按用户/Agent/会话细粒度隔离的标准化 API,请默认选用 Mem0。当且仅当深度的时序演变感知、多维并行混合检索、实证观察层沉淀与高阶反思(Reflect)成为决定答案质量的生死线时,选择 Hindsight;当业务的核心本质就是一套需要施加严密企业级 RBAC/ABAC、审计流、持久保留与租户物理隔离的时序关系图谱时,选择 Zep。
目前构建 AI Agent 最省钱的持久化记忆系统是哪款?
多款工具均提供了免费起步的阶梯,但真实账单取决于计费仪表与运维模型。在纯处理量上,Cognee Standard 每处理 1,000 万 Token 收取 $25(工作区等费用另计);Supermemory 对其记忆图谱中 1,000 万纯文本唯一 SM Token 计费 $50;而 Hindsight 的 Retain 操作摄入 1,000 万 Input Token 需 $100。这些物理单位对应的实际工作流截然不同,而开源自建方案则必须将模型调用开销、数据库集群成本、服务器网络及高昂的人力运维工时合并计算。
如何让 AI Agent 真正彻底遗忘某项数据?
必须在宿主程序端建立显式的、由业务方完全掌控的纠错、过期、物理删除与敏感脱敏入口,且必须绑定与初始写入时完全一致的多租户隔离键。完成删除操作后,必须在下游全链路执行完备的穿透测试——因为若不可变历史版本、文本摘要归纳、关联图谱边、内存级高速缓存,或已导出的下游数据副本中依然潜藏着该信息的残留,仅在数据库当前最新版本中执行一次单行记录删除是毫无意义的。
希望将持久化验证、数据删除合规与成本核算落实为一份实用的行动清单?欢迎下载《AI 商业工作流审计清单》,下周一即刻为你业务中的首个记忆工作流精准打分。
2026年9月3日







