Wise玩转AI智能体头像
关注
架构实践 | 智能体三级记忆系统全设计:统一抽象、分层存储与自动升降级策略封面图

架构实践 | 智能体三级记忆系统全设计:统一抽象、分层存储与自动升降级策略

智能体记忆系统之「三级记忆」架构设计方案,涵盖:

  • 记忆抽象模型

  • 热 / 温 / 冷三类存储介质、延迟与成本

  • 读写流程(智能体如何使用这些记忆)

  • 自动升降级策略(含示例规则 & SQL/pseudo code)

  • 策略配置与监控落地方案

一、统一「记忆单元」抽象

无论存在哪一层,都用同一种逻辑抽象:Memory Item(记忆单元)。

核心字段建议:

  • id:全局唯一 ID(UUID)

  • user_id:所属用户/会话主体

  • type:memory 类型(对话片段 / 用户偏好 / 任务历史 / 文档切片等)

  • content:原始文本或结构化 JSON

  • embedding:向量(只在热 / 温层快速可用,或异步补全)

  • created_at:创建时间

  • updated_at:最近修改时间

  • last_access_at:最近一次被检索或命中的时间

  • access_count_7d:近 7 天访问次数

  • access_count_30d:近 30 天访问次数

  • tier:当前所属层级(HOT / WARM / COLD)

  • status:是否已删除 / 冻结

关键点:ID 与元数据统一存放在温记忆(关系型数据库)中;热 / 冷层更多是「索引 + 内容缓存」。

二、三级记忆的划分与技术选型

热记忆(HOT)——向量缓存层

定位:

  • 存近期高频访问、对对话质量影响大的记忆(最近对话、重点用户偏好、正在进行的任务状态)

  • 追求:极低延迟 + 高查询吞吐

推荐介质:

  • 内存型向量缓存 + KV:

    • Redis + RedisSearch / Redis-Vector(或类似)

    • 或 基于 Faiss / HNSW 的 in-memory 向量服务(自建 / Milvus / Qdrant 的内存集群)

  • 可选:引入本地 LRU 缓存(per-Agent 进程内)做二级缓存

典型延迟 & 成本:

  • 单次向量检索:1–10 ms

  • 成本:高(内存 + 高性能节点)

适合存:

  • 最近 N 轮对话的摘要 &关键信息

  • 近 7~30 天内频繁命中(access_count 高)的知识片段

  • 活跃用户的个性偏好、长期画像摘要

温记忆(WARM)——关系型数据库层

定位:

  • 逻辑真相来源(Source of Truth)

  • 负责:强一致的元数据管理 + 基本检索能力

  • 读写量中等、可接受 10–100 ms 延迟

推荐介质:

  • PostgreSQL / MySQL + 向量扩展(如 pgvector)

  • 或 关系型数据库 + 外部向量库(Milvus / Qdrant / Elasticsearch)

典型延迟 & 成本:

  • 单次查询:10–100 ms(视索引 & 负载)

  • 成本:中(SSD 磁盘为主,可水平扩展)

适合存:

  • 所有记忆单元的元数据

  • 近期到中长期(如 3~6 个月)的重要记忆内容

  • 不那么高频,但偶尔要被搜

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/vaminal/article/details/157872604

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--