Agent 记忆八选一:先看钱袋子再谈优雅

798 字
4 分钟
Agent 记忆八选一:先看钱袋子再谈优雅

记忆方案一多,宣传就爱说「无限上下文」「永不遗忘」。落地时真正咬人的是 token 账单——你塞进上下文的每一段历史,都在烧额度。策略没有银弹,只有按场景选型;八招可以组合,但组合本身也是工程债。

这篇是通用选型轴(会话长度 × 精度 × 预算 × 工程复杂度),不是某一家产品(Claude Code / pi / OpenCode)的装法说明书。宿主各有自己的记忆壳,换产品时别假设策略能原样搬家。


选型先盯四根轴

问自己
会话长度几轮就完,还是跨天跨项目?
精度要求漏一句就翻车,还是大概对就行?
预算token / 向量化 / 图谱构建,哪条账先爆?
工程复杂度谁维护检索、摘要质量、换页逻辑?

四根轴拉满再谈「要不要上向量库 / 图谱」。好策略会给 Skill 留接口——检索、压缩、分层写入都能做成可调用能力包;烂选型则是把整段历史硬塞进 prompt,Skill 也救不回来。


八招对照

策略核心做法更适合
全量记忆历史原样进 LLM不丢信息、准token 贵;过长拖性能短对话、关键信息不许丢
滑动窗口只留最近 N 轮长度稳、成本可控早期没了;怕长程依赖客服、实时问答、只看最新
相关性过滤先筛再喂噪声少、省 token检索差就误杀重点知识问答、文档聊、检索向
摘要 / 压缩长史压成短文大幅省钱、留主干细节易丢;绑摘要模型长聊总结、纪要、长文分析
向量库向量化 + 按需召回语义检索、可扩海量向量成本;质量看 embedding知识库、企业文档、长期检索
知识图谱实体关系进 GraphDB关系清、利复杂推理构建 / 维护极贵关系推理、知识管理、专家系统
分层记忆短窗 + 长向量双轨效率与完整可兼顾架构重、维护重超长聊、个性化助手、复杂任务
类 OS 内存Active ↔ Disk 换页撑超长与持续学习工程极大;换页有开销超长交互、持续学习、持久记忆

读表时别只盯「优势」列——劣势列往往才是账单和翻车点


怎么叠,别怎么吹

可组合:窗口管当下,摘要管中程,向量管「以前说过啥」,图谱只留给真有关系推理的域。

无银弹:宣传里的「无限记忆」多半是某一层换了一种存法,不是免费无限上下文。

上线前先估峰值 token;上线后盯误召回 / 误摘要。记忆策略决定上下文从哪来;Skill 决定拿到上下文后怎么做事——前者选型错了,后者再漂亮也是在噪声里干活。

和五种 RAG 架构怎么选是邻居题:那边问「检索会在哪失败」,这边问「历史塞进上下文要付什么账」。两张表可以并排看,别当成同一张考卷。

评论区

像发消息一样写就好:点工具栏插入表情 / 图片,表情会直接显示。插图 ≤5MB。