不期而至🎁 惊喜礼盒
🎁 Surprise · 不定期 · 随缘更新


🎁 Surprise · 不定期 · 随缘更新
🎁 SURPRISE
谢谢你停在这里。愿你被温柔以待,也愿你带着一点勇气继续往前——这是我留给访客的小小礼物 🎀✨。
— threetwoa
(=;ェ;=) 客来不妨坐下,落叶声里续一壶茶;猫会自己找你。
走进数字花园
记忆方案一多,宣传就爱说「无限上下文」「永不遗忘」。落地时真正咬人的是 token 账单——你塞进上下文的每一段历史,都在烧额度。策略没有银弹,只有按场景选型;八招可以组合,但组合本身也是工程债。
这篇是通用选型轴(会话长度 × 精度 × 预算 × 工程复杂度),不是某一家产品(Claude Code / pi / OpenCode)的装法说明书。宿主各有自己的记忆壳,换产品时别假设策略能原样搬家。
| 轴 | 问自己 |
|---|---|
| 会话长度 | 几轮就完,还是跨天跨项目? |
| 精度要求 | 漏一句就翻车,还是大概对就行? |
| 预算 | token / 向量化 / 图谱构建,哪条账先爆? |
| 工程复杂度 | 谁维护检索、摘要质量、换页逻辑? |
四根轴拉满再谈「要不要上向量库 / 图谱」。好策略会给 Skill 留接口——检索、压缩、分层写入都能做成可调用能力包;烂选型则是把整段历史硬塞进 prompt,Skill 也救不回来。
| 策略 | 核心做法 | 优 | 劣 | 更适合 |
|---|---|---|---|---|
| 全量记忆 | 历史原样进 LLM | 不丢信息、准 | token 贵;过长拖性能 | 短对话、关键信息不许丢 |
| 滑动窗口 | 只留最近 N 轮 | 长度稳、成本可控 | 早期没了;怕长程依赖 | 客服、实时问答、只看最新 |
| 相关性过滤 | 先筛再喂 | 噪声少、省 token | 检索差就误杀重点 | 知识问答、文档聊、检索向 |
| 摘要 / 压缩 | 长史压成短文 | 大幅省钱、留主干 | 细节易丢;绑摘要模型 | 长聊总结、纪要、长文分析 |
| 向量库 | 向量化 + 按需召回 | 语义检索、可扩海量 | 向量成本;质量看 embedding | 知识库、企业文档、长期检索 |
| 知识图谱 | 实体关系进 GraphDB | 关系清、利复杂推理 | 构建 / 维护极贵 | 关系推理、知识管理、专家系统 |
| 分层记忆 | 短窗 + 长向量双轨 | 效率与完整可兼顾 | 架构重、维护重 | 超长聊、个性化助手、复杂任务 |
| 类 OS 内存 | Active ↔ Disk 换页 | 撑超长与持续学习 | 工程极大;换页有开销 | 超长交互、持续学习、持久记忆 |
读表时别只盯「优势」列——劣势列往往才是账单和翻车点。
可组合:窗口管当下,摘要管中程,向量管「以前说过啥」,图谱只留给真有关系推理的域。
无银弹:宣传里的「无限记忆」多半是某一层换了一种存法,不是免费无限上下文。
上线前先估峰值 token;上线后盯误召回 / 误摘要。记忆策略决定上下文从哪来;Skill 决定拿到上下文后怎么做事——前者选型错了,后者再漂亮也是在噪声里干活。
和五种 RAG 架构怎么选是邻居题:那边问「检索会在哪失败」,这边问「历史塞进上下文要付什么账」。两张表可以并排看,别当成同一张考卷。
复制链接或生成海报,发给感兴趣的人。

Skill 每次调用都把背景、规则、示例整段灌进上下文,才是真烧钱。四条原则 + 五条削胖改法,对照本仓写薄纪律。
2026-08-11部分内容可能已过时
分享你的想法,与大家交流讨论
像发消息一样写就好:点工具栏插入表情 / 图片,表情会直接显示。插图 ≤5MB。

🎁 Surprise · 不定期 · 随缘更新
🎁 SURPRISE
谢谢你停在这里。愿你被温柔以待,也愿你带着一点勇气继续往前——这是我留给访客的小小礼物 🎀✨。
— threetwoa
有什么想了解的?
我基于博客内容回答