draft · 仅 crs13 预览环境显示,正式站不会发布

【万字长文】LLM 缓存这笔账,藏着多少猫腻?

工作目录:分章节讨论,最终合并成公众号/博客成稿。 当前状态:结构稿。 更新时间:2026-06-02。

标题

【万字长文】LLM 缓存这笔账,藏着多少猫腻?

备选副标题:

从 Claude、OpenAI、DeepSeek 到 Claude Code、中转站和 AI Agent 成本黑箱

写作目标

这篇不写成单纯的“缓存机制科普”,而是从真实使用场景出发,把缓存命中率和成本、模型选择、Agent 框架、中转站计费放在一条线上讲清楚。

核心问题:

目标读者

文章风格

主线

一句话主线:

LLM 缓存不是省钱小技巧,它是 AI Agent 成本结构的地基。缓存命中率低,意味着模型每一轮都在重新读取大量上下文;中转链路不透明,意味着缓存省下的钱未必省给用户。

章节拆分

0. 开场:你以为只问了一句,模型可能又读了一遍全场

目的:建立异常感。

要讲:

1. 缓存到底缓存了什么

目的:讲清 prompt caching 和普通“记忆”的差别。

要讲:

关键例子:

[tools][system][project rules][history][new user message]

只要前面有一点变了,后面都可能跟着失效。

2. Claude 的缓存:强控制,也容易被自己打碎

目的:细讲 Claude。

要讲:

核心观点:

3. 5 分钟和 1 小时:不是越长越好

目的:讲 TTL 选择。

要讲:

4. Mid-conversation system messages:为什么它是缓存相关功能

目的:解释用户关心的新功能。

要讲:

5. OpenAI 的缓存:自动省心,但控制感弱

目的:对比 OpenAI。

要讲:

6. DeepSeek 的缓存:硬盘缓存和极端价差

目的:讲国产模型尤其 DeepSeek。

要讲:

重点表达:

DeepSeek 的 cache hit 不是省一点钱,它可能直接决定这一轮输入是正常价格,还是接近白送。

7. Claude Code 最近的缓存相关变化

目的:讲具体工具动态。

要讲:

观点:

Claude Code 最近不少变化,本质都在围绕“让稳定前缀更稳定,让动态内容晚一点出现”。

8. 为什么 Agent 框架天然容易缓存命中率不高

目的:把 OpenClaw / Hermes / OpenCode 放进来。

要讲:

核心句:

越智能的 Agent,越容易制造动态上下文;越动态的上下文,越难命中缓存。

9. 中转站猫腻:缓存省下的钱到底给了谁

目的:文章爆点。

要讲:

可靠中转站应该:

10. 怎么判断自己有没有被缓存坑到

目的:给实用 checklist。

要讲:

11. 模型选择和工程建议

目的:收束到选型和实践。

要讲:

12. 结尾:缓存是 AI Agent 的成本地基

目的:升维。

要讲:

资料来源待合并

已核实的官方信息:

协作方式

每次只讨论 1-2 个章节。

流程:

  1. 先确认章节要表达的观点。
  2. 写章节讨论稿。
  3. 用户指出删改方向。
  4. 修改后落入章节文件。
  5. 最后统一合并、顺稿、补图、生成公众号版。