Workbench
内容工作台
这里把 ideas、drafts、review 和 published 内容合在一起预览。正式站只发布 published;crs13 预览域名用于内部编辑和检查阅读节奏。
Drafts
2199-revision-notes
顺稿待处理事项 更新时间:20260602
08-claude-code-cache-changes
07 Claude Code 最近的缓存相关变化 Claude Code 这一段,不适合写成 changelog 逐条解释。真正值得讲的是:Claude Code 正在从单个 coding agent,变成一个会调度工具、压缩上下文、切换模式、拉起子任务的工程系统。系统越复杂,越容易制造动态上下文;动态上下文越多,缓存
11-how-to-detect-cache-issues
10 怎么判断自己有没有被缓存坑到 前面讲了很多机制。真正落到使用上,不要一上来就问“它有没有缓存”。这个问题太粗。
02-what-cache-caches
01 缓存到底缓存了什么 要讲缓存,先得把它和几件容易混在一起的东西分开。
07-deepseek-cache
06 DeepSeek 的缓存,硬盘缓存和极端价差 DeepSeek 的 Context Caching 很值得单独讲,因为它和 Claude、OpenAI 的体感差异很大。
10-proxy-cache-accounting
09 中转站猫腻,缓存省下的钱到底给了谁 前面几节讲的是模型和 Agent 框架。到中转站这里,问题会变得更现实。
12-model-choice-engineering-advice
11 模型选择和工程建议 讲到这里,模型选型就不能只看标价了。
92-full-polished
【万字长文】LLM 缓存这笔账,藏着多少猫腻? 从 Claude、OpenAI、DeepSeek 到 Claude Code、中转站和 AI Agent 成本黑箱
91-full-revised-reader-version
【万字长文】LLM 缓存这笔账,藏着多少猫腻? 副标题:从 Claude、OpenAI、DeepSeek 到 Claude Code、中转站和 AI Agent 成本黑箱
90-full-current-assembled
<! BEGIN 01opening.md 00 开场:一句“继续”,也可能消耗大量输入额度
06-openai-cache
05 OpenAI 的缓存,自动省心,但控制感弱 OpenAI 的 prompt caching 更偏自动化。只要请求满足条件,系统会自动尝试复用前缀,不需要开发者手动写 cache breakpoint,也没有额外的 cache write 费用。
00-outline
【万字长文】LLM 缓存这笔账,藏着多少猫腻? 工作目录:分章节讨论,最终合并成公众号/博客成稿。
13-conclusion
12 结尾,缓存是长上下文时代的真实账本 这篇文章从 prompt caching 讲起,最后落到的其实不只是一个 API 功能。
05-mid-conversation-system-messages
04 Midconversation system messages,为什么它和缓存有关 Claude 最近新增的 midconversation system messages,看起来像是一个系统提示词能力,实际和缓存关系很直接。
01-opening
00 开场:一句“继续”,也可能消耗大量输入额度 我第一次认真看 Claude Code 的用量,是因为它贵得有点离谱。
04-ttl
03 5 分钟和 1 小时,TTL 要按使用节奏选 Claude prompt caching 默认是 5 分钟 TTL,也可以选择 1 小时 TTL。
93-full-polished-integrated
【万字长文】LLM 缓存这笔账,藏着多少猫腻? 从 Claude、OpenAI、DeepSeek 到 Claude Code、中转站和 AI Agent 成本黑箱
03-claude-cache
02 Claude 的缓存,控制很强,也很容易被打碎 Claude 的 prompt caching 比较适合拿来讲 Agent 成本,因为它的机制足够明确,usage 字段也比较细。
09-agent-framework-cache-problems
08 为什么 Agent 框架天然容易缓存命中率不高 上一节讲 Claude Code,是因为它有文档、有 changelog,也能看到它怎么处理缓存、MCP、compaction 和 subagent。
90-draft-v1
AI 监控,最怕不报错的故障 最近在琢磨怎么给一个 AI 系统做监控,越想越觉得,过去那套经验基本套不上。
90-piece1-draft
AI 拨测,怎么才算真的测到位 传统拨测特别省事,发个请求,看能不能通、状态码符不符合预期。通了、码也对,就当它没事。
Review
0Ideas
14多模型协作的几个管理学命题
多模型协作的几个管理学命题 来源
我要设计一个 AI 监控平台,第一张图应该怎么画
我要设计一个 AI 监控平台,第一张图应该怎么画 核心判断
你的 AI 应用,可能正在悄悄变笨
你的 AI 应用,可能正在悄悄变笨 一句话判断
大模型代理里的缓存,可能正在改变你的结果
大模型代理里的缓存,可能正在改变你的结果 一句话判断
大模型调用价格低,不代表企业成本低
大模型调用价格低,不代表企业成本低 一句话判断
AI 评估不是排行榜,而是企业自己的质量基线
AI 评估不是排行榜,而是企业自己的质量基线 一句话判断
企业不能只按单价选择模型代理
企业不能只按单价选择模型代理 一句话判断
便宜的模型调用,为什么最后可能更贵
便宜的模型调用,为什么最后可能更贵 一句话判断
多模型管理真正难的不是接 API,而是治理
多模型管理真正难的不是接 API,而是治理 一句话判断
LLM 可观测到底应该观测什么
LLM 可观测到底应该观测什么 一句话判断
同一个模型名,背后可能不是同一次调用
同一个模型名,背后可能不是同一次调用 一句话判断
企业 AI 成本为什么必须按业务归因
企业 AI 成本为什么必须按业务归因 一句话判断
模型代理服务最怕的,是不可解释
模型代理服务最怕的,是不可解释 一句话判断
企业 AI 落地,为什么需要一层“控制面”?
企业 AI 落地,为什么需要一层“控制面”? 核心观点
Published
6AI 对组织架构变革的思考
AI 对组织架构变革的思考 
大家都在等更大的模型,但增量可能在别处
大家都在等更大的模型,但增量可能在别处 
【万字长文】LLM 缓存这笔账,藏着多少猫腻?
【万字长文】LLM 缓存这笔账,藏着多少猫腻? 从 Claude、OpenAI、DeepSeek,到 Coding Agent、中转站和 AI Gateway 的成本黑箱
AI 拨测,怎么才算真的测到位
AI 拨测,怎么才算真的测到位 传统拨测特别省事,发个请求,看能不能通、状态码符不符合预期。通了、码也对,就当它没事。
铺天盖地的中转站,提供的 Claude 到底是什么?
铺天盖地的中转站,提供的 Claude 到底是什么? 
企业AI转型的门槛,根本不在模型本身
企业AI转型的门槛,根本不在模型本身 企业刚开始用 AI,通常不会先建设什么平台。