模型发布

Claude 会话缓存过期会多掏钱?开源工具 claude-thermos 想把那 22% 账单压下去

一个叫 claude-thermos 的本地代理工具,能在 Claude Code 主智能体空闲时自动发送预热请求,维持提示缓存热度。开发者实测约 185 次会话中发现,缓存过期导致的重新编码占账单约 22%。对依赖 Claude API 的开发者和团队来说,这类工具正在成为成本优化的新方向。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
Claude 会话缓存过期会多掏钱?开源工具 claude-thermos 想把那 22% 账单压下去

最近一个名为 claude-thermos 的开源工具在 Hacker News 上引起讨论。它做的事很直接:在本地起一个反向代理,盯着你的 Claude Code 会话,一旦主智能体因为等子任务空闲超过 5 分钟,就自动发个预热请求,把快要过期的提示缓存重新加热。

为什么会产生这笔"沉默账单"提示缓存是 Claude API 的省钱机制:同样的上下文如果命中缓存,后续请求只需付一小部分费用。但会话一旦停下超过几分钟,缓存就会过期;下次继续时,所有上下文得重新编码,账单上多出一笔"沉默开销"。工具作者实测约 185 次本地会话,这部分占了账单约 22%。

claude-thermos 的实现思路并不复杂。它通过 uvx 直接运行,不需要复杂安装。默认阈值是空闲 5 分钟触发预热,用户也可以自定义间隔。本地代理的好处是请求只在自己机器和 API 之间转一圈,不经过任何第三方,隐私和延迟都比较可控。

对开发者和团队的实际意义如果你的工作流是 Claude Code 长跑、频繁切出再回来,这类工具的边际收益最高。对每周烧几百美元 API 的小团队来说,能直接砍掉两成左右成本;相比换更便宜模型,保缓存是不伤体验的优化路径。独立开发者省的钱不算多,但积少成多也是真金白银。

当然也有局限。首先它只覆盖本地 Claude Code 会话,不适用于网页端或其他平台调用。其次 Anthropic 的缓存有效期政策可能调整,今天 5 分钟的阈值未必一直适用。再者频繁预热本身会产生少量 API 调用,需要自己权衡。

不只是省钱的工具,更是工作流的延伸更深一层的意义在于,claude-thermos 代表了围绕 Claude Code 正在形成的外围生态。官方没做自动保温,第三方就补上。这和当年围绕 VS Code 的插件潮很像——底层平台越强,围绕它的工具链就越有机会冒出来。开源社区的反应速度,正在成为这类 AI 编程产品体验的一部分。

对国内用户来说,直接使用 Claude Code 有门槛,但"提示缓存"这个概念本身值得理解。OpenAI、Anthropic、Google 的主流大模型 API 都支持某种形式的缓存策略。无论写自动化脚本、做 Agent 还是跑多轮对话工具,知道缓存怎么算钱、何时会过期,都是控制成本的基础功。

值得后续观察的几个方向- Anthropic 会不会自己推出类似功能,或者延长缓存有效期- 是否会出现更通用的"多模型缓存保温"工具,把 Claude、GPT、Gemini 都覆盖- 本地代理的思路能不能拓展到 Cursor、Continue 这类 IDE 插件

这些动向,决定了"沉默账单"未来能不能被彻底消灭。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具