
在使用 Claude Code 进行开发对话时,保留会话窗口以便无缝衔接是常见习惯。然而,随着 Claude Code 新增 /cost 命令,这一习惯背后的 Token 消耗成本得以量化。该命令不仅显示 Token 使用量,还深入分析缓存未命中、上下文重新缓存量及潜在原因。数据显示,长时间断开会话导致提示词缓存过期,是造成后续处理成本激增的主要因素。
/cost 命令提供精细化用量洞察
运行 /cost 命令可调取会话的 Token 使用详情,按模型对输入、输出、缓存读取和写入进行分类统计。尽管界面显示美元估算值,但在 Pro 或 Max 订阅套餐下,这主要反映工作量而非额外费用。核心关注点在于“Prompt cache (main)”栏目,它揭示了缓存提供的输入比例、未命中次数、需重新缓存的 Token 数量,以及缓存处于“热”或“冷”的状态,并在可能时指出最后一次未命中的原因。
对于订阅用户,用量明细进一步将消耗归因于技能(skills)、子代理(subagents)、插件及各 MCP 服务器。当 Claude 将任务委托给其他组件时,这些代理独立发起的请求会与主会话共同消耗用量。用户可切换查看最近一天或一周的数据,以监控长期消耗趋势。
会话中断引发隐性成本
Claude Code 具备自主读取文件、编辑代码及运行测试的能力,适合耗时任务。但若用户不在场,AI 可能陷入无效修复或重复搜索文件的循环。以修复 TypeScript 错误为例,每次尝试虽可能揭示新问题,但若同一错误反复出现且修改方案雷同,缺乏人工干预将导致策略低效。
重复尝试会向对话中注入大量代码和命令输出,导致上下文不断增长。尽管提示词缓存能降低重复输入成本,但缓存读取仍计入用量,且处理日益庞大的上下文本身即产生高额费用。一旦离开,用户便失去了在关键节点打断并修正诊断逻辑的机会,只能事后审查结果。
优化策略:明确边界与主动干预
为降低 Token 浪费,建议在分配任务后设定明确的停止点。相较于“修复所有错误”这类开放指令,更倾向于指定受影响的功能模块及需通过的测试,或要求 AI 在同一错误两次尝试未果后停止并解释。对于较大变更,利用“计划模式”(plan mode)在编辑前审查方案,可提前规避不必要的重构或需求遗漏。
若发现 AI 陷入失败循环,应立即打断并要求解释结论,或使用 rewind 命令回退至之前的对话节点或代码检查点,避免在无效编辑基础上堆砌代码。此外,在新任务开始前,可使用 clear 命令开启全新对话,或使用 compact 命令总结当前会话。需注意,压缩操作本身亦消耗 Token,频繁执行会增加开销。
根本上提升效率的关键,在于从“离开托管”转向“实时监控”,以便在 AI 陷入循环时及时介入。配合清晰的初始目标、精确的提示词以及合理的设置调整,可显著减少因缓存失效和重复计算导致的资源浪费。