你请了个年薪百万的AI码农,结果发现它每分钟都在偷偷刷你的卡。

Anthropic最近发了篇博客,标题很朴素:《Maximizing the value of your Claude Code sessions》。翻译成人话就是:教你怎么别让Claude Code把你_token_烧破产。

Claude Code token计费示意

文章写得像本说明书。但越读越觉得荒诞——一个被吹成“能自主编程”的AI,用起来居然要像管孩子吃饭一样,精确计算它每口吃了多少token。

输出token比输入贵5倍,而“思考”最烧钱

Claude Code的账单分两步。

第一步叫prefill,模型读你塞进去的东西:系统提示词、CLAUDE.md、你的消息、整个对话历史、它读过的文件、运行过的命令结果。这叫输入token。

第二步叫decode,它开始写:思考过程、工具调用、你看到的回复。这叫输出token。

一个200 token的回复,就是模型跑了200次。输出token把GPU占得更久,所以输出价格大概是输入的5倍。

Claude Code提示缓存示意

而输出里很大一部分是“思考token”。你让它多想,它真的多收钱。 /effort这个命令就是干这个的——而且你选了什么档位,下次会话还记得。

Anthropic给的tip也很真实:新开会话时先跑一遍/model/effort,搞清楚自己到底在什么档位。 别稀里糊涂把上次的高档 effort 继承下来,干个修bug的活儿也收你研究生级别的思考费。

缓存是你的朋友,但脆弱得像玻璃

Prompt caching这玩意儿,原理听着很美。

如果这次请求的开头和上次完全一样,服务器就把算过的状态存起来,下次直接读。读缓存只要0.1倍价格,写缓存贵一点,最多2倍,但只写一次。

所以理想情况下,你每轮对话都在“历史读缓存 + 新内容全价 + 输出收费”的模型里运行。Anthropic举了个例子:修一个测试,Claude Code要来回发5次请求,每次请求都包含整段对话,但只有新内容是全价。

听起来很划算。但问题是,缓存极易被“炸掉”。

Claude Code会话流程示意

只要请求前缀有一丝变化,后面全部重新prefill。哪些操作会炸缓存?

  • 切模型(/model):每个模型有独立缓存
  • 改effort(/effort):缓存key的一部分
  • 开fast mode:也是key的一部分
  • /compact:对话被重写,前面全不匹配
  • 时间:订阅用户缓存1小时过期,API key只要5分钟

最后这点最扎心。你泡杯咖啡回来,缓存没了。整个对话重新prefill一遍。所以Anthropic的忠告是:要切模型、切effort,最好在会话开头切。

真正的黑洞:上下文越聊越肥

比缓存更狠的,是context膨胀。

Claude Code里,没有东西只发一次。 它读过的每个文件、运行过的每条命令输出,都会被塞进对话,在之后的每一轮里反复发送。

你让它“修下失败的测试”,它可能先grep一圈、打开几个文件找线索——这些中间结果全都会永久留在上下文里,即使后面根本用不到。

Claude Code上下文管理示意

Anthropic给的建议包括:

  • @文件名直接附文件,省掉一次Read调用
  • 把常用命令写进CLAUDE.md,带上quiet参数
  • 命令输出超过3万字符会自动转文件,但低于3万的“400行测试通过日志”会原样塞进去
  • 新任务用/clear,同任务里旧内容用/compact
  • noisy任务交给subagent,只把结论拿回来

说白了:会话越长,你每说一句话就越贵。

反转:用户没感谢,反而骂得更凶

按说官方教你省钱,大家应该感恩吧?

评论区完全不是这个画风。

最高赞的吐槽直指核心:“这像是Anthropic版的‘你拿错方式了’(You're holding it wrong)。”

另一条评论更扎心:“Bro一边吹超智能AGI要自动化一切,一边教我们记得/clear、记得设置effort、记得@文件。这AI到底是来干活的,还是来让我考代币管理证书的?”

Claude Code成本关注优先级

还有用户爆料缓存机制的坑:明明什么都没改,400K token的对话突然重写800K缓存,最后飙到2M,找不到原因。也有人抱怨桌面端@文件功能有bug,搜索结果完全不对。

最讽刺的是这条:“我的 cynical 解读是,这帖子是在把企业里的账单责任推给工程师——‘你花超了?那篇价值最大化博客你读了吗?这是你的错。’”

所以问题到底是什么?

Anthropic这篇博客本身没毛病。它把Claude Code的计费机制讲得很透,很多技巧也确实能省钱。

但它暴露了一个更深层的问题:AI工具正在从“按结果付费”滑向“按呼吸付费”。

AI配图

你每让它多喘一口气——多思考一下、多读一个文件、多跑一条命令——都要算钱。而为了不被反噬,用户不得不学习一整套“会话管理学”:什么时候/clear,什么时候/compact,什么时候开subagent,缓存多久会过期。

一个号称能自主完成任务的系统,却要求用户成为它的token会计师。

这中间的落差,才是评论区愤怒的来源。

当AI公司还在讲“提升生产力”的故事时,用户已经在精打细算每一个思考token。也许下一步,该有人写篇博客叫《Maximizing the value of your AI vendor》了。

【锐评】:AI吹的是“自动驾驶”,实际卖的却是“节油驾驶课”——而且油表还藏在你看不见的地方。

参考链接:
https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions