Claude Code token 消耗太快?12 招省额度实战(2026)
同样是写代码,有人一天几美元,有人一上午就把 5 小时额度打满。差别很少来自「谁干的活多」,绝大部分来自上下文管理习惯。Claude Code token 消耗的核心规律只有一条:每发一条消息,整段对话都要重新发一遍给模型。所以真正决定成本的不是你打了多少字,而是你的上下文里躺着多少历史。这篇讲清消耗机制,再给 12 招能立刻上手的省额度方法——对 Claude Code、Codex CLI、Cursor 以及接了国产模型的各类 CLI 都通用。
先搞清楚:token 到底花在哪
- 模型是无状态的:它不记得你上一句说了什么。每一轮请求,客户端都要把系统提示词、CLAUDE.md、工具定义、全部对话历史、读过的文件内容打包重发。对话越长,单条消息越贵。
- 输出比输入贵:主流模型的输出单价通常是输入的 2-4 倍。让 AI 少说废话、少贴无关代码,直接省钱。
- 思考 token 算输出:扩展思考(extended thinking)默认开启,思考预算按模型不同可以到每次请求几万 token,而且是按输出计费的。
- 缓存能救命也会失效:重复的前缀内容(系统提示词、CLAUDE.md、已读文件)走 prompt caching,命中时便宜一个数量级。但缓存有生命周期——订阅档是 1 小时,用到额度加油包后降到 5 分钟,API key 和云厂商默认就是 5 分钟。中午吃个饭回来发第一句,就是一次全量重算。
- 工具定义也占地方:每个 MCP server 的工具清单、每个技能的描述都在上下文里常驻。
一个反直觉的事实
在一个开了一整天的会话里问一句「这行代码什么意思」,花的不是一句话的钱,是整整一天对话的钱。所以「切任务就清上下文」比任何提示词技巧都省。
第一步:先测量,别凭感觉省
省钱的前提是知道钱花在哪。Claude Code 里有三个入口:
- 1
/usage:顶部 Session 区块显示当前会话的 token 明细和本地估算的花费;订阅用户还能看到额度进度条,以及把用量归因到技能、子智能体、插件、各个 MCP server 的占比拆解。按d/w切换近 24 小时和近 7 天。 - 2
/context:看当前上下文里各部分各占多少空间——哪个 MCP 撑爆了上下文,一眼就能看出来。 - 3状态栏常驻显示:把上下文占用配到 statusline 上,随时扫一眼比每次敲命令强。
想要跨天、跨项目的账本,社区工具 ccusage 是目前最常用的选择,它直接读本地会话 JSONL 文件算账,不需要联网也不需要 API key:
# 按天看用量
npx ccusage@latest daily
# 按会话看,找出最烧钱的那次对话
npx ccusage@latest session
# 实时看当前 5 小时窗口的燃烧速度
npx ccusage@latest blocks --live订阅用户看哪个数字
`/usage` 里的美元金额是按 API 价目本地估算的,对 Pro / Max 订阅用户没有账单意义——你该盯的是额度进度条和归因拆解。当某项行为占到近期用量的 10% 以上(比如 long context、cache miss),面板会主动标出来并给建议。
上下文管理:省钱收益最大的四招
第 1 招:换任务就 `/clear`。 这是投入产出比最高的一招。上一个任务的残留上下文,会在之后的每一条消息上重复收费。怕清完找不回来?先 /rename 给会话起个名,需要时 /resume 回去。另外,/clear 本身不花钱。
第 2 招:`/compact` 要带指令,而且别滥用。 直接敲 /compact 是让模型自由发挥地总结,很容易把你需要的细节压没了。带上重点:
/compact 重点保留代码改动和 API 调用方式,测试输出可以概括也可以把压缩偏好写进项目的 CLAUDE.md,之后每次自动压缩都遵守:
# Compact instructions
压缩对话时,重点保留测试输出和代码改动,省略探索过程中的无效尝试。compact 本身是一次大请求
`/compact` 需要把要压缩的整段对话读一遍才能总结,所以对一个超大上下文做压缩,这个动作本身就很贵。如果你并不需要延续之前的上下文,直接 `/clear` 才是对的——它不花钱。
第 3 招:给 CLAUDE.md 瘦身。 CLAUDE.md 在每次会话启动时全量进上下文,你写的每一行、无论当前任务用不用得上,都在为每条消息付费。官方建议控制在 200 行以内,只放真正的公共约定。那些「PR 审查流程」「数据库迁移步骤」之类只在特定场景用的长篇说明,搬到 Skills 里去——技能是按需加载的,不调用就不占上下文。
第 4 招:把高噪声操作丢给子智能体。 跑测试、读几千行日志、抓一份文档,这些操作的原始输出动辄上万 token。交给 subagent 去做,脏数据留在它自己的上下文里,回到主会话的只有一段结论。
模型与推理档位:别拿旗舰模型改错别字
第 5 招:模型分级。 Sonnet 档足以应付绝大多数编码任务,成本远低于 Opus 档;Opus 留给架构决策、复杂多步推理。会话中 /model 随时切,默认值在 /config 里设。子智能体做机械活时,直接在它的配置里写 model: haiku。API 账单异常高的排查经验里,「Opus 一直当默认模型没换回来」是最常见的原因之一。
第 6 招:调低思考档位。 扩展思考默认开着,简单任务上就是纯浪费。用 /effort 降档,或在 /config 里关掉思考;对固定思考预算的模型,可以用环境变量限制:
export MAX_THINKING_TOKENS=8000注意自适应推理的模型会忽略非零预算值,那类模型只认 effort 档位。
第 7 招:国产模型要会错峰。 国产 API 这两年普遍上了峰谷计费。以 DeepSeek 为例,高峰时段(每日 9-12 点、14-18 点)价格约为平峰的两倍,缓存命中、未命中、输出三档同步翻倍。把批量重构、跑长任务这类不着急的活挪到晚上或清晨,账单能直接砍一半。另外缓存命中价和未命中价能差上百倍,保持前缀稳定(别频繁改 CLAUDE.md、别反复切换项目)本身就是省钱。
工具与输入:把垃圾挡在上下文外面
第 8 招:MCP 该关就关,能用 CLI 就别用 MCP。 跑 /mcp 看看挂了哪些 server,不用的直接停掉。gh、aws、gcloud、sentry-cli 这类命令行工具比对应的 MCP server 更省上下文——它们不需要在上下文里常驻一份工具清单,AI 直接执行命令就行。
第 9 招:用 hooks 做预处理。 与其让 AI 读一个一万行的测试日志去找失败用例,不如在 hook 里先 grep 一遍,只把匹配行喂给它。同样一件事,上下文能从几万 token 降到几百。下面这个 PreToolUse hook 会在跑测试时自动改写命令,只保留失败信息:
{
"hooks": {
"PreToolUse": [
{
"matcher": "Bash",
"hooks": [
{
"type": "command",
"command": "~/.claude/hooks/filter-test-output.sh"
}
]
}
]
}
}第 10 招:给强类型项目装代码智能插件。 有了语言服务器,AI 用「跳转到定义」一次就能定位符号,替代原本「先 grep 再挨个读候选文件」的一串操作,少读的每个文件都是省下的 token。
工作习惯:少走弯路就是最大的省
第 11 招:提示词要具体。 「优化一下这个项目」会触发全库扫描;「给 auth.ts 里的 login 函数加输入校验」只读一个文件。模糊的需求不是省了你打字的时间,是把成本转嫁到了扫描上。
第 12 招:早停、早验证、早回滚。 复杂任务先按 Shift+Tab 进 plan 模式,让它先出方案你确认,比返工便宜得多;发现方向不对立刻按 Esc 打断,别等它写完一屏;用 /rewind 或双击 Esc 回到之前的检查点;提示词里带上测试用例、期望输出、截图,让 AI 能自己验证,就不用你再花一轮去指出问题。
- 换任务先 /clear,会话别开一整天
- CLAUDE.md 压到 200 行以内,长流程搬去 Skills
- 默认模型设成 Sonnet 档,Opus 按需切
- 简单任务降 effort 档位
- 不用的 MCP server 停掉
- 跑测试 / 读日志交给子智能体或 hook 过滤
- 复杂改动先走 plan 模式
- 国产模型把长任务挪到平峰时段
这几个坑,越「省」越贵
- 为省钱疯狂 /compact:压缩本身是一次读全上下文的大请求,频繁压缩比直接清空贵得多。
- 长时间挂着会话不关:休息一小时以上再回来,第一条消息大概率缓存未命中,全量上下文重新计费。要走开就先把手上任务收尾。
- 忘了后台还有定时任务:挂着的定时任务会按间隔照常触发,每次都发送完整上下文,人不在也在烧。
- 随手开 Agent Teams:多智能体团队在队友跑 plan 模式时约为标准会话的 7 倍消耗,每个队友都是独立上下文。日常小活别组队。
- 只盯着输入省,不管输出:不加约束时 AI 很爱把整个文件重贴一遍。要求它只输出 diff、只改动必要部分,输出侧的钱更贵。
订阅制和 API:省的不是一回事
| 订阅制(Pro / Max / 国产编程套餐) | API / 云厂商按量计费 | |
|---|---|---|
| 计费单位 | 额度窗口(如 5 小时窗口 + 周限额) | 每百万 token 单价 |
| 「省」的目标 | 别撞限额、把额度留给关键任务 | 直接降低账单金额 |
| 最有效的手段 | 清上下文、降模型档、别多开实例 | 缓存命中率、错峰、模型分级 |
| 缓存生命周期 | 订阅档约 1 小时(用加油包后降到 5 分钟) | 默认 5 分钟 |
| 撞限额怎么办 | 等窗口重置,或加购额度 | 提额度 / 换更便宜的模型 |
| 典型花费参考 | 看套餐档位 | 企业部署平均约 13 美元/人/活跃日 |
官方给出的企业侧参考数据是:平均约 13 美元每开发者每活跃日、150-250 美元每人每月,90% 的用户每活跃日低于 30 美元。如果你的实际消耗远超这个量级,八成不是活干多了,而是上面某条踩了坑——最常见的就是会话从不清理,以及 Opus 忘了切回去。
省 token 说到底是上下文工程的一部分:给模型刚好够用的信息,不多不少。控制住上下文,账单和输出质量会同时变好——因为塞满噪声的上下文不仅贵,还会让模型变笨。想系统学会上下文工程、Skills、Hooks 这套让 AI 编程真正稳定产出的方法,欢迎来 IMAI 看看我们的实战课程。
想系统学会用 AI 编程,从入门到做出真实产品?
查看系统课程