月费 $400 的 AI 团队,按 API 计费要 $53,403
两个固定月费的编程订阅一个月 $400。同样的 30 天真实用量,按 API 牌价算是 $53,403——订阅价的 133 倍,按牌价年化的运转成本比一个资深工程师的全成本还高。本文把这张按模型的明细账单从本机 CLI 日志里重建出来,并说明:让 AI 团队全自动跑,靠的正是这份固定月费,而不是按量 API——后者会把账算翻。
订阅永远不会告诉你的那个数
我用两个固定月费的订阅养着一支 AI 编程团队——Claude Max 20x 和 ChatGPT Pro,各 $200,一个月 $400。在限额之内,它感觉「约等于无限」;而正是这个固定费用,决定了这支团队能以现在的方式运转:agent 之间跨厂商互审、永不下班的巡检、随手就发、发错也无所谓的投机重试。计价表被关掉了,于是你就不再数了。
可这恰恰引出一个两家厂商都不会回答的问题:如果同样这些用量不走固定月费、而是走按量计费的 API,账单会是多少?Claude Code 的 /usage 只给一个百分比进度条——你这个窗口的额度烧了多少——没有 token 数,也没有按模型的拆分。ChatGPT 的订阅版干脆没有用量面板(只有按量计费的 API 账户才有 dashboard)。你想要的那个数字,在任何界面里都不存在。
但它确实存在——在磁盘上。两个 CLI 都会把每一次请求的完整日志写下来,带着模型名和 token 数。所以我把厂商不肯给你的那张按量账单重建了出来:逐个模型、逐项拆开。它揭出的那道差距,才是这篇文章的重点。
实付 $400,计价表上是 $53,403
取一个 30 天窗口(2026-06-24 → 07-24),每个模型都按它的官方 API 牌价计:
| 我实际付的固定月费 | $400 |
| 同样用量的按量 API 牌价 | $53,403 |
| 倍数 | 133.5× |
拆开来:Codex / ChatGPT 一侧 $42,351,Claude 一侧 $11,052,合计 558,466 次请求、766 亿 token。这是一个牌价反事实,不是省下了 $53,403——第 6 节会认真交代它的边界,而且那些边界很要紧。但这道差本身是实的:就这些用量而言,按量 API 会收你 订阅价的 133 倍。
逐个模型的明细账单
一个总数会把钱花在哪儿藏起来,所以这里把整张账单摊开——每个模型、它按桶分的真实 token 数、以及牌价小计。没有一项是凭空冒出来的数字:每一个小计,都只是 token × 公开单价。
Codex CLI(ChatGPT Pro)——$42,351
| 模型 | 请求数 | 未缓存输入 | 缓存输入 | 输出 | 牌价 |
|---|---|---|---|---|---|
gpt-5.6-sol | 388,400 | 1.02B | 51.60B | 115.5M | $34,382 |
| 未标注 → sol/5.5 档† | 61,486 | 156.5M | 8.15B | 18.1M | $5,401 |
gpt-5.5 | 16,186 | 150.2M | 1.66B | 8.68M | $1,840 |
gpt-5.6-terra | 9,045 | 24.4M | 1.08B | 2.75M | $372 |
gpt-5.6-luna | 11,886 | 51.5M | 1.76B | 3.90M | $251 |
gpt-5.3-codex-spark | 3,091 | 7.50M | 207.4M | 0.96M | $63 |
codex-auto-review | 461 | 4.73M | 34.4M | 0.05M | $42 |
gpt-5.4 | 1 | 23.1K | 1.9K | 0.34K | $0 |
| 合计 | 490,556 | 1.42B | 64.49B | 150.0M | $42,351 |
† 有 61,486 次请求日志里没记模型名;按 OpenAI 默认的 sol/5.5 顶档计价——对这一块是上限(见第 6 节)。
Claude Code(Claude Max)——$11,052
| 模型 | 请求数 | 输入 | 缓存读 | 缓存写 | 输出 | 牌价 |
|---|---|---|---|---|---|---|
| Opus 4.8 | 37,414 | 8.12M | 5.36B | 213.2M | 42.6M | $5,431 |
| Fable 5 | 16,762 | 3.73M | 2.59B | 89.3M | 17.4M | $4,833 |
| Sonnet 5(优惠价) | 11,700 | 2.12M | 2.08B | 48.6M | 6.52M | $641 |
| Opus 4.7 | 1,253 | 13.4K | 68.6M | 13.2M | 0.81M | $137 |
| Haiku 4.5 | 732 | 49.9K | 26.4M | 2.35M | 0.27M | $7 |
| Sonnet 4.6 | 49 | 171 | 1.35M | 0.47M | 42.5K | $4 |
| 合计 | 67,910 | 14.0M | 10.12B | 367.2M | 67.6M | $11,052 |
每个小计都是机械的。拿最大的一行 gpt-5.6-sol 来说——token × 公开的每百万单价:
| 项目 | Token | $ / 百万 | 金额 |
|---|---|---|---|
| 未缓存输入 | 1.02B | $5.00 | $5,114.61 |
| 缓存输入(读) | 51.60B | $0.50 | $25,801.57 |
| 输出 | 115.5M | $30.00 | $3,466.08 |
| gpt-5.6-sol 小计 | $34,382.26 |
再换个维度:不按模型、而按你到底在为什么付钱来归类,形状就非常刺眼:
- 缓存读 + 写:$40,151——占账单的 75%。光
gpt-5.6-sol一个模型的缓存读就是 $25,802,是整张账单的一半。 - 新鲜(未缓存)输入:$6,880——占 13%。
- 真正生成的输出:$6,372——占 12%。
这正是 agent 工作的特征:一份大上下文在每个回合被重发,绝大多数从缓存命中,而每次新产出的文本相对少得多。这也恰好是订阅制能很好吸收、而按量计费会狠狠惩罚的那种形状——这就是第 5 节。
为什么这个总数可信(三个陷阱)
「token × 单价」不值一提。全部的严谨性都在聚合这一步,而一个天真地把原始日志加总的脚本,会分别往三个方向「自信地错着」——每一个都足以把标题数挪动到改变结论的程度。上面这个数字之所以立得住,正因为它把三个陷阱都躲过了。
- 流式会重复同一个请求,而且计数在往上涨。Claude Code 是流式的,响应一边生成、它一边往日志追加行,于是同一个请求出现在很多行上,
output_tokens逐行递增。把每行都加就重复计数;只取首行又会把响应截在流的半途(在一批大会话的抽样里,首行会把输出少算约 28%)。解法:按requestId+message.id分组,每个请求只保留最后一次出现。 - fork 出来的会话会把累计总量重复计。Codex 日志里带一个逐会话的运行累计
total_token_usage;一个 fork 的会话会继承父会话的累计,于是把会话末值相加,共享的前缀就被算了两遍——71.0B,而真实约 66B,多算了约 7%。解法:改成累加逐回合的last_token_usage增量。 - cached input 是 input 的子集,不是额外一项。Codex 把
input_tokens报成该回合的总输入,把cached_input_tokens报成其中从缓存命中的那部分——它本就含在输入里。缓存读的计费大约是输入价的十分之一,所以计价前必须拆开(未缓存 =input − cached),否则你就把缓存那部分收贵了 10 倍。
然后交叉验证:我把逐回合的和跟会话末值对了一遍,直到彻底搞清那 7% 的差从哪来,才敢信这个数。
固定月费,才是这门生意的商业模式
把这个窗口年化,按牌价的按量等值大约是 每年 $641k——比大多数市场里一个资深工程师的全成本还高。粗看,这像是在说「AI 团队比人还贵」。但这不是结论——因为你根本不会真的去付这笔钱。
计价表一旦打开,你运转的方式立刻就变:砍并发、缩掉每回合重发的那份大上下文、掐掉投机重试和永不下班的巡检——正因为现在每一次缓存读都是有价的。那 $641k 是这套运转模式在牌价下的成本,不是谁会真的开出的一张支票。而这个反转,才是真正的重点:
固定订阅不是「更便宜的算力」——它是让这套运转模式根本得以成立的前提。永远在线、彼此互审、多 agent 的自动化,之所以算得过账,只是因为在使用的那一刻,边际 token 是免费的。把同样的行为改走按量 API,算式就翻了个个儿——它会比它本想撬动的那个人还贵——所以没人会那样跑自动化。订阅是让它成为可能的那项技术,而不是它的一个折扣。
所以值得盯的那个数,不是 $53,403 这个奖杯。而是你实付的价、和同样行为按量计费的价之间那 133 倍的差——因为那道差,就是「把 agent 当团队养、而不是当一次次 API 调用」的全部预算。
诚实的边界
- 这是反事实,不是省下的钱。「$53,403 的价值」是这些用量如果走按量 API 会计价多少——不是谁开给你的支票,而且(如第 5 节)也不是你真会花的钱,因为按量计费会改变你运转的方式。
- 这个用量是靠反复重置额度才跑出来的。Codex 这一侧塞不进单个标准周额度——周限额在窗口内三次打满 100%,靠几次重置清空(一部分手动、一部分厂商侧)。所以这个标题数是「一个订阅加上多次重置」,而不是一个原装订阅就能达到的。
- 大体是个下限,但有一处是上限,得点名。日志只覆盖这两个 CLI——不含 claude.ai 网页/移动端、ChatGPT 的网页/App、以及云端运行的任何用量——这些遗漏只会把数字往上推;价格侧还有两条也往上推:一个 Claude 模型在优惠价上,OpenAI 的缓存写量在日志里从没被填过(字段存在但恒为 0;已排除,上界不到 +$1,700)。唯一往反方向走、也是整张账单里最大的一处估算:约 10% 的总额($5,401、61,486 次请求)来自没有记录模型的会话,按 OpenAI 的默认档
sol/5.5顶价计——对这一块是上限。sol占有标注请求的约 90%,拿它当中心估计站得住;但如果这些会话其实是更便宜的模型,这一块可能少约 $4,300(约占标题数的 8%)。综合看,那些被排除的用量大概仍让总数是个下限;这一块是需要点名的例外。
总结
- 去问那个被计价表藏起来的问题。固定月费的 AI 订阅只给你一个百分比进度条,或者什么都不给;按模型、按 token 的用量只存在于本机 CLI 日志里(
~/.claude/projects、~/.codex/sessions)。重建按量账单,就是 token × 牌价。 - 做成明细,别只给总数。一个 30 天窗口:实付 $400,按量 $53,403——133 倍。其中缓存读写占 75%,单个模型的缓存读就是整张账单的一半。明细才是故事;孤零零一个总数会把它藏起来。
- 过了三个陷阱才敢信:流式会用递增的计数重复同一个请求(去重、取末次),fork 会话会把累计总量重复计(累加逐回合增量),cached input 是 input 的子集、不是额外一项(计价前先拆)。
- 固定月费,才是让这一切成立的技术。在每年约 $641k 的按量运转成本下,永远在线的自动化 agent 会比人还贵——所以没人按量那样跑。订阅那份「边际为零」的月费,才是让一支 AI 团队算得过账的原因。值得盯的不是那个奖杯般的总数——而是那道 133 倍的差,它才是「把 agent 当团队养」的预算。