返回

LLM Coding Plan 经济学——厂商哭穷你也信?

各家大模型厂商都推出了Coding Plan,例如智谱、MiniMax、阿里云。购买Coding Plan,付出100人民币的价格,每个月能够使用10亿token,简直便宜到爆。

不少人会好奇,大模型厂商是真的在赔本赚吆喝吗?为什么要有Coding Plan这种模式?

结论其实也很简单,大模型厂商的Coding Plan并不会真正亏本。绝大多数大模型厂商都在哭穷而已。想要理解LLM Coding Plan经济学的核心,有这么几个概念——缓存输入、用户行为模式变化、API毛利、健身房模式。

缓存输入

必须明确:Coding Plan动辄10亿token、100亿token消耗,绝大多数都是缓存输入。

大模型在处理用户请求的时候,对于输入进行prefill,计算decode输出新的token。对于前面已经输入过的内容,厂商并不需要从头进行prefill,而可以复用此前计算的KV-Cache。这部分输入被称为缓存输入cached input。

缓存输入直接反映在API定价上,GPT 5.4模型,输入价格为2.5美元,输出价格为15美元,缓存输入仅为0.25美元/million token。Claude也有类似的折扣,缓存输入价格仅为1/10。




对于Coding Plan来说,Agent调用过程中需要执行多轮工具调用,每一轮都要把前面的历史发送回去,使得缓存输入占了绝大多数。

这是笔者使用OpenAI Codex抓取的使用量记录。输入为319万token,缓存输入为285万token,真正新读入的仅为30万token,输出仅有2万token。

{"total_token_usage" :{"input_tokens":3198499, "cached_input_tokens":2857088, "output_tokens":19228, "reasoning_output_tokens":2680, "total_tokens":3217727 }

大致来说,input:output的比例是100:1,其中cached input占比90%。而随着Agent能够执行越来越长的任务,这个比例甚至会上升到200:1,甚至缓存输入占比达到95%。

笔者一个任务消耗的3M token,按照OpenAI官方的GPT 5.4 API价格计算,2.850.25 + 0.32.5 + 0.02*15 = 1.76美元。平均下来0.58美元/M token。

同理,虽然看起来消耗token总量很大,但实际token的单价更多取决于缓存输入的价格

Coding Plan专属用户行为模式 和 API 毛利

值得注意的是,Agentic Coding和常规API用户的行为模式会存在很大不同。

对于API来说,厂商无法判断这个请求是否会有高比例的缓存输入,存在相当大的机会成本。如果API没有产生缓存命中,那么厂商就白白浪费了为了维持KV-Cache而占用显存、内存和硬盘存储的成本。缓存输入的收费,很大程度上是在为机会成本付费。

但是对于Agentic Coding来说,多轮工具调用必然会产生大比例的缓存输入,这几乎是确定性的。厂商更容易预测Coding Plan用户的行为模式,由此缓存输入的成本还能够进一步降低。例如等待5秒钟的工具调用,返回本地文件读取的结果,缓存命中的成本远远低于收费的0.25美元/M token。

Claude Code、Codex的system prompt、工具定义,一个请求起步就会占用掉2万token以上。Agentic Coding主要工具就那么几种,Claude Code、Codex都有着相同的system prompt,这部分厂商不需要重新进行prefill,可以直接复用缓存。

同时不要忘了,厂商的API定价,并非厂商自己的成本,而是包含了毛利的对外售价。Deepseek曾经公布过的毛利高达84%,根据the information的报道OpenAI毛利也已经改善至70%,Anthropic毛利也达到了60%以上。

不仅海外厂商的毛利极高,即便是财报亏损的智谱,其API单次调用的毛利实际上也是极高的。

以GLM 5模型为例,总参数788B,激活参数40B,采用了和Deepseek一样的稀疏注意力机制。作为对比Deepseek V3.2为671B总参数,激活参数32B,稀疏注意力机制。Deepseek V3.2售价为输入2人民币,输出3人民币/M token。两者之间的成本应该大致相同。

我们既便认为Deepseek的infra水平较高,把Deepseek的对外售价当作GLM 5的成本。GLM 5输入单价6元,输出24人民币/M token,毛利水平也应该在80%以上。




如果我们将缓存输入的真实成本认为仅有对外售价的10%,而常规的输入输出认为毛利为80%。那么笔者在前面使用Codex 的 GPT 5.4模型,真实成本仅为 2.850.2510% + (0.32.5 + 0.0215) * 20% = 0.21 美元。这还是300万token,平均下来真实的成本仅为0.07美元/百万token。

这里还要提醒一下,厂商财报口径的销售成本COGS,也并非真正使用token的边际成本。例如OpenAI ChatGPT免费用户产生的推理成本、infra人员的工资和股权激励都会被计算到COGS。而事实上例如推理infra人员工资是有很强的规模效益,并不会随着你多用token而线性增长。同样的显卡集群,也有相当大的弹性,可以通过降低单用户tps来换取更高的总吞吐量,在一定范围内对于厂商来说几乎是0边际成本。

如果我们拆出真正意义上token的边际利润,也就是显卡折旧、电费,则会比财报口径显示的毛利乐观得多

健身房模式

订阅制都绕不开健身房模式,只有少数高频用户会将容量用满,绝大多数用户使用频次很低。订阅制在ChatGPT上已经得到了充分的验证。Coding Plan用户虽然看起来更专业一些,但是即便代码用户内部也存在分化,二八定律这样绝大多数人不怎么用的模式依然成立。

ChatGPT年度总结显示,年度发送4139条消息就跻身前5%用户行列,平均下来每天发送11条消息而已。这侧面反映Chatbot反而变成了一个性感的生意。用户聊天能消耗多少token呢?ChatGPT的20美元一个月实际上赚的盆满钵满。

Codex相比于Claude Code订阅能够给出更加慷慨的额度。同样是20美元订阅,Claude每5小时只能使用5美元,每周50美元。Codex则5小时可以使用17美元,每周80美元额度。

ChatGPT目前订阅会员超过5000万,绝大多数用户都是低频用户的前提下,OpenAI就可以利用ChatGPT会员订阅收来的钱补贴Codex用量。




而如果放到中国语境下,Coding Plan很大程度上随着OpenClaw热度而大卖。但事实上微信指数显示,OpenClaw比峰值已经跌去了95%,图新鲜用户购买Coding Plan也早就不怎么用了。



事实上,根据此前ChatGPT的年度分享透露的分位数,采用对数正态分布,我们可以反推出ChatGPT用户平均每年发送1138条消息,也即每天3条。Coding Plan虽然无从得知其具体分布,但也可以参照ChatGPT的分布。



在笔者写此文的2026年4月14日,ChatGPT的周活用户是9亿,订阅用户5000万,Codex用户周活刚刚突破300万。这意味着如果OpenAI愿意用ChatGPT用户会员费补贴Codex,实际上存在10倍以上的补贴空间。

根据前文的计算,按照官方标价0.58美元/M token,实际成本仅为0.07美元,占比12%。ChatGPT Plus会员真实缴费20美元,Codex每周可用80美元,每个月320美元等额API额度,真实成本仅为38.4美元。试问,又有多少用户真正把Codex每周额度都用到50%以上呢?更不要忘了前面ChatGPT会员费带来的10倍补贴空间。

笔者贡献一个样本,周额度剩余98%,还有5天重置额度。



厂商哭穷你别信

大模型这一轮舆论咄咄怪事尤其多,例如2023年猛吹私有部署、微调小模型的奇谈怪论,到了2026看这些完全都不是主线。模型通用能力的提升,Agentic框架更好的脚手架才是绝对的主线。

大模型不赚钱的论调也甚嚣尘上。事实恰恰和舆论论调相反:模型推理毛利极高,行业主流都在80%以上。营收ARR体量上OpenAI达到250亿美元,Anthropic达到300亿美元,以人类商业史上从未有过的速度增长。

Anthropic CEO Dario Amodei多次强调quite profitable。即便是Coding Plan,在前文计算下,也是一种营销手段。

大众看到的亏损,有一部分是研发和营收错位导致的,厂商在训练下一代模型,而下一代模型尚未产生营收。有一部分可能单纯是重走CV四小龙的老路,研发效率低下导致的。至于不赚钱?厂商哭穷你别信。

分享到
QQ 微信 微博 复制链接
微信分享二维码

微信扫一扫,分享给好友

本文来自投稿,不代表本站立场,如若转载,请注明出处:

发表评论

V注册会员 L评论等级
R1 条回复
  1. 2026-08-25     Android /    UC浏览器

    看了你这篇分析我真想笑你知道我上个月刚买了智谱的coding plan花了100块本来觉得捡了大便宜结果用了一个星期我就发现问题了你是说缓存输入很便宜对吧但你有没有想过厂商根本不会把便宜的缓存价格算给你看他们给你看的是总token消耗量那个数字大的吓人10亿token听着挺多实际上跑个agent任务没几下就没了我也算过一笔账我这边写代码经常要改同一个文件里的多个函数每次让agent帮忙改东西它都要把整个文件内容重新读一遍虽然你说这是缓存输入但我的感受就是每次都在等它思考等它转圈圈速度跟用免费版的时候差不多慢的要死根本没觉得便宜到哪去 而且你说缓存输入只占十分之一的成本那为什么我买的包月套餐里的token消耗速度还是那么快我查了下后台消耗记录一次简单的重构就吃了30多万token我当时就懵了这要是我直接调API用缓存价格来算我敢说根本花不了几毛钱但套餐里就是这么扣的你觉得是厂商傻还是我傻他们要是真按你说的成本定价为什么还要搞这种打包模式还不是因为单次调API的缓存价格太透明了他们赚不到钱所以才搞个包月套餐让你觉得便宜实际上你根本算不清自己到底用了多少缓存多少非缓存 我记得有一次我那个agent任务跑了特别久中间连续调了几十次工具我盯着后台数据看输入token差不多是输出的八十多倍然后我就想这么高的缓存命中率成本应该极低啊但那个套餐的消耗计数器还是蹭蹭往上涨最后一天不到就把我10亿token干掉了将近一半我真是服了你要说这不亏本我信但你要说厂商不赚钱那我绝对不信他们这种商业模式明摆着就是把用户当韭菜割呢 再说说你这个健身房模式的说法听起来挺有道理但健身房是真的赌你不来很多人办卡就是头脑一热买完就忘而coding plan不一样我买了这个就是为了每天上班用啊那是刚需而且越用越亏越不用也觉得亏这心态完全不一样我身边好几个同事都买了不同家的plan每天都在那比谁用的多像是赚到了似的实际上大家都被套牢了你说厂商预测用户行为模式我觉得他们预测的太对了知道你跑不了知道你会天天用所以才敢定这个价要真像你说的缓存成本这么低他们应该大大方方把价钱降下来才对怎么反而越来越多人抱怨token不够用呢 我不是说你的数据是假的但你那个3M token的例子也太理想了吧OpenAI那个工具你是拿来做实验吧我实际用智谱的glm coding的时候觉得缓存命中率根本没你炫耀的那么高有时候我改了文件里的几行代码它居然把整个文件重新处理了一遍甚至历史对话里我删掉了一句话它也把之前的缓存全给冲了这种真实使用场景跟你的实验室数据差太远了程序员用agent写代码本来就东改一下西改一下不是那种规规矩矩从头跑到尾的流程你拿一个跑通的任务来说缓存输入占90我觉得没代表性 而且你还没提一个很重要的东西就是那些坑爹的上下文遗忘问题有时候agent跑着跑着突然忘了前面的上下文它就会重新把之前的工具结果全部拉一遍你以为这是缓存输入很便宜但实际上这代表着之前的缓存已经失效了要重新计算这在你那个统计口径里是算缓存还是算新的输入我猜厂商肯定把这种也按缓存算了因为技术上说KV cache可能还有一部分能复用但背后付出的代价绝对不是你想象中那么大水下的成本你根本没算进去 我还有个亲身体验就是高峰时段用那个coding plan经常卡的要死遇到过好几次直接报错超时联系客服他们也没办法就知道说系统繁忙你想想如果缓存成本真这么低他们为什么不多部署点机器让高峰时段也流畅些说白了就是扣成本呢宁可让你多等一会儿也不愿意多花钱买算力这恰好说明他们对缓存资源的控制其实挺紧的并不是像你讲的那样无本万利你光算电费和显存的消耗但你算过用户在高峰期堵车时候的时间成本吗虽然这个钱不是厂商出的但用户体验变差反过来也会影响他们的营收啊 另外你说缓存输入价格只是十分之一那你怎么解释市面上那些白嫖方案比如github copilot现在也有类似plan很多人用那种几十块一个月的共享账号说到底这玩意儿的实际成本真的低到了能撑得起这种灰色市场如果AI厂商真的在亏本卖那些共享账号拿什么赚钱还不是用你的API key然后疯狂刷缓存输入把成本压低到一个离谱的程度你说厂商哭穷我觉得他们不是在哭穷而是在闷声发大财把用户耍的团团转 我知道你想说因为缓存输入有巨大的确定性所以可以进一步压成本但你好歹也提一下网络传输和工程运维吧一个coding plan用户每次任务要来回传多少数据那些system prompt工具定义加起来确实2万token但每轮都要发送一遍虽然服务端有缓存但网络带宽呢你本地到服务器的延迟呢这些都不要钱吗你举的例子里面一个3M token的任务有285万是缓存输入就算全都命中缓存但传输过程中消耗的资源也不小啊你怎么能在算成本的时候把这些都给忽略了呢 还有一种情况你没想到就是多用户并发如果你有1000个coding plan用户同时跑任务大家的缓存输入都命中各自不同的上下文服务器就要维护1000份不同的KV cache这可不是共用的啊每个人都占一块显存内存你这成本怎么算你想过没有即便缓存比prefill便宜但对硬件资源的占用是实实在在的而且这种并发场景是常态尤其是工作日上午程序员们都开始干活的时候那服务器压力爆表你光用个0.25美元每百万token就说明不了什么问题了那只是边际成本里的边际成本而已 我记得我们公司去年测试过Claude的API也试过openai的agentic coding算下来跑一个中等项目包括调试和修bug总共消耗的token换算成钱早就超过100美元了要是用plan那确实便宜很多但你有没有想过plan模式让用户产生了过度使用的心理我们以前用API都得盯着预算不舍得多调现在好了买了个plan就疯狂地用各种小任务都丢给agent去搞恨不得把整个代码库都让它重写一遍这种用户行为的变化会大幅提高厂商的实际运营成本他们要是真按照你那个物理成本来定价早就亏到姥姥家了 再说你们的那个健身房类比我觉得一点都不恰当健身房的成本主要是房租和器械这些是固定的去的人少反而能省水电费但AI服务的成本是动态的用的越多消耗越大哪怕缓存再便宜它也是有边际成本的白嫖党用你提供的资源去跑私有任务你要维护那些state和缓存其实比重新生成的代价更高因为你不能随意丢弃用户的数据啊你得保障可靠性吧光这一块存储成本就够喝一壶的你怎么能一句缓存命中就把这些都抹掉了呢 再说说你提到的缓存输入价格是输出的十分之一这种定价策略你以为是厂商良心发现吗那其实是为了吸引API用户好把那些无脑重复请求转移到缓存上来从而降低整体负载但coding plan用户的请求模式远远比纯API用户更复杂他们要实时交互要响应各种工具调用的输出要快速切换上下文缓存命中带来的性能提升被他们通过加大并发量给抵消了你去看那些买了plan的人几乎都开着好几个terminal同时跑好几个agent你说这服务器遭得住吗 我有个朋友更狠他把公司所有项目的代码都让一个agent去读然后把用不到的那些模块全删了结果那个agent上下文爆炸了令牌直接烧掉了好几个亿他那个plan一天就报废了你觉得这种用户占多数吗但厂商肯定遇到过不少这样的人他们设计plan的时候肯定已经把这个风险算进去了所以价格绝对不可能像你说的那样没有利润空间 所以我总结一下不是我不信你的数据我只是觉得你把成本结构想的太简单了你把缓存输入的价格当成实际的边际成本但你忘了缓存要消耗存储和内存要维护一致性要处理淘汰策略还要应对用户的不确定性行为这些都会让实际成本比那个标价高得多而且越高负载的环境下这些成本越膨胀你说厂商哭穷也许是演戏但那不代表他们真的赚到盆满钵满也有可能他们确实是薄利多销只是市场宣传做得好让你觉得他们亏本然后再通过别的渠道赚回来比如卖更贵的企业版啥的 我最后再吐槽一句你那个GPT 5.4的模型例子到现在我也没见到哪个厂商真给这么优惠的缓存价格国内这些plan全都是把缓存算进去但并没有在后台告诉你缓存花了多少钱你只能看到总token然后总觉得用的飞快这搁谁谁不怀疑厂商在偷偷加价你还站出来替他们说话你是不是收钱了 反正我下个月不准备续费了我打算自己搭个本地模型搞个autopilot虽然效果差点但至少心里明白每token的成本在哪不被你们这些人云里雾里的忽悠你自己用吧我不奉陪了

    回复
没有更多评论了

作者信息

吕思勉
作者有点忙,还没写简介
TA的最新作品
    请配置好页面缩略名选项

推荐话题

关于本站

来跟我聊聊吧~