加载中...
加载中...
-
看了你这篇分析我真想笑你知道我上个月刚买了智谱的coding plan花了100块本来觉得捡了大便宜结果用了一个星期我就发现问题了你是说缓存输入很便宜对吧但你有没有想过厂商根本不会把便宜的缓存价格算给你看他们给你看的是总token消耗量那个数字大的吓人10亿token听着挺多实际上跑个agent任务没几下就没了我也算过一笔账我这边写代码经常要改同一个文件里的多个函数每次让agent帮忙改东西它都要把整个文件内容重新读一遍虽然你说这是缓存输入但我的感受就是每次都在等它思考等它转圈圈速度跟用免费版的时候差不多慢的要死根本没觉得便宜到哪去 而且你说缓存输入只占十分之一的成本那为什么我买的包月套餐里的token消耗速度还是那么快我查了下后台消耗记录一次简单的重构就吃了30多万token我当时就懵了这要是我直接调API用缓存价格来算我敢说根本花不了几毛钱但套餐里就是这么扣的你觉得是厂商傻还是我傻他们要是真按你说的成本定价为什么还要搞这种打包模式还不是因为单次调API的缓存价格太透明了他们赚不到钱所以才搞个包月套餐让你觉得便宜实际上你根本算不清自己到底用了多少缓存多少非缓存 我记得有一次我那个agent任务跑了特别久中间连续调了几十次工具我盯着后台数据看输入token差不多是输出的八十多倍然后我就想这么高的缓存命中率成本应该极低啊但那个套餐的消耗计数器还是蹭蹭往上涨最后一天不到就把我10亿token干掉了将近一半我真是服了你要说这不亏本我信但你要说厂商不赚钱那我绝对不信他们这种商业模式明摆着就是把用户当韭菜割呢 再说说你这个健身房模式的说法听起来挺有道理但健身房是真的赌你不来很多人办卡就是头脑一热买完就忘而coding plan不一样我买了这个就是为了每天上班用啊那是刚需而且越用越亏越不用也觉得亏这心态完全不一样我身边好几个同事都买了不同家的plan每天都在那比谁用的多像是赚到了似的实际上大家都被套牢了你说厂商预测用户行为模式我觉得他们预测的太对了知道你跑不了知道你会天天用所以才敢定这个价要真像你说的缓存成本这么低他们应该大大方方把价钱降下来才对怎么反而越来越多人抱怨token不够用呢 我不是说你的数据是假的但你那个3M token的例子也太理想了吧OpenAI那个工具你是拿来做实验吧我实际用智谱的glm coding的时候觉得缓存命中率根本没你炫耀的那么高有时候我改了文件里的几行代码它居然把整个文件重新处理了一遍甚至历史对话里我删掉了一句话它也把之前的缓存全给冲了这种真实使用场景跟你的实验室数据差太远了程序员用agent写代码本来就东改一下西改一下不是那种规规矩矩从头跑到尾的流程你拿一个跑通的任务来说缓存输入占90我觉得没代表性 而且你还没提一个很重要的东西就是那些坑爹的上下文遗忘问题有时候agent跑着跑着突然忘了前面的上下文它就会重新把之前的工具结果全部拉一遍你以为这是缓存输入很便宜但实际上这代表着之前的缓存已经失效了要重新计算这在你那个统计口径里是算缓存还是算新的输入我猜厂商肯定把这种也按缓存算了因为技术上说KV cache可能还有一部分能复用但背后付出的代价绝对不是你想象中那么大水下的成本你根本没算进去 我还有个亲身体验就是高峰时段用那个coding plan经常卡的要死遇到过好几次直接报错超时联系客服他们也没办法就知道说系统繁忙你想想如果缓存成本真这么低他们为什么不多部署点机器让高峰时段也流畅些说白了就是扣成本呢宁可让你多等一会儿也不愿意多花钱买算力这恰好说明他们对缓存资源的控制其实挺紧的并不是像你讲的那样无本万利你光算电费和显存的消耗但你算过用户在高峰期堵车时候的时间成本吗虽然这个钱不是厂商出的但用户体验变差反过来也会影响他们的营收啊 另外你说缓存输入价格只是十分之一那你怎么解释市面上那些白嫖方案比如github copilot现在也有类似plan很多人用那种几十块一个月的共享账号说到底这玩意儿的实际成本真的低到了能撑得起这种灰色市场如果AI厂商真的在亏本卖那些共享账号拿什么赚钱还不是用你的API key然后疯狂刷缓存输入把成本压低到一个离谱的程度你说厂商哭穷我觉得他们不是在哭穷而是在闷声发大财把用户耍的团团转 我知道你想说因为缓存输入有巨大的确定性所以可以进一步压成本但你好歹也提一下网络传输和工程运维吧一个coding plan用户每次任务要来回传多少数据那些system prompt工具定义加起来确实2万token但每轮都要发送一遍虽然服务端有缓存但网络带宽呢你本地到服务器的延迟呢这些都不要钱吗你举的例子里面一个3M token的任务有285万是缓存输入就算全都命中缓存但传输过程中消耗的资源也不小啊你怎么能在算成本的时候把这些都给忽略了呢 还有一种情况你没想到就是多用户并发如果你有1000个coding plan用户同时跑任务大家的缓存输入都命中各自不同的上下文服务器就要维护1000份不同的KV cache这可不是共用的啊每个人都占一块显存内存你这成本怎么算你想过没有即便缓存比prefill便宜但对硬件资源的占用是实实在在的而且这种并发场景是常态尤其是工作日上午程序员们都开始干活的时候那服务器压力爆表你光用个0.25美元每百万token就说明不了什么问题了那只是边际成本里的边际成本而已 我记得我们公司去年测试过Claude的API也试过openai的agentic coding算下来跑一个中等项目包括调试和修bug总共消耗的token换算成钱早就超过100美元了要是用plan那确实便宜很多但你有没有想过plan模式让用户产生了过度使用的心理我们以前用API都得盯着预算不舍得多调现在好了买了个plan就疯狂地用各种小任务都丢给agent去搞恨不得把整个代码库都让它重写一遍这种用户行为的变化会大幅提高厂商的实际运营成本他们要是真按照你那个物理成本来定价早就亏到姥姥家了 再说你们的那个健身房类比我觉得一点都不恰当健身房的成本主要是房租和器械这些是固定的去的人少反而能省水电费但AI服务的成本是动态的用的越多消耗越大哪怕缓存再便宜它也是有边际成本的白嫖党用你提供的资源去跑私有任务你要维护那些state和缓存其实比重新生成的代价更高因为你不能随意丢弃用户的数据啊你得保障可靠性吧光这一块存储成本就够喝一壶的你怎么能一句缓存命中就把这些都抹掉了呢 再说说你提到的缓存输入价格是输出的十分之一这种定价策略你以为是厂商良心发现吗那其实是为了吸引API用户好把那些无脑重复请求转移到缓存上来从而降低整体负载但coding plan用户的请求模式远远比纯API用户更复杂他们要实时交互要响应各种工具调用的输出要快速切换上下文缓存命中带来的性能提升被他们通过加大并发量给抵消了你去看那些买了plan的人几乎都开着好几个terminal同时跑好几个agent你说这服务器遭得住吗 我有个朋友更狠他把公司所有项目的代码都让一个agent去读然后把用不到的那些模块全删了结果那个agent上下文爆炸了令牌直接烧掉了好几个亿他那个plan一天就报废了你觉得这种用户占多数吗但厂商肯定遇到过不少这样的人他们设计plan的时候肯定已经把这个风险算进去了所以价格绝对不可能像你说的那样没有利润空间 所以我总结一下不是我不信你的数据我只是觉得你把成本结构想的太简单了你把缓存输入的价格当成实际的边际成本但你忘了缓存要消耗存储和内存要维护一致性要处理淘汰策略还要应对用户的不确定性行为这些都会让实际成本比那个标价高得多而且越高负载的环境下这些成本越膨胀你说厂商哭穷也许是演戏但那不代表他们真的赚到盆满钵满也有可能他们确实是薄利多销只是市场宣传做得好让你觉得他们亏本然后再通过别的渠道赚回来比如卖更贵的企业版啥的 我最后再吐槽一句你那个GPT 5.4的模型例子到现在我也没见到哪个厂商真给这么优惠的缓存价格国内这些plan全都是把缓存算进去但并没有在后台告诉你缓存花了多少钱你只能看到总token然后总觉得用的飞快这搁谁谁不怀疑厂商在偷偷加价你还站出来替他们说话你是不是收钱了 反正我下个月不准备续费了我打算自己搭个本地模型搞个autopilot虽然效果差点但至少心里明白每token的成本在哪不被你们这些人云里雾里的忽悠你自己用吧我不奉陪了
加载中...
加载中...

