加载中...
加载中...
-
刚刷到这篇 Deepseek V4 测评 我第一反应不是兴奋 是有点想笑 文章里那个 Vals AI 说 Vibe Code Benchmark 压倒性第一 又说 V3点2只有5分 这不是笔误 我看到这句就卡住了 5分 这也太像拿一个刚学会走路的小孩去比百米冠军 不是说V4不行 是说这个对比太会挑时候了 老版本被踩到泥里 新版本自然飞上天 这数据好看 但看久了就发现味道不对 还有文章里那个时间线 我有点懵 现在外面都 GPT5点5 了 还有 Claude Opus4点7 还有 Gemini3点1 Pro 我这几个月没上网吗 我怎么记得我还在用 V3点2 写脚本 这文章要是提前写好的科幻稿 那我也能写 Deepseek V8 拳打外星人 脚踢黑洞 反正没人见过 当然要是真出了 那当我没说 我先道歉 但看标题第一波测评 结果全是二手搬运 连个完整表格都没贴 我信一半都算多 Arena ai 那个数据我倒觉得还算实在 代码竞技场开源第3 综合第14 这个排名就很有信息量 综合第14 说明前面还有13个 它没说是闭源还是开源 要是闭源多 那你DeepSeek再便宜也是追 追和超是两码事 文章标题写得像已经登基 实际是开源里第3 综合14 这就像班里数学考第三 总分排14 你非说自己是学霸 也不是不行 但别把偏科吹成全能 Vals AI 那个 Vibe Code Benchmark 名字我就想吐槽 氛围编程基准 听着像一群人在X上凭感觉投票 谁解释得花哨谁赢 我不是说它一定假 我是说这种榜的含金量得打个大问号 你拿它当唯一证据 还写压倒性优势 击败Gemini3点1 Pro 结果综合指数第2 跟 Kimi K2点6 只差百分之0点07 这百分之0点07能说明啥 下一次跑分可能就翻过来了 这不叫统治 这叫并列第一梯队 那个10倍性能跃升 我越看越觉得怪 V3点2在该基准上仅得5分 这不是笔误 那问题来了 V3点2真的这么烂吗 我记得V3点2出来的时候也是铺天盖地吹 怎么到V4这里就变成5分垫底了 测评基准是不是专门为了衬托新版改过 或者V3点2根本不适合这个任务 拿不适合的旧模型当对照组 得出来的10倍就是数字游戏 5分涨到50分叫10倍 50分涨到100分叫翻倍 哪个更难 用脚想都知道 定价那段更逗 V4 Flash 输出每百万token 0点28美元 比 Claude Opus4点7 低百分之九十九 你怎么不跟同级别的比 你拿最贵的跑车比自行车 说自行车便宜百分之九十九 这不废话吗 还有 V4 Pro 3点48美元 是同级别前沿模型中定价最低的选项之一 之一这俩字很妙 最低就最低 之一就是给自己留后路 说明还有别的也低 或者它根本不敢说绝对最低 我一个小公司写后端的 平时也用API 我最怕的不是单价 是总账单 你单价0点28 结果思考模式一开 输出几千token 长上下文一挂 输入也烧钱 缓存命中率低 排队还慢 最后一个月账单比Claude还贵 这不是不可能 低价是钩子 用户进来才发现鱼食也要钱 文章只给出输出价格 输入价格呢 缓存价格呢 并发限制呢 吞吐限制呢 全没提 那我只能自己踩坑 百万级上下文 听起来很猛 我也试过别家的百万上下文 问中间某一段的细节 它给我编得跟真的一样 找了三遍没找到 最后还得自己grep 长上下文不等于有效记忆 更不等于便宜 100万token塞进去 每次推理都读一遍 那成本能低吗 KV缓存能把显存吃光 家里跑更别想 文章说门槛压低 我看是把调用门槛压低 把部署门槛抬到天上 MIT开源协议是好东西 我认 权重放出来能让小厂自己折腾 但1点6万亿参数 激活49B 你让我拿什么跑 我只有一张4090 跑个量化版都喘 速度跟蜗牛上树 社区那个 Sigrid Jin 说现在可以在家里跑 GPT5点4-ish 的模型 我求求你别吹了 家里跑的是阉割量化版 上下文一长就崩 写个hello world当然像 你让他跑真实项目试试 跑一半显存不足 直接黑屏 V4 Flash 2840亿参数 激活13B 看着好像亲民 但13B激活也不是免费 长上下文一开 KV缓存照样爆炸 而且Flash便宜归便宜 文章自己都引了 Michael Anti 说实际体验没超越V3点2 老用户升级失望 这话比那些X上的吹子可信多了 老用户有对比 有旧账单 有旧项目 他们说不香 那大概率真不香 新用户没吃过好的 上来当然觉得香 官方自评那段我反而觉得是全文最诚实的地方 说知识与推理接近闭源系统 但仍有约3到6个月差距 还提示受限于高端算力 Pro服务吞吐有限 后续价格存在下调预期 你看 自己都承认有差距 自己都说吞吐有限 自己都说会降价 那现在冲Pro的人图啥 图当付费测试员 图帮官方压测 图以后降价了没有补偿 官方越克制 越说明现在不是最佳入手点 等三个月 等正式版 等价格下来 不香吗 社区反应分化 这很正常 X上那几个账号说打穿 说中国主导AI 我看了毫无波澜 一个榜单第一就能主导AI 那AI也太不值钱了 Ejaaz 说代码竞技场排名第一 可他说的是Vibe Code Benchmark 不是所有代码任务 也不是所有综合任务 偷换概念太明显 Sigrid Jin 说击败GPT5点4高强度模式 我想问哪个GPT5点4 我连GPT5点5都没摸过 这些名字现在跟玄幻小说境界一样 一个比一个唬人 文章标题第一波测评来了 第一波往往是最乐观的一波 厂商送测 平台配合 社区上头 真等独立开发者用一个月 等真实项目跑起来 等账单出来 第二波第三波才是真相 V4预览版开源 预览版这三个字就很关键 预览版不等于正式版 正式版可能缩水 也可能涨价 也可能改协议 现在吹上天 到时候翻车 谁负责 文章作者负责吗 他只会再写一篇 V4翻车第一波 我承认DeepSeek代码能力一直不差 以前用V3写小工具 确实比某些国外模型顺手 中文提示词也友好 价格也便宜 这点该夸就夸 但夸归夸 别把Vals AI一个榜当圣旨 也别把Arena第14说成综合第一 代码偏科是好事 但偏科不等于全科第一 写业务代码要懂遗留系统 要懂内部框架 要懂产品需求 要懂线上报错 这些榜单测不出来 刷榜再高 接不进我项目也是白搭 自述材料里说代码与Agent领域差距最小 知识和推理接近闭源 这句话翻译一下就是 代码追得最近 但还是有差距 知识推理还差三到六个月 这已经很明白了 不是领先 是追赶 追赶不丢人 丢人的是粉丝硬吹成碾压 还有那个受限于高端算力 这话听着心酸 也是现实 但用户不关心你心酸 用户关心能不能稳定调用 能不能不排队 能不能不涨价 你吞吐有限 我花钱也买不到稳定 那低价对我意义在哪 价格下调预期 这句我最敏感 因为我现在要是按3点48美元用 过俩月你降到1块 我前面花的钱找谁退 你肯定不退 那最优策略就是等 等降价 等正式版 等Flash再改进 等Michael Anti说的那些问题修好 我不是不买 我是不想当韭菜 文章写得热火朝天 我钱包是冷的 每百万token看着小 乘上项目量就是大 老板不会因为我用国产模型就多给预算 还有那个比Claude Opus4点7低百分之九十九 这种话术太low了 Claude贵有贵的场景 你拿自己便宜去比 就像沙县小吃说比米其林便宜百分之九十九 对 你便宜 但人家客户群不一样 你要比就跟同价位的比 跟GPT5点5比 跟Gemini3点1 Pro比 跟Kimi K2点6比 跟Qwen比 专挑最贵的比 除了营销真没别的解释 而且低百分之九十九 用户真能省百分之九十九吗 不可能 因为token用量 思考长度 重试次数 都不一样 V4 Pro 1点6万亿参数 激活49B 这个规模开源 确实有魄力 我佩服 但开源权重不等于开源训练数据 也不等于开源训练代码 更不等于开源算力 你能下载权重 但你复现不了 你微调成本也高 对小团队来说 开源的意义是省API钱 但部署成本可能比API还贵 除非你量特别大 不然还是乖乖买API 那买API又回到吞吐有限 排队 涨价 这些问题 所以别一听开源就高潮 Arena代码竞技场开源第3 综合第14 这个数据我反复看 它说明V4在代码上确实能打 但综合能力还差得远 综合第14 前面13个是谁 文章不列 我猜有闭源也有开源 要是前面全是闭源 那还说得过去 要是前面还有开源 那开源第一梯队这个说法就有点水分 文章只说冲进开源第一梯队 第一梯队可以很多人 第3是 第10也是 第20也能硬蹭 反正没标准 Vals综合指数第2 与K
加载中...
加载中...

