加载中...
加载中...
-
看你们吹得这么凶我就想说两句不好听的 代码榜第一又咋了 我拿flash跑了个我们项目里的老接口重构 结果它把我原来的异常处理全砍了 看着跑通了 一上线就崩 查半天发现它把try catch吞了还一本正经注释说简化逻辑 这哪是简化这是埋雷 我家那破笔记本16g内存跑v4pro想都别想 flash倒是能跑 但生成到一半开始疯狂复读 同一个函数给我写三遍 每一遍还都长得不一样 改起来比我自己写还累 那些榜单到底测的啥啊 全是竞技场投票和特定基准 跟真实工程场景两码事 我之前用v3.2写脚本倒是稳得很 现在升级了反而要盯着它别自作聪明 官方自己都说跟闭源差三到六个月 怎么到网友嘴里就成吊打gpt5.5了 0.28美元一百万token是便宜 可你要是让它干点复杂活 来回纠错消耗的token加起来也没省多少 尤其那个什么vibecode榜 我怀疑评测的人是不是就让它写个贪吃蛇 那当然随便赢 还有那个说在家跑gpt5.4类似模型的 我就想笑 你知道1.6万亿参数啥概念吗 那是pro不是flash 普通人的显卡连量化版都塞不进去 能用得起flash就算不错了 可flash这体验跟v3.2比真没啥惊喜 上下文倒是长了 可我塞了一份五百页的屎山代码进去 它读到后面把前面需求忘了 还得我提醒它 百万上下文听着唬人 实际就是个记忆橡皮擦 我不是说deepseek不行 我是烦这种每次发新版就一群人高潮的风气 v3.2刚出的时候也吹开源第一 结果呢 用俩月就发现复杂推理还是得靠gpt 现在v4出来又吹十倍跃升 十倍 这词跟不要钱似的 我数学不好 但5分到50分确实是十倍 可你要是从0分到10分那也是无穷大啊 这种benchmark看看就得了 真信了拿生产环境去试 哭都来不及 反正我打算继续用v3.2 等v4再迭代几个小版本再说 别跟我提什么MIT开源啥的 开源是好 可你本地跑不动 还不是得用他们api 用api就得忍受限流 我看那pro的吞吐写着有限 到时候抢不到算力 再便宜有啥用 不如把v3.2调教好点 至少我知道它啥时候犯蠢
加载中...
加载中...

