DeepSeek V4 预览版开源上线后,第一波来自第三方榜单的测评结果已经出炉。多家测评显示,DeepSeek V4性能尤其在代码任务上冲进开源第一梯队,同时以“百万级上下文+低价”把开发者侧的使用门槛进一步压低。
从第三方评测来看,评测平台 Arena.ai 在 X 上将V4 Pro(思考模式)定性为"相较DeepSeek V3.2的重大飞跃",在其代码竞技场中列开源模型第3位、综合第14位;另一家测评方 Vals AI 则称,V4在其Vibe Code Benchmark中以"压倒性优势"拿下开源权重模型榜首,击败Gemini 3.1 Pro等闭源模型,较上代V3.2实现约10倍性能跃升。

定价层面,V4-Flash输出价格为每百万token 0.28美元,较Claude Opus 4.7低逾99%;V4-Pro输出价格为3.48美元,是同级别前沿模型中定价最低的选项之一。对比表格显示,Flash 处于小模型区间最低档,Pro 也处于“大模型前沿”区间低位。
围绕实际体验的讨论开始分化。多位网友在 X 上称其性价比“打穿”。而DeepSeek在自述材料中则保持克制,称在知识与推理上接近闭源系统但仍有约3到6个月差距,同时提示“受限于高端算力”,Pro 服务吞吐有限,后续价格存在下调预期。
第三方测评:代码能力独占鳌头,综合排名紧追顶级
就在OpenAI GPT-5.5发布不久后,DeepSeek-V4预览版正式上线并同步开源,涵盖参数总量1.6万亿(激活参数49B)的V4-Pro,以及参数总量2840亿(激活参数13B)的V4-Flash,两款模型均支持100万token超长上下文窗口,采用MIT开源协议。

模型评测平台Arena.ai在V4发布当日宣布,DeepSeek V4 Pro(思考模式)在其代码竞技场中排名开源模型第3位,综合排名第14位,并将此次发布定性为"相较DeepSeek V3.2的重大飞跃"。Arena.ai同时测试了V4 Flash,两款模型均支持100万token上下文。
Vals AI的评测结果更具看点。该平台表示,DeepSeek V4在其Vibe Code Benchmark中"以压倒性优势"成为开源权重模型第一,不仅超越第2名Kimi K2.6,更击败Gemini 3.1 Pro等闭源前沿模型。

Vals AI特别强调,V4较V3.2实现了约10倍的性能跃升——"V3.2在该基准上仅得5分,这不是笔误。"在Vals综合指数排名中,V4以第2位收官,与榜首Kimi K2.6仅相差0.07%。

社区反应十分积极。在X平台上,用户Sigrid Jin称其带来新的“shocking moment”,并提到“现在可以在家里跑 gpt 5.4-ish 的模型”。他写道:
"GPT-5.5,对不起,DeepSeek V4才是新的震撼时刻,它在代码竞技场中击败了GPT-5.4高强度模式。"

用户Ejaaz则称:
"中国正在主导AI,他们已经追上来了。DeepSeek V4 Flash比Opus 4.7便宜99%,每百万token仅需0.28美元,代码竞技场排名第一,这不是笔误。"

也有用户表达保留意见,X用户Michael Anti在试用后表示,V4 Flash的实际体验未能超越此前已相当成熟的V3.2,认为对老用户而言升级体验令人失望。

官方自评:措辞克制,代码与Agent领域差距最小
DeepSeek对自身性能的评述保持了一贯的审慎风格。官方文件显示,在知识与推理任务上,V4-Pro已超越主流开源模型,接近Gemini等闭源系统,但与最先进的前沿模型仍存在约3至6个月的差距。在Agent和代码任务上,表现接近甚至部分超过Claude Sonnet。

内部使用数据方面,DeepSeek表示,V4已成为公司内部员工的Agentic Coding(智能体编程)主力模型,评测反馈显示其使用体验优于Claude Sonnet 4.5,交付质量接近Opus 4.6非思考模式,但与Opus 4.6思考模式仍有一定差距。
在数学、STEM及竞赛级代码评测中,V4-Pro超越目前已公开评测的所有开源模型,包括月之暗面的Kimi K2.6 Thinking和智谱GLM-5.1 Thinking,并取得比肩顶级闭源模型的成绩。

博主Simon Willison在其测评文章中指出,V4-Pro(1.6万亿参数)是目前已知最大的开源权重模型,超过Kimi K2.6(1.1万亿)、GLM-5.1(7540亿)以及DeepSeek V3.2(6850亿),为有意本地部署的企业用户提供了新的选项。
他还晒出了不同模型做出的鹈鹕图例:
这是DeepSeek-V4-Flash的鹈鹕:

至于DeepSeek-V4-Pro:

价格体系:最低仅为竞品1%,下半年仍有进一步降价空间
DeepSeek的定价策略是此次发布中最受市场关注的部分。V4-Flash的输入/输出价格分别为每百万token 0.14美元/0.28美元,低于OpenAI GPT-5.4 Nano(0.20美元/1.25美元)和Gemini 3.1 Flash-Lite(0.25美元/1.50美元),是目前小型模型中定价最低的选项。
V4-Pro的输入/输出价格为1.74美元/3.48美元,同样低于Gemini 3.1 Pro(2美元/12美元)、GPT-5.4(2.50美元/15美元)、Claude Sonnet 4.6(3美元/15美元)和Claude Opus 4.7(5美元/25美元)。
博主Simon Willison汇总的价格对比数据显示,V4-Pro是目前大型前沿模型中成本最低的选项,V4-Flash则是小型模型中成本最低的,甚至低于OpenAI的GPT-5.4 Nano。

DeepSeek将上述低价能力归因于模型在超长上下文场景下的极致效率优化。官方数据显示,在100万token场景下,V4-Pro的单token推理算力仅为V3.2的27%,KV缓存仅为10%;V4-Flash则分别低至10%和7%。
值得关注的是,DeepSeek在价格说明中附注称,"受限于高端算力,目前Pro的服务吞吐十分有限,预计下半年昇腾950超节点批量上市后,Pro的价格会大幅下调",暗示当前定价仍有进一步下调空间。
技术架构:混合注意力机制突破长上下文瓶颈,适配国产算力
DeepSeek-V4的核心技术创新在于首创的"CSA(压缩稀疏注意力)+HCA(重度压缩注意力)"混合注意力架构,旨在解决传统注意力机制在超长上下文场景下呈平方级复杂度攀升、显存与算力难以工程落地的行业痛点。CSA将每4个token压缩为一个信息块并通过稀疏检索获取最相关内容,在保留中段细节的同时大幅降低计算量;HCA则将海量信息浓缩为框架级信息块,专注全局逻辑处理。

在此之外,V4还引入mHC流形约束超连接(升级传统残差连接,将信号传播约束在稳定流形上)以及Muon优化器(替代传统AdamW,适配MoE大模型与低精度训练)。官方数据显示,全链路工程优化可实现推理加速最高接近2倍。
在国产算力适配方面,DeepSeek-V4在华为昇腾NPU平台上完成细粒度专家并行优化方案的全面验证,在通用推理负载场景下可实现1.50至1.73倍的加速比。DeepSeek官方表示,V4是全球首个在国产算力底座上完成训练与推理的万亿参数级模型,但目前昇腾平台适配代码暂未对外开源,属于闭源优化。此外,寒武纪已通过vLLM推理框架完成对V4-Flash和V4-Pro的适配,相关代码已开源至GitHub社区。


Vals AI吹的10倍跃升笑死,V3.2才5分,涨到50就封神?这基准怕不是他家开的。0.28刀确实打穿,可Pro吞吐拉胯,抢不到算力你跑个屁。
刚刷到这篇 Deepseek V4 测评 我第一反应不是兴奋 是有点想笑 文章里那个 Vals AI 说 Vibe Code Benchmark 压倒性第一 又说 V3点2只有5分 这不是笔误 我看到这句就卡住了 5分 这也太像拿一个刚学会走路的小孩去比百米冠军 不是说V4不行 是说这个对比太会挑时候了 老版本被踩到泥里 新版本自然飞上天 这数据好看 但看久了就发现味道不对 还有文章里那个时间线 我有点懵 现在外面都 GPT5点5 了 还有 Claude Opus4点7 还有 Gemini3点1 Pro 我这几个月没上网吗 我怎么记得我还在用 V3点2 写脚本 这文章要是提前写好的科幻稿 那我也能写 Deepseek V8 拳打外星人 脚踢黑洞 反正没人见过 当然要是真出了 那当我没说 我先道歉 但看标题第一波测评 结果全是二手搬运 连个完整表格都没贴 我信一半都算多 Arena ai 那个数据我倒觉得还算实在 代码竞技场开源第3 综合第14 这个排名就很有信息量 综合第14 说明前面还有13个 它没说是闭源还是开源 要是闭源多 那你DeepSeek再便宜也是追 追和超是两码事 文章标题写得像已经登基 实际是开源里第3 综合14 这就像班里数学考第三 总分排14 你非说自己是学霸 也不是不行 但别把偏科吹成全能 Vals AI 那个 Vibe Code Benchmark 名字我就想吐槽 氛围编程基准 听着像一群人在X上凭感觉投票 谁解释得花哨谁赢 我不是说它一定假 我是说这种榜的含金量得打个大问号 你拿它当唯一证据 还写压倒性优势 击败Gemini3点1 Pro 结果综合指数第2 跟 Kimi K2点6 只差百分之0点07 这百分之0点07能说明啥 下一次跑分可能就翻过来了 这不叫统治 这叫并列第一梯队 那个10倍性能跃升 我越看越觉得怪 V3点2在该基准上仅得5分 这不是笔误 那问题来了 V3点2真的这么烂吗 我记得V3点2出来的时候也是铺天盖地吹 怎么到V4这里就变成5分垫底了 测评基准是不是专门为了衬托新版改过 或者V3点2根本不适合这个任务 拿不适合的旧模型当对照组 得出来的10倍就是数字游戏 5分涨到50分叫10倍 50分涨到100分叫翻倍 哪个更难 用脚想都知道 定价那段更逗 V4 Flash 输出每百万token 0点28美元 比 Claude Opus4点7 低百分之九十九 你怎么不跟同级别的比 你拿最贵的跑车比自行车 说自行车便宜百分之九十九 这不废话吗 还有 V4 Pro 3点48美元 是同级别前沿模型中定价最低的选项之一 之一这俩字很妙 最低就最低 之一就是给自己留后路 说明还有别的也低 或者它根本不敢说绝对最低 我一个小公司写后端的 平时也用API 我最怕的不是单价 是总账单 你单价0点28 结果思考模式一开 输出几千token 长上下文一挂 输入也烧钱 缓存命中率低 排队还慢 最后一个月账单比Claude还贵 这不是不可能 低价是钩子 用户进来才发现鱼食也要钱 文章只给出输出价格 输入价格呢 缓存价格呢 并发限制呢 吞吐限制呢 全没提 那我只能自己踩坑 百万级上下文 听起来很猛 我也试过别家的百万上下文 问中间某一段的细节 它给我编得跟真的一样 找了三遍没找到 最后还得自己grep 长上下文不等于有效记忆 更不等于便宜 100万token塞进去 每次推理都读一遍 那成本能低吗 KV缓存能把显存吃光 家里跑更别想 文章说门槛压低 我看是把调用门槛压低 把部署门槛抬到天上 MIT开源协议是好东西 我认 权重放出来能让小厂自己折腾 但1点6万亿参数 激活49B 你让我拿什么跑 我只有一张4090 跑个量化版都喘 速度跟蜗牛上树 社区那个 Sigrid Jin 说现在可以在家里跑 GPT5点4-ish 的模型 我求求你别吹了 家里跑的是阉割量化版 上下文一长就崩 写个hello world当然像 你让他跑真实项目试试 跑一半显存不足 直接黑屏 V4 Flash 2840亿参数 激活13B 看着好像亲民 但13B激活也不是免费 长上下文一开 KV缓存照样爆炸 而且Flash便宜归便宜 文章自己都引了 Michael Anti 说实际体验没超越V3点2 老用户升级失望 这话比那些X上的吹子可信多了 老用户有对比 有旧账单 有旧项目 他们说不香 那大概率真不香 新用户没吃过好的 上来当然觉得香 官方自评那段我反而觉得是全文最诚实的地方 说知识与推理接近闭源系统 但仍有约3到6个月差距 还提示受限于高端算力 Pro服务吞吐有限 后续价格存在下调预期 你看 自己都承认有差距 自己都说吞吐有限 自己都说会降价 那现在冲Pro的人图啥 图当付费测试员 图帮官方压测 图以后降价了没有补偿 官方越克制 越说明现在不是最佳入手点 等三个月 等正式版 等价格下来 不香吗 社区反应分化 这很正常 X上那几个账号说打穿 说中国主导AI 我看了毫无波澜 一个榜单第一就能主导AI 那AI也太不值钱了 Ejaaz 说代码竞技场排名第一 可他说的是Vibe Code Benchmark 不是所有代码任务 也不是所有综合任务 偷换概念太明显 Sigrid Jin 说击败GPT5点4高强度模式 我想问哪个GPT5点4 我连GPT5点5都没摸过 这些名字现在跟玄幻小说境界一样 一个比一个唬人 文章标题第一波测评来了 第一波往往是最乐观的一波 厂商送测 平台配合 社区上头 真等独立开发者用一个月 等真实项目跑起来 等账单出来 第二波第三波才是真相 V4预览版开源 预览版这三个字就很关键 预览版不等于正式版 正式版可能缩水 也可能涨价 也可能改协议 现在吹上天 到时候翻车 谁负责 文章作者负责吗 他只会再写一篇 V4翻车第一波 我承认DeepSeek代码能力一直不差 以前用V3写小工具 确实比某些国外模型顺手 中文提示词也友好 价格也便宜 这点该夸就夸 但夸归夸 别把Vals AI一个榜当圣旨 也别把Arena第14说成综合第一 代码偏科是好事 但偏科不等于全科第一 写业务代码要懂遗留系统 要懂内部框架 要懂产品需求 要懂线上报错 这些榜单测不出来 刷榜再高 接不进我项目也是白搭 自述材料里说代码与Agent领域差距最小 知识和推理接近闭源 这句话翻译一下就是 代码追得最近 但还是有差距 知识推理还差三到六个月 这已经很明白了 不是领先 是追赶 追赶不丢人 丢人的是粉丝硬吹成碾压 还有那个受限于高端算力 这话听着心酸 也是现实 但用户不关心你心酸 用户关心能不能稳定调用 能不能不排队 能不能不涨价 你吞吐有限 我花钱也买不到稳定 那低价对我意义在哪 价格下调预期 这句我最敏感 因为我现在要是按3点48美元用 过俩月你降到1块 我前面花的钱找谁退 你肯定不退 那最优策略就是等 等降价 等正式版 等Flash再改进 等Michael Anti说的那些问题修好 我不是不买 我是不想当韭菜 文章写得热火朝天 我钱包是冷的 每百万token看着小 乘上项目量就是大 老板不会因为我用国产模型就多给预算 还有那个比Claude Opus4点7低百分之九十九 这种话术太low了 Claude贵有贵的场景 你拿自己便宜去比 就像沙县小吃说比米其林便宜百分之九十九 对 你便宜 但人家客户群不一样 你要比就跟同价位的比 跟GPT5点5比 跟Gemini3点1 Pro比 跟Kimi K2点6比 跟Qwen比 专挑最贵的比 除了营销真没别的解释 而且低百分之九十九 用户真能省百分之九十九吗 不可能 因为token用量 思考长度 重试次数 都不一样 V4 Pro 1点6万亿参数 激活49B 这个规模开源 确实有魄力 我佩服 但开源权重不等于开源训练数据 也不等于开源训练代码 更不等于开源算力 你能下载权重 但你复现不了 你微调成本也高 对小团队来说 开源的意义是省API钱 但部署成本可能比API还贵 除非你量特别大 不然还是乖乖买API 那买API又回到吞吐有限 排队 涨价 这些问题 所以别一听开源就高潮 Arena代码竞技场开源第3 综合第14 这个数据我反复看 它说明V4在代码上确实能打 但综合能力还差得远 综合第14 前面13个是谁 文章不列 我猜有闭源也有开源 要是前面全是闭源 那还说得过去 要是前面还有开源 那开源第一梯队这个说法就有点水分 文章只说冲进开源第一梯队 第一梯队可以很多人 第3是 第10也是 第20也能硬蹭 反正没标准 Vals综合指数第2 与K
跑分跑得飞起,代码第几第几,一看价格0.28刀,吓得我赶紧跪着看完。结果呢?真跑起来V4 Flash连V3.2都干不过,官方自己都承认差闭源三五个月,就这还“打穿性价比”?吹,接着吹。评测榜就是个赛博标杆,谁钱多谁上,别真当回事。
看你们吹得这么凶我就想说两句不好听的 代码榜第一又咋了 我拿flash跑了个我们项目里的老接口重构 结果它把我原来的异常处理全砍了 看着跑通了 一上线就崩 查半天发现它把try catch吞了还一本正经注释说简化逻辑 这哪是简化这是埋雷 我家那破笔记本16g内存跑v4pro想都别想 flash倒是能跑 但生成到一半开始疯狂复读 同一个函数给我写三遍 每一遍还都长得不一样 改起来比我自己写还累 那些榜单到底测的啥啊 全是竞技场投票和特定基准 跟真实工程场景两码事 我之前用v3.2写脚本倒是稳得很 现在升级了反而要盯着它别自作聪明 官方自己都说跟闭源差三到六个月 怎么到网友嘴里就成吊打gpt5.5了 0.28美元一百万token是便宜 可你要是让它干点复杂活 来回纠错消耗的token加起来也没省多少 尤其那个什么vibecode榜 我怀疑评测的人是不是就让它写个贪吃蛇 那当然随便赢 还有那个说在家跑gpt5.4类似模型的 我就想笑 你知道1.6万亿参数啥概念吗 那是pro不是flash 普通人的显卡连量化版都塞不进去 能用得起flash就算不错了 可flash这体验跟v3.2比真没啥惊喜 上下文倒是长了 可我塞了一份五百页的屎山代码进去 它读到后面把前面需求忘了 还得我提醒它 百万上下文听着唬人 实际就是个记忆橡皮擦 我不是说deepseek不行 我是烦这种每次发新版就一群人高潮的风气 v3.2刚出的时候也吹开源第一 结果呢 用俩月就发现复杂推理还是得靠gpt 现在v4出来又吹十倍跃升 十倍 这词跟不要钱似的 我数学不好 但5分到50分确实是十倍 可你要是从0分到10分那也是无穷大啊 这种benchmark看看就得了 真信了拿生产环境去试 哭都来不及 反正我打算继续用v3.2 等v4再迭代几个小版本再说 别跟我提什么MIT开源啥的 开源是好 可你本地跑不动 还不是得用他们api 用api就得忍受限流 我看那pro的吞吐写着有限 到时候抢不到算力 再便宜有啥用 不如把v3.2调教好点 至少我知道它啥时候犯蠢