主页 > 互联网 > 正文

DeepSeek-V4-Flash正式API上线!Agent能力暴涨6倍,价格仅为Claude的1/90

2026-08-01 09:26:21来源:Techweb编辑:李川峰

扫一扫

分享文章到微信

扫一扫

关注豌豆财经网微信公众号

  8月1日消息,AI圈又炸了。DeepSeek悄然上线了V4-Flash正式版API,一个“廉价版”模型,却在Agent能力上碾压了三个月前的Pro预览版。更让人震惊的是——它只重新做了后训练,模型骨架一点没变。

  昨晚,DeepSeek-V4-Flash正式版API上线。

  消息一出,开发者社区瞬间沸腾。

  这不是一次普通的版本迭代。一个2840亿参数的MoE模型,激活参数仅130亿,价格低至0.2元/百万tokens(缓存命中),却在多项Agent基准测试中,硬生生把三个月前的V4-Pro预览版摁在地上摩擦。

  最让人细思极恐的是模型结构、尺寸一点没变,只是重新做了一遍后训练。

  这意味着什么?后训练优化的空间,可能比我们想象的大得多。

  九项基准测试,全面碾压

  先看硬指标。

  DeepSeek-V4-Flash正式版采用MoE架构,总参数量2840亿,激活参数130亿,支持100万token上下文,可切换思考/非思考模式。

  官方公布的9项Agent基准测试成绩,堪称惊艳:

  最大的亮点在DeepSWE(专门用于评估 AI Agent在‌真实、长周期、多步骤编程任务‌中的自主解决能力)从预览版的7.3分飙升至54.4分,暴涨超过6倍。在 Terminal Bench 2.1(评估 AI Agent在‌Linux 终端环境中自主规划、执行多步命令行任务及错误恢复能力‌的权威基准测试) 中,Flash 正式版得分82.7,高于V4-Pro-Preview的72.1和GLM-5.2 的81.0,逼近Opus-4.8的 85.0

  在海外模型评测机构Artificial Analysis的智能指数测试中,V4-Flash-0731(最高推理档位)拿下50分,而同类可比模型的中位数仅为17分。

  差距,肉眼可见。

  真正恐怖的是:模型没变,只重做了后训练

  如果说性能提升是常规操作,那这次升级的方式才真正值得细品。

  DeepSeek官方确认:V4-Flash-0731的模型结构、尺寸与预览版完全一致,仅重新进行了后训练。

  同一个骨架,同一套参数规模,只是后训练的策略更精细了,结果就在Agent基准测试上产生了质的飞跃。

  这让很多人开始重新思考:堆参数真的是唯一出路吗?

  后训练阶段的优化空间,可能被严重低估了。

  与此同时,DeepSeek自研的Agent测试框架DeepSeek Harness也首次正式亮相。

  开发者实测:便宜到离谱,干活还不赖

  性能是纸面上的,真正让开发者兴奋的是实测体验。

  有用户晒出账单:“蹬了一小时才不到一块钱”。

  价格有多夸张?输入命中缓存0.02元/百万tokens,未命中1元,输出2元。大约只有Claude的1/90(DeepSeek-V4-Flash的输出价格约0.28美元,Claude Opus 4.8输出25美元)。

  最让人上头的场景是Claude Code。

  有开发者分享:“今天正式版出来后,就用官方API接入Claude Code中开始干活,不到4个小时,差不多消耗了1亿token,缓存命中率竟然达到了99%,关键是干活质量还不错,很少返工。”

  另一位用户更直接:“一遍写完,真实测试一遍完美通过,顺手还修了十几个bug……最恐怖的是opencode花了0.1美元。”

  从事Qt/C++上位机、STM嵌入式开发的个人开发者反馈:“flash0731的agent表现与v4-pro-preview的表现非常接近”,“目前初步使用感觉flash在能力上和pro-preview相比没有明显差异,但是人是便宜啊!!!”

  微博上有用户评价:“最近又高强度的使用了DeepSeek V4 Flash,感觉优势貌似又回来了点儿,在代码和Terminal指令这块貌似也提升很大。”

  槽点也很真实:普通用户玩不了

  当然,质疑声也不少。

  最大的槽点是仅限API公测。网页端和App都没有更新,普通用户暂时无法体验。“对大众玩家不够友好”是高频反馈。

  指令遵循仍有短板。有开发者指出:“这版本太喜欢框框干了,没说清楚的事情不太适合交给他干,会出错岔子的;很清晰、有边界的任务可以交给他。”

  另外,Agent模式下推理语言被锁定为英文,系统提示词完全无效。GitHub上已有用户提出希望开放语言控制参数。

  嵌入式开发仍有瑕疵。有开发者反馈:“在嵌入式开发表现已经比上半年的许多模型表现好很多了,但是还是会出现端口识别不清、写出连编译都通过不了的代码。”

  原生支持Responses API,剑指Codex生态

  除了模型本身,工程侧的适配同样值得关注。

  V4-Flash正式版原生支持OpenAI的Responses API格式,并针对性适配了Codex。开发者可以在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中直接调用DeepSeek模型。

  Responses API目前仅支持V4-Flash,V4-Pro预计8月初接入。

  这意味着开发者可以用更低的成本,无缝接入Codex生态。

  长上下文效率:单token计算量降至27%

  V4-Flash在长上下文场景下的工程优化同样值得一提:

  100万token场景下,V4系列的单token推理计算量仅为V3.2的27%,KV Cache占用降至约10%。

  长链路任务的算力与显存成本,被大幅压缩。

  巧合还是狙击?同日OpenAI宣布降价80%

  就在DeepSeek-V4-Flash正式版上线的同一天,OpenAI宣布GPT-5.6 Luna降价80%。

  时间点耐人寻味。

  一边是国际巨头主动降价,一边是中国厂商用1/90的价格交出更强的Agent能力。

  有评论一针见血:“DeepSeek-V4-Flash正式版的Agent能力全面超越此前的Pro预览版,相当于用更便宜的价格交出了更强的干活能力。这是在证明,低价不等于低能。”

  有业内人士指出,这次升级释放了一个明确的信号,大模型竞赛正在从“堆参数”转向“精调优”。同样的模型骨架,仅靠后训练的优化,就能在Agent能力上实现6倍增长。这对整个行业的启发是深远的,参数的尽头可能不是更大,而是更聪明地训练。

     投稿邮箱:lukejiwang@163.com   详情访问豌豆财经网:http://www.wdyxw.com.cn

相关推荐
Kimi K3正式开源:2.8万亿参数MoE模型开放权重,全 Kimi K3正式开源:2.8万亿参数MoE模型开放权重,全

7月28日消息,月之暗面27日深夜正式发布Kimi K3模型权重、技术报告,并同步开源

互联网2026-07-28

Kimi K3今晚正式开源:全球首个3万亿参数级超级模 Kimi K3今晚正式开源:全球首个3万亿参数级超级模

国产大模型独角兽月之暗面宣布,其于本月16日发布的新一代旗舰大模型Kimi K

互联网2026-07-27

长鑫科技科创板上市首日“封神”:市值3.28万亿 长鑫科技科创板上市首日“封神”:市值3.28万亿

国产DRAM龙头企业长鑫科技今日正式登陆上交所科创板,上演了一场载入A股史册

互联网2026-07-27

高德正式上线包车业务:采用一口价模式 无车、 高德正式上线包车业务:采用一口价模式 无车、

7月24日消息,近日,阿里集团旗下高德正式上线包车业务,覆盖商务接待等多场

互联网2026-07-24

Unity 7正式公布:无缝兼容Unity 6,计划2027年一季 Unity 7正式公布:无缝兼容Unity 6,计划2027年一季

在今日于韩国举行的Unite Seoul大会上,Unity Technologies正式揭开了次世代引擎Uni

互联网2026-07-21

阿里千问输入法App正式发布!AI自动润色 无广告 阿里千问输入法App正式发布!AI自动润色 无广告

快科技7月19日消息,日前,阿里千问输入法App正式发布,目前已在苹果App Stor

互联网2026-07-19

全球限量700台!宝马7系熠影臻藏版正式发售: 全球限量700台!宝马7系熠影臻藏版正式发售:

今日,宝马中国推出专属限量旗舰车型——BMW7系熠影臻藏版,新车官方指导价

互联网2026-07-16

苹果正式起诉OpenAI:指控其系统性窃取硬件商业 苹果正式起诉OpenAI:指控其系统性窃取硬件商业

7月11日消息,苹果已向美国加州北区联邦法院提起诉讼,指控OpenAI策划长期窃取

互联网2026-07-11

SpaceX正式纳入纳斯达克100指数 市值已蒸发8千亿美 SpaceX正式纳入纳斯达克100指数 市值已蒸发8千亿美

快科技7月7日消息, 今天 SpaceX正式进入纳斯达克100指数,它也是这只指数里第

互联网2026-07-07

OpenAI首款硬件正式亮相:一个键盘,7月15日发售 OpenAI首款硬件正式亮相:一个键盘,7月15日发售

7月1日消息,当全世界都在期待一款AI时代的“iPhone”时,OpenAI交出的第一份硬

互联网2026-07-01