DeepSeek V4最新进展:Flash先行,Pro仍在路上

(注意:文章发布时间为2026年8月4日,DeepSeek V4 Pro正式版已于2026年8月13日发布)

等待三个多月后,DeepSeek V4终于迎来了一次重要更新。

2026年7月31日,DeepSeek宣布,DeepSeek-V4-Flash正式版API上线公测。开发者无需更换模型名称,继续调用deepseek-v4-flash,即可使用最新的DeepSeek-V4-Flash-0731。

不过,这次更新还不能简单理解为“DeepSeek V4正式版全面上线”。

DeepSeek官方明确说明,此次升级只涉及V4-Flash的API接口,DeepSeek-V4-Pro API以及App、网页端模型均未发生变化,V4-Pro正式版仍在推进之中。

因此,DeepSeek V4目前的状态可以概括为:

Flash正式版率先进入API公测,Pro正式版仍在路上,普通用户暂时还无法在DeepSeek网页端和App中体验这次更新。

一、V4早已亮相,这次更新了什么

DeepSeek V4最早于2026年4月24日发布预览版。

当时,DeepSeek一次性推出了V4-Pro和V4-Flash两个型号,并同步开放API和模型权重。

其中,V4-Pro拥有约1.6万亿总参数,每次生成激活约490亿参数;V4-Flash拥有约2840亿总参数,每次激活约130亿参数。两个模型均支持思考和非思考模式,上下文长度达到100万Token。

从产品定位上看,两个型号承担着不同任务。

V4-Pro负责探索能力上限,重点面向复杂推理、知识密集型任务、大型代码工程和长链条智能体工作流。

V4-Flash则更加注重响应速度、调用成本和并发效率,适合高频代码生成、客服问答、批量内容处理、工具调用和自动化办公等场景。

这次上线的DeepSeek-V4-Flash-0731,没有继续扩大参数规模,也没有改变模型基本结构。根据官方说明,新版本与V4-Flash预览版的模型结构和尺寸保持一致,主要进行了新一轮后训练

也就是说,这次更新的核心不在于把模型“做得更大”,而在于让它更适合执行真实任务。

二、这次升级的关键词是Agent

DeepSeek在更新说明中反复强调了一项能力:Agent,即智能体。

普通聊天模型主要负责理解问题、整理信息并生成答案。智能体则要在此基础上继续向前一步:调用工具、执行命令、检索文件、修改代码,并根据每一步的结果决定下一步行动。

简单来说,聊天模型更像一名能够提供建议的顾问,智能体则更接近一名能够实际操作工具、推进工作的助手。

以软件开发为例,用户让普通模型“分析一下这个程序为什么报错”,模型通常会给出可能的原因和修改建议。

如果换成代码智能体,它可以进一步读取代码仓库、运行程序、查看错误日志、定位故障文件、修改代码,再重新运行测试。

从“告诉用户怎么做”到“直接参与把事情做完”,正是当前大模型产品演进的重要方向。

DeepSeek公布的数据显示,更新后的V4-Flash在Terminal Bench 2.1上取得82.7分,在DeepSWE上取得54.4分,在Toolathlon Verified上取得70.3分,并在多项智能体测试中超过V4-Pro预览版。

当然,官方跑分仍需理性看待。

DeepSeek在更新日志中注明,部分代码智能体测试使用了自家的DeepSeek Harness测试框架及指定参数,DSBench-FullStack和DSBench-Hard则属于内部测试集。因此,这些数据可以用来观察模型的优化方向,最终的实际表现还需要更多开发者在不同环境中验证。

相比单项跑分,更值得关注的是V4-Flash正式版已经原生支持Responses API,并针对Codex类编程工作流进行了适配。

目前,开发者还可以把DeepSeek接入Claude Code、GitHub Copilot、OpenCode等编程和智能体工具,将其作为后端模型使用。

这意味着V4-Flash的目标已经十分明确:它不只要进入聊天框,还要进入代码编辑器、终端、自动化平台和企业业务流程。

三、为什么是Flash率先更新

DeepSeek没有详细解释为何选择Flash率先推出正式版,但从成本和应用场景来看,这个决定并不难理解。

大模型从实验室进入真实业务后,能力只是衡量标准之一。

一家企业还要考虑模型响应是否足够快、输出是否稳定、能够同时处理多少任务,以及每天调用数万次、数十万次需要花多少钱。

在这些方面,V4-Flash拥有天然优势。

DeepSeek中国区官方API价格显示,当前两款模型的收费标准如下:

计费项目 V4-Flash V4-Pro
百万Token输入,缓存命中 0.02元 0.025元
百万Token输入,缓存未命中 1元,约0.14美元 3元,约0.44美元
百万Token输出 2元,约0.28美元 6元,约0.87美元
默认并发限制 2500 500

需要注意的是,这里的“百万Token”是计费单位,不是调用一次模型的固定价格。一次任务实际花费多少,取决于输入材料和生成内容消耗了多少Token。

举个简单的例子。

假设一次任务需要输入10万Token,最终输出1万Token,并且输入没有命中缓存,那么调用一次V4-Flash的理论费用约为:

  • 输入费用:10万Token,约0.1元;
  • 输出费用:1万Token,约0.02元;
  • 合计约0.12元。

实际计费还会受到缓存命中、任务长度和后续价格调整等因素影响,但这仍能直观反映V4-Flash的成本水平。

对个人用户来说,几角钱的差距可能并不明显。

对需要每天处理海量文件、客服对话、代码任务和业务数据的企业而言,模型之间每百万Token相差几元,经过数千万乃至数十亿Token的调用后,就会形成明显的成本差距。

因此,Flash率先转正,很可能代表了DeepSeek更加务实的一条产品路线:先把具备较强能力、响应速度更快、调用成本更低的模型推向大规模应用,再由Pro继续向能力上限发起冲击。

四、低价之外,峰谷定价也值得注意

DeepSeek还在价格页面预告,API服务即将采用峰谷定价策略。

按照目前公布的规则,高峰时段价格将调整为平时价格的两倍,覆盖全部计费项目。高峰时段暂定为北京时间每日9时至12时、14时至18时,具体实施时间仍以正式通知为准。

这意味着,假如峰谷定价正式实施,V4-Flash在高峰期的百万Token输入缓存未命中价格可能由1元提高至2元,百万Token输出价格可能由2元提高至4元。

这一机制对普通对话影响有限,却可能改变企业批量任务的运行方式。

例如,文档归档、数据清洗、代码扫描、内容审核等不要求立即完成的任务,可以尽量安排在非高峰时段处理。对于调用规模较大的企业,这种错峰运行能够进一步降低成本。

从这个细节也能看出,DeepSeek的API正在从单纯提供模型能力,逐渐走向更成熟的算力和服务调度体系。

五、100万Token上下文意味着什么

除了智能体能力,DeepSeek V4的另一项重要变化,是100万Token上下文已经成为Flash和Pro的标准配置,单次最大输出长度可达38.4万Token。

Token是模型识别和处理文本的基本单位,可以是文字、单词、数字或标点。它和汉字数量并不完全对应。

按照DeepSeek官方给出的粗略换算关系,一个汉字大约对应0.6个Token。不过,文档格式、代码、表格、英文和特殊符号都会影响实际占用量。

因此,100万Token可以大致理解为能够容纳百万字级别的中文材料。

这些材料可能是一套大型代码仓库,也可能是一批制度文件、合同资料、会议记录、技术方案或研究文献。

在过去,处理长文档通常需要先把材料切分成很多小段,再通过检索系统找出可能相关的内容,分批交给模型分析。

这种方式能够降低单次上下文压力,却容易割裂材料之间的联系。某个重要结论可能出现在第一份文件中,限制条件却藏在第五十份附件里。模型如果没有同时看到两部分内容,就可能产生误判。

上下文扩大后,模型可以在一次任务中接触更完整的信息,减少反复切割和重新拼接材料的需要。

不过,“能够装下100万Token”和“能够准确理解100万Token”仍是两回事。

真正需要观察的,是模型能否在海量材料中稳定找到关键信息,能否识别相互矛盾的表述,能否建立跨章节、跨文件的逻辑联系,以及在长时间运行后是否仍能保持任务目标。

100万Token提供了更大的“工作台”,模型能不能把工作台上的材料用好,仍要靠真实任务检验。

六、Flash不再只是Pro的“轻量版”

过去,人们提到Flash、Mini、Lite等型号时,往往会把它们理解为旗舰模型的简化版本:运行更快、价格更低,能力也相应下降。

V4-Flash正在改变这种印象。

它虽然只有约2840亿总参数、130亿激活参数,但仍支持100万Token上下文、思考与非思考双模式、工具调用、JSON输出、Responses API和Anthropic API格式。

在部分简单智能体任务上,V4-Flash预览版已经能够接近V4-Pro;经过新一轮后训练后,正式版又在多项智能体测试中超过了Pro预览版。

这说明Flash承担的角色已经发生变化。

它不只是帮助用户处理简单问答,也在成为可以大规模接入生产环境的工作模型。

企业可能只需要少量旗舰模型解决特别复杂的战略分析、科研推理和大型工程问题,却可能需要成千上万个低成本模型实例,分别处理客服、代码、文档、审批、搜索和数据整理任务。

从这个角度看,决定大模型能否真正普及的,未必永远是能力最强的旗舰型号。

很多时候,真正铺开市场的,反而是能力足够、速度够快、价格也足够低的高效模型。

七、V4-Pro仍是最大的悬念

尽管V4-Flash已经率先进入正式版API公测阶段,V4-Pro仍然是很多用户真正等待的型号。

DeepSeek在4月发布预览版时,将V4-Pro定位为V4系列的旗舰模型。

按照官方介绍,V4-Pro拥有约1.6万亿总参数、490亿激活参数,重点强化知识、数学、科学、代码和智能体能力,希望在开放模型中建立更明显的优势,并接近全球头部闭源模型。

不过,截至2026年8月4日,DeepSeek尚未公布V4-Pro正式版的准确发布时间。

目前的V4-Pro API仍然可以调用,但此次没有随着Flash一同更新。DeepSeek网页端和App端的模型也未同步切换,官方只表示V4-Pro正式版将“尽快发布”。

接下来,围绕V4-Pro还有几个关键问题:

它会继续沿用预览版的模型架构和参数规模吗?

它的智能体能力能否重新拉开与Flash的差距?

它是否会原生支持Responses API?

网页端和App端何时同步更新?

正式版V4-Pro会继续提高推理能力,还是会把更多资源投入代码、搜索和工具操作?

这些问题的答案,将决定DeepSeek V4系列的最终形态。

八、DeepSeek正在重新定义“便宜模型”

回顾DeepSeek过去几代模型,其引发行业关注的原因,往往不只在于模型能力,也在于极具竞争力的训练和调用成本。

V4-Flash延续了这条路线,并向前推进了一步。

低价模型过去常被视为一种妥协方案。用户为了降低成本,只能接受更弱的推理能力、更短的上下文和更有限的功能。

V4-Flash呈现出另一种思路:在控制参数激活规模和调用价格的同时,保留长上下文、思考模式、工具调用和智能体能力。

这意味着“便宜”不必等同于“只能处理简单问题”。

对于处在使用端的企业来说,这条路线可能比单纯刷新排行榜更有吸引力。

因为企业真正关心的是,模型能否稳定接入现有系统,能否处理业务材料,能否控制数据和调用成本,能否支撑多人、多部门同时使用。

如果一个模型能力领先5%,调用成本却高出数倍,它未必适合覆盖所有日常任务。

相反,一个模型只要能力达到业务要求,同时具有明显的价格和并发优势,就有机会成为企业智能化转型中的基础设施。

V4-Pro负责定义DeepSeek的能力上限,V4-Flash则负责扩大这种能力的应用范围。

一个负责“能做到多难”,一个负责“能用到多广”。

结语

DeepSeek V4的正式版故事,目前只写完了前半部分。

V4-Flash已经率先进入正式版API公测阶段,重点强化代码智能体、工具调用、长上下文和低成本部署能力;V4-Pro正式版仍在路上,具体发布时间和最终表现尚未揭晓。

这次更新真正值得关注的,已经不只是DeepSeek又取得了多少项测试成绩。

更重要的问题是:当大模型开始进入代码编辑器、终端、办公平台和企业业务系统后,怎样才能让每一次智能推理都足够稳定、足够快速,也足够便宜?

从目前的路线来看,DeepSeek给出的答案是:

用Pro继续提高能力上限,用Flash降低实际应用门槛。

Flash已经先行,Pro仍在路上,而DeepSeek V4真正的竞争,才刚刚开始。

本文信息截至2026年8月4日,模型状态及API价格可能随官方后续更新发生变化。

暂无评论

发送评论 编辑评论


				
|´・ω・)ノ
ヾ(≧∇≦*)ゝ
(☆ω☆)
(╯‵□′)╯︵┴─┴
 ̄﹃ ̄
(/ω\)
∠( ᐛ 」∠)_
(๑•̀ㅁ•́ฅ)
→_→
୧(๑•̀⌄•́๑)૭
٩(ˊᗜˋ*)و
(ノ°ο°)ノ
(´இ皿இ`)
⌇●﹏●⌇
(ฅ´ω`ฅ)
(╯°A°)╯︵○○○
φ( ̄∇ ̄o)
ヾ(´・ ・`。)ノ"
( ง ᵒ̌皿ᵒ̌)ง⁼³₌₃
(ó﹏ò。)
Σ(っ °Д °;)っ
( ,,´・ω・)ノ"(´っω・`。)
╮(╯▽╰)╭
o(*////▽////*)q
>﹏<
( ๑´•ω•) "(ㆆᴗㆆ)
😂
😀
😅
😊
🙂
🙃
😌
😍
😘
😜
😝
😏
😒
🙄
😳
😡
😔
😫
😱
😭
💩
👻
🙌
🖕
👍
👫
👬
👭
🌚
🌝
🙈
💊
😶
🙏
🍦
🍉
😣
Source: github.com/k4yt3x/flowerhd
颜文字
Emoji
小恐龙
花!
上一篇
下一篇