(注意:文章发布时间为2026年8月4日,DeepSeek V4 Pro正式版已于2026年8月13日发布)
等待三个多月后,DeepSeek V4终于迎来了一次重要更新。
2026年7月31日,DeepSeek宣布,DeepSeek-V4-Flash正式版API上线公测。开发者无需更换模型名称,继续调用deepseek-v4-flash,即可使用最新的DeepSeek-V4-Flash-0731。
不过,这次更新还不能简单理解为“DeepSeek V4正式版全面上线”。
DeepSeek官方明确说明,此次升级只涉及V4-Flash的API接口,DeepSeek-V4-Pro API以及App、网页端模型均未发生变化,V4-Pro正式版仍在推进之中。
因此,DeepSeek V4目前的状态可以概括为:
Flash正式版率先进入API公测,Pro正式版仍在路上,普通用户暂时还无法在DeepSeek网页端和App中体验这次更新。
一、V4早已亮相,这次更新了什么
DeepSeek V4最早于2026年4月24日发布预览版。
当时,DeepSeek一次性推出了V4-Pro和V4-Flash两个型号,并同步开放API和模型权重。
其中,V4-Pro拥有约1.6万亿总参数,每次生成激活约490亿参数;V4-Flash拥有约2840亿总参数,每次激活约130亿参数。两个模型均支持思考和非思考模式,上下文长度达到100万Token。
从产品定位上看,两个型号承担着不同任务。
V4-Pro负责探索能力上限,重点面向复杂推理、知识密集型任务、大型代码工程和长链条智能体工作流。
V4-Flash则更加注重响应速度、调用成本和并发效率,适合高频代码生成、客服问答、批量内容处理、工具调用和自动化办公等场景。
这次上线的DeepSeek-V4-Flash-0731,没有继续扩大参数规模,也没有改变模型基本结构。根据官方说明,新版本与V4-Flash预览版的模型结构和尺寸保持一致,主要进行了新一轮后训练。
也就是说,这次更新的核心不在于把模型“做得更大”,而在于让它更适合执行真实任务。
二、这次升级的关键词是Agent
DeepSeek在更新说明中反复强调了一项能力:Agent,即智能体。
普通聊天模型主要负责理解问题、整理信息并生成答案。智能体则要在此基础上继续向前一步:调用工具、执行命令、检索文件、修改代码,并根据每一步的结果决定下一步行动。
简单来说,聊天模型更像一名能够提供建议的顾问,智能体则更接近一名能够实际操作工具、推进工作的助手。
以软件开发为例,用户让普通模型“分析一下这个程序为什么报错”,模型通常会给出可能的原因和修改建议。
如果换成代码智能体,它可以进一步读取代码仓库、运行程序、查看错误日志、定位故障文件、修改代码,再重新运行测试。
从“告诉用户怎么做”到“直接参与把事情做完”,正是当前大模型产品演进的重要方向。
DeepSeek公布的数据显示,更新后的V4-Flash在Terminal Bench 2.1上取得82.7分,在DeepSWE上取得54.4分,在Toolathlon Verified上取得70.3分,并在多项智能体测试中超过V4-Pro预览版。
当然,官方跑分仍需理性看待。
DeepSeek在更新日志中注明,部分代码智能体测试使用了自家的DeepSeek Harness测试框架及指定参数,DSBench-FullStack和DSBench-Hard则属于内部测试集。因此,这些数据可以用来观察模型的优化方向,最终的实际表现还需要更多开发者在不同环境中验证。
相比单项跑分,更值得关注的是V4-Flash正式版已经原生支持Responses API,并针对Codex类编程工作流进行了适配。
目前,开发者还可以把DeepSeek接入Claude Code、GitHub Copilot、OpenCode等编程和智能体工具,将其作为后端模型使用。
这意味着V4-Flash的目标已经十分明确:它不只要进入聊天框,还要进入代码编辑器、终端、自动化平台和企业业务流程。
三、为什么是Flash率先更新
DeepSeek没有详细解释为何选择Flash率先推出正式版,但从成本和应用场景来看,这个决定并不难理解。
大模型从实验室进入真实业务后,能力只是衡量标准之一。
一家企业还要考虑模型响应是否足够快、输出是否稳定、能够同时处理多少任务,以及每天调用数万次、数十万次需要花多少钱。
在这些方面,V4-Flash拥有天然优势。
DeepSeek中国区官方API价格显示,当前两款模型的收费标准如下:
| 计费项目 | V4-Flash | V4-Pro |
|---|---|---|
| 百万Token输入,缓存命中 | 0.02元 | 0.025元 |
| 百万Token输入,缓存未命中 | 1元,约0.14美元 | 3元,约0.44美元 |
| 百万Token输出 | 2元,约0.28美元 | 6元,约0.87美元 |
| 默认并发限制 | 2500 | 500 |
需要注意的是,这里的“百万Token”是计费单位,不是调用一次模型的固定价格。一次任务实际花费多少,取决于输入材料和生成内容消耗了多少Token。
举个简单的例子。
假设一次任务需要输入10万Token,最终输出1万Token,并且输入没有命中缓存,那么调用一次V4-Flash的理论费用约为:
- 输入费用:10万Token,约0.1元;
- 输出费用:1万Token,约0.02元;
- 合计约0.12元。
实际计费还会受到缓存命中、任务长度和后续价格调整等因素影响,但这仍能直观反映V4-Flash的成本水平。
对个人用户来说,几角钱的差距可能并不明显。
对需要每天处理海量文件、客服对话、代码任务和业务数据的企业而言,模型之间每百万Token相差几元,经过数千万乃至数十亿Token的调用后,就会形成明显的成本差距。
因此,Flash率先转正,很可能代表了DeepSeek更加务实的一条产品路线:先把具备较强能力、响应速度更快、调用成本更低的模型推向大规模应用,再由Pro继续向能力上限发起冲击。
四、低价之外,峰谷定价也值得注意
DeepSeek还在价格页面预告,API服务即将采用峰谷定价策略。
按照目前公布的规则,高峰时段价格将调整为平时价格的两倍,覆盖全部计费项目。高峰时段暂定为北京时间每日9时至12时、14时至18时,具体实施时间仍以正式通知为准。
这意味着,假如峰谷定价正式实施,V4-Flash在高峰期的百万Token输入缓存未命中价格可能由1元提高至2元,百万Token输出价格可能由2元提高至4元。
这一机制对普通对话影响有限,却可能改变企业批量任务的运行方式。
例如,文档归档、数据清洗、代码扫描、内容审核等不要求立即完成的任务,可以尽量安排在非高峰时段处理。对于调用规模较大的企业,这种错峰运行能够进一步降低成本。
从这个细节也能看出,DeepSeek的API正在从单纯提供模型能力,逐渐走向更成熟的算力和服务调度体系。
五、100万Token上下文意味着什么
除了智能体能力,DeepSeek V4的另一项重要变化,是100万Token上下文已经成为Flash和Pro的标准配置,单次最大输出长度可达38.4万Token。
Token是模型识别和处理文本的基本单位,可以是文字、单词、数字或标点。它和汉字数量并不完全对应。
按照DeepSeek官方给出的粗略换算关系,一个汉字大约对应0.6个Token。不过,文档格式、代码、表格、英文和特殊符号都会影响实际占用量。
因此,100万Token可以大致理解为能够容纳百万字级别的中文材料。
这些材料可能是一套大型代码仓库,也可能是一批制度文件、合同资料、会议记录、技术方案或研究文献。
在过去,处理长文档通常需要先把材料切分成很多小段,再通过检索系统找出可能相关的内容,分批交给模型分析。
这种方式能够降低单次上下文压力,却容易割裂材料之间的联系。某个重要结论可能出现在第一份文件中,限制条件却藏在第五十份附件里。模型如果没有同时看到两部分内容,就可能产生误判。
上下文扩大后,模型可以在一次任务中接触更完整的信息,减少反复切割和重新拼接材料的需要。
不过,“能够装下100万Token”和“能够准确理解100万Token”仍是两回事。
真正需要观察的,是模型能否在海量材料中稳定找到关键信息,能否识别相互矛盾的表述,能否建立跨章节、跨文件的逻辑联系,以及在长时间运行后是否仍能保持任务目标。
100万Token提供了更大的“工作台”,模型能不能把工作台上的材料用好,仍要靠真实任务检验。
六、Flash不再只是Pro的“轻量版”
过去,人们提到Flash、Mini、Lite等型号时,往往会把它们理解为旗舰模型的简化版本:运行更快、价格更低,能力也相应下降。
V4-Flash正在改变这种印象。
它虽然只有约2840亿总参数、130亿激活参数,但仍支持100万Token上下文、思考与非思考双模式、工具调用、JSON输出、Responses API和Anthropic API格式。
在部分简单智能体任务上,V4-Flash预览版已经能够接近V4-Pro;经过新一轮后训练后,正式版又在多项智能体测试中超过了Pro预览版。
这说明Flash承担的角色已经发生变化。
它不只是帮助用户处理简单问答,也在成为可以大规模接入生产环境的工作模型。
企业可能只需要少量旗舰模型解决特别复杂的战略分析、科研推理和大型工程问题,却可能需要成千上万个低成本模型实例,分别处理客服、代码、文档、审批、搜索和数据整理任务。
从这个角度看,决定大模型能否真正普及的,未必永远是能力最强的旗舰型号。
很多时候,真正铺开市场的,反而是能力足够、速度够快、价格也足够低的高效模型。
七、V4-Pro仍是最大的悬念
尽管V4-Flash已经率先进入正式版API公测阶段,V4-Pro仍然是很多用户真正等待的型号。
DeepSeek在4月发布预览版时,将V4-Pro定位为V4系列的旗舰模型。
按照官方介绍,V4-Pro拥有约1.6万亿总参数、490亿激活参数,重点强化知识、数学、科学、代码和智能体能力,希望在开放模型中建立更明显的优势,并接近全球头部闭源模型。
不过,截至2026年8月4日,DeepSeek尚未公布V4-Pro正式版的准确发布时间。
目前的V4-Pro API仍然可以调用,但此次没有随着Flash一同更新。DeepSeek网页端和App端的模型也未同步切换,官方只表示V4-Pro正式版将“尽快发布”。
接下来,围绕V4-Pro还有几个关键问题:
它会继续沿用预览版的模型架构和参数规模吗?
它的智能体能力能否重新拉开与Flash的差距?
它是否会原生支持Responses API?
网页端和App端何时同步更新?
正式版V4-Pro会继续提高推理能力,还是会把更多资源投入代码、搜索和工具操作?
这些问题的答案,将决定DeepSeek V4系列的最终形态。
八、DeepSeek正在重新定义“便宜模型”
回顾DeepSeek过去几代模型,其引发行业关注的原因,往往不只在于模型能力,也在于极具竞争力的训练和调用成本。
V4-Flash延续了这条路线,并向前推进了一步。
低价模型过去常被视为一种妥协方案。用户为了降低成本,只能接受更弱的推理能力、更短的上下文和更有限的功能。
V4-Flash呈现出另一种思路:在控制参数激活规模和调用价格的同时,保留长上下文、思考模式、工具调用和智能体能力。
这意味着“便宜”不必等同于“只能处理简单问题”。
对于处在使用端的企业来说,这条路线可能比单纯刷新排行榜更有吸引力。
因为企业真正关心的是,模型能否稳定接入现有系统,能否处理业务材料,能否控制数据和调用成本,能否支撑多人、多部门同时使用。
如果一个模型能力领先5%,调用成本却高出数倍,它未必适合覆盖所有日常任务。
相反,一个模型只要能力达到业务要求,同时具有明显的价格和并发优势,就有机会成为企业智能化转型中的基础设施。
V4-Pro负责定义DeepSeek的能力上限,V4-Flash则负责扩大这种能力的应用范围。
一个负责“能做到多难”,一个负责“能用到多广”。
结语
DeepSeek V4的正式版故事,目前只写完了前半部分。
V4-Flash已经率先进入正式版API公测阶段,重点强化代码智能体、工具调用、长上下文和低成本部署能力;V4-Pro正式版仍在路上,具体发布时间和最终表现尚未揭晓。
这次更新真正值得关注的,已经不只是DeepSeek又取得了多少项测试成绩。
更重要的问题是:当大模型开始进入代码编辑器、终端、办公平台和企业业务系统后,怎样才能让每一次智能推理都足够稳定、足够快速,也足够便宜?
从目前的路线来看,DeepSeek给出的答案是:
用Pro继续提高能力上限,用Flash降低实际应用门槛。
Flash已经先行,Pro仍在路上,而DeepSeek V4真正的竞争,才刚刚开始。
本文信息截至2026年8月4日,模型状态及API价格可能随官方后续更新发生变化。