DeepSeek-V4-Flash 正式版出来了。最有意思的看点:一个只有 13B 激活参数的模型,在全部 9 项 Agent 基准上干掉了 49B 激活的 V4-Pro 预览版——而且只靠后训练,架构一笔没动。
2026 年 7 月 31 日,DeepSeek-V4-Flash 从预览版升格为正式版(DeepSeek-V4-Flash-0731),API 公开测试同步开放(来源)。权重 MIT 开源,定价不变。
架构没变,能力飞涨
就是同一套 CSA + HCA 架构,同一个 284B total / 13B active 的参数规模——只做了一轮 re-post-training。你换个权重文件就行,推理代码一行不用改。
| 指标 | DeepSeek-V4-Flash-0731 |
|---|---|
| 总参数量 | 284B |
| 激活参数量 | 13B |
| 架构 | CSA + HCA |
| 上下文长度 | 1M |
| 最大输出 | 384K |
| 精度 | FP4 + FP8 混合 |
| 新增 | DSpark 推测解码 |
| 开源协议 | MIT |
DSpark 推测解码是新增的加速模块,不改变输出内容,纯粹提吞吐。
Agent 基准:13B 打 49B
后训练带来的 Agent 能力提升不是挤牙膏,是跳了一档。9 项基准全部碾压 V4-Pro 预览版(来源):
| 基准 | V4-Flash-0731 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
DSBench 是 DeepSeek 内部测试集,和公开基准没有可比性,看趋势参考就好。
新加的能力
Responses API
原生支持了 Responses API——OpenAI 那套新的有状态 API,比 Chat Completions 更适合多轮 Agent 任务。V4-Pro 的 Responses API 还要等到 8 月初。
Codex 适配
专门给 Codex(Claude Code 的 Agent 框架)做了优化。如果你用 Claude Code + DeepSeek API 的组合,这波更新体验直接拉满。配置参考 官方文档。
DSpark 推测解码
加速推理用的,不改输出,不提参数,纯粹让 token 跑得更快。
定价和并发
完全没变,跟预览版一个价:
| 计费项 | 价格(CNY) | 价格(USD) |
|---|---|---|
| 缓存命中输入 | ¥0.02 / MTok | $0.0028 / MTok |
| 缓存未命中输入 | ¥1 / MTok | $0.14 / MTok |
| 输出 | ¥2 / MTok | $0.28 / MTok |
并发 2500,思考/非思考双模式、JSON Output、Tool Calls 全在。
额外提一句:官方定价页也挂了个涨价预告,涨幅应该不小。这事儿上篇文章细聊过,简单说就是趁现在把缓存策略做好。
开源权重
MIT 协议,HuggingFace 和 ModelScope 都有:
- HuggingFace: deepseek-ai/DeepSeek-V4-Flash-0731
- ModelScope: deepseek-ai/DeepSeek-V4-Flash-0731
Base 和 Instruct 两个版本。自己微调拿 Base,开箱即用拿 Instruct。
几个要注意的点
- 这次只升了 Flash,Pro 的 API 没动。APP/WEB 的模型也还是老版本。
- V4-Pro 正式版快了,官方预告"将很快发布"。
deepseek-chat和deepseek-reasoner已经彻底停服(7 月 24 日 23:59),现在自动转到 v4-flash 的对应模式。- 涨价预告别不当回事——赶紧算一下月度消耗、做好缓存策略。