DeepSeek 今天把"眼睛"睁开了。2026 年 8 月 21 日,实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,把 model 设为 deepseek-v4-flash-vision-exp 就能用(来源)。最打动人的是价格——和 V4-Flash 一模一样,一分钱没涨。
这个模型是干嘛的
一句话:在 V4-Flash 的文本能力上,加了一个能读图的视觉模块,价格不变。 官方说它在 Agent、推理、世界知识这些纯文本能力上跟 V4-Flash 正式版持平,只在视觉理解的 Agent 基准上大幅跃升,多模态 Agent 能力已经接近 Opus-4.8(来源)。对开发者来说,DeepSeek 之前最大的槽点就是"看不见图"——尤其进了 DeepSeek Harness 之后,上传一张截图直接给你 MODEL_DOES_NOT_SUPPORT_IMAGES。现在这个坑填上了。
它支持 JPEG、PNG、GIF、WebP 四种格式(按文件实际内容判断格式,不看文件名和 MIME 声明),能描述图片、识别截图里的文字、分析图表(来源)。
图片怎么传
三种传图方式:base64 内联、外部 URL、Files API,都是标准的 OpenAI 兼容格式。 base64 适合本地文件直接嵌入,外部 URL 传一个可公开访问的链接让模型自己下载,Files API 上传一次拿 file_id 反复复用(来源)。三种方式各有边界:
| 传入方式 | 上限 | 适合场景 |
|---|---|---|
| Base64 内联 | 计入 48 MiB 请求体限制,单图最大 32 MiB | 本地文件直接传 |
| 外部 URL | URL 最长 8192 字符,单图最大 32 MiB,60 秒内下载完 | 已有公开链接的图片 |
| Files API | 单图最大 64 MiB,不受 32 MiB 检查 | 大图、多请求复用同一张图 |
官方今天还上线了免费的 Files API:图片上传一次,之后请求里用 file_id 引用,同一张图多个请求不用重复上传,省请求带宽(来源)。
怎么计费
图片按尺寸折算成 token 计费,单张封顶 384 tokens,价格和 V4-Flash 完全一致。 图片进模型前会自动缩放:总像素小于约 384×384 的放大,更大的等比缩小到约 800×800 等价——所以 2000×2000 和 5000×5000 的图消耗的 token 数是一样的,单张永远不超 384 个(来源)。
计费一览(model id = deepseek-v4-flash-vision-exp,单位:每百万 tokens):
| 计费项 | 空闲时段(CNY) | 高峰时段(CNY) |
|---|---|---|
| 缓存命中输入 | ¥0.05 / MTok | ¥0.10 / MTok |
| 缓存未命中输入 | ¥1.5 / MTok | ¥3 / MTok |
| 输出 | ¥4.5 / MTok | ¥9 / MTok |
| 单张图片 | ≤ 384 tokens(折算进输入) | — |
高峰时段是北京时间 9:00–12:00、14:00–18:00,其余为空闲,空闲价是高峰价的一半(来源)。按高峰输入价算,一张图成本上限约 384 × ¥3/百万 ≈ ¥0.001,几乎可以忽略。
视觉能力有多强
官方更新日志给出了完整的视觉基准跑分,Chartography 图表理解 64.3、ZeroBench 零样本视觉推理 35.0。 相比 V4-Flash 是大幅跃升,官方原话是"多模态 Agent 能力已接近 Opus-4.8"(来源):
| 基准 | deepseek-v4-flash-vision-exp |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench (Public) | 25.7 |
| ApexBench (Pass@1) | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography(图表理解) | 64.3 |
| ZeroBench (Pass@5) | 35.0 |
以上 Code Agent 文本任务均使用 DeepSeek Harness 极简模式作为测试框架,max 档位、temperature=1.0、topp=0.95。
用的时候要注意什么
模型还是实验性质,几个坑先说清楚(来源):
- 目前只有这个模型能接收图片。 把图片传给
deepseek-v4-flash或deepseek-v4-pro会返回 400 错误(This model does not support image),必须用deepseek-v4-flash-vision-exp。 - 图片只能出现在 user 消息里,放进 system 或 assistant 消息会返回 400。
- 暂不支持 FIM 补全,需要补全的场景换回纯文本模型。
- 单请求最多 600 张图;不含 file_id 的图片总大小最多 64 MiB,含 file_id 最高 200 MiB;图片单边最长 8192 像素,15 张及以上降为 4096 像素。
- 实验版更适合原型和试用,别一上来就压到核心生产链路。
怎么选,给个建议
折腾视觉能力就上这个,纯文本任务还是 V4-Flash / V4-Pro。 你要做截图理解、图文混排文档解析、图表分析、带视觉的 Agent,就用 deepseek-v4-flash-vision-exp,成本跟 Flash 一样。要是只写代码、跑批处理,没必要为视觉能力买单,直接用 deepseek-v4-flash 更省。
需要固定月费的话,DeepSeek 官方没有包月 Coding Plan,可以走 火山方舟、天翼云、百度千帆 这类第三方套餐,按套餐额度用 DeepSeek,不受官方并发和涨价影响。