DeepSeek V4 Flash Vision Exp
DeepSeek 的实验性多模态 API 模型在 V4-Flash 同档价格下增加图片输入,本文说明它能做什么、怎么用以及有哪些限制。
先把最容易误会的一点说清楚:DeepSeek-V4-Flash-Vision-Exp 是“看图”模型,不是“生图”模型。
它能读取截图、照片、扫描件和图表,再结合工具完成任务;但官方没有把它定位成图片生成器。拿它做网页截图排错、票据识别、图表分析很合适,拿它生成海报、头像或商品图就找错模型了。
截至 2026 年 8 月 21 日,官方确认的信息可以压缩成五句话:
- 模型 ID 是
deepseek-v4-flash-vision-exp; - 文本能力对齐 V4-Flash,包括 Agent、推理和世界知识;
- 新增图片输入,支持文本与图片混合任务;
- API 价格与 V4-Flash 相同,图片按 token 计费;
- 名字里仍有 Exp,它是实验版,不应未经回归测试就直接替换生产链路。
下面重点回答大家会实际搜索的问题:它是什么、能做什么、一张图多少钱、怎么传图、有哪些硬限制,以及和 V4-Flash、V4-Pro 到底怎么选。
DeepSeek-V4-Flash-Vision-Exp 是什么?
这是 DeepSeek 在 API 平台新上线的多模态模型。所谓多模态,在这里主要指模型可以同时接收文字和图片,再输出文字或调用工具继续完成任务。
它的基础不是 V4-Pro,而是 V4-Flash。官方说它在文本任务上保持 V4-Flash 的能力,同时在多模态 Agent 评测中相对 V4-Flash 有明显提升,表现接近 Opus 4.8。
这句话要带着两个限定理解:
- “接近 Opus 4.8”来自 DeepSeek 官方的多模态 Agent 评测,不是所有任务的独立第三方结论;
- 它对齐的是 V4-Flash 的文本能力,不代表纯文本复杂推理已经等同于 V4-Pro。
官方价格页给出的基础规格是 1M 上下文、最高 384K 输出,支持思考模式、JSON Output、Tool Calls、Responses API 和 Anthropic API。它不支持 FIM 补全,因此不能只看到“支持代码 Agent”就把它当成完整的代码补全模型。
它能做什么?不能做什么?
DeepSeek 官方列出的能力包括描述图片、识别截图中的文字和分析图表。放到真实工作流里,我认为最值得试的是下面五类任务。
一是网页和软件截图排错。
把报错截图、界面状态和文字需求一起交给模型,让它先读页面,再结合日志或工具继续排查。Vision 版本真正有价值的地方,不是多回答一句“图里有什么”,而是让 Agent 能看见操作环境。
二是扫描件和票据整理。
可以从发票、收据、表单、快递面单或扫描页中提取字段,再输出结构化结果。涉及财务、合同或身份信息时,仍应做权限隔离和人工复核;视觉模型会看错字,也可能把模糊内容补成看似合理的答案。
三是图表和仪表盘分析。
它可以读折线图、柱状图、表格截图或业务后台,再回答趋势、异常和对比问题。但对坐标轴很密、字号很小、颜色非常接近的图表,不要只看一次回答就下业务结论。
四是 UI 验收和前端 Agent。
把设计稿与浏览器截图放在同一任务里,让模型找布局、文案、状态和响应式问题。它支持 Responses API 和工具调用,因此比“只会描述图片”的视觉模型更适合进入可执行工作流。
五是批量图片分类和内容整理。
单次请求最多可以带 600 张图片,适合做商品归类、素材筛选或批量说明生成。不过 600 是接口上限,不是建议每次都塞满;图片越多,定位具体错误和核验结果就越困难。
它目前不适合三类任务:
- 图片生成或编辑:这是视觉理解模型,不是生图模型;
- 像素级测量和极细文字识别:图片会在进入模型前缩放,专业 OCR 或计算机视觉工具仍有价值;
- 无人工兜底的高风险判断:医疗影像、合同金额、财务凭证等场景必须保留专业复核。
DeepSeek Vision 价格是多少?一张图多少钱?
deepseek-v4-flash-vision-exp 与 V4-Flash 使用同一档价格,单位是“元 / 百万 tokens”。北京时间 9:00—12:00、14:00—18:00 是高峰时段,其余为空闲时段。
| 计费项目 | 空闲时段 | 高峰时段 |
|---|---|---|
| 缓存命中输入 | 0.05 元 / 百万 tokens | 0.10 元 / 百万 tokens |
| 缓存未命中输入 | 1.50 元 / 百万 tokens | 3.00 元 / 百万 tokens |
| 输出 | 4.50 元 / 百万 tokens | 9.00 元 / 百万 tokens |
图片会先根据尺寸换算成 token,再和文字输入一起计费。官方规则是每张图片最多消耗 384 tokens:较小图片会保持比例放大,较大图片会保持比例缩小到总像素约等于 800×800,之后再进入模型。
按缓存未命中的输入价格粗算,一张达到 384-token 上限的图片本身大约是:
- 空闲时段:
384 ÷ 1,000,000 × 1.5 = 0.000576元; - 高峰时段:
384 ÷ 1,000,000 × 3 = 0.001152元。
也就是说,单张图片的输入成本很低。但这不是一次完整请求的总价:文字提示、模型输出、多轮对话和 Agent 工具调用都会继续产生 token。实际账单往往由长输出和多轮执行主导,而不是那一张图片。
Files API 的上传和文件复用本身免费,模型读取图片时仍会计费。“文件上传免费”不等于“图片分析免费”。
DeepSeek-V4-Flash-Vision-Exp 怎么用?
官方支持三种图片输入方式:
- Base64 内联:适合临时发送本地小图片,但编码内容会占用请求体;
- 外部图片 URL:适合已经有公开地址的图片,服务端会自动下载;
- Files API:适合图片较大,或同一张图要在多个请求里重复使用的场景。
三种方式都可以用于 OpenAI 兼容的对话接口和 Responses API;官方也提供 Anthropic Messages 兼容方式。接入时真正需要改的是模型选择与图片内容块,不要继续把图片发送给 V4-Pro 或普通 V4-Flash,否则接口会返回“不支持图片”的错误。
图片还有一个很实用的细节级别设置:
| 级别 | 处理方式 | 适合场景 |
|---|---|---|
| low | 先缩放到 512×512 | 普通分类、画面概述、追求速度和低 token |
| high | 保留原图,等同 original | 小字、图表、界面细节 |
| original | 保留原图 | 需要尽量保留视觉细节的任务 |
| auto | 当前等同 original | 不想手动判断,但行为将来可能调整 |
如果一张图会反复分析,优先用 Files API;如果只是临时看一张小截图,内联或 URL 更直接。图片里有小字时用 original,批量粗分类时再考虑 low。
图片格式、大小和数量限制
这部分很容易被发布稿略过,却是开发时最容易踩坑的地方。
| 限制项 | 官方当前限制 |
|---|---|
| 支持格式 | JPEG、PNG、GIF、WebP |
| 单次请求最多图片数 | 600 张 |
| 请求体大小 | 48 MiB |
| Base64 / 外部 URL 单图大小 | 最高 32 MiB |
| Files API 单图大小 | 最高 64 MiB |
| 单次请求图片总大小 | 不含 file_id 时最高 64 MiB;包含 file_id 图片时最高 200 MiB |
| 图片最长边 | 最高 8192 像素 |
| 一次发送 15 张及以上 | 每张最长边降为 4096 像素 |
| 外部 URL 长度 | 最高 8192 个字符 |
| 外部图片下载时间 | 需在 60 秒内完成 |
还有四个容易忽略的限制:
- 在常规对话接口中,图片只能放在 user 消息里;放进 system 或 assistant 消息会返回 400;
- 只有
deepseek-v4-flash-vision-exp接受图片,其它 DeepSeek 模型收到图片会报错; - GIF 虽然属于支持格式,但官方页面没有说明是否完整理解所有动画帧,不应把它当成视频模型;
- PDF 不在当前列出的图片格式中,处理 PDF 时应先提取文字,或把相关页面转换成受支持的图片格式。
Responses API 的图片位置规则更灵活,可以出现在 user、developer 或工具输出中。使用哪一种协议时,应按对应文档组织内容,不要把不同协议的图片结构混用。
它和 V4-Flash、V4-Pro 怎么选?
| 任务 | 更合适的模型 |
|---|---|
| 纯文本批量任务、低成本 Agent | V4-Flash |
| 截图、照片、图表与工具混合任务 | V4-Flash-Vision-Exp |
| 复杂纯文本推理、架构判断、最终审查 | V4-Pro |
Vision 版本并不是“比 V4-Flash 更贵的升级版”。它和 V4-Flash 价格相同,文本能力也对齐 Flash,只是多了图片输入。只处理文字时没有必要为了型号更新而迁移;任务确实包含视觉信息时,它才有明显价值。
它也不能完全替代 V4-Pro。复杂架构决策、长链路调试和高质量最终稿,仍应拿 V4-Pro 或其它前沿模型交叉验证。多模态 Agent 跑分接近某个模型,不代表所有文字任务、所有工具环境和所有真实项目都同样接近。
DeepSeek 新视觉模型免费吗?能在网页和本地使用吗?
API 不是免费的。 它按文字、图片和输出 token 计费,价格与 V4-Flash 相同。Files API 免费指的是上传与复用文件,不包括模型推理费用。
官方发布公告目前明确确认的是 API 平台。 公告没有同步说明网页端或 APP 已提供这个实验视觉模型,因此是否出现在产品界面,应以当前账号实际显示为准,不要把 V4-Pro 的“专家模式”入口误认为 Vision Exp。
官方这次也没有在发布公告中同步宣布 Vision Exp 的开放权重或本地部署方案。 V4 文本模型此前开放权重,不代表这个视觉实验版自动具备相同下载条件。看到明确的官方模型卡和许可证之前,不应把“可以调用 API”写成“可以本地部署”。
常见问题
DeepSeek-V4-Flash-Vision-Exp 可以生成图片吗?
不可以。它的官方能力是图片理解:描述图片、识别文字、分析图表并参与 Agent 工作流,输出仍以文字和工具调用为主。
它与普通 V4-Flash 的价格一样吗?
一样。图片换算成输入 token 后,按 V4-Flash 的峰谷价格计费。
一张图片最多消耗多少 token?
官方当前上限是每张 384 tokens。多张图片会分别计算,没有额外的图片计费公式。
它支持一次分析很多图片吗?
单次请求上限是 600 张,但实际任务应控制批次大小,并保留图片编号和结构化输出,方便定位错误与重新处理。
它支持 OCR 吗?
可以识别截图和图片中的文字,但它不是确定性的专业 OCR。小字、倾斜、反光、低分辨率和复杂表格都可能降低准确率,关键字段需要复核。
图片上传失败或图片文字没识别出来怎么办?
先检查是否使用 JPEG、PNG、GIF 或 WebP,文件大小和外部 URL 是否超过限制。小字可以把 detail 调到 high 或 original;大图或需要重复使用的图片,改用 Files API。重要字段不要只依赖一次模型结果。
它适合 Codex 或 Claude Code 吗?
协议层面具备 Responses API、Anthropic API 和工具调用能力,适合让 Agent 读取截图或工具输出。实际能否稳定工作,还取决于具体客户端是否正确传递图片、思考字段和工具结果。
最后怎么判断值不值得用
如果你的任务只有文字,继续用 V4-Flash 或 V4-Pro,没有必要为了“新”而切模型。
如果你的任务里本来就有截图、扫描件、图表或网页界面,deepseek-v4-flash-vision-exp 值得拿真实样本测一轮。它最吸引人的地方不是发布稿里的跑分,而是 V4-Flash 同档价格下,Agent 终于能把图片当成工作上下文。
我自己的主力工作流仍会通过 OmniAKey 看 Claude、GPT、Gemini 的调用明细;这个 DeepSeek 实验模型则单独拿真实截图做小流量测试。两边分开,反而不会因为一个新型号发布就把整条生产链路一起换掉。
先用 20—50 个真实样本测识别准确率、工具调用成功率、延迟和总费用,再决定是否扩大范围。它现在最合适的位置,是低成本视觉 Agent 的新候选,而不是未经验证的全场替代品。