DeepSeek V4 Flash 上线 · 我们的 GLM-5.2 价格本次下调至 5折
博客
指南

DeepSeek V4 Flash Vision Exp

DeepSeek 的实验性多模态 API 模型在 V4-Flash 同档价格下增加图片输入,本文说明它能做什么、怎么用以及有哪些限制。

12 分钟阅读OmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

先把最容易误会的一点说清楚:DeepSeek-V4-Flash-Vision-Exp 是“看图”模型,不是“生图”模型。

它能读取截图、照片、扫描件和图表,再结合工具完成任务;但官方没有把它定位成图片生成器。拿它做网页截图排错、票据识别、图表分析很合适,拿它生成海报、头像或商品图就找错模型了。

截至 2026 年 8 月 21 日,官方确认的信息可以压缩成五句话:

  • 模型 ID 是 deepseek-v4-flash-vision-exp
  • 文本能力对齐 V4-Flash,包括 Agent、推理和世界知识;
  • 新增图片输入,支持文本与图片混合任务;
  • API 价格与 V4-Flash 相同,图片按 token 计费;
  • 名字里仍有 Exp,它是实验版,不应未经回归测试就直接替换生产链路。

下面重点回答大家会实际搜索的问题:它是什么、能做什么、一张图多少钱、怎么传图、有哪些硬限制,以及和 V4-Flash、V4-Pro 到底怎么选。

DeepSeek-V4-Flash-Vision-Exp 是什么?

这是 DeepSeek 在 API 平台新上线的多模态模型。所谓多模态,在这里主要指模型可以同时接收文字和图片,再输出文字或调用工具继续完成任务。

它的基础不是 V4-Pro,而是 V4-Flash。官方说它在文本任务上保持 V4-Flash 的能力,同时在多模态 Agent 评测中相对 V4-Flash 有明显提升,表现接近 Opus 4.8。

这句话要带着两个限定理解:

  1. “接近 Opus 4.8”来自 DeepSeek 官方的多模态 Agent 评测,不是所有任务的独立第三方结论;
  2. 它对齐的是 V4-Flash 的文本能力,不代表纯文本复杂推理已经等同于 V4-Pro。

官方价格页给出的基础规格是 1M 上下文、最高 384K 输出,支持思考模式、JSON Output、Tool Calls、Responses API 和 Anthropic API。它不支持 FIM 补全,因此不能只看到“支持代码 Agent”就把它当成完整的代码补全模型。

它能做什么?不能做什么?

DeepSeek 官方列出的能力包括描述图片、识别截图中的文字和分析图表。放到真实工作流里,我认为最值得试的是下面五类任务。

一是网页和软件截图排错。

把报错截图、界面状态和文字需求一起交给模型,让它先读页面,再结合日志或工具继续排查。Vision 版本真正有价值的地方,不是多回答一句“图里有什么”,而是让 Agent 能看见操作环境。

二是扫描件和票据整理。

可以从发票、收据、表单、快递面单或扫描页中提取字段,再输出结构化结果。涉及财务、合同或身份信息时,仍应做权限隔离和人工复核;视觉模型会看错字,也可能把模糊内容补成看似合理的答案。

三是图表和仪表盘分析。

它可以读折线图、柱状图、表格截图或业务后台,再回答趋势、异常和对比问题。但对坐标轴很密、字号很小、颜色非常接近的图表,不要只看一次回答就下业务结论。

四是 UI 验收和前端 Agent。

把设计稿与浏览器截图放在同一任务里,让模型找布局、文案、状态和响应式问题。它支持 Responses API 和工具调用,因此比“只会描述图片”的视觉模型更适合进入可执行工作流。

五是批量图片分类和内容整理。

单次请求最多可以带 600 张图片,适合做商品归类、素材筛选或批量说明生成。不过 600 是接口上限,不是建议每次都塞满;图片越多,定位具体错误和核验结果就越困难。

它目前不适合三类任务:

  • 图片生成或编辑:这是视觉理解模型,不是生图模型;
  • 像素级测量和极细文字识别:图片会在进入模型前缩放,专业 OCR 或计算机视觉工具仍有价值;
  • 无人工兜底的高风险判断:医疗影像、合同金额、财务凭证等场景必须保留专业复核。

DeepSeek Vision 价格是多少?一张图多少钱?

deepseek-v4-flash-vision-exp 与 V4-Flash 使用同一档价格,单位是“元 / 百万 tokens”。北京时间 9:00—12:00、14:00—18:00 是高峰时段,其余为空闲时段。

计费项目空闲时段高峰时段
缓存命中输入0.05 元 / 百万 tokens0.10 元 / 百万 tokens
缓存未命中输入1.50 元 / 百万 tokens3.00 元 / 百万 tokens
输出4.50 元 / 百万 tokens9.00 元 / 百万 tokens

图片会先根据尺寸换算成 token,再和文字输入一起计费。官方规则是每张图片最多消耗 384 tokens:较小图片会保持比例放大,较大图片会保持比例缩小到总像素约等于 800×800,之后再进入模型。

按缓存未命中的输入价格粗算,一张达到 384-token 上限的图片本身大约是:

  • 空闲时段:384 ÷ 1,000,000 × 1.5 = 0.000576 元;
  • 高峰时段:384 ÷ 1,000,000 × 3 = 0.001152 元。

也就是说,单张图片的输入成本很低。但这不是一次完整请求的总价:文字提示、模型输出、多轮对话和 Agent 工具调用都会继续产生 token。实际账单往往由长输出和多轮执行主导,而不是那一张图片。

Files API 的上传和文件复用本身免费,模型读取图片时仍会计费。“文件上传免费”不等于“图片分析免费”。

DeepSeek-V4-Flash-Vision-Exp 怎么用?

官方支持三种图片输入方式:

  1. Base64 内联:适合临时发送本地小图片,但编码内容会占用请求体;
  2. 外部图片 URL:适合已经有公开地址的图片,服务端会自动下载;
  3. Files API:适合图片较大,或同一张图要在多个请求里重复使用的场景。

三种方式都可以用于 OpenAI 兼容的对话接口和 Responses API;官方也提供 Anthropic Messages 兼容方式。接入时真正需要改的是模型选择与图片内容块,不要继续把图片发送给 V4-Pro 或普通 V4-Flash,否则接口会返回“不支持图片”的错误。

图片还有一个很实用的细节级别设置:

级别处理方式适合场景
low先缩放到 512×512普通分类、画面概述、追求速度和低 token
high保留原图,等同 original小字、图表、界面细节
original保留原图需要尽量保留视觉细节的任务
auto当前等同 original不想手动判断,但行为将来可能调整

如果一张图会反复分析,优先用 Files API;如果只是临时看一张小截图,内联或 URL 更直接。图片里有小字时用 original,批量粗分类时再考虑 low。

图片格式、大小和数量限制

这部分很容易被发布稿略过,却是开发时最容易踩坑的地方。

限制项官方当前限制
支持格式JPEG、PNG、GIF、WebP
单次请求最多图片数600 张
请求体大小48 MiB
Base64 / 外部 URL 单图大小最高 32 MiB
Files API 单图大小最高 64 MiB
单次请求图片总大小不含 file_id 时最高 64 MiB;包含 file_id 图片时最高 200 MiB
图片最长边最高 8192 像素
一次发送 15 张及以上每张最长边降为 4096 像素
外部 URL 长度最高 8192 个字符
外部图片下载时间需在 60 秒内完成

还有四个容易忽略的限制:

  • 在常规对话接口中,图片只能放在 user 消息里;放进 system 或 assistant 消息会返回 400;
  • 只有 deepseek-v4-flash-vision-exp 接受图片,其它 DeepSeek 模型收到图片会报错;
  • GIF 虽然属于支持格式,但官方页面没有说明是否完整理解所有动画帧,不应把它当成视频模型;
  • PDF 不在当前列出的图片格式中,处理 PDF 时应先提取文字,或把相关页面转换成受支持的图片格式。

Responses API 的图片位置规则更灵活,可以出现在 user、developer 或工具输出中。使用哪一种协议时,应按对应文档组织内容,不要把不同协议的图片结构混用。

它和 V4-Flash、V4-Pro 怎么选?

任务更合适的模型
纯文本批量任务、低成本 AgentV4-Flash
截图、照片、图表与工具混合任务V4-Flash-Vision-Exp
复杂纯文本推理、架构判断、最终审查V4-Pro

Vision 版本并不是“比 V4-Flash 更贵的升级版”。它和 V4-Flash 价格相同,文本能力也对齐 Flash,只是多了图片输入。只处理文字时没有必要为了型号更新而迁移;任务确实包含视觉信息时,它才有明显价值。

它也不能完全替代 V4-Pro。复杂架构决策、长链路调试和高质量最终稿,仍应拿 V4-Pro 或其它前沿模型交叉验证。多模态 Agent 跑分接近某个模型,不代表所有文字任务、所有工具环境和所有真实项目都同样接近。

DeepSeek 新视觉模型免费吗?能在网页和本地使用吗?

API 不是免费的。 它按文字、图片和输出 token 计费,价格与 V4-Flash 相同。Files API 免费指的是上传与复用文件,不包括模型推理费用。

官方发布公告目前明确确认的是 API 平台。 公告没有同步说明网页端或 APP 已提供这个实验视觉模型,因此是否出现在产品界面,应以当前账号实际显示为准,不要把 V4-Pro 的“专家模式”入口误认为 Vision Exp。

官方这次也没有在发布公告中同步宣布 Vision Exp 的开放权重或本地部署方案。 V4 文本模型此前开放权重,不代表这个视觉实验版自动具备相同下载条件。看到明确的官方模型卡和许可证之前,不应把“可以调用 API”写成“可以本地部署”。

常见问题

DeepSeek-V4-Flash-Vision-Exp 可以生成图片吗?

不可以。它的官方能力是图片理解:描述图片、识别文字、分析图表并参与 Agent 工作流,输出仍以文字和工具调用为主。

它与普通 V4-Flash 的价格一样吗?

一样。图片换算成输入 token 后,按 V4-Flash 的峰谷价格计费。

一张图片最多消耗多少 token?

官方当前上限是每张 384 tokens。多张图片会分别计算,没有额外的图片计费公式。

它支持一次分析很多图片吗?

单次请求上限是 600 张,但实际任务应控制批次大小,并保留图片编号和结构化输出,方便定位错误与重新处理。

它支持 OCR 吗?

可以识别截图和图片中的文字,但它不是确定性的专业 OCR。小字、倾斜、反光、低分辨率和复杂表格都可能降低准确率,关键字段需要复核。

图片上传失败或图片文字没识别出来怎么办?

先检查是否使用 JPEG、PNG、GIF 或 WebP,文件大小和外部 URL 是否超过限制。小字可以把 detail 调到 highoriginal;大图或需要重复使用的图片,改用 Files API。重要字段不要只依赖一次模型结果。

它适合 Codex 或 Claude Code 吗?

协议层面具备 Responses API、Anthropic API 和工具调用能力,适合让 Agent 读取截图或工具输出。实际能否稳定工作,还取决于具体客户端是否正确传递图片、思考字段和工具结果。

最后怎么判断值不值得用

如果你的任务只有文字,继续用 V4-Flash 或 V4-Pro,没有必要为了“新”而切模型。

如果你的任务里本来就有截图、扫描件、图表或网页界面,deepseek-v4-flash-vision-exp 值得拿真实样本测一轮。它最吸引人的地方不是发布稿里的跑分,而是 V4-Flash 同档价格下,Agent 终于能把图片当成工作上下文

我自己的主力工作流仍会通过 OmniAKey 看 Claude、GPT、Gemini 的调用明细;这个 DeepSeek 实验模型则单独拿真实截图做小流量测试。两边分开,反而不会因为一个新型号发布就把整条生产链路一起换掉。

先用 20—50 个真实样本测识别准确率、工具调用成功率、延迟和总费用,再决定是否扩大范围。它现在最合适的位置,是低成本视觉 Agent 的新候选,而不是未经验证的全场替代品。

官方资料