GPT-5.4 和 GPT-5.4 Mini 已下线 · 请切换至其他可用模型
博客
指南

DeepSeek V4.1 Flash

新 Flash 的价格更低,多项 Agent 跑分高于 V4 Pro,但官方证据并不支持“所有任务全面胜出”的简单结论。

12 分钟阅读OmniaKey
DeepSeek V4.1 Flash模型评测API 价格多模态编程 Agent

一篇可信的 DeepSeek V4.1 Flash 评测,需要把模型架构、DeepSeek 自己公布的跑分,以及开发者真正能从 API 调用到什么分开来看。

先给结论:V4.1 Flash 很可能成为高频 Agent 任务更合理的默认起点。DeepSeek 官方直连 API 的闲时价格降到 缓存未命中输入 1 元、输出 4 元/百万 token,模型原生支持图片输入,多项厂商 Agent 跑分也超过 V4 Pro。但它没有在每一项推理测试里取胜,本文也没有运行付费独立速度或质量基准,因此不会把发布稿写成“亲测全面碾压”。

事实核验日期:2026 年 9 月 10 日。 本文是基于 DeepSeek 发布说明、实时价格与 API 文档、开源模型卡和复现说明完成的研究型评测。所有跑分均为厂商报告(vendor-reported),未经本文独立复现。

DeepSeek V4.1 Flash 评测结论

这些任务值得先试: 长上下文、频繁工具调用的 Agent;截图辅助排错;图片或文档理解;对吞吐与单次 token 成本敏感的批量任务。

这些任务先做回归: 依赖 V4 Pro 特定知识与推理表现的工作流;严格依赖工具调用格式的长链路;必须固定模型身份才能审计复现的生产任务。

正在使用 deepseek-v4-pro 的团队不要被动等待。 DeepSeek 已宣布,从 2026-09-14 12:00(北京时间) 起,这个模型名会转发到 V4.1 Flash,并按 Flash 价格计费,直到 V4.1 Pro 上线。也就是说,模型 ID 不变,背后的模型行为却会改变。

首发信息速览

项目已核实信息
正式发布日期2026-09-10
DeepSeek API 正式模型 IDdeepseek-flash
临时兼容 IDdeepseek-v4-flashdeepseek-v4-flash-vision-exp
V4 Pro 切换deepseek-v4-pro 从 2026-09-14 12:00(北京时间)路由到 V4.1 Flash
架构552B 参数、多模态 MoE、Causal Encoder-Decoder
每 token 激活参数Prefill 8B,Decode 16B
上下文与输出1M 上下文,最大 384K 输出
模态文字与图片输入,文字或工具调用输出
托管 API 推理档位非思考 / 思考;lowhighmax,默认 high
API 协议Chat Completions、Responses API、Anthropic API
开放权重MIT 许可证

旧 V4 Flash 与 V4 Flash Vision Exp 已经下线。两个旧 ID 只是暂时兼容到 V4.1 Flash 的别名,没有公布永久保留承诺;新接入应直接使用 deepseek-flash

V4.1 的新架构改变了什么?

V4.1 Flash 不是只换了一轮后训练权重。官方模型卡描述的是一套 40 层 Causal Encoder-Decoder:前 20 层为因果编码器,后 20 层为解码器。输入 Prefill 与逐 token Decode 的计算方式不对称,因此两段只分别激活 8B 和 16B 参数。

这里最容易读错:8B / 16B 不是模型总参数。V4.1 Flash 公布的骨干参数量是 552B,只是 MoE 稀疏路由让每个 token 不必激活全部参数。

对长 Agent 会话更实用的变化是 KV Cache:

  • Compressed Sparse Attention 2 在不同层之间共享或复用注意力状态;
  • FP4 主 KV 缓存把全局 KV Cache 压到每 token 890 字节
  • DeepSeek 报告其全局 KV Cache 约为上一代 V4 Flash 的 1/4
  • SWA Bounded Replay 把需要持久化的缓存进一步降到上一代约 1/8

这不等于一次 API 请求只计算或计费四分之一的 token。KV 压缩首先降低的是服务端显存和存储占用;开发者真正能拿到多少收益,要看公开费率、实际吞吐、首 token 延迟、完整任务时间和可用性。

DeepSeek V4.1 Flash API 价格

DeepSeek 中文价格页按人民币列出以下官方直连价,单位均为元 / 百万 token:

计费项目空闲时段高峰时段
缓存命中输入0.02 元0.04 元
缓存未命中输入1.00 元2.00 元
输出4.00 元8.00 元

高峰时段是 工作日 9:00-12:00、14:00-18:00(北京时间),其它时段都按闲时价格,包括周末。新价格从 2026-09-10 12:00(北京时间)生效。

这张表是 DeepSeek 官方直连 API 价格,不是 OmniAKey 报价。使用任何网关时,都应查看该网关实时目录和账务规则,不能直接复制供应商费率做预算。

成本算例:10 万输入 + 2 万输出

假设一次请求有 100,000 个缓存未命中输入 token,并生成 20,000 个输出 token。不计缓存命中、重试、税费和外围工具成本:

text
V4.1 Flash 闲时 = 0.1 x 1.00 元 + 0.02 x 4.00 元 = 0.18 元
V4.1 Flash 峰时 = 0.1 x 2.00 元 + 0.02 x 8.00 元 = 0.36 元
V4 Pro 闲时     = 0.1 x 4.50 元 + 0.02 x 13.50 元 = 0.72 元
V4 Pro 峰时     = 0.1 x 9.00 元 + 0.02 x 27.00 元 = 1.44 元

按这个固定 token 组合,V4.1 Flash 比 V4 Pro 低 75%。这只是可复算的价格结论,不是质量分数。低价模型如果需要多次重试和人工返工,最终的“通过任务成本”仍可能更高。

此前的 V4 Pro API 价格指南保留了 2026 年 8 月的费率与缓存算例。新预算应以实时官方价格页为准,因为 DeepSeek 已经宣布 Pro 的路由切换。

V4.1 Flash 真的全面超过 V4 Pro 吗?

在多项 Agent 测试上超过了;在每一项公开跑分上,并没有。

下表只截取官方模型卡中三个 DeepSeek 版本的同表数据。Instruct 模型统一使用最大推理强度、temperature=1.0top_p=0.95。这些是 DeepSeek 自己运行的结果,不是 OmniAKey 或独立实验室复测。

基准V4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE 纯文本子集37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE(带工具)51.560.063.9
AutomationBench37.743.254.8

更准确的结论是:V4.1 Flash 在表中的编程、安全、自动化和工具使用任务上提升明显;但 V4 Pro 的 GPQA Diamond 与可比的 HLE 纯文本成绩仍然更高。“厂商计划用 Flash 接替 Pro”不能自动推导成“每个任务都更强”。

官方资料还存在一处值得公开保留的冲突:9 月 10 日更新日志把 NL2Repo-Bench 写成 65.4,实时 Hugging Face 模型卡表格则写成 64.0。DeepSeek 澄清前,本文不把这一项纳入总结结论。

同一个模型,Agent 框架可拉开 8.7 个百分点

模型卡还给了一组很有价值的 Scaffold 对比。仍然是同一个 V4.1 Flash:DeepSWE v1.1 从 OpenCode 的 65.5 到 mini-SWE-agent 的 74.2,相差 8.7 个百分点;Terminal-Bench 2.1 从 Codex 的 84.1 到 DeepSeek Harness Minimal 的 90.6,相差 6.5 个百分点。

DeepSeek 披露,DeepSWE 每题 N=8,Terminal-Bench 每题 N=3;测试使用 Linux 容器,Agent 最多 500 步,Terminal-Bench 不开放网络,并统一使用最大推理强度。

这说明“模型跑分”只回答了部署问题的一部分。提示格式、工具循环、上下文整理、重试规则与 Agent 框架,足以改变一次接近的模型对比。你真正使用 Claude Code、Codex、OpenCode 或自研 Harness,就应该在那个框架里复现任务,而不是只拿官方表里最高的一格做决策。

原生视觉能做什么?

V4.1 Flash 可以在同一请求中接收文字与图片。DeepSeek 文档支持 JPEG、PNG、GIF、WebP,可通过 base64、公开 URL 或 Files API 传入,也能用于 Chat Completions、Responses API 和 Anthropic 兼容接口。

当前图像理解指南还给出这些边界:

  • detail: low 会缩放到 512 x 512,highoriginal 保留原图;
  • 每张图片自动缩放后最多计 1,024 个输入 token
  • 单次请求最多 600 张图片,但还受请求体、单图大小和尺寸限制;
  • 在 Chat Completions 中,图片只能放在 user 消息里,放进 system 或 assistant 消息会返回 400;Responses API 另行支持 developer 和工具输出位置。

按缓存未命中的闲时输入价,一张达到 1,024-token 上限的图片,其图片输入成本约为 0.001024 元

text
1,024 / 1,000,000 x 1.00 元 = 0.001024 元

这不是一次完整请求的总价。文字输入、推理 token、可见输出、多轮上下文和工具调用都会继续产生费用。V4.1 Flash 也是视觉理解模型,不是图片生成器;OCR、小字号密集图表和重要文档字段仍应交给确定性校验或人工复核。

推理档位与接入陷阱

DeepSeek 托管 API 公开支持 lowhighmax,思考模式默认开启,默认档位为 high。开源 Prompt 格式可以使用 1-100 的连续整数预算,但不要据此假设托管 API 也接受任意数字;它当前公开文档写的是三个命名档位。

迁移时至少回归下面三个细节:

  1. 思考模式带 tools 时,后续请求必须完整回传 reasoning_content,否则官方文档说明会返回 HTTP 400。
  2. FIM 补全只支持非思考模式。
  3. 正式模型 ID 是 deepseek-flash,内测报道里出现的临时 ID 不是生产合同。

DeepSeek 同时开放了独立 Python 编码参考和维护版 deepseek-recipe。相较 V4,V4.1 改了 DSML 工具标签、数字推理预算编码和对话中途 system 消息的处理。自托管推理框架不能只复用旧 V4 Chat Template 就假设兼容。

“上线 DeepSeek API”不等于已上线所有网关

V4.1 Flash 已经上线的是 DeepSeek 官方直连 API。这件事不会自动让同一个模型 ID 同时出现在所有第三方网关。

截至本文核验时点 2026-09-10,OmniAKey 实时模型目录仍列出旧 V4 Flash、V4 Flash Vision Exp 和 V4 Pro 路由,尚未列出正式 deepseek-flash。因此本文不声称 V4.1 Flash 当前已经能通过 OmniAKey 调用,也不发布一条未经实时目录验证的 OmniAKey 价格。

创建密钥前,先在目录确认准确 ID。只有新路由真正出现后,再到 API Keys 控制台创建单独限额的 key,完成第一笔 smoke test 后核对实际模型、输入、缓存、输出和费用。透明计费指南说明了应该检查哪些明细;请求格式见 API 快速开始

一套可执行的 V4 Pro 迁移测试

直接使用 DeepSeek API 的团队,最好在 9 月 14 日别名切换前完成下面这轮回归:

  1. 固定 10-30 个代表性任务及其验收命令或人工标准。
  2. 记录当前 deepseek-v4-pro 的结果、延迟、缓存命中与未命中 token、输出 token、重试和总费用。
  3. 在输入、工具和权限完全相同的条件下改跑 deepseek-flash
  4. 至少比较 highmax,每轮只改一个变量。
  5. 加入一项长工具循环;业务需要视觉时,再加入一项真实图片任务。
  6. 比较通过任务成本,不只比较第一条响应的单价。
  7. 在别名背后的模型改变前,更新监控、allowlist、Dashboard 标签与审计记录。

回滚方案不能假设 9 月 14 日以后 deepseek-v4-pro 仍能选中旧 Pro。保留测试产物;若某类任务确实回退,应选择一个身份明确的替代路由。

谁适合先用 V4.1 Flash?

优先测试它的场景包括:

  • 长 Prompt、多轮工具调用的编程 Agent;
  • 截图辅助的前端排错与 UI 验收;
  • 带下游校验的 OCR 与文档抽取;
  • 重视吞吐和 token 成本的批量自动化;
  • 已经使用 V4 Flash、能够迁移到正式新 ID 的团队。

下面这些场景应保留对照路由:

  • 知识密集任务,而且 V4 Pro 更高的官方 GPQA / HLE 恰好贴近真实工作;
  • 没有完整回归证据就不能接受模型行为变化的生产链路;
  • 像素级视觉、精确 OCR 或高风险文档判断;
  • 必须依赖独立延迟、稳定性数据,而不是厂商发布结论的系统。

开放权重也不等于能在笔记本运行。DeepSeek 提供 MIT 权重和参考推理代码,但 552B MoE 的生产部署仍需要专用硬件、权重转换、正确 Prompt 编码与完整运维验证。

常见问题

DeepSeek V4.1 Flash 已经正式发布了吗?

已经发布。DeepSeek 于 2026 年 9 月 10 日正式发布并上线官方 API,生产模型 ID 是 deepseek-flash

V4.1 Flash 比 V4 Pro 强吗?

它在多项官方 Agent 基准上更高,直连 API 价格也低很多;但官方表里的 GPQA Diamond 和 HLE 纯文本子集仍低于 V4 Pro。是否更适合,要在真实 Agent 框架和验收任务里测试。

deepseek-v4-pro 之后会发生什么?

DeepSeek 宣布从 2026 年 9 月 14 日 12:00(北京时间)起,这个 ID 会转发到 V4.1 Flash,并按 V4.1 Flash 价格计费,直到 V4.1 Pro 上线。

DeepSeek V4.1 Flash API 多少钱?

中文官方直连价中,闲时缓存命中输入为 0.02 元、缓存未命中输入为 1 元、输出为 4 元/百万 token;工作日高峰价全部翻倍。

V4.1 Flash 能识别图片吗?

可以。它原生接收图片,可用于图片描述、类 OCR 抽取、图表分析和多模态 Agent,但不能生成图片。

DeepSeek V4.1 Flash 开源了吗?

模型仓库与权重采用 MIT 许可证。它属于开放权重模型,但 552B 稀疏模型的实际部署仍是大型基础设施项目。

一手来源

证据说明:事实与计算于 2026 年 9 月 10 日核验。本文没有运行付费模型、独立速度测试或生产稳定性测试;部署前应重新确认模型 ID、价格、路由日期与网关可用性。