DeepSeek V4 Flash 上线 · 我们的 GLM-5.2 价格本次下调至 5折
博客
成本控制

DeepSeek V4 Pro API 价格

DeepSeek V4 Pro 谷时每百万输入与输出 token 分别为 $0.66 和 $1.98;进入每日两个 UTC 峰时时段后,费率翻倍至 $1.32 和 $3.96。

12 分钟阅读OmniaKey
DeepSeek V4 ProAPI pricing0813cost control

最新 DeepSeek V4 Pro API 价格会随每天的时段变化。通过 DeepSeek 官方 API 直连时,谷时每百万 token 的缓存命中输入为 $0.022、缓存未命中输入为 $0.66、输出为 $1.98;峰时则分别翻倍至 $0.044、$1.32 和 $3.96

8 月 13 日发布的权重快照名为 DeepSeek-V4-Pro-0813,但 API 模型 ID 仍是 deepseek-v4-pro。发请求时不要把 0813 写进模型 ID。

核验日期:2026 年 8 月 18 日。 DeepSeek 于 8 月 13 日发布 V4 Pro 0813,新峰谷价格从 8 月 16 日 16:00 UTC 起生效。下文表格均为 DeepSeek 官方直连 API 费率,不代表 OmniAKey 的永久价格;制定生产预算前请再次核对实时路由。

DeepSeek V4 Pro 0813 关键信息

项目当前官方信息
权重 / 快照DeepSeek-V4-Pro-0813
API 模型 IDdeepseek-v4-pro
发布日期2026 年 8 月 13 日
上下文窗口1M token
最大输出384K token
默认思考模式已启用,默认为 high
推理强度lowhighmax
原生接口Chat Completions、Responses API、Anthropic API
谷时:缓存命中 / 未命中 / 输出$0.022 / $0.66 / $1.98
峰时:缓存命中 / 未命中 / 输出$0.044 / $1.32 / $3.96
峰时时段01:00-04:00 与 06:00-10:00 UTC

所有价格均为每百万 token 的美元价格。除上述两个时间窗口外,其余时段全部按谷时计费,价格为峰时的一半。

DeepSeek V4 Pro 官方 API 价格表

计费项目谷时峰时峰时倍率
缓存命中输入$0.022$0.0442 倍
缓存未命中输入$0.66$1.322 倍
输出$1.98$3.962 倍

通用计算公式为:

text
费用 = 缓存命中输入百万数 x 命中费率
     + 缓存未命中输入百万数 x 未命中费率
     + 输出百万数 x 输出费率

DeepSeek 以 UTC 定义两个时段,但该价格页没有说明跨越时段边界的长请求如何拆分。预算与日志应直接使用 UTC,以供应商实际计费记录为准;若要把长请求排在边界附近,应先向 DeepSeek 确认规则。

其中,DeepSeek V4 Pro 模型页负责展示 OmniAKey 当前报价、可用状态和请求参考;上表只描述 DeepSeek 官方直连计费。网关价格与 DeepSeek 的分时直连价属于两套计费关系,因此应查看实时模型目录,不要默认两者完全一致。

“0813” 到底代表什么

DeepSeek-V4-Pro-0813 是取代 V4 Pro Preview 的正式 GA 权重快照。DeepSeek 没有更改托管 API 的别名:

json
{
  "model": "deepseek-v4-pro"
}

该版本沿用 Preview 架构,并增加 DSpark 推测解码模块。DeepSeek 还以 MIT 许可证开放模型权重。这对自托管用户很重要,但开放权重不等于免费推理:硬件、服务、存储和运维仍然会产生成本。

对托管 API 用户而言,实际变化包括:

  • Agent 基准成绩出现官方报告的明显提升;
  • 推理强度明确分为 lowhighmax
  • 原生支持 Responses API,并针对 Codex 做了优化;
  • 1M 上下文,以及 highmax 下建议最高 384K 输出;
  • 新增峰时与谷时价格表。

固定别名便于直接升级,但它不如固定权重快照容易复现。比较效果时,应记录请求日期、API 模型 ID、推理强度、Harness 版本与验收标准。

成本算例 1:缓存未命中输入

假设一次编程任务使用 100,000 个缓存未命中输入 token,并生成 20,000 个输出 token。

时段计算过程
谷时0.1 x $0.66 + 0.02 x $1.98 = $0.1056
峰时0.1 x $1.32 + 0.02 x $3.96 = $0.2112

把完全相同的 token 工作负载移到谷时可节省 $0.1056。任务本身并没有减少 token,只是每个 token 使用了更低费率。

成本算例 2:缓存命中输入

现在假设相同的 100,000 个输入 token 全部命中缓存,模型仍生成 20,000 个输出 token。

时段计算过程
谷时0.1 x $0.022 + 0.02 x $1.98 = $0.0418
峰时0.1 x $0.044 + 0.02 x $3.96 = $0.0836

在这个案例里,输出已经成为主要成本。稳定前缀命中缓存虽然有帮助,但冗长推理、过长回答、反复工具循环与重试仍可能吞掉缓存节省。

DeepSeek 上下文缓存如何计费

DeepSeek 默认启用磁盘上下文缓存。后续请求只有完整匹配已持久化的缓存前缀单元,才会获得缓存命中费率。文字相似或只复用部分文件,并不必然构成命中。

应检查响应中的 usage 字段:

  • prompt_cache_hit_tokens 表示按缓存命中价计费的输入 token;
  • prompt_cache_miss_tokens 表示按缓存未命中价计费的输入 token。

缓存采用尽力而为机制。构建缓存需要时间;未继续使用的数据通常会在数小时到数天后清理。预算必须以实际返回字段为准,而不是以预期复用量为准。

稳定的 system 指令、工具 schema、仓库规范和大型参考资料适合作为缓存前缀。如果客户端允许控制请求结构,应把经常变化的指令放在稳定前缀之后。

思考 token 也按输出计费

思考模式默认开启,默认强度为 high。DeepSeek 会把 OpenAI 风格的 mediumxhigh 请求映射为 high;模型实际支持的等级是 lowhighmax

使用 Chat Completions 时,通过 reasoning_effort 参数设置上述三个有效等级之一。

在 Responses API 中,推理用量显示在 usage.output_tokens_details.reasoning_tokens。它属于输出 token,因此不能只根据用户可见的最终回答估算成本。回答很短,也可能包含大量推理输出。

简单抽取或格式转换可从 low 开始,日常 Agent 工作使用 high,只有当更高任务通过率能覆盖额外输出、延迟与成本时,才测试 max。384K 是容量上限,不是默认推荐值。

若要从工作流层面控制上下文,可阅读减少 token 使用指南,先清理陈旧上下文和无边界工具输出,而不是直接牺牲模型质量。

V4 Pro 0813 基准提升

DeepSeek 公布了相对 V4 Pro Preview 的以下变化:

基准V4 Pro PreviewV4 Pro 0813
Terminal Bench 2.172.187.9
DeepSWE12.862.7
Toolathlon-Verified55.974.1
HLE(带工具)48.260.0

来源:DeepSeek(vendor-reported,未经独立复现)。 在公开代码 Agent 基准中,DeepSeek 使用 DeepSeek Harness 的 minimal 模式、max 推理强度、temperature = 1.0top_p = 0.95。同一表格中的 DSBench-FullStack 和 DSBench-Hard 是内部测试集。

这些数字可以支持“0813 在 DeepSeek 的测试配置下优于 Preview”,但不能证明它在所有模型、客户端、仓库与生产任务中都占优。应使用相同输入、权限、工具和通过标准复现自己的代表性任务。

关于具体配置,DeepSeek Harness 接入教程负责安装与自定义 Provider;本文只负责价格与 0813 成本决策,两者不会争抢同一搜索意图。

DeepSeek V4 Flash 价格约为三分之一

DeepSeek 公布的 V4 Flash 费率约为 Pro 的三分之一。价格表中的缓存未命中与输出恰好是三分之一;按展示精度取整后的缓存命中价略低于三分之一。

V4 Flash 计费项目谷时峰时
缓存命中输入$0.007$0.014
缓存未命中输入$0.22$0.44
输出$0.66$1.32

Flash 的 API ID 是 deepseek-v4-flash,当前快照为 DeepSeek-V4-Flash-0731。官方并发上限也更高:Flash 为 2,500,Pro 为 500。

对于高吞吐、边界清楚的任务,Flash 是更便宜的首测选项,但价格不能证明质量相同。永久切换 Agent 路由前,应比较包含重试与人工修正在内的通过任务成本。

通过 OmniAKey 调用 DeepSeek V4 Pro

先在 API Keys 控制台创建独立限额的密钥,确认实时目录仍包含 deepseek-v4-pro,再调用 OpenAI 兼容接口:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "找出这份迁移计划中风险最高的假设。"}
    ],
    "stream": true
  }'

请使用实时目录显示的准确网关模型 ID。API 快速开始说明了端点与鉴权方式。

完成一项代表性任务后,到用量控制台检查明细。除非 OmniAKey 实时报价明确采用相同规则,否则不要把 DeepSeek 官方直连的峰谷表套用到 OmniAKey 用量记录上。

关于用量核对,可阅读透明计费指南,了解如何检查模型、输入、缓存、输出和单次费用。

实用的调度与预算策略

建议按以下顺序执行:

  1. 用户交互和紧急任务优先保证延迟,不要只为折扣故意推迟。
  2. DeepSeek 直连的批量评测、索引、夜间分析和可重试作业,尽量避开 01:00-04:00 与 06:00-10:00 UTC。
  3. 分开记录缓存命中、缓存未命中、推理与输出 token。
  4. 按人员、环境或自动化角色分别创建密钥并设置限额。
  5. 用相同验收标准比较 Pro 与 Flash。
  6. 修改生产调度前,再检查一次官方价格页。

消费上限只能控制最大损失,不能自动减少 token。先优化请求,再根据成功任务的正常波动设置足够的限额。

常见 DeepSeek V4 Pro 价格误区

DeepSeek-V4-Pro-0813 当作 API 模型 ID

这是权重快照名。托管 API 仍使用 deepseek-v4-pro

认为全天都是谷时

01:00-04:00 与 06:00-10:00 UTC 使用峰时价格,其余 17 小时才是半价谷时。

认为重复文字一定命中缓存

请求必须完整匹配已持久化的缓存前缀单元。应信任 prompt_cache_hit_tokens,而不是肉眼判断相似度。

把 1M 上下文或 384K 输出当成免费额度

两者都是容量限制,占用这些窗口的 token 仍然计费。

忽略不可见的推理输出

推理 token 包含在输出用量中。可见回答短,不代表输出成本一定低。

把厂商基准当作独立证据

0813 的提升属于 vendor-reported 结果,使用了明确披露的 Harness 与 max 配置。它是升级信号,不是通用生产排名。

常见问题

DeepSeek V4 Pro API 多少钱?

谷时每百万 token 的缓存命中输入、缓存未命中输入与输出分别为 $0.022、$0.66 和 $1.98;峰时分别为 $0.044、$1.32 和 $3.96。

DeepSeek V4 Pro 什么时候是谷时?

除 01:00-04:00 与 06:00-10:00 UTC 外,其余所有 UTC 时段都是谷时,价格比峰时低 50%。

DeepSeek V4 Pro 0813 的 API 模型 ID 是什么?

使用 deepseek-v4-proDeepSeek-V4-Pro-0813 是已发布的权重与快照名称,不是托管 API 请求 ID。

DeepSeek V4 Pro 支持 100 万 token 吗?

支持。官方列出 1M 上下文窗口和 384K 最大输出;它们是上限,不是免费额度。

DeepSeek V4 Pro 比 V4 Flash 便宜吗?

不是。Flash 在两个时段的标示费率都约为 Pro 的三分之一。Pro 必须通过更高的任务通过率证明溢价值得。

0813 是否提高了编程 Agent 能力?

DeepSeek 报告其相对 Pro Preview 在 Terminal Bench 2.1、DeepSWE 和 Toolathlon-Verified 上有明显提升。公开代码 Agent 测试使用 DeepSeek Harness minimal 模式和 max 推理强度。在自己的任务复现前,应将其视为 vendor-reported 结果。

核验来源

事实核验于 2026 年 8 月 18 日。厂商价格、峰谷时段、模型别名、网关可用性与功能支持均可能变化;制定生产预算前,请再次检查上述第一方文档和实时目录。