DeepSeek V4 Pro API 价格
DeepSeek V4 Pro 谷时每百万输入与输出 token 分别为 $0.66 和 $1.98;进入每日两个 UTC 峰时时段后,费率翻倍至 $1.32 和 $3.96。
最新 DeepSeek V4 Pro API 价格会随每天的时段变化。通过 DeepSeek 官方 API 直连时,谷时每百万 token 的缓存命中输入为 $0.022、缓存未命中输入为 $0.66、输出为 $1.98;峰时则分别翻倍至 $0.044、$1.32 和 $3.96。
8 月 13 日发布的权重快照名为 DeepSeek-V4-Pro-0813,但 API 模型 ID 仍是 deepseek-v4-pro。发请求时不要把 0813 写进模型 ID。
核验日期:2026 年 8 月 18 日。 DeepSeek 于 8 月 13 日发布 V4 Pro 0813,新峰谷价格从 8 月 16 日 16:00 UTC 起生效。下文表格均为 DeepSeek 官方直连 API 费率,不代表 OmniAKey 的永久价格;制定生产预算前请再次核对实时路由。
DeepSeek V4 Pro 0813 关键信息
| 项目 | 当前官方信息 |
|---|---|
| 权重 / 快照 | DeepSeek-V4-Pro-0813 |
| API 模型 ID | deepseek-v4-pro |
| 发布日期 | 2026 年 8 月 13 日 |
| 上下文窗口 | 1M token |
| 最大输出 | 384K token |
| 默认思考模式 | 已启用,默认为 high |
| 推理强度 | low、high 或 max |
| 原生接口 | Chat Completions、Responses API、Anthropic API |
| 谷时:缓存命中 / 未命中 / 输出 | $0.022 / $0.66 / $1.98 |
| 峰时:缓存命中 / 未命中 / 输出 | $0.044 / $1.32 / $3.96 |
| 峰时时段 | 01:00-04:00 与 06:00-10:00 UTC |
所有价格均为每百万 token 的美元价格。除上述两个时间窗口外,其余时段全部按谷时计费,价格为峰时的一半。
DeepSeek V4 Pro 官方 API 价格表
| 计费项目 | 谷时 | 峰时 | 峰时倍率 |
|---|---|---|---|
| 缓存命中输入 | $0.022 | $0.044 | 2 倍 |
| 缓存未命中输入 | $0.66 | $1.32 | 2 倍 |
| 输出 | $1.98 | $3.96 | 2 倍 |
通用计算公式为:
费用 = 缓存命中输入百万数 x 命中费率
+ 缓存未命中输入百万数 x 未命中费率
+ 输出百万数 x 输出费率
DeepSeek 以 UTC 定义两个时段,但该价格页没有说明跨越时段边界的长请求如何拆分。预算与日志应直接使用 UTC,以供应商实际计费记录为准;若要把长请求排在边界附近,应先向 DeepSeek 确认规则。
其中,DeepSeek V4 Pro 模型页负责展示 OmniAKey 当前报价、可用状态和请求参考;上表只描述 DeepSeek 官方直连计费。网关价格与 DeepSeek 的分时直连价属于两套计费关系,因此应查看实时模型目录,不要默认两者完全一致。
“0813” 到底代表什么
DeepSeek-V4-Pro-0813 是取代 V4 Pro Preview 的正式 GA 权重快照。DeepSeek 没有更改托管 API 的别名:
{
"model": "deepseek-v4-pro"
}
该版本沿用 Preview 架构,并增加 DSpark 推测解码模块。DeepSeek 还以 MIT 许可证开放模型权重。这对自托管用户很重要,但开放权重不等于免费推理:硬件、服务、存储和运维仍然会产生成本。
对托管 API 用户而言,实际变化包括:
- Agent 基准成绩出现官方报告的明显提升;
- 推理强度明确分为
low、high与max; - 原生支持 Responses API,并针对 Codex 做了优化;
- 1M 上下文,以及
high和max下建议最高 384K 输出; - 新增峰时与谷时价格表。
固定别名便于直接升级,但它不如固定权重快照容易复现。比较效果时,应记录请求日期、API 模型 ID、推理强度、Harness 版本与验收标准。
成本算例 1:缓存未命中输入
假设一次编程任务使用 100,000 个缓存未命中输入 token,并生成 20,000 个输出 token。
| 时段 | 计算过程 |
|---|---|
| 谷时 | 0.1 x $0.66 + 0.02 x $1.98 = $0.1056 |
| 峰时 | 0.1 x $1.32 + 0.02 x $3.96 = $0.2112 |
把完全相同的 token 工作负载移到谷时可节省 $0.1056。任务本身并没有减少 token,只是每个 token 使用了更低费率。
成本算例 2:缓存命中输入
现在假设相同的 100,000 个输入 token 全部命中缓存,模型仍生成 20,000 个输出 token。
| 时段 | 计算过程 |
|---|---|
| 谷时 | 0.1 x $0.022 + 0.02 x $1.98 = $0.0418 |
| 峰时 | 0.1 x $0.044 + 0.02 x $3.96 = $0.0836 |
在这个案例里,输出已经成为主要成本。稳定前缀命中缓存虽然有帮助,但冗长推理、过长回答、反复工具循环与重试仍可能吞掉缓存节省。
DeepSeek 上下文缓存如何计费
DeepSeek 默认启用磁盘上下文缓存。后续请求只有完整匹配已持久化的缓存前缀单元,才会获得缓存命中费率。文字相似或只复用部分文件,并不必然构成命中。
应检查响应中的 usage 字段:
prompt_cache_hit_tokens表示按缓存命中价计费的输入 token;prompt_cache_miss_tokens表示按缓存未命中价计费的输入 token。
缓存采用尽力而为机制。构建缓存需要时间;未继续使用的数据通常会在数小时到数天后清理。预算必须以实际返回字段为准,而不是以预期复用量为准。
稳定的 system 指令、工具 schema、仓库规范和大型参考资料适合作为缓存前缀。如果客户端允许控制请求结构,应把经常变化的指令放在稳定前缀之后。
思考 token 也按输出计费
思考模式默认开启,默认强度为 high。DeepSeek 会把 OpenAI 风格的 medium 与 xhigh 请求映射为 high;模型实际支持的等级是 low、high 和 max。
使用 Chat Completions 时,通过 reasoning_effort 参数设置上述三个有效等级之一。
在 Responses API 中,推理用量显示在 usage.output_tokens_details.reasoning_tokens。它属于输出 token,因此不能只根据用户可见的最终回答估算成本。回答很短,也可能包含大量推理输出。
简单抽取或格式转换可从 low 开始,日常 Agent 工作使用 high,只有当更高任务通过率能覆盖额外输出、延迟与成本时,才测试 max。384K 是容量上限,不是默认推荐值。
若要从工作流层面控制上下文,可阅读减少 token 使用指南,先清理陈旧上下文和无边界工具输出,而不是直接牺牲模型质量。
V4 Pro 0813 基准提升
DeepSeek 公布了相对 V4 Pro Preview 的以下变化:
| 基准 | V4 Pro Preview | V4 Pro 0813 |
|---|---|---|
| Terminal Bench 2.1 | 72.1 | 87.9 |
| DeepSWE | 12.8 | 62.7 |
| Toolathlon-Verified | 55.9 | 74.1 |
| HLE(带工具) | 48.2 | 60.0 |
来源:DeepSeek(vendor-reported,未经独立复现)。 在公开代码 Agent 基准中,DeepSeek 使用 DeepSeek Harness 的 minimal 模式、max 推理强度、temperature = 1.0 与 top_p = 0.95。同一表格中的 DSBench-FullStack 和 DSBench-Hard 是内部测试集。
这些数字可以支持“0813 在 DeepSeek 的测试配置下优于 Preview”,但不能证明它在所有模型、客户端、仓库与生产任务中都占优。应使用相同输入、权限、工具和通过标准复现自己的代表性任务。
关于具体配置,DeepSeek Harness 接入教程负责安装与自定义 Provider;本文只负责价格与 0813 成本决策,两者不会争抢同一搜索意图。
DeepSeek V4 Flash 价格约为三分之一
DeepSeek 公布的 V4 Flash 费率约为 Pro 的三分之一。价格表中的缓存未命中与输出恰好是三分之一;按展示精度取整后的缓存命中价略低于三分之一。
| V4 Flash 计费项目 | 谷时 | 峰时 |
|---|---|---|
| 缓存命中输入 | $0.007 | $0.014 |
| 缓存未命中输入 | $0.22 | $0.44 |
| 输出 | $0.66 | $1.32 |
Flash 的 API ID 是 deepseek-v4-flash,当前快照为 DeepSeek-V4-Flash-0731。官方并发上限也更高:Flash 为 2,500,Pro 为 500。
对于高吞吐、边界清楚的任务,Flash 是更便宜的首测选项,但价格不能证明质量相同。永久切换 Agent 路由前,应比较包含重试与人工修正在内的通过任务成本。
通过 OmniAKey 调用 DeepSeek V4 Pro
先在 API Keys 控制台创建独立限额的密钥,确认实时目录仍包含 deepseek-v4-pro,再调用 OpenAI 兼容接口:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "找出这份迁移计划中风险最高的假设。"}
],
"stream": true
}'
请使用实时目录显示的准确网关模型 ID。API 快速开始说明了端点与鉴权方式。
完成一项代表性任务后,到用量控制台检查明细。除非 OmniAKey 实时报价明确采用相同规则,否则不要把 DeepSeek 官方直连的峰谷表套用到 OmniAKey 用量记录上。
关于用量核对,可阅读透明计费指南,了解如何检查模型、输入、缓存、输出和单次费用。
实用的调度与预算策略
建议按以下顺序执行:
- 用户交互和紧急任务优先保证延迟,不要只为折扣故意推迟。
- DeepSeek 直连的批量评测、索引、夜间分析和可重试作业,尽量避开 01:00-04:00 与 06:00-10:00 UTC。
- 分开记录缓存命中、缓存未命中、推理与输出 token。
- 按人员、环境或自动化角色分别创建密钥并设置限额。
- 用相同验收标准比较 Pro 与 Flash。
- 修改生产调度前,再检查一次官方价格页。
消费上限只能控制最大损失,不能自动减少 token。先优化请求,再根据成功任务的正常波动设置足够的限额。
常见 DeepSeek V4 Pro 价格误区
把 DeepSeek-V4-Pro-0813 当作 API 模型 ID
这是权重快照名。托管 API 仍使用 deepseek-v4-pro。
认为全天都是谷时
01:00-04:00 与 06:00-10:00 UTC 使用峰时价格,其余 17 小时才是半价谷时。
认为重复文字一定命中缓存
请求必须完整匹配已持久化的缓存前缀单元。应信任 prompt_cache_hit_tokens,而不是肉眼判断相似度。
把 1M 上下文或 384K 输出当成免费额度
两者都是容量限制,占用这些窗口的 token 仍然计费。
忽略不可见的推理输出
推理 token 包含在输出用量中。可见回答短,不代表输出成本一定低。
把厂商基准当作独立证据
0813 的提升属于 vendor-reported 结果,使用了明确披露的 Harness 与 max 配置。它是升级信号,不是通用生产排名。
常见问题
DeepSeek V4 Pro API 多少钱?
谷时每百万 token 的缓存命中输入、缓存未命中输入与输出分别为 $0.022、$0.66 和 $1.98;峰时分别为 $0.044、$1.32 和 $3.96。
DeepSeek V4 Pro 什么时候是谷时?
除 01:00-04:00 与 06:00-10:00 UTC 外,其余所有 UTC 时段都是谷时,价格比峰时低 50%。
DeepSeek V4 Pro 0813 的 API 模型 ID 是什么?
使用 deepseek-v4-pro。DeepSeek-V4-Pro-0813 是已发布的权重与快照名称,不是托管 API 请求 ID。
DeepSeek V4 Pro 支持 100 万 token 吗?
支持。官方列出 1M 上下文窗口和 384K 最大输出;它们是上限,不是免费额度。
DeepSeek V4 Pro 比 V4 Flash 便宜吗?
不是。Flash 在两个时段的标示费率都约为 Pro 的三分之一。Pro 必须通过更高的任务通过率证明溢价值得。
0813 是否提高了编程 Agent 能力?
DeepSeek 报告其相对 Pro Preview 在 Terminal Bench 2.1、DeepSWE 和 Toolathlon-Verified 上有明显提升。公开代码 Agent 测试使用 DeepSeek Harness minimal 模式和 max 推理强度。在自己的任务复现前,应将其视为 vendor-reported 结果。
核验来源
- DeepSeek V4 Pro GA 发布说明
- DeepSeek 模型与价格
- DeepSeek API 模型别名
- DeepSeek 思考模式
- DeepSeek 上下文缓存
- DeepSeek-V4-Pro-0813 模型卡与权重
- OmniAKey DeepSeek V4 Pro 模型页
- OmniAKey API 快速开始
事实核验于 2026 年 8 月 18 日。厂商价格、峰谷时段、模型别名、网关可用性与功能支持均可能变化;制定生产预算前,请再次检查上述第一方文档和实时目录。