DeepSeek V4 Flash 上线 · 我们的 GLM-5.2 价格本次下调至 5折
博客
成本控制

Grok 4.6 API 价格

xAI 对 200K token 以内的 prompt 列出每百万输入 $2、输出 $6;超过 200K 后,输入与输出费率翻倍。

12 分钟阅读OmniaKey
Grok 4.6API pricingxAIcoding cost

Grok 4.6 API 价格分为两个 prompt 长度档位。xAI 对不超过 200K token 的 prompt 列出每百万输入 token $2、每百万输出 token $6;当 prompt 超过 200K token 后,费率变为输入 $4、输出 $12。xAI 同时列出两个档位的缓存读取费率,分别为每百万 token $0.50$1.00

OmniAKey 当前目录把 Grok 4.6 按长上下文档展示,报价为每百万 $3.20 输入、$9.60 输出、$0.80 缓存读取。这是 OmniAKey 的平台报价,不是 xAI 新公布的直连价格。做预算时必须分开这两套计费关系。

价格与模型信息核验于 2026 年 8 月 22 日。 xAI 官方 API 页将 grok-4.6 标为最新旗舰,列出 500K 上下文窗口与按量计费。下文 OmniAKey 数字来自当前模型目录,按长上下文档的 80% 比例计算。生产采购前请再次查看两个实时页面。

Grok 4.6 API 价格一览

以下均为每百万 token 的美元价格。prompt 超过 200K 时使用长上下文档;这不是“前 200K 免费”的意思。

用量xAI 不超过 200KxAI 超过 200KOmniAKey 当前目录报价*
输入$2.00$4.00$3.20
缓存读取输入$0.50$1.00$0.80
输出$6.00$12.00$9.60

* OmniAKey 当前对该模型展示长上下文档报价。这是网关价格,可能独立于 xAI 直连价格变化。

通用计算公式:

text
费用 = 未缓存输入百万数 x 输入费率
     + 缓存读取输入百万数 x 缓存费率
     + 输出百万数 x 输出费率

Grok 4.6 模型页负责展示 OmniAKey 当前报价、模型 ID、上下文窗口、能力与请求示例。把数字写进生产预算前,先查看实时模型目录

这张表只覆盖模型 token 费用,不包含税费、汇率、单独的文件或工具费用、图片生成与语音/视频端点费用,也不包含企业合同条款。当前 xAI 模型元数据显示 Grok 4.6 没有 Batch 折扣,因此不要默认把任务改到 Batch 就会降低该模型的 token 单价。

超过 200K prompt 后发生什么

这个阈值看的是发送给模型的 prompt,不是 500K 最大上下文,也不是账户月度配额。仓库文件、工具 schema、对话历史和 Agent 注入的系统指令,都可能把请求推过阈值,即使最终回答很短。

实际要注意:

  • 500K 是容量上限,不是免费 token;
  • 每轮重复大型仓库前缀,可能每轮都进入长上下文档;
  • 输出单独计费,长推理、补丁重试和工具循环都会增加成本;
  • 缓存读取可以降低输入行项目,但不会让输出免费;
  • OmniAKey 有自己的目录价格,不应把 xAI 直连的档位切换直接套到网关余额上。

如果客户端能提供 token 统计,请记录请求前的 prompt 大小,并在请求后与供应商返回的 usage 对账。不要只按字符数或文件大小判断 token。

在边界处可以这样读费率:

Prompt 大小xAI 档位输入 / 缓存读取 / 输出
恰好 200,000 token标准档每百万 $2 / $0.50 / $6
200,001 至 500,000 token长上下文档每百万 $4 / $1 / $12
超过当前列出的 500K prompt 上限当前模型元数据不支持查看实时模型页

当前模型元数据把 500K 列为最大 prompt 长度;它不代表 500K prompt 还能再附带不受限制的输出。接近任一边界时,应以供应商返回的 token 字段和最终账单为准,不要用字符数估算替代。

三个可复算的成本算例

以下算例使用 xAI 官方费率,不包含税费、汇率、单独的媒体费用和未来价格变化。

算例一:普通编程请求

假设使用 100,000 个未缓存输入 token,并生成 20,000 个输出 token,prompt 没有超过 200K。

路由计算总计
xAI 标准档0.1 x $2 + 0.02 x $6$0.32
OmniAKey 目录报价0.1 x $3.20 + 0.02 x $9.60$0.512

OmniAKey 数字使用当前目录的长上下文报价,即使该算例低于 200K。把它当作固定合同前,应确认实时网关费率。

算例二:仓库级上下文

假设使用 300,000 个未缓存输入 token,并生成 40,000 个输出 token,prompt 已越过阈值。

路由计算总计
xAI 长上下文档0.3 x $4 + 0.04 x $12$1.68
OmniAKey 目录报价0.3 x $3.20 + 0.04 x $9.60$1.344

长上下文会显著抬高同一模型的成本。先清理重复工具输出、过期对话和无关文件,再考虑牺牲模型质量。

算例三:重复上下文命中缓存

假设 300,000 个 token 被报告为缓存读取,输出为 40,000 token。

路由计算总计
xAI 长上下文缓存读取0.3 x $1 + 0.04 x $12$0.78
OmniAKey 目录报价0.3 x $0.80 + 0.04 x $9.60$0.624

只有供应商明确报告为缓存读取时,这个算例才成立。文本看起来相似,或前缀发生变化,都可能变成缓存未命中。

缓存读取不是免费 prompt

xAI 的缓存费率只是对符合条件的重复输入提供较低单价,并不会把上下文窗口变成订阅额度。客户端与供应商共同决定前缀是否复用,实际账单记录才是依据。

编程 Agent 中,稳定的 system 指令、工具定义、仓库规则和固定项目说明适合作为缓存前缀。如果客户端允许控制请求顺序,把变化频繁的任务内容放在稳定前缀之后。

建议分开记录:

  1. 未缓存输入 token;
  2. 缓存读取 token;
  3. 输出 token,包括 API 报告的推理 token;
  4. 重试与失败的工具轮次;
  5. 最终通过验收的任务结果。

只节省输入、却因为过期指令增加重试的缓存策略,仍可能让完整任务更贵。

Grok 4.6 适合哪些工作

xAI 将 Grok 4.6 定位为用于编程、长时间运行 Agent、工具调用以及互动或视觉工作的最新旗舰。官方 API 页列出:

  • 模型 ID grok-4.6
  • 500K 上下文窗口;
  • 视觉理解与结构化工具调用;
  • OpenAI 兼容和 xAI 原生接入路径;
  • 按量计费、预付余额和企业账单选项。

这些是文档中的能力说明,不是本文独立复现的 benchmark。工具可靠性、延迟、拒答行为和通过任务成本,仍取决于客户端、权限、prompt、工具与实际工作负载。

更宽泛的模型选择请看编程 Agent 模型指南;本文只解决 Grok 4.6 API 如何做成本预算。

Grok 4.6 与 Grok 4.5 的成本比较

OmniAKey 目录同时列出了两个模型 ID,也都显示 500K 上下文。目前长上下文档的对比如下:

模型xAI 输入 / 缓存读取 / 输出OmniAKey 当前报价*
grok-4.6$4 / $1 / $12$3.20 / $0.80 / $9.60
grok-4.5$4 / $0.60 / $12$3.20 / $0.48 / $9.60
  • OmniAKey 一列按模型目录当前展示的 xAI 价格 80% 计算,且可能独立变化。只看 token 单价时,当前差异在缓存读取:只有供应商实际报告 cache read 时,Grok 4.5 才有更低的缓存输入价。不要因此断言它的通过任务成本更低,仍应比较准确模型 ID、行为、重试和实时目录报价。

对比时固定仓库版本、system prompt、工具权限、验收测试和最大输出,记录:

  • 请求和返回的模型 ID;
  • prompt、缓存和输出 token;
  • 延迟和重试次数;
  • 是否无需人工修复就通过测试;
  • 最终账单金额。

有用的指标是通过任务成本,而不是单独的每百万 token 价格:

text
通过任务成本 = 成功运行费用
             + 失败重试费用
             + 人工修复时间
             + 修复风险

通过 OpenAI 兼容接口调用 Grok 4.6

先在 API Keys 控制台创建独立密钥,确认实时目录仍有 grok-4.6,再调用 OpenAI 兼容端点:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "messages": [{"role": "user", "content": "检查这份部署计划中隐藏的失败模式。"}],
    "stream": true
  }'

请使用准确模型 ID。API 快速开始说明端点和鉴权方式。完成一项代表性任务后,查看用量控制台,把 token 字段与客户端估算进行核对。

编程 Agent 的预算控制

本地实验、CI 和共享自动化分别使用独立密钥,才能单独归因、限额和撤销。

推荐顺序:

  1. 用明确的验收测试运行一项代表性任务;
  2. 记录 prompt、缓存、输出、重试和总费用;
  3. 删除过期上下文与无边界工具输出;
  4. 把限额设在正常波动之上;
  5. 对重复失败或异常模型 ID 设置告警;
  6. 复盘通过任务成本后再提高限额。

透明计费指南介绍如何核对模型身份、token 数量和网关费用。消费上限只能减少暴露,不会自动减少 token 消耗。

常见 Grok 4.6 价格误区

把 500K 上下文当成免费额度

它只是最大请求容量,放入其中的 token 仍然计费。

给 300K prompt 使用 $2 输入费率

请求已经超过长上下文阈值,应使用 xAI 更高的费率档。

假设网关完全复制 xAI 的档位切换

OmniAKey 是独立的计费关系,必须查看自己的实时目录。

把所有重复前缀都算成缓存命中

只有供应商报告的缓存读取才享受低费率。

只比较 token 单价

重试、延迟、工具失败和人工修复可能主导完整任务成本。

把真实 API Key 放进仓库或 prompt

使用环境变量和独立密钥,真实值不要出现在 issue、benchmark 日志或文章示例中。

常见问题

Grok 4.6 API 多少钱?

xAI 对不超过 200K 的 prompt 列出每百万输入 $2、输出 $6;超过 200K 后为输入 $4、输出 $12。缓存读取费率分别为 $0.50 与 $1.00。

Grok 4.6 的 API 模型 ID 是什么?

使用 grok-4.6。固定准确 ID 更容易复现实验和预算。

Grok 4.6 有 500K 免费额度吗?

没有。500K 是上下文容量,输入、缓存读取和输出仍按量计费。

通过 OmniAKey 使用 Grok 4.6 多少钱?

当前目录按长上下文档列出每百万输入 $3.20、缓存读取 $0.80、输出 $9.60。平台价格会变,采购前请查看实时模型页。

Grok 4.6 一定比 Claude 或 GPT 便宜吗?

不一定。应比较具体模型、prompt 档位、缓存行为、重试和通过任务成本。更广泛的成本方法见供应商 API 价格对比

Grok 4.6 能用于编程 Agent 吗?

可以,只要客户端支持所需的 OpenAI 兼容或 xAI 原生协议,且实时目录开放 grok-4.6。生产运行前请核对客户端配置和模型 ID。

核验来源

事实核验于 2026 年 8 月 22 日。xAI 费率、缓存条款、上下文阈值、网关可用性和平台报价都可能变化;制定生产预算前,请再次检查第一方文档与 OmniAKey 实时目录。