Jev 模型已集成上线 · 欢迎使用
博客
指南

Grok 4.7 评测

Grok 4.7 是长时间编程与知识工作 Agent 值得优先测试的同价升级,但 xAI 的发布跑分不能替代同任务实测。

13 分钟阅读OmniaKey
Grok 4.7Grok 4.6API 价格编程 benchmark模型评测

这篇 Grok 4.7 评测的结论比发布宣传更克制:如果你主要运行长时间编程、工具调用或专业知识工作 Agent,Grok 4.7 应该成为第一测试对象。它在 xAI 公布的七项 Grok 4.6 对照成绩中全部提升,标准 API 价格和 500K 上下文窗口却没有上涨。但这不等于它是所有任务的通用冠军:官方表格混用了不同推理档位,我们也没有运行付费的第一手 benchmark。

SpaceXAI 于 2026 年 9 月 21 日正式发布 grok-4.7。xAI 公共 API 已可调用,但截至 9 月 22 日,OmniaKey 还没有在公开目录中列出该模型。在实时目录更新前,请在 OmniaKey 使用 Grok 4.6,或选择明确提供该精确 ID 的平台。

资料核验于 2026 年 9 月 22 日。 下文规格与发布跑分来自 SpaceXAI 官方公告和开发文档。Artificial Analysis 已公布早期 xhigh Intelligence Index,但速度与供应商价格字段仍不完整。我们没有使用私有预览、xAI 凭据或第一手延迟测试;文中会分别标注官方成绩、独立结果与本站判断。

Grok 4.7 评测结论

新增长时间 Agent 工作,先测 4.7。 最有价值的证据不是跨厂商口号,而是代际变化:xAI 报告 4.7 在七项直接对照中全部高于 4.6,其中 Terminal-Bench 4.0 和 EEBench 提升明显,标准 token 费率保持不变。

不要只看发布标题就迁移。 xAI 的表格使用 Grok 4.7 xhigh、Grok 4.6 high,另外两款前沿模型则使用 max;DeepSWE 的 4.7 成绩又单独标成 high effort。推理档位会改变 token 消耗、延迟和行为。

自有任务通过前保留 4.6 回滚。 两代模型都有 500K 上下文和相同直连费率。分阶段评测的成本,远低于上线后才发现工具调用、拒答、冗长输出或格式回归。

Grok 4.7 发布信息一览

项目Grok 4.7 官方合同
发布时间2026 年 9 月 21 日
API 模型 IDgrok-4.7
输入 / 输出文本和图像 / 文本
上下文窗口500,000 token
知识截止时间2026 年 5 月
推理档位lowmediumhigh(默认)、xhigh
APIResponses API、Chat Completions
能力Function calling、结构化输出、Web 搜索、X 搜索、代码执行
Batch API不支持
Prompt 低于 200K 的全球直连价每百万输入 $2 / 缓存输入 $0.50 / 输出 $6
Prompt 达到或超过 200K 的全球直连价每百万输入 $4 / 缓存输入 $1 / 输出 $12

500K 是容量,不是免费额度。Prompt 一旦达到 200K token,xAI 说明该请求的全部 token都按高档费率计算。入门文档写着没有文本输出上限,但真实任务仍受账号限流、延迟、预算和端点行为约束。

Grok 4.7 对比 Grok 4.6:改了什么?

SpaceXAI 表示,Grok 4.7 使用新的、更大的基础模型,进行了更长时间的强化学习,并把训练任务更多放在需要数小时完成的难题上。官方还宣称它更善于自检、管理长上下文、原生理解 Grok Bot harness,并采用全新的安全防护栈。

这些是有参考价值的发布信息,不是经过独立审计的架构结论。官方发布页和当前模型合同都没有公开参数量。

决策项Grok 4.7Grok 4.6实际含义
基础模型 / 训练更大新底座;更长 RL;偏重长任务上一代长时间 Agent 值得重测
直连标准价$2 / $0.50 / $6$2 / $0.50 / $6升级没有官方单价溢价
长上下文价$4 / $1 / $12$4 / $1 / $12200K 阈值经济性相同
上下文500K500K容量没有升级
推理low 至 xhigh;默认 highlow 至 xhigh;默认 high对比时必须固定同一档位
Batch不支持不支持不要预设 Batch 折扣
发布重点编程、Agent、知识工作、自检编程与长时间 Agent重点是任务可靠性,不是新模态

因此,4.7 的核心升级是相同目录价下宣称的任务能力,而不是更大上下文或更低 token 价格。Grok 4.6 API 价格指南仍负责 OmniaKey 当前已上架路线的详细预算。

Grok 4.7 benchmark 怎么看

下面全部是 SpaceXAI 官方报告,并非 OmniaKey 复测。发布方标注的设置分别是 4.7 xhigh、4.6 high、GPT-5.6 Sol max、Fable 5.1 max;星号表示 4.7 的 DeepSWE 使用 high effort。

测试Grok 4.7Grok 4.6GPT-5.6 SolFable 5.14.7 相对 4.6
CursorBench 4.046.3%40.4%41.7%51.8%+5.9 个百分点
DeepSWE v1.171.0%*65.2%72.7%70.0%+5.8 个百分点
EEBench64.0%53.0%39.4%56.4%+11.0 个百分点
AA Briefcase v1.11,6571,5461,4871,678+111 Elo
Terminal-Bench 4.038.0%20.3%37.3%57.9%+17.7 个百分点
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%+3.8 个百分点
HealthBench Professional56.7%48.5%60.5%62.1%+8.2 个百分点

这张表能支持的稳妥结论是:在 xAI 自己的测试设置下,4.7 在所有展示的任务类型上都比 4.6 更高。 它不能证明“Grok 4.7 击败所有模型”。表中 Fable 领先 CursorBench、AA Briefcase、Terminal-Bench 和 HealthBench,GPT-5.6 Sol 领先 DeepSWE;价格、推理档位、harness、token 使用和验收标准也不相同。

对编程用户而言,Terminal-Bench 的代际增幅最值得关注,因为它考察数小时的终端工作;但 Fable 在这一项的领先也最大。实际评测需要同时记录成功标准和失败分类,不能只抄总分。

有哪些独立评测证据?

核验时,Artificial Analysis 已经上线 Grok 4.7 xhigh 页面,显示 Intelligence Index 46,并把它描述为同价位中领先且价格有竞争力的模型。页面还显示其评测总输出达到 240M token,而该页中位数为 92M,说明输出量偏高。

这只是早期快照。输出速度仍为 N/A,供应商价格字段也没有可靠填充。因此,我们不会用它验证 xAI 的“同速度”说法、Fast 版本速度或每任务成本;随着评测完成或版本更新,分数也可能变化。

合理解读是:

  • 官方证据显示 4.6 到 4.7 的提升方向一致;
  • 一个独立套件已把 xhigh 放在前沿区间;
  • 截止核验时,还没有稳定的独立速度、p95 延迟或同条件 4.6 成本对照;
  • 最终仍应由你的真实任务决定。

Grok 4.7 API 价格与长上下文

Grok 4.7 与 4.6 使用同一套全球直连价格。要注意当前文档的阈值表述:它写的是低于 200K达到或超过 200K,而不是某些旧文章所写的“200K 仍在标准档”。

路线Prompt 范围输入缓存输入输出
xAI 全球端点低于 200K$2.00$0.50$6.00
xAI 全球端点达到或超过 200K$4.00$1.00$12.00
xAI 美国区域端点低于 200K$2.20$0.55$6.60
xAI 美国区域端点达到或超过 200K$4.40$1.10$13.20

以上均为每百万 token 的美元价格。美国区域端点承诺推理留在美国,token 费率加收 10%。工具调用、存储、税费、汇率和第三方平台报价需要另算。

三个全球端点算例可以看出阈值影响:

工作量算式模型 token 成本
100K 未缓存输入 + 20K 输出0.10 x $2 + 0.02 x $6$0.32
250K 未缓存输入 + 20K 输出0.25 x $4 + 0.02 x $12$1.24
50K 未缓存 + 200K 缓存 + 20K 输出0.05 x $4 + 0.20 x $1 + 0.02 x $12$0.64

只有供应商报告命中缓存时,才能使用缓存费率。xAI 建议 Responses 请求设置 prompt_cache_key,Chat Completions 使用 x-grok-conv-id,让同一会话更可能落到同一服务器。长工具循环还应做上下文压缩,因为反复发送 200K 以上 prompt 会让三类 token 费率全部翻倍。

Grok 4.7 Fast 需要谨慎读价表

Grok 4.7 Fast 是同一模型的更快基础设施版本,只在 Cursor 和 Grok Build 提供,不属于公共 xAI API,也不包含在 Grok Build 免费档。

当前价格页一边称 Fast 是“标准 token 费率的两倍”,一边列出低于 200K 为 $4 / $1 / $12、高于 200K 为 $6 / $1.50 / $18。第二行其实是公共长上下文档的 1.5 倍,而不是 2 倍。做预算时应直接引用表格并复核账单,不要根据宣传语推算。Cursor 的 Fast 费用按 Cursor 套餐结算。

“输出速度两倍”也是供应商宣称,不是端到端延迟 SLA。解码速度不包含排队、prompt 预填充、首 token、工具、网络和重试。

Agent 接入时真正重要的 API 细节

grok-4.7 的 Responses API 总会返回 reasoning.encrypted_content,即使 include 没有请求它。多轮 Agent 应把这些 reasoning item 原样传回下一轮,才能保留推理状态;Chat Completions 行为不变。

迁移前至少检查:

  1. 实际返回的模型 ID 和端点;
  2. 两代模型使用相同 reasoning_effort
  3. 工具 schema 合法性与重试行为;
  4. 输入、缓存输入、推理和可见输出 token;
  5. 首 token、端到端 p50/p95 延迟和通过验收的任务成本;
  6. 输出长度,因为 xhigh 可能在同费率下消耗更多 token;
  7. 不修改其它 harness 配置即可回滚 grok-4.6

直连 xAI Responses 的最小请求如下:

bash
curl https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "prompt_cache_key": "repo-review-v1",
    "input": "Review this patch, run the acceptance criteria, and report any remaining failure."
  }'

缓存键应使用不敏感且稳定的标识,不能放 API Key、邮箱、仓库 Secret 或客户 ID。上面的 xAI 直连地址和凭据不是 OmniaKey 配置。

Grok 4.7 在哪里可以使用?

平台2026 年 9 月 22 日状态重要边界
xAI APIgrok-4.7 已可用公共 API 只有标准版,没有 Fast
Grok Build默认模型Fast 收费且不在免费档
CursorxAI 称所有套餐可用Fast 按 Cursor 套餐计费
GitHub Copilot已宣布逐步上线Pro、Pro+、Max、Business、Enterprise;管理员策略可关闭
OpenRouter、Vercel、CloudflarexAI 列为网关各自维护路线、价格与可用性
OmniaKey核验时未上架查看实时模型目录,不要猜测模型 ID

GitHub 公告覆盖 VS Code、Visual Studio、Copilot CLI、Cloud Agent、Copilot App、JetBrains、Xcode 和 Eclipse。“逐步上线”并不代表所有账号立即都能看到。

可复现的 Grok 4.6 到 4.7 升级测试

从真实失败分布中挑选 20 到 50 个任务,而不是只选简单 prompt。固定仓库版本、系统提示词、工具、权限、推理档位、超时和验收命令。

至少记录:

  • 无修复通过、重试后通过和失败;
  • 工具 schema 错误、错误修改、测试失败、拒答与循环;
  • 输入、缓存输入、推理和输出 token;
  • 首 token 与端到端 p50/p95 延迟;
  • 供应商返回的模型 ID 与总账单;
  • 人工审核或修复分钟数。

当 4.7 降低通过验收的任务成本,或减少真正重要的失败类型时再切换。如果结果相同,而现有 4.6 路线更稳定,继续使用 4.6 也合理。跨模型家族选型请查看编程 Agent 模型指南,不要从一张发布表格外推。

常见 Grok 4.7 评测误区

把官方跑分写成独立评测

七项发布表格很有价值,但由 SpaceXAI 选择和运行。必须标注来源,并保留推理档位。

把 2.1T 参数写成已确认事实

发布前确实出现过参数量讨论,但正式发布页和当前开发文档没有公布数字。唯一确认的表述是“新的、更大的基础模型”。

把 500K 上下文当成免费额度

它是最大容量。Prompt 达到 200K 时,整个请求进入高费率档。

把 Fast 当成公共 API 模型 ID

Fast 是 Cursor 与 Grok Build 的服务选项。公共 xAI API 公开的是 grok-4.7,没有文档化的 Fast slug。

把供应商发布等同于 OmniaKey 已上架

供应商发布与网关接入是两个事件。核验日没有公开的 OmniaKey 4.7 路线。

常见问题

Grok 4.7 什么时候发布?

SpaceXAI 于 2026 年 9 月 21 日发布 Grok 4.7,直连 API 模型 ID 为 grok-4.7

Grok 4.7 比 Grok 4.6 强吗?

它更值得优先测试。xAI 报告的所有 4.6 对照项都由 4.7 领先,直连 token 价格相同;但真实价值仍取决于相同推理档位、token 消耗、工具和失败类型下的任务验收。

Grok 4.7 API 多少钱?

xAI 全球端点中,低于 200K prompt 时每百万输入 $2、缓存输入 $0.50、输出 $6;达到或超过 200K 时分别为 $4、$1 和 $12。

Grok 4.7 上下文窗口多大?

文档列出 500,000 token。入门页还写明没有文本输出上限,但账号限流、时间和预算依然存在。

Grok 4.7 有多少参数?

SpaceXAI 没有在正式发布页或开发模型页公开参数量,只确认 4.7 的基础模型比 4.6 更新、更大。

Grok 4.7 支持图片和工具吗?

支持。它接收文本与图像,输出文本,并支持 function calling、结构化输出、Web 搜索、X 搜索和代码执行。

OmniaKey 支持 Grok 4.7 吗?

截至 9 月 22 日核验时不支持。公开目录列出 Grok 4.6 与 4.5,但没有 grok-4.7。请以实时目录为准,不要根据本文猜测可用性。

核验来源

事实核验于 2026 年 9 月 22 日。模型可用性、动态独立分数、价格与平台上线范围都可能变化,生产迁移前请重新检查一手来源和实时目录。