Grok 4.7 评测
Grok 4.7 是长时间编程与知识工作 Agent 值得优先测试的同价升级,但 xAI 的发布跑分不能替代同任务实测。
这篇 Grok 4.7 评测的结论比发布宣传更克制:如果你主要运行长时间编程、工具调用或专业知识工作 Agent,Grok 4.7 应该成为第一测试对象。它在 xAI 公布的七项 Grok 4.6 对照成绩中全部提升,标准 API 价格和 500K 上下文窗口却没有上涨。但这不等于它是所有任务的通用冠军:官方表格混用了不同推理档位,我们也没有运行付费的第一手 benchmark。
SpaceXAI 于 2026 年 9 月 21 日正式发布 grok-4.7。xAI 公共 API 已可调用,但截至 9 月 22 日,OmniaKey 还没有在公开目录中列出该模型。在实时目录更新前,请在 OmniaKey 使用 Grok 4.6,或选择明确提供该精确 ID 的平台。
资料核验于 2026 年 9 月 22 日。 下文规格与发布跑分来自 SpaceXAI 官方公告和开发文档。Artificial Analysis 已公布早期 xhigh Intelligence Index,但速度与供应商价格字段仍不完整。我们没有使用私有预览、xAI 凭据或第一手延迟测试;文中会分别标注官方成绩、独立结果与本站判断。
Grok 4.7 评测结论
新增长时间 Agent 工作,先测 4.7。 最有价值的证据不是跨厂商口号,而是代际变化:xAI 报告 4.7 在七项直接对照中全部高于 4.6,其中 Terminal-Bench 4.0 和 EEBench 提升明显,标准 token 费率保持不变。
不要只看发布标题就迁移。 xAI 的表格使用 Grok 4.7 xhigh、Grok 4.6 high,另外两款前沿模型则使用 max;DeepSWE 的 4.7 成绩又单独标成 high effort。推理档位会改变 token 消耗、延迟和行为。
自有任务通过前保留 4.6 回滚。 两代模型都有 500K 上下文和相同直连费率。分阶段评测的成本,远低于上线后才发现工具调用、拒答、冗长输出或格式回归。
Grok 4.7 发布信息一览
| 项目 | Grok 4.7 官方合同 |
|---|---|
| 发布时间 | 2026 年 9 月 21 日 |
| API 模型 ID | grok-4.7 |
| 输入 / 输出 | 文本和图像 / 文本 |
| 上下文窗口 | 500,000 token |
| 知识截止时间 | 2026 年 5 月 |
| 推理档位 | low、medium、high(默认)、xhigh |
| API | Responses API、Chat Completions |
| 能力 | Function calling、结构化输出、Web 搜索、X 搜索、代码执行 |
| Batch API | 不支持 |
| Prompt 低于 200K 的全球直连价 | 每百万输入 $2 / 缓存输入 $0.50 / 输出 $6 |
| Prompt 达到或超过 200K 的全球直连价 | 每百万输入 $4 / 缓存输入 $1 / 输出 $12 |
500K 是容量,不是免费额度。Prompt 一旦达到 200K token,xAI 说明该请求的全部 token都按高档费率计算。入门文档写着没有文本输出上限,但真实任务仍受账号限流、延迟、预算和端点行为约束。
Grok 4.7 对比 Grok 4.6:改了什么?
SpaceXAI 表示,Grok 4.7 使用新的、更大的基础模型,进行了更长时间的强化学习,并把训练任务更多放在需要数小时完成的难题上。官方还宣称它更善于自检、管理长上下文、原生理解 Grok Bot harness,并采用全新的安全防护栈。
这些是有参考价值的发布信息,不是经过独立审计的架构结论。官方发布页和当前模型合同都没有公开参数量。
| 决策项 | Grok 4.7 | Grok 4.6 | 实际含义 |
|---|---|---|---|
| 基础模型 / 训练 | 更大新底座;更长 RL;偏重长任务 | 上一代 | 长时间 Agent 值得重测 |
| 直连标准价 | $2 / $0.50 / $6 | $2 / $0.50 / $6 | 升级没有官方单价溢价 |
| 长上下文价 | $4 / $1 / $12 | $4 / $1 / $12 | 200K 阈值经济性相同 |
| 上下文 | 500K | 500K | 容量没有升级 |
| 推理 | low 至 xhigh;默认 high | low 至 xhigh;默认 high | 对比时必须固定同一档位 |
| Batch | 不支持 | 不支持 | 不要预设 Batch 折扣 |
| 发布重点 | 编程、Agent、知识工作、自检 | 编程与长时间 Agent | 重点是任务可靠性,不是新模态 |
因此,4.7 的核心升级是相同目录价下宣称的任务能力,而不是更大上下文或更低 token 价格。Grok 4.6 API 价格指南仍负责 OmniaKey 当前已上架路线的详细预算。
Grok 4.7 benchmark 怎么看
下面全部是 SpaceXAI 官方报告,并非 OmniaKey 复测。发布方标注的设置分别是 4.7 xhigh、4.6 high、GPT-5.6 Sol max、Fable 5.1 max;星号表示 4.7 的 DeepSWE 使用 high effort。
| 测试 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 | 4.7 相对 4.6 |
|---|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% | +5.9 个百分点 |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% | +5.8 个百分点 |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% | +11.0 个百分点 |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 | +111 Elo |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% | +17.7 个百分点 |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% | +3.8 个百分点 |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% | +8.2 个百分点 |
这张表能支持的稳妥结论是:在 xAI 自己的测试设置下,4.7 在所有展示的任务类型上都比 4.6 更高。 它不能证明“Grok 4.7 击败所有模型”。表中 Fable 领先 CursorBench、AA Briefcase、Terminal-Bench 和 HealthBench,GPT-5.6 Sol 领先 DeepSWE;价格、推理档位、harness、token 使用和验收标准也不相同。
对编程用户而言,Terminal-Bench 的代际增幅最值得关注,因为它考察数小时的终端工作;但 Fable 在这一项的领先也最大。实际评测需要同时记录成功标准和失败分类,不能只抄总分。
有哪些独立评测证据?
核验时,Artificial Analysis 已经上线 Grok 4.7 xhigh 页面,显示 Intelligence Index 46,并把它描述为同价位中领先且价格有竞争力的模型。页面还显示其评测总输出达到 240M token,而该页中位数为 92M,说明输出量偏高。
这只是早期快照。输出速度仍为 N/A,供应商价格字段也没有可靠填充。因此,我们不会用它验证 xAI 的“同速度”说法、Fast 版本速度或每任务成本;随着评测完成或版本更新,分数也可能变化。
合理解读是:
- 官方证据显示 4.6 到 4.7 的提升方向一致;
- 一个独立套件已把 xhigh 放在前沿区间;
- 截止核验时,还没有稳定的独立速度、p95 延迟或同条件 4.6 成本对照;
- 最终仍应由你的真实任务决定。
Grok 4.7 API 价格与长上下文
Grok 4.7 与 4.6 使用同一套全球直连价格。要注意当前文档的阈值表述:它写的是低于 200K与达到或超过 200K,而不是某些旧文章所写的“200K 仍在标准档”。
| 路线 | Prompt 范围 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|---|
| xAI 全球端点 | 低于 200K | $2.00 | $0.50 | $6.00 |
| xAI 全球端点 | 达到或超过 200K | $4.00 | $1.00 | $12.00 |
| xAI 美国区域端点 | 低于 200K | $2.20 | $0.55 | $6.60 |
| xAI 美国区域端点 | 达到或超过 200K | $4.40 | $1.10 | $13.20 |
以上均为每百万 token 的美元价格。美国区域端点承诺推理留在美国,token 费率加收 10%。工具调用、存储、税费、汇率和第三方平台报价需要另算。
三个全球端点算例可以看出阈值影响:
| 工作量 | 算式 | 模型 token 成本 |
|---|---|---|
| 100K 未缓存输入 + 20K 输出 | 0.10 x $2 + 0.02 x $6 | $0.32 |
| 250K 未缓存输入 + 20K 输出 | 0.25 x $4 + 0.02 x $12 | $1.24 |
| 50K 未缓存 + 200K 缓存 + 20K 输出 | 0.05 x $4 + 0.20 x $1 + 0.02 x $12 | $0.64 |
只有供应商报告命中缓存时,才能使用缓存费率。xAI 建议 Responses 请求设置 prompt_cache_key,Chat Completions 使用 x-grok-conv-id,让同一会话更可能落到同一服务器。长工具循环还应做上下文压缩,因为反复发送 200K 以上 prompt 会让三类 token 费率全部翻倍。
Grok 4.7 Fast 需要谨慎读价表
Grok 4.7 Fast 是同一模型的更快基础设施版本,只在 Cursor 和 Grok Build 提供,不属于公共 xAI API,也不包含在 Grok Build 免费档。
当前价格页一边称 Fast 是“标准 token 费率的两倍”,一边列出低于 200K 为 $4 / $1 / $12、高于 200K 为 $6 / $1.50 / $18。第二行其实是公共长上下文档的 1.5 倍,而不是 2 倍。做预算时应直接引用表格并复核账单,不要根据宣传语推算。Cursor 的 Fast 费用按 Cursor 套餐结算。
“输出速度两倍”也是供应商宣称,不是端到端延迟 SLA。解码速度不包含排队、prompt 预填充、首 token、工具、网络和重试。
Agent 接入时真正重要的 API 细节
grok-4.7 的 Responses API 总会返回 reasoning.encrypted_content,即使 include 没有请求它。多轮 Agent 应把这些 reasoning item 原样传回下一轮,才能保留推理状态;Chat Completions 行为不变。
迁移前至少检查:
- 实际返回的模型 ID 和端点;
- 两代模型使用相同
reasoning_effort; - 工具 schema 合法性与重试行为;
- 输入、缓存输入、推理和可见输出 token;
- 首 token、端到端 p50/p95 延迟和通过验收的任务成本;
- 输出长度,因为 xhigh 可能在同费率下消耗更多 token;
- 不修改其它 harness 配置即可回滚
grok-4.6。
直连 xAI Responses 的最小请求如下:
curl https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"prompt_cache_key": "repo-review-v1",
"input": "Review this patch, run the acceptance criteria, and report any remaining failure."
}'
缓存键应使用不敏感且稳定的标识,不能放 API Key、邮箱、仓库 Secret 或客户 ID。上面的 xAI 直连地址和凭据不是 OmniaKey 配置。
Grok 4.7 在哪里可以使用?
| 平台 | 2026 年 9 月 22 日状态 | 重要边界 |
|---|---|---|
| xAI API | grok-4.7 已可用 | 公共 API 只有标准版,没有 Fast |
| Grok Build | 默认模型 | Fast 收费且不在免费档 |
| Cursor | xAI 称所有套餐可用 | Fast 按 Cursor 套餐计费 |
| GitHub Copilot | 已宣布逐步上线 | Pro、Pro+、Max、Business、Enterprise;管理员策略可关闭 |
| OpenRouter、Vercel、Cloudflare | xAI 列为网关 | 各自维护路线、价格与可用性 |
| OmniaKey | 核验时未上架 | 查看实时模型目录,不要猜测模型 ID |
GitHub 公告覆盖 VS Code、Visual Studio、Copilot CLI、Cloud Agent、Copilot App、JetBrains、Xcode 和 Eclipse。“逐步上线”并不代表所有账号立即都能看到。
可复现的 Grok 4.6 到 4.7 升级测试
从真实失败分布中挑选 20 到 50 个任务,而不是只选简单 prompt。固定仓库版本、系统提示词、工具、权限、推理档位、超时和验收命令。
至少记录:
- 无修复通过、重试后通过和失败;
- 工具 schema 错误、错误修改、测试失败、拒答与循环;
- 输入、缓存输入、推理和输出 token;
- 首 token 与端到端 p50/p95 延迟;
- 供应商返回的模型 ID 与总账单;
- 人工审核或修复分钟数。
当 4.7 降低通过验收的任务成本,或减少真正重要的失败类型时再切换。如果结果相同,而现有 4.6 路线更稳定,继续使用 4.6 也合理。跨模型家族选型请查看编程 Agent 模型指南,不要从一张发布表格外推。
常见 Grok 4.7 评测误区
把官方跑分写成独立评测
七项发布表格很有价值,但由 SpaceXAI 选择和运行。必须标注来源,并保留推理档位。
把 2.1T 参数写成已确认事实
发布前确实出现过参数量讨论,但正式发布页和当前开发文档没有公布数字。唯一确认的表述是“新的、更大的基础模型”。
把 500K 上下文当成免费额度
它是最大容量。Prompt 达到 200K 时,整个请求进入高费率档。
把 Fast 当成公共 API 模型 ID
Fast 是 Cursor 与 Grok Build 的服务选项。公共 xAI API 公开的是 grok-4.7,没有文档化的 Fast slug。
把供应商发布等同于 OmniaKey 已上架
供应商发布与网关接入是两个事件。核验日没有公开的 OmniaKey 4.7 路线。
常见问题
Grok 4.7 什么时候发布?
SpaceXAI 于 2026 年 9 月 21 日发布 Grok 4.7,直连 API 模型 ID 为 grok-4.7。
Grok 4.7 比 Grok 4.6 强吗?
它更值得优先测试。xAI 报告的所有 4.6 对照项都由 4.7 领先,直连 token 价格相同;但真实价值仍取决于相同推理档位、token 消耗、工具和失败类型下的任务验收。
Grok 4.7 API 多少钱?
xAI 全球端点中,低于 200K prompt 时每百万输入 $2、缓存输入 $0.50、输出 $6;达到或超过 200K 时分别为 $4、$1 和 $12。
Grok 4.7 上下文窗口多大?
文档列出 500,000 token。入门页还写明没有文本输出上限,但账号限流、时间和预算依然存在。
Grok 4.7 有多少参数?
SpaceXAI 没有在正式发布页或开发模型页公开参数量,只确认 4.7 的基础模型比 4.6 更新、更大。
Grok 4.7 支持图片和工具吗?
支持。它接收文本与图像,输出文本,并支持 function calling、结构化输出、Web 搜索、X 搜索和代码执行。
OmniaKey 支持 Grok 4.7 吗?
截至 9 月 22 日核验时不支持。公开目录列出 Grok 4.6 与 4.5,但没有 grok-4.7。请以实时目录为准,不要根据本文猜测可用性。
核验来源
- SpaceXAI:Introducing Grok 4.7
- SpaceXAI:Grok 4.7 开发入门
- SpaceXAI:Grok 4.7 模型页
- SpaceXAI:API 价格
- SpaceXAI:Release notes
- Artificial Analysis:Grok 4.7 xhigh
- GitHub:Grok 4.7 上线 Copilot
- OpenRouter:Grok 4.7 路线
- OmniaKey 实时模型目录
事实核验于 2026 年 9 月 22 日。模型可用性、动态独立分数、价格与平台上线范围都可能变化,生产迁移前请重新检查一手来源和实时目录。