Jev モデルが統合され提供開始 · ぜひご利用ください
ブログ
ガイド

Grok 4.7 レビュー

Grok 4.7は長時間のコーディングと知識作業Agentで優先的に試す価値がある同価格の更新ですが、xAIの発表値だけで移行を決めるべきではありません。

読了目安 13分OmniaKey
Grok 4.7Grok 4.6API料金コーディングベンチマークモデルレビュー

この Grok 4.7レビューの結論は、発表時の見出しより限定的です。長時間のコーディング、tool use、専門知識を扱うAgentでは、まず4.7を評価するのが妥当です。xAIが公開したGrok 4.6との7項目の比較ではすべて改善し、標準API料金と500Kコンテキストは据え置かれました。ただし万能な勝者と証明されたわけではありません。公式表はreasoning effortが統一されておらず、当サイトは有料リクエストによる第一手のベンチマークは実施していません。

SpaceXAIは 2026年9月21日grok-4.7 を公開しました。xAIの公開APIでは利用できますが、9月22日の確認時点でOmniaKeyの公開カタログにはありません。カタログが更新されるまでは、OmniaKeyでは Grok 4.6 を使うか、正確なIDを明示するproviderから4.7を利用してください。

2026年9月22日に検証。 仕様と発表ベンチマークはSpaceXAIの発表および開発者向け資料に基づきます。Artificial Analysisには初期のxhigh Intelligence Indexがありましたが、速度とprovider価格は未完成でした。private previewやxAIのcredentialは使わず、直接のレイテンシ測定も行っていません。vendor値、独立結果、当サイトの判断を分けて記載します。

Grok 4.7レビューの結論

新しい長時間Agentには、4.6より先に4.7を試す。 最も意味のある材料は世代間の変化です。xAIによると、4.7は直接比較した7行すべてで4.6を上回り、特にTerminal-Bench 4.0とEEBenchの差が大きい一方、標準token単価は変わりません。

発表の見出しだけで移行しない。 表ではGrok 4.7が xhigh、Grok 4.6が high、他社モデルが max です。DeepSWEの4.7だけはhigh effortと注記されています。設定差はtoken数、遅延、挙動に影響します。

実タスクが通るまでは4.6をrollbackに残す。 両世代とも500Kコンテキストと同じ直販料金です。tool call、拒否、冗長性、出力schemaの回帰を本番で見つけるより、段階的に評価する方が安価です。

リリース日と主要仕様

項目Grok 4.7の契約
リリース日2026年9月21日
APIモデルIDgrok-4.7
入力 / 出力text・image / text
コンテキスト500,000 tokens
知識カットオフ2026年5月
Reasoning effortlowmediumhigh(default)、xhigh
APIResponses API、Chat Completions
機能Function calling、structured outputs、web search、X search、code execution
Batch API非対応
Promptが200K未満のglobal直販価格1Mあたりinput $2 / cached input $0.50 / output $6
Promptが200K以上のglobal直販価格1Mあたりinput $4 / cached input $1 / output $12

500Kは容量であり、無料枠ではありません。promptが200K tokensに達すると、そのrequestの全tokenに高い料金が適用されます。start guideはtext output limitを設けていませんが、rate limit、待ち時間、予算、endpointの制約は残ります。

Grok 4.6から何が変わったか

SpaceXAIは、新しくより大きなbase model、難しい長時間taskを増やした長期のreinforcement learning、self-verificationとlong-context管理の改善、Grok Bot harnessのnative理解、新しいsafeguard stackを説明しています。

これは公式の製品説明であり、独立監査されたarchitecture結果ではありません。発表記事と現行model contractにはparameter数が公開されていません。

判断軸Grok 4.7Grok 4.6実務上の意味
Base / trainingより大きな新base、難しい長時間taskで長いRL旧世代長時間Agentを再評価する理由になる
標準直販価格$2 / $0.50 / $6$2 / $0.50 / $6更新による定価上昇なし
Long-context価格$4 / $1 / $12$4 / $1 / $12200K境界の経済性は同じ
Context500K500K容量拡大ではない
Reasoninglow〜xhigh、highがdefaultlow〜xhigh、highがdefault比較時は同じeffortに固定
Batch非対応非対応Batch割引を前提にしない
発表の焦点coding、Agent、knowledge work、self-checkcoding、長時間Agent新modalityより信頼性を狙った更新

つまり、主要な更新は同じ定価でのtask performanceであり、context拡大や値下げではありません。OmniaKeyで現在掲載されているrouteの詳しい予算計算は Grok 4.6 API料金ガイド を参照してください。

Grok 4.7ベンチマークの読み方

次はSpaceXAIによる発表値で、OmniaKeyが再現した結果ではありません。publisherの設定は4.7が xhigh、4.6が high、GPT-5.6 SolとFable 5.1が max です。アスタリスクのDeepSWEのみ4.7がhigh effortです。

評価Grok 4.7Grok 4.6GPT-5.6 SolFable 5.14.7対4.6
CursorBench 4.046.3%40.4%41.7%51.8%+5.9 pp
DeepSWE v1.171.0%*65.2%72.7%70.0%+5.8 pp
EEBench64.0%53.0%39.4%56.4%+11.0 pp
AA Briefcase v1.11,6571,5461,4871,678+111 Elo
Terminal-Bench 4.038.0%20.3%37.3%57.9%+17.7 pp
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%+3.8 pp
HealthBench Professional56.7%48.5%60.5%62.1%+8.2 pp

この表から堅く言えるのは、xAI自身の評価条件では、表示された全task familyで4.7が4.6を改善したことです。「Grok 4.7が全modelに勝つ」とは言えません。FableはCursorBench、AA Briefcase、Terminal-Bench、HealthBenchで、GPT-5.6 SolはDeepSWEで上です。価格、effort、harness、token使用量、合格条件も異なります。

codingでは、数時間規模のterminal作業を扱うTerminal-Benchの伸びが特に注目点です。同時にFableとの差も最大です。aggregate scoreだけでなく、成功条件と失敗分類を実taskで確認してください。

独立した評価はあるか

確認時、Artificial Analysisは xhigh のGrok 4.7に Intelligence Index 46 を掲載していました。同ページはindex全体で240M output tokens、median 92Mも示しており、出力token使用量は多めです。

ただし初期snapshotです。output speedは N/A、provider価格欄も安定して入力されていませんでした。そのためxAIの「同じ速度」、Fast variant、task単位costの検証には使いません。評価の完了やsuite更新でscoreが変わる可能性もあります。

  • 公式証拠では4.6から4.7への一貫した改善がある
  • 独立suiteの一つではxhighがfrontier帯に入っている
  • 安定した独立speed、p95 latency、4.6との同条件cost比較はまだない
  • 最終判断は自社workloadで行う

Grok 4.7 API料金とlong context

Grok 4.7のglobal直販rate cardはGrok 4.6と同じです。現在のmodel pageの境界は 200K未満200K以上 です。200Kちょうどを標準料金として扱わないでください。

RoutePrompt範囲InputCached inputOutput
xAI global200K未満$2.00$0.50$6.00
xAI global200K以上$4.00$1.00$12.00
xAI US regional200K未満$2.20$0.55$6.60
xAI US regional200K以上$4.40$1.10$13.20

すべて1M tokensあたりのUSDです。US endpointは推論を米国内に置き、token価格が10%増します。tool call、storage、税、為替、third-party platformの見積もりは別です。

Workload計算Model token cost
100K uncached input + 20K output0.10 x $2 + 0.02 x $6$0.32
250K uncached input + 20K output0.25 x $4 + 0.02 x $12$1.24
50K uncached + 200K cached + 20K output0.05 x $4 + 0.20 x $1 + 0.02 x $12$0.64

cached料金はproviderがcache hitを報告した場合だけ適用されます。xAIはResponsesの prompt_cache_key、またはChat Completionsの x-grok-conv-id で関連turnを同じserverに送ることを勧めます。長いtool loopでは200K超のpromptを繰り返すと3種類のtoken単価がすべて倍になるため、context compactionが重要です。

Fast版は表を基準に読む

Grok 4.7 Fastは同じmodelを高速なinfrastructureで提供するものです。CursorとGrok Buildだけで利用でき、xAI public APIとGrok Build free tierにはありません。

現在のpricing pageはFastを「標準token料金の2倍」と説明しながら、表では200K未満を $4 / $1 / $12、200K以上を $6 / $1.50 / $18 としています。後者はpublic long-context行の1.5倍です。説明から推計せず表を引用し、大量利用前にlive billを再確認してください。Cursor側ではCursor planで請求されます。

「output speedが2倍」もprovider claimで、latency保証ではありません。decode throughputにはqueue、prompt prefill、time to first token、tool、network、retryが含まれません。

Agent実装で重要なAPI挙動

Responses APIの grok-4.7 は、include で要求しなくても reasoning.encrypted_content を返します。multi-turn Agentではreasoning itemを変更せず次のturnに戻し、reasoning stateを維持します。Chat Completionsの挙動は従来どおりです。

移行前に次を確認してください。

  1. 実際に返るmodel IDとendpoint
  2. 両世代で同じ reasoning_effort
  3. tool-call schemaの妥当性とretry挙動
  4. prompt、cache read、reasoning、visible outputのtoken数
  5. first token、end-to-end、accepted-task cost
  6. xhighで増える可能性があるoutput length
  7. harnessを変えず grok-4.6 にrollbackできること

直接xAI Responsesを呼ぶ例です。

bash
curl https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "prompt_cache_key": "repo-review-v1",
    "input": "Review this patch, run the acceptance criteria, and report any remaining failure."
  }'

cache keyにはsecretではない安定値を使い、API key、email、repository secret、customer IDを入れないでください。このbase URLとcredentialはxAI直結用で、OmniaKey設定ではありません。

Grok 4.7の提供状況

Surface2026年9月22日の状態注意点
xAI APIgrok-4.7 として利用可能標準版のみ。Fastはpublic APIではない
Grok Builddefault modelFastは有料でfree tier対象外
CursorxAIによると全planで利用可能Fastの請求はCursor planに従う
GitHub Copilot段階的rolloutを発表Pro、Pro+、Max、Business、Enterprise。admin policyで無効化可
OpenRouter、Vercel、CloudflarexAIがgatewayとして掲載route、価格、availabilityは各社管理
OmniaKey確認時点で未掲載live model catalogを確認し、routeを推測しない

GitHubはVS Code、Visual Studio、Copilot CLI、cloud agent、Copilot app、JetBrains、Xcode、Eclipseを対象に挙げています。「rollout中」は、全accountのpickerに即時表示される意味ではありません。

再現可能なGrok 4.6対4.7テスト

簡単なprompt集ではなく、実際のfailure distributionから20〜50 taskを選びます。repository revision、system prompt、tools、permission、effort、timeout、acceptance commandを固定してください。

  • repairなしで合格、retry後に合格、失敗
  • tool schema error、誤編集、test failure、拒否、loop
  • input、cached input、reasoning、output tokens
  • first-tokenとend-to-endのp50 / p95
  • providerが返すmodel IDと請求総額
  • 人手reviewまたはrepair時間

accepted-task costが下がる、または重要なfailureが減るなら4.7を選びます。同等でroute運用が4.6の方が簡単なら維持します。他familyも含む選択は coding Agent modelガイド を参照してください。

よくある評価ミス

Vendor scoreを独立レビューと呼ぶ

7行の表は有用ですが、選定と実行はSpaceXAIです。出典とeffort設定を表示してください。

2.1T parametersを確定値にする

release前の議論にはありますが、発表とdeveloper contractはparameter数を公開していません。確認できる表現は「new, larger base model」だけです。

500K contextを無料と考える

最大容量です。200K tokensに達するとrequest全体が高い直販tierに入ります。

Fastをpublic API model IDと考える

CursorとGrok Buildのserving optionです。xAI public APIのdocumented IDは grok-4.7 です。

ReleaseとOmniaKey提供開始を同一視する

providerの公開とgateway onboardingは別です。確認日にはOmniaKeyのpublic 4.7 routeはありませんでした。

よくある質問

Grok 4.7のリリース日はいつですか?

2026年9月21日です。直接APIのmodel IDは grok-4.7 です。

Grok 4.7はGrok 4.6より高性能ですか?

最初に試す候補としては強いです。xAIは同じ直販token価格で、掲載した全比較項目が4.6を上回ったと報告しています。ただしeffort、token数、tools、failure modeをそろえた実task評価が必要です。

Grok 4.7 APIの料金はいくらですか?

xAI global endpointでは200K未満が1M tokensあたりinput $2、cached input $0.50、output $6です。200K以上は$4、$1、$12です。

Grok 4.7のcontext windowは?

500,000 tokensです。start guideはtext output limitなしとも記載しますが、rate、時間、予算の上限は残ります。

Grok 4.7のparameter数は?

SpaceXAIは発表記事とdeveloper model pageで公開していません。4.6より新しく大きなbase modelという説明だけです。

画像とtoolsに対応しますか?

はい。textとimageを入力しtextを出力します。Function calling、structured output、web search、X search、code executionが記載されています。

OmniaKeyでGrok 4.7を使えますか?

9月22日の確認時点では使えません。公開catalogにはGrok 4.6と4.5がありましたが grok-4.7 はありません。推測せず live catalog を確認してください。

確認した情報源

2026年9月22日にfact-check済み。model availability、動的な独立score、価格、platform rolloutは変わるため、本番移行前に一次情報とlive catalogを再確認してください。