Grok 4.7 리뷰
Grok 4.7은 장시간 코딩과 지식 작업 에이전트에서 먼저 평가할 만한 동일 가격 업그레이드지만, xAI의 출시 점수만으로 이전을 결정해서는 안 됩니다.
이 Grok 4.7 리뷰의 결론은 출시 홍보보다 좁습니다. 장시간 코딩, 도구 사용, 전문 지식 작업 에이전트라면 4.7을 먼저 평가하는 편이 합리적입니다. xAI가 공개한 Grok 4.6 직접 비교 7개 항목에서 모두 개선됐고 표준 API 가격과 500K 컨텍스트는 그대로입니다. 하지만 모든 작업에서 우월하다고 입증된 것은 아닙니다. 공식 표는 reasoning effort 조건이 섞여 있으며, 당사는 유료 요청을 이용한 직접 벤치마크는 실행하지 않았습니다.
SpaceXAI는 2026년 9월 21일 grok-4.7을 출시했습니다. xAI 공개 API에서는 사용할 수 있지만, 9월 22일 확인 당시 OmniaKey 공개 카탈로그에는 없었습니다. 카탈로그가 바뀌기 전에는 OmniaKey에서 Grok 4.6를 사용하거나 정확한 ID를 실제로 제공하는 provider를 선택하세요.
자료 확인일: 2026년 9월 22일. 아래 사양과 출시 점수는 SpaceXAI 발표 및 개발자 문서에 근거합니다. Artificial Analysis에는 초기 xhigh Intelligence Index가 있었지만 속도와 provider 가격 필드는 미완성이었습니다. private preview, xAI credential, 직접 지연 시간 측정은 사용하지 않았습니다. vendor 점수, 독립 결과, 이 글의 판단을 구분해 표시합니다.
Grok 4.7 리뷰 결론
새로운 장시간 에이전트 작업은 4.6보다 4.7을 먼저 테스트하세요. 가장 의미 있는 증거는 세대 변화입니다. xAI에 따르면 4.7은 직접 비교한 7개 항목 모두에서 4.6보다 높았고, Terminal-Bench 4.0과 EEBench의 상승 폭이 큰데도 표준 token 요율은 오르지 않았습니다.
출시 제목만 보고 이전하지 마세요. xAI 표는 Grok 4.7에 xhigh, Grok 4.6에 high, 다른 frontier model에 max를 사용합니다. 4.7 DeepSWE 점수는 별도로 high effort입니다. 설정은 token 사용량, 지연 시간, 동작을 바꿀 수 있습니다.
자체 작업이 통과할 때까지 4.6을 rollback으로 유지하세요. 두 세대 모두 500K 컨텍스트와 같은 직접 가격을 제공합니다. tool call, 거부, 장황함, 출력 schema 회귀를 운영 환경에서 발견하는 것보다 단계적 평가가 저렴합니다.
출시 정보와 주요 사양
| 항목 | Grok 4.7 계약 |
|---|---|
| 출시일 | 2026년 9월 21일 |
| API 모델 ID | grok-4.7 |
| 입력 / 출력 | 텍스트·이미지 / 텍스트 |
| 컨텍스트 윈도 | 500,000 tokens |
| 지식 기준일 | 2026년 5월 |
| Reasoning effort | low, medium, high(기본값), xhigh |
| API | Responses API, Chat Completions |
| 기능 | Function calling, structured outputs, web search, X search, code execution |
| Batch API | 지원하지 않음 |
| Prompt 200K 미만 global 직접 가격 | 1M당 input $2 / cached input $0.50 / output $6 |
| Prompt 200K 이상 global 직접 가격 | 1M당 input $4 / cached input $1 / output $12 |
500K는 용량이지 무료 할당량이 아닙니다. prompt가 200K tokens에 도달하면 높은 요율이 해당 request의 모든 token에 적용됩니다. start guide는 text output limit이 없다고 하지만 rate limit, 지연 시간, 예산, endpoint 동작은 실제 사용량을 제한합니다.
Grok 4.6에서 무엇이 달라졌나
SpaceXAI는 새롭고 더 큰 base model, 더 어려운 장시간 task를 포함한 긴 reinforcement-learning 과정, self-verification과 long-context 관리 개선, Grok Bot harness의 native 이해, 새로운 safeguard stack을 설명합니다.
이는 공식 출시 설명이며 독립적으로 감사된 architecture 결과가 아닙니다. 회사는 출시 글이나 현재 model contract에 parameter 수를 공개하지 않았습니다.
| 판단 기준 | Grok 4.7 | Grok 4.6 | 의미 |
|---|---|---|---|
| Base / training | 더 큰 새 base, 어려운 장시간 task에 긴 RL | 이전 세대 | 장시간 에이전트를 재시험할 근거 |
| 표준 직접 가격 | $2 / $0.50 / $6 | $2 / $0.50 / $6 | 업그레이드 정가 부담 없음 |
| Long-context 가격 | $4 / $1 / $12 | $4 / $1 / $12 | 200K 경계 비용 구조 동일 |
| Context | 500K | 500K | 용량 업그레이드는 아님 |
| Reasoning | low부터 xhigh, high 기본값 | low부터 xhigh, high 기본값 | 비교할 때 같은 effort로 고정 |
| Batch | 지원하지 않음 | 지원하지 않음 | Batch 할인을 가정하지 말 것 |
| 출시 초점 | 코딩, 에이전트, 지식 작업, self-check | 코딩과 장시간 에이전트 | 새 modality보다 신뢰성에 초점 |
실질적 업그레이드는 더 큰 컨텍스트나 저렴한 token이 아니라 같은 정가에서 주장되는 task 성능입니다. OmniaKey에 현재 등록된 route의 자세한 예산은 Grok 4.6 API 가격 가이드에서 확인하세요.
Grok 4.7 벤치마크 해석
다음은 SpaceXAI가 보고한 결과이며 OmniaKey가 재현한 결과가 아닙니다. publisher 설정은 4.7 xhigh, 4.6 high, GPT-5.6 Sol max, Fable 5.1 max입니다. 별표가 붙은 4.7 DeepSWE만 high effort입니다.
| 평가 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 | 4.7 대 4.6 |
|---|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% | +5.9 pp |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% | +5.8 pp |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% | +11.0 pp |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 | +111 Elo |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% | +17.7 pp |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% | +3.8 pp |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% | +8.2 pp |
이 표가 확실히 뒷받침하는 주장은 하나입니다. xAI 자체 평가 조건에서 4.7은 표시된 모든 task family에서 4.6보다 향상됐습니다. “Grok 4.7이 모든 모델을 이긴다”는 뜻은 아닙니다. 표시된 표에서 Fable은 CursorBench, AA Briefcase, Terminal-Bench, HealthBench를, GPT-5.6 Sol은 DeepSWE를 앞섭니다. 가격, effort, harness, token 사용량, 합격 기준도 다릅니다.
코딩에서는 수 시간의 terminal 작업을 다루는 Terminal-Bench 상승이 가장 흥미롭지만, Fable과의 차이도 가장 큽니다. 총점뿐 아니라 성공 기준과 실패 범주를 자체 작업으로 확인하세요.
독립적인 근거는 어디까지 나왔나
확인 당시 Artificial Analysis는 xhigh Grok 4.7에 Intelligence Index 46을 표시했습니다. 해당 페이지는 index 전체에서 240M output tokens를 사용해 페이지 median 92M보다 높다고도 보여줍니다.
하지만 초기 snapshot입니다. output speed는 N/A였고 provider 가격 필드도 안정적으로 채워지지 않았습니다. 따라서 xAI의 “같은 속도”, Fast variant, task당 비용을 검증하는 자료로 쓰지 않습니다. 평가가 완료되거나 suite가 바뀌면 점수도 달라질 수 있습니다.
- 공식 근거는 4.6에서 4.7로 일관된 개선을 보여 줍니다.
- 하나의 독립 suite는 xhigh를 frontier 범위에 놓았습니다.
- 안정적인 독립 속도, p95 latency, 동일 조건의 4.6 비용 비교는 없었습니다.
- 자체 workload가 최종 기준입니다.
Grok 4.7 API 가격과 long context
Grok 4.7은 Grok 4.6과 같은 global 직접 rate card를 유지합니다. 현재 model page의 경계는 200K 미만과 200K 이상입니다. 200K를 표준 구간으로 계산하면 안 됩니다.
| Route | Prompt 구간 | Input | Cached input | Output |
|---|---|---|---|---|
| xAI global | 200K 미만 | $2.00 | $0.50 | $6.00 |
| xAI global | 200K 이상 | $4.00 | $1.00 | $12.00 |
| xAI US regional | 200K 미만 | $2.20 | $0.55 | $6.60 |
| xAI US regional | 200K 이상 | $4.40 | $1.10 | $13.20 |
모든 가격은 1M tokens당 USD입니다. US endpoint는 추론을 미국에 두며 token 가격에 10% premium이 붙습니다. tool call, storage, 세금, 환율, third-party platform 견적은 별도입니다.
| Workload | 계산 | Model token cost |
|---|---|---|
| 100K uncached input + 20K output | 0.10 x $2 + 0.02 x $6 | $0.32 |
| 250K uncached input + 20K output | 0.25 x $4 + 0.02 x $12 | $1.24 |
| 50K uncached + 200K cached + 20K output | 0.05 x $4 + 0.20 x $1 + 0.02 x $12 | $0.64 |
cached 가격은 provider가 cache hit를 보고할 때만 적용됩니다. xAI는 Responses의 prompt_cache_key 또는 Chat Completions의 x-grok-conv-id로 관련 turn을 같은 server에 보내도록 권장합니다. 긴 tool loop에서 200K 이상 prompt를 반복하면 세 token 요율이 모두 두 배가 되므로 context compaction이 중요합니다.
Fast 버전은 문장보다 표를 확인해야 한다
Grok 4.7 Fast는 같은 model을 더 빠른 infrastructure에서 제공합니다. Cursor와 Grok Build에서만 쓸 수 있고 xAI public API나 Grok Build free tier에는 없습니다.
현재 pricing page는 Fast를 “표준 token 요율의 두 배”라고 설명하면서 표에는 200K 미만 $4 / $1 / $12, 200K 이상 $6 / $1.50 / $18을 적습니다. 두 번째 행은 public long-context 요율의 1.5배입니다. 문구로 계산하지 말고 표를 인용하며 대량 실행 전 live bill을 재확인하세요. Cursor는 자체 plan으로 청구합니다.
“output speed 두 배” 역시 provider 주장이지 latency 보장은 아닙니다. decode throughput에는 queue, prompt prefill, time to first token, tools, network, retry가 포함되지 않습니다.
에이전트 구현에서 중요한 API 동작
Responses API의 grok-4.7은 include에 요청하지 않아도 reasoning.encrypted_content를 반환합니다. multi-turn 에이전트는 reasoning item을 그대로 다음 turn에 전달해 reasoning state를 보존해야 합니다. Chat Completions 동작은 바뀌지 않았습니다.
이전 전에 다음을 검증하세요.
- 실제 반환 model ID와 endpoint
- 두 세대에 동일한
reasoning_effort - tool-call schema 유효성과 retry 동작
- prompt, cache read, reasoning, visible output tokens
- first token, end-to-end latency, accepted-task cost
- xhigh에서 늘어날 수 있는 output length
- harness를 바꾸지 않고
grok-4.6으로 rollback 가능 여부
xAI Responses 직접 호출 예시입니다.
curl https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"prompt_cache_key": "repo-review-v1",
"input": "Review this patch, run the acceptance criteria, and report any remaining failure."
}'
cache key에는 secret이 아닌 안정적인 값을 쓰고 API key, email, repository secret, customer ID를 넣지 마세요. 위 base URL과 credential은 xAI 직접 연결용이며 OmniaKey 설정이 아닙니다.
Grok 4.7 사용 가능 플랫폼
| Surface | 2026년 9월 22일 상태 | 중요한 경계 |
|---|---|---|
| xAI API | grok-4.7로 사용 가능 | 표준판이며 Fast는 public API가 아님 |
| Grok Build | 기본 모델 | Fast는 유료이며 free tier 제외 |
| Cursor | xAI 발표상 모든 plan에서 사용 가능 | Fast 과금은 Cursor plan을 따름 |
| GitHub Copilot | 단계적 rollout 발표 | Pro, Pro+, Max, Business, Enterprise. admin policy로 비활성화 가능 |
| OpenRouter, Vercel, Cloudflare | xAI가 gateway로 명시 | route, 가격, availability는 각 플랫폼 소관 |
| OmniaKey | 확인 당시 미등록 | 실시간 모델 카탈로그를 보고 route를 추측하지 말 것 |
GitHub는 VS Code, Visual Studio, Copilot CLI, cloud agent, Copilot app, JetBrains, Xcode, Eclipse를 포함한다고 밝혔습니다. “rollout 중”이 모든 account의 picker에 즉시 나타난다는 뜻은 아닙니다.
재현 가능한 Grok 4.6 대 4.7 테스트
쉬운 prompt 모음 대신 실제 failure distribution에서 20~50개 task를 고르세요. repository revision, system prompt, tools, permission, effort, timeout, acceptance command를 고정합니다.
- 수정 없이 합격, retry 후 합격, 실패
- tool schema error, 잘못된 편집, test failure, 거부, loop
- input, cached input, reasoning, output tokens
- first-token 및 end-to-end latency p50 / p95
- provider가 반환한 model ID와 총 청구액
- 사람의 review 또는 repair 시간
accepted-task cost가 개선되거나 의미 있는 failure가 줄면 4.7을 선택하세요. 결과가 같고 기존 route가 운영상 단순하면 4.6을 유지합니다. 다른 계열까지 비교하려면 코딩 에이전트 모델 가이드를 참고하세요.
흔한 Grok 4.7 리뷰 오류
Vendor 점수를 독립 리뷰라고 부르기
7개 항목 표는 유용하지만 SpaceXAI가 선택하고 실행했습니다. 출처와 effort 조건을 함께 표시해야 합니다.
2.1T parameter를 사실로 단정하기
출시 전 논의에는 있었지만 출시 글과 현재 developer contract에는 숫자가 없습니다. 확인된 표현은 “new, larger base model”입니다.
500K 컨텍스트를 무료로 보기
최대 prompt 용량입니다. 200K tokens에 도달하면 request 전체가 높은 직접 가격 tier로 넘어갑니다.
Fast를 public API model ID로 가정하기
Cursor와 Grok Build의 serving option입니다. xAI public API가 문서화한 ID는 grok-4.7입니다.
출시와 OmniaKey 등록을 같은 사건으로 보기
provider 출시와 gateway onboarding은 별개입니다. 확인일에는 공개 OmniaKey 4.7 route가 없었습니다.
자주 묻는 질문
Grok 4.7 출시일은 언제인가요?
2026년 9월 21일입니다. 직접 API 모델 ID는 grok-4.7입니다.
Grok 4.7이 Grok 4.6보다 좋은가요?
먼저 평가할 후보로는 더 강합니다. xAI는 같은 직접 token 가격에서 표시된 모든 4.6 비교보다 높은 결과를 보고했습니다. 그러나 effort, token 사용, tools, failure mode가 생산 가치를 바꾸므로 동일 조건의 자체 테스트가 필요합니다.
Grok 4.7 API 가격은 얼마인가요?
xAI global endpoint에서 200K 미만은 1M tokens당 input $2, cached input $0.50, output $6입니다. 200K 이상은 $4, $1, $12입니다.
Grok 4.7 컨텍스트 윈도는 얼마인가요?
500,000 tokens입니다. 현재 start guide는 text output limit이 없다고 하지만 rate, 시간, 예산 제한은 여전히 적용됩니다.
Grok 4.7 parameter 수는 얼마인가요?
SpaceXAI는 출시 글이나 developer model page에 공개하지 않았습니다. 4.6보다 새롭고 큰 base model이라고만 확인했습니다.
이미지와 tools를 지원하나요?
예. 텍스트와 이미지를 입력하고 텍스트를 출력합니다. Function calling, structured output, web search, X search, code execution을 문서화했습니다.
OmniaKey에서 Grok 4.7을 사용할 수 있나요?
9월 22일 확인 당시에는 아닙니다. 공개 카탈로그에 Grok 4.6과 4.5는 있었지만 grok-4.7은 없었습니다. 추측하지 말고 실시간 카탈로그를 확인하세요.
확인한 출처
- SpaceXAI: Grok 4.7 출시
- SpaceXAI: Grok 4.7 developer start guide
- SpaceXAI: Grok 4.7 model page
- SpaceXAI: API pricing
- SpaceXAI: release notes
- Artificial Analysis: Grok 4.7 xhigh
- GitHub: Grok 4.7 in Copilot
- OpenRouter: Grok 4.7 route
- OmniaKey 실시간 모델 카탈로그
2026년 9월 22일 fact-check 완료. 모델 availability, 동적 독립 점수, 가격, 플랫폼 rollout은 바뀔 수 있으므로 운영 이전 전 1차 출처와 실시간 카탈로그를 다시 확인하세요.