Grok 4.7 Test
Grok 4.7 ist für lang laufende Coding- und Wissens-Agenten ein sinnvoller erster Test zum gleichen Listenpreis, doch die xAI-Launchwerte ersetzen keinen Vergleich mit eigenen Aufgaben.
Dieser Grok 4.7 Test kommt zu einem engeren Ergebnis als die Schlagzeilen zum Release. Für lang laufendes Coding, Tool-Nutzung und professionelle Wissensarbeit sollte 4.7 zuerst geprüft werden: In allen sieben von xAI veröffentlichten Vergleichen mit Grok 4.6 steigt der Wert, während Standardpreis und 500K-Kontext gleich bleiben. Ein universeller Sieger ist damit nicht bewiesen. Die offizielle Tabelle mischt Reasoning-Stufen, und wir haben keinen eigenen kostenpflichtigen Benchmark ausgeführt.
SpaceXAI veröffentlichte grok-4.7 am 21. September 2026. Die öffentliche xAI API ist verfügbar, im öffentlichen OmniaKey-Katalog fehlte das Modell bei der Prüfung am 22. September jedoch. Bis sich der Live-Katalog ändert, nutze bei OmniaKey Grok 4.6 oder einen Anbieter, der die exakte 4.7-ID tatsächlich ausweist.
Stand: 22. September 2026. Spezifikationen und Launch-Benchmarks stammen aus Ankündigung und Entwicklerdokumentation von SpaceXAI. Artificial Analysis hatte einen frühen xhigh Intelligence Index veröffentlicht, aber Geschwindigkeit und Providerpreise waren unvollständig. Wir nutzten weder private Preview noch xAI-Zugangsdaten und führten keinen eigenen Latenztest durch. Herstellerwerte, unabhängige Ergebnisse und unsere Empfehlung sind getrennt gekennzeichnet.
Urteil im Grok 4.7 Test
Für neue, lang laufende Agent-Aufgaben zuerst 4.7 testen. Der aussagekräftigste Punkt ist der Generationsvergleich: xAI meldet in allen sieben direkten Zeilen höhere Werte für 4.7, darunter deutliche Zuwächse bei Terminal-Bench 4.0 und EEBench, ohne höhere Standard-Tokenpreise.
Nicht allein wegen der Überschrift migrieren. xAI vergleicht Grok 4.7 mit xhigh, Grok 4.6 mit high und die anderen Frontier-Modelle mit max; DeepSWE für 4.7 ist gesondert als high effort markiert. Diese Einstellungen verändern Tokenverbrauch, Latenz und Verhalten.
4.6 als Rollback behalten, bis eigene Aufgaben bestehen. Beide Generationen bieten 500K Kontext und dieselben Direktpreise. Eine gestufte Evaluation ist günstiger als Tool-, Refusal-, Längen- oder Formatregressionen erst in Produktion zu finden.
Release und technische Daten
| Merkmal | Vertrag von Grok 4.7 |
|---|---|
| Release-Datum | 21. September 2026 |
| API-Modell-ID | grok-4.7 |
| Eingabe / Ausgabe | Text und Bild / Text |
| Kontextfenster | 500,000 tokens |
| Wissensstand | Mai 2026 |
| Reasoning effort | low, medium, high (Standard), xhigh |
| APIs | Responses API und Chat Completions |
| Funktionen | Function calling, structured outputs, web search, X search, code execution |
| Batch API | Nicht unterstützt |
| Globaler Direktpreis unter 200K Prompt-Tokens | $2 Input / $0.50 Cache / $6 Output je 1M |
| Globaler Direktpreis ab 200K Prompt-Tokens | $4 Input / $1 Cache / $12 Output je 1M |
500K ist Kapazität, kein kostenloses Kontingent. Sobald der Prompt 200K tokens erreicht, gilt laut xAI der höhere Preis für alle Tokens der Anfrage. Der Start Guide nennt kein Text-Output-Limit; Rate Limits, Laufzeit, Budget und Endpoint-Verhalten begrenzen reale Workloads trotzdem.
Was ändert sich gegenüber Grok 4.6?
SpaceXAI beschreibt ein neues, größeres Basismodell, längeres Reinforcement Learning mit schwierigeren mehrstündigen Aufgaben, bessere Selbstprüfung und Verwaltung langen Kontexts, natives Verständnis des Grok-Bot-Harness sowie einen neuen Safeguard-Stack.
Das sind Herstellerangaben zum Release, keine unabhängig geprüften Architekturresultate. Weder Launch-Post noch aktueller Modellvertrag nennen eine Parameterzahl.
| Entscheidung | Grok 4.7 | Grok 4.6 | Bedeutung |
|---|---|---|---|
| Basis / Training | Neue größere Basis; längeres RL auf schwierigen Langzeitaufgaben | Vorige Generation | Grund, lange Agents neu zu testen |
| Standard-Direktpreis | $2 / $0.50 / $6 | $2 / $0.50 / $6 | Kein Listenpreis-Aufschlag beim Wechsel |
| Long-Context-Preis | $4 / $1 / $12 | $4 / $1 / $12 | Gleiche Kostenlogik an der 200K-Grenze |
| Kontext | 500K | 500K | Kein Kapazitäts-Upgrade |
| Reasoning | low bis xhigh; high als Standard | low bis xhigh; high als Standard | Im Vergleich denselben effort fixieren |
| Batch | Nicht unterstützt | Nicht unterstützt | Keinen Batch-Rabatt einplanen |
| Release-Fokus | Coding, Agents, Wissen, Selbstprüfung | Coding und lange Agents | Zuverlässigkeit statt neuer Modalität |
Das praktische Upgrade ist behauptete Aufgabenleistung zum gleichen Listenpreis, nicht mehr Kontext oder ein billigeres Token. Der Leitfaden zu den Grok-4.6-API-Preisen bleibt die ausführliche Budgetreferenz für die derzeit bei OmniaKey gelistete Route.
Grok 4.7 Benchmarks richtig lesen
Dies sind von SpaceXAI gemeldete Werte, nicht von OmniaKey reproduzierte Ergebnisse. Der Publisher zeigt 4.7 mit xhigh, 4.6 mit high, GPT-5.6 Sol mit max und Fable 5.1 mit max; der Stern markiert DeepSWE 4.7 mit high effort.
| Evaluation | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 | 4.7 vs. 4.6 |
|---|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% | +5.9 pp |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% | +5.8 pp |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% | +11.0 pp |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 | +111 Elo |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% | +17.7 pp |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% | +3.8 pp |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% | +8.2 pp |
Die Tabelle trägt eine belastbare Aussage: Unter xAIs eigenem Setup verbessert 4.7 alle gezeigten Aufgabenfamilien gegenüber 4.6. Sie belegt nicht, dass Grok 4.7 jedes Modell schlägt. Fable führt bei CursorBench, AA Briefcase, Terminal-Bench und HealthBench, GPT-5.6 Sol bei DeepSWE. Preis, effort, Harness, Tokenverbrauch und Akzeptanzkriterien unterscheiden sich ebenfalls.
Für Coding ist der Zuwachs bei Terminal-Bench besonders interessant, weil mehrstündige Terminalarbeit geprüft wird. Dort ist zugleich Fables Vorsprung am größten. Bewerte Erfolgskriterien und Fehlerklassen, nicht nur den Gesamtprozentsatz.
Welche unabhängigen Daten gibt es?
Artificial Analysis hatte Grok 4.7 in xhigh bereits aufgenommen. Die Seite zeigte einen Intelligence Index von 46 und hohen Outputverbrauch: 240M Tokens im Index gegenüber einem Seitenmedian von 92M.
Das ist eine frühe Momentaufnahme. Output Speed stand auf N/A, Providerpreise waren nicht zuverlässig ausgefüllt. Deshalb validiert der Eintrag weder xAIs Aussage zur gleichen Geschwindigkeit noch Fast oder Kosten je Aufgabe. Mit Abschluss des Laufs oder Änderungen der Suite kann sich der Wert bewegen.
- Offizielle Daten zeigen eine konsistente Verbesserung von 4.6 auf 4.7.
- Eine unabhängige Suite ordnet xhigh bereits im Frontier-Bereich ein.
- Stabile unabhängige Geschwindigkeit, p95-Latenz und gepaarte 4.6-Kosten fehlten.
- Der eigene Workload bleibt die entscheidende Prüfung.
Grok 4.7 API-Preise und langer Kontext
Grok 4.7 übernimmt die globale Direktpreisliste von Grok 4.6. Die aktuelle Grenze lautet unter 200K gegenüber ab 200K. Genau 200K gehört nicht mehr in die Standardstufe.
| Route | Prompt-Bereich | Input | Cached input | Output |
|---|---|---|---|---|
| xAI global | Unter 200K | $2.00 | $0.50 | $6.00 |
| xAI global | Ab 200K | $4.00 | $1.00 | $12.00 |
| xAI US regional | Unter 200K | $2.20 | $0.55 | $6.60 |
| xAI US regional | Ab 200K | $4.40 | $1.10 | $13.20 |
Alle Werte sind USD je eine Million Tokens. Der US-Endpoint hält Inference in den USA und berechnet 10% Aufschlag. Tool Calls, Speicher, Steuern, Umrechnung und ein eigener Preis des Drittanbieters kommen getrennt hinzu.
| Workload | Rechnung | Modell-Tokenkosten |
|---|---|---|
| 100K uncached Input + 20K Output | 0.10 x $2 + 0.02 x $6 | $0.32 |
| 250K uncached Input + 20K Output | 0.25 x $4 + 0.02 x $12 | $1.24 |
| 50K uncached + 200K cached + 20K Output | 0.05 x $4 + 0.20 x $1 + 0.02 x $12 | $0.64 |
Cachepreise gelten nur, wenn der Provider einen cache hit meldet. xAI empfiehlt prompt_cache_key für Responses oder x-grok-conv-id für Chat Completions, damit zusammengehörige Turns denselben Server erreichen. Bei langen Tool-Loops ist Context Compaction wichtig, weil wiederholte Prompts ab 200K alle drei Tokenpreise verdoppeln.
Bei Fast zählt die Preistabelle
Grok 4.7 Fast ist dasselbe Modell auf schnellerer Infrastruktur. Es ist nur in Cursor und Grok Build verfügbar, nicht in der öffentlichen xAI API oder im kostenlosen Grok-Build-Tarif.
Die Preisseite nennt Fast „doppelt so teuer wie Standard“, listet aber $4 / $1 / $12 unter 200K und $6 / $1.50 / $18 ab 200K. Die zweite Zeile entspricht 1.5x der öffentlichen Long-Context-Zeile, nicht 2x. Zitiere die Tabelle, statt aus dem Text abzuleiten, und prüfe vor großen Läufen die reale Abrechnung. Cursor rechnet die Variante über seinen Plan ab.
Auch „doppelte Output-Geschwindigkeit“ ist eine Providerangabe, keine Latenzgarantie. Decode Throughput schließt Queue, Prompt Prefill, Time to First Token, Tools, Netzwerk und Retries nicht ein.
Wichtige API-Details für Agents
Die Responses API liefert bei grok-4.7 immer reasoning.encrypted_content, selbst wenn include es nicht anfordert. Gib diese Reasoning-Elemente im nächsten Turn unverändert zurück, damit ein Multi-Turn-Agent seinen Zustand behält. Chat Completions bleibt unverändert.
Vor der Migration prüfen:
- tatsächlich zurückgegebene Modell-ID und Endpoint;
- denselben
reasoning_effortfür beide Generationen; - Tool-Call-Schema und Retry-Verhalten;
- Prompt-, Cache-, Reasoning- und sichtbare Output-Tokens;
- First Token, End-to-End-Latenz und Kosten je akzeptierter Aufgabe;
- Ausgabelänge, da xhigh mehr Tokens erzeugen kann;
- Rollback auf
grok-4.6ohne Änderung des Harness.
Direkter xAI-Responses-Aufruf:
curl https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"prompt_cache_key": "repo-review-v1",
"input": "Review this patch, run the acceptance criteria, and report any remaining failure."
}'
Der Cache Key sollte stabil und nicht geheim sein. Verwende keine API Keys, E-Mail-Adressen, Repository-Secrets oder Kunden-IDs. Base URL und Credential gelten für xAI direkt und sind keine OmniaKey-Einstellungen.
Wo Grok 4.7 verfügbar ist
| Oberfläche | Status am 22. September 2026 | Wichtige Grenze |
|---|---|---|
| xAI API | Als grok-4.7 verfügbar | Standardvariante; Fast ist keine öffentliche API |
| Grok Build | Standardmodell | Fast ist kostenpflichtig und nicht im Free Tier |
| Cursor | Laut xAI in allen Plänen verfügbar | Fast-Abrechnung folgt dem Cursor-Plan |
| GitHub Copilot | Schrittweiser Rollout angekündigt | Pro, Pro+, Max, Business, Enterprise; Admin-Policy kann sperren |
| OpenRouter, Vercel, Cloudflare | Von xAI als Gateways genannt | Route, Preis und Verfügbarkeit liegen beim Anbieter |
| OmniaKey | Bei Prüfung nicht gelistet | Live-Modellkatalog prüfen, keine Route erraten |
GitHub nennt VS Code, Visual Studio, Copilot CLI, Cloud Agent, Copilot App, JetBrains, Xcode und Eclipse. „Rollout“ bedeutet nicht, dass die Auswahl sofort in jedem Konto erscheint.
Reproduzierbarer Vergleich von Grok 4.6 und 4.7
Wähle 20 bis 50 Aufgaben aus der echten Fehlerverteilung statt nur einfacher Prompts. Fixiere Repository-Revision, System Prompt, Tools, Berechtigungen, effort, Timeout und Akzeptanzbefehle.
- ohne Reparatur akzeptiert, nach Retry akzeptiert oder fehlgeschlagen;
- Schemafehler, falsche Änderungen, Testfehler, Refusals und Loops;
- Input-, Cache-, Reasoning- und Output-Tokens;
- First-Token- und End-to-End-Latenz als p50 und p95;
- gemeldete Modell-ID und Gesamtbetrag;
- Minuten für menschliches Review oder Repair.
Wähle 4.7, wenn Kosten je akzeptierter Aufgabe sinken oder wichtige Fehler verschwinden. Bleibe bei 4.6, wenn die Ergebnisse gleich sind und die bestehende Route einfacher läuft. Für Modellfamilien nutze den Leitfaden zu Coding-Agent-Modellen.
Häufige Fehler in Grok-4.7-Tests
Herstellerwerte als unabhängigen Test bezeichnen
Die Tabelle ist nützlich, aber SpaceXAI hat sie ausgewählt und ausgeführt. Quelle und effort gehören sichtbar dazu.
2.1T Parameter als Fakt nennen
Die Zahl kursierte vor dem Release, steht aber weder im Launch-Post noch im aktuellen Entwicklervertrag. Bestätigt ist nur „new, larger base model“.
500K Kontext als kostenlos behandeln
Es ist die maximale Promptkapazität. Ab 200K Tokens fällt die gesamte Anfrage in die höhere Preisstufe.
Fast für eine öffentliche API-ID halten
Fast ist eine Serving-Option in Cursor und Grok Build. Die öffentliche xAI API dokumentiert grok-4.7, keinen Fast-Slug.
Release mit OmniaKey-Verfügbarkeit gleichsetzen
Provider-Release und Gateway-Onboarding sind getrennt. Am Prüftag gab es keine öffentliche OmniaKey-Route für 4.7.
Häufige Fragen
Wann wurde Grok 4.7 veröffentlicht?
Am 21. September 2026. Die direkte API-Modell-ID lautet grok-4.7.
Ist Grok 4.7 besser als Grok 4.6?
Es ist der stärkere erste Testkandidat. xAI meldet bei gleichem Direktpreis höhere Werte in jedem gezeigten Vergleich. Wegen effort, Tokenverbrauch, Tools und Fehlerarten ist ein gepaarter Workload-Test trotzdem nötig.
Was kostet die Grok 4.7 API?
Global kosten Prompts unter 200K je Million $2 Input, $0.50 Cache und $6 Output. Ab 200K gelten $4, $1 und $12.
Wie groß ist das Kontextfenster?
500,000 tokens. Der Start Guide nennt kein Text-Output-Limit, Rate-, Zeit- und Budgetgrenzen gelten dennoch.
Wie viele Parameter hat Grok 4.7?
SpaceXAI veröffentlicht im Launch-Post und auf der Modellseite keine Zahl. Bestätigt ist lediglich eine neue, größere Basis als bei 4.6.
Unterstützt Grok 4.7 Bilder und Tools?
Ja. Es akzeptiert Text und Bilder, gibt Text aus und dokumentiert Function Calling, strukturierte Ausgabe, Websuche, X-Suche und Codeausführung.
Ist Grok 4.7 bei OmniaKey verfügbar?
Nicht bei der Prüfung am 22. September. Der öffentliche Katalog führte Grok 4.6 und 4.5, aber nicht grok-4.7. Prüfe den Live-Katalog.
Geprüfte Quellen
- SpaceXAI: Vorstellung von Grok 4.7
- SpaceXAI: Grok 4.7 Developer Start Guide
- SpaceXAI: Grok 4.7 Modellseite
- SpaceXAI: API-Preise
- SpaceXAI: Release Notes
- Artificial Analysis: Grok 4.7 xhigh
- GitHub: Grok 4.7 in Copilot
- OpenRouter: Grok 4.7 Route
- OmniaKey Live-Modellkatalog
Geprüft am 22. September 2026. Verfügbarkeit, dynamische Scores, Preise und Rollouts können sich ändern; prüfe Primärquellen und Live-Katalog vor einer Produktionsmigration erneut.