Das Jev-Modell ist jetzt integriert und live · Herzlich willkommen
Blog
Leitfaden

Grok 4.7 Test

Grok 4.7 ist für lang laufende Coding- und Wissens-Agenten ein sinnvoller erster Test zum gleichen Listenpreis, doch die xAI-Launchwerte ersetzen keinen Vergleich mit eigenen Aufgaben.

13 Min. LesezeitOmniaKey
Grok 4.7Grok 4.6API-PreiseCoding-BenchmarkModelltest

Dieser Grok 4.7 Test kommt zu einem engeren Ergebnis als die Schlagzeilen zum Release. Für lang laufendes Coding, Tool-Nutzung und professionelle Wissensarbeit sollte 4.7 zuerst geprüft werden: In allen sieben von xAI veröffentlichten Vergleichen mit Grok 4.6 steigt der Wert, während Standardpreis und 500K-Kontext gleich bleiben. Ein universeller Sieger ist damit nicht bewiesen. Die offizielle Tabelle mischt Reasoning-Stufen, und wir haben keinen eigenen kostenpflichtigen Benchmark ausgeführt.

SpaceXAI veröffentlichte grok-4.7 am 21. September 2026. Die öffentliche xAI API ist verfügbar, im öffentlichen OmniaKey-Katalog fehlte das Modell bei der Prüfung am 22. September jedoch. Bis sich der Live-Katalog ändert, nutze bei OmniaKey Grok 4.6 oder einen Anbieter, der die exakte 4.7-ID tatsächlich ausweist.

Stand: 22. September 2026. Spezifikationen und Launch-Benchmarks stammen aus Ankündigung und Entwicklerdokumentation von SpaceXAI. Artificial Analysis hatte einen frühen xhigh Intelligence Index veröffentlicht, aber Geschwindigkeit und Providerpreise waren unvollständig. Wir nutzten weder private Preview noch xAI-Zugangsdaten und führten keinen eigenen Latenztest durch. Herstellerwerte, unabhängige Ergebnisse und unsere Empfehlung sind getrennt gekennzeichnet.

Urteil im Grok 4.7 Test

Für neue, lang laufende Agent-Aufgaben zuerst 4.7 testen. Der aussagekräftigste Punkt ist der Generationsvergleich: xAI meldet in allen sieben direkten Zeilen höhere Werte für 4.7, darunter deutliche Zuwächse bei Terminal-Bench 4.0 und EEBench, ohne höhere Standard-Tokenpreise.

Nicht allein wegen der Überschrift migrieren. xAI vergleicht Grok 4.7 mit xhigh, Grok 4.6 mit high und die anderen Frontier-Modelle mit max; DeepSWE für 4.7 ist gesondert als high effort markiert. Diese Einstellungen verändern Tokenverbrauch, Latenz und Verhalten.

4.6 als Rollback behalten, bis eigene Aufgaben bestehen. Beide Generationen bieten 500K Kontext und dieselben Direktpreise. Eine gestufte Evaluation ist günstiger als Tool-, Refusal-, Längen- oder Formatregressionen erst in Produktion zu finden.

Release und technische Daten

MerkmalVertrag von Grok 4.7
Release-Datum21. September 2026
API-Modell-IDgrok-4.7
Eingabe / AusgabeText und Bild / Text
Kontextfenster500,000 tokens
WissensstandMai 2026
Reasoning effortlow, medium, high (Standard), xhigh
APIsResponses API und Chat Completions
FunktionenFunction calling, structured outputs, web search, X search, code execution
Batch APINicht unterstützt
Globaler Direktpreis unter 200K Prompt-Tokens$2 Input / $0.50 Cache / $6 Output je 1M
Globaler Direktpreis ab 200K Prompt-Tokens$4 Input / $1 Cache / $12 Output je 1M

500K ist Kapazität, kein kostenloses Kontingent. Sobald der Prompt 200K tokens erreicht, gilt laut xAI der höhere Preis für alle Tokens der Anfrage. Der Start Guide nennt kein Text-Output-Limit; Rate Limits, Laufzeit, Budget und Endpoint-Verhalten begrenzen reale Workloads trotzdem.

Was ändert sich gegenüber Grok 4.6?

SpaceXAI beschreibt ein neues, größeres Basismodell, längeres Reinforcement Learning mit schwierigeren mehrstündigen Aufgaben, bessere Selbstprüfung und Verwaltung langen Kontexts, natives Verständnis des Grok-Bot-Harness sowie einen neuen Safeguard-Stack.

Das sind Herstellerangaben zum Release, keine unabhängig geprüften Architekturresultate. Weder Launch-Post noch aktueller Modellvertrag nennen eine Parameterzahl.

EntscheidungGrok 4.7Grok 4.6Bedeutung
Basis / TrainingNeue größere Basis; längeres RL auf schwierigen LangzeitaufgabenVorige GenerationGrund, lange Agents neu zu testen
Standard-Direktpreis$2 / $0.50 / $6$2 / $0.50 / $6Kein Listenpreis-Aufschlag beim Wechsel
Long-Context-Preis$4 / $1 / $12$4 / $1 / $12Gleiche Kostenlogik an der 200K-Grenze
Kontext500K500KKein Kapazitäts-Upgrade
Reasoninglow bis xhigh; high als Standardlow bis xhigh; high als StandardIm Vergleich denselben effort fixieren
BatchNicht unterstütztNicht unterstütztKeinen Batch-Rabatt einplanen
Release-FokusCoding, Agents, Wissen, SelbstprüfungCoding und lange AgentsZuverlässigkeit statt neuer Modalität

Das praktische Upgrade ist behauptete Aufgabenleistung zum gleichen Listenpreis, nicht mehr Kontext oder ein billigeres Token. Der Leitfaden zu den Grok-4.6-API-Preisen bleibt die ausführliche Budgetreferenz für die derzeit bei OmniaKey gelistete Route.

Grok 4.7 Benchmarks richtig lesen

Dies sind von SpaceXAI gemeldete Werte, nicht von OmniaKey reproduzierte Ergebnisse. Der Publisher zeigt 4.7 mit xhigh, 4.6 mit high, GPT-5.6 Sol mit max und Fable 5.1 mit max; der Stern markiert DeepSWE 4.7 mit high effort.

EvaluationGrok 4.7Grok 4.6GPT-5.6 SolFable 5.14.7 vs. 4.6
CursorBench 4.046.3%40.4%41.7%51.8%+5.9 pp
DeepSWE v1.171.0%*65.2%72.7%70.0%+5.8 pp
EEBench64.0%53.0%39.4%56.4%+11.0 pp
AA Briefcase v1.11,6571,5461,4871,678+111 Elo
Terminal-Bench 4.038.0%20.3%37.3%57.9%+17.7 pp
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%+3.8 pp
HealthBench Professional56.7%48.5%60.5%62.1%+8.2 pp

Die Tabelle trägt eine belastbare Aussage: Unter xAIs eigenem Setup verbessert 4.7 alle gezeigten Aufgabenfamilien gegenüber 4.6. Sie belegt nicht, dass Grok 4.7 jedes Modell schlägt. Fable führt bei CursorBench, AA Briefcase, Terminal-Bench und HealthBench, GPT-5.6 Sol bei DeepSWE. Preis, effort, Harness, Tokenverbrauch und Akzeptanzkriterien unterscheiden sich ebenfalls.

Für Coding ist der Zuwachs bei Terminal-Bench besonders interessant, weil mehrstündige Terminalarbeit geprüft wird. Dort ist zugleich Fables Vorsprung am größten. Bewerte Erfolgskriterien und Fehlerklassen, nicht nur den Gesamtprozentsatz.

Welche unabhängigen Daten gibt es?

Artificial Analysis hatte Grok 4.7 in xhigh bereits aufgenommen. Die Seite zeigte einen Intelligence Index von 46 und hohen Outputverbrauch: 240M Tokens im Index gegenüber einem Seitenmedian von 92M.

Das ist eine frühe Momentaufnahme. Output Speed stand auf N/A, Providerpreise waren nicht zuverlässig ausgefüllt. Deshalb validiert der Eintrag weder xAIs Aussage zur gleichen Geschwindigkeit noch Fast oder Kosten je Aufgabe. Mit Abschluss des Laufs oder Änderungen der Suite kann sich der Wert bewegen.

  • Offizielle Daten zeigen eine konsistente Verbesserung von 4.6 auf 4.7.
  • Eine unabhängige Suite ordnet xhigh bereits im Frontier-Bereich ein.
  • Stabile unabhängige Geschwindigkeit, p95-Latenz und gepaarte 4.6-Kosten fehlten.
  • Der eigene Workload bleibt die entscheidende Prüfung.

Grok 4.7 API-Preise und langer Kontext

Grok 4.7 übernimmt die globale Direktpreisliste von Grok 4.6. Die aktuelle Grenze lautet unter 200K gegenüber ab 200K. Genau 200K gehört nicht mehr in die Standardstufe.

RoutePrompt-BereichInputCached inputOutput
xAI globalUnter 200K$2.00$0.50$6.00
xAI globalAb 200K$4.00$1.00$12.00
xAI US regionalUnter 200K$2.20$0.55$6.60
xAI US regionalAb 200K$4.40$1.10$13.20

Alle Werte sind USD je eine Million Tokens. Der US-Endpoint hält Inference in den USA und berechnet 10% Aufschlag. Tool Calls, Speicher, Steuern, Umrechnung und ein eigener Preis des Drittanbieters kommen getrennt hinzu.

WorkloadRechnungModell-Tokenkosten
100K uncached Input + 20K Output0.10 x $2 + 0.02 x $6$0.32
250K uncached Input + 20K Output0.25 x $4 + 0.02 x $12$1.24
50K uncached + 200K cached + 20K Output0.05 x $4 + 0.20 x $1 + 0.02 x $12$0.64

Cachepreise gelten nur, wenn der Provider einen cache hit meldet. xAI empfiehlt prompt_cache_key für Responses oder x-grok-conv-id für Chat Completions, damit zusammengehörige Turns denselben Server erreichen. Bei langen Tool-Loops ist Context Compaction wichtig, weil wiederholte Prompts ab 200K alle drei Tokenpreise verdoppeln.

Bei Fast zählt die Preistabelle

Grok 4.7 Fast ist dasselbe Modell auf schnellerer Infrastruktur. Es ist nur in Cursor und Grok Build verfügbar, nicht in der öffentlichen xAI API oder im kostenlosen Grok-Build-Tarif.

Die Preisseite nennt Fast „doppelt so teuer wie Standard“, listet aber $4 / $1 / $12 unter 200K und $6 / $1.50 / $18 ab 200K. Die zweite Zeile entspricht 1.5x der öffentlichen Long-Context-Zeile, nicht 2x. Zitiere die Tabelle, statt aus dem Text abzuleiten, und prüfe vor großen Läufen die reale Abrechnung. Cursor rechnet die Variante über seinen Plan ab.

Auch „doppelte Output-Geschwindigkeit“ ist eine Providerangabe, keine Latenzgarantie. Decode Throughput schließt Queue, Prompt Prefill, Time to First Token, Tools, Netzwerk und Retries nicht ein.

Wichtige API-Details für Agents

Die Responses API liefert bei grok-4.7 immer reasoning.encrypted_content, selbst wenn include es nicht anfordert. Gib diese Reasoning-Elemente im nächsten Turn unverändert zurück, damit ein Multi-Turn-Agent seinen Zustand behält. Chat Completions bleibt unverändert.

Vor der Migration prüfen:

  1. tatsächlich zurückgegebene Modell-ID und Endpoint;
  2. denselben reasoning_effort für beide Generationen;
  3. Tool-Call-Schema und Retry-Verhalten;
  4. Prompt-, Cache-, Reasoning- und sichtbare Output-Tokens;
  5. First Token, End-to-End-Latenz und Kosten je akzeptierter Aufgabe;
  6. Ausgabelänge, da xhigh mehr Tokens erzeugen kann;
  7. Rollback auf grok-4.6 ohne Änderung des Harness.

Direkter xAI-Responses-Aufruf:

bash
curl https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "prompt_cache_key": "repo-review-v1",
    "input": "Review this patch, run the acceptance criteria, and report any remaining failure."
  }'

Der Cache Key sollte stabil und nicht geheim sein. Verwende keine API Keys, E-Mail-Adressen, Repository-Secrets oder Kunden-IDs. Base URL und Credential gelten für xAI direkt und sind keine OmniaKey-Einstellungen.

Wo Grok 4.7 verfügbar ist

OberflächeStatus am 22. September 2026Wichtige Grenze
xAI APIAls grok-4.7 verfügbarStandardvariante; Fast ist keine öffentliche API
Grok BuildStandardmodellFast ist kostenpflichtig und nicht im Free Tier
CursorLaut xAI in allen Plänen verfügbarFast-Abrechnung folgt dem Cursor-Plan
GitHub CopilotSchrittweiser Rollout angekündigtPro, Pro+, Max, Business, Enterprise; Admin-Policy kann sperren
OpenRouter, Vercel, CloudflareVon xAI als Gateways genanntRoute, Preis und Verfügbarkeit liegen beim Anbieter
OmniaKeyBei Prüfung nicht gelistetLive-Modellkatalog prüfen, keine Route erraten

GitHub nennt VS Code, Visual Studio, Copilot CLI, Cloud Agent, Copilot App, JetBrains, Xcode und Eclipse. „Rollout“ bedeutet nicht, dass die Auswahl sofort in jedem Konto erscheint.

Reproduzierbarer Vergleich von Grok 4.6 und 4.7

Wähle 20 bis 50 Aufgaben aus der echten Fehlerverteilung statt nur einfacher Prompts. Fixiere Repository-Revision, System Prompt, Tools, Berechtigungen, effort, Timeout und Akzeptanzbefehle.

  • ohne Reparatur akzeptiert, nach Retry akzeptiert oder fehlgeschlagen;
  • Schemafehler, falsche Änderungen, Testfehler, Refusals und Loops;
  • Input-, Cache-, Reasoning- und Output-Tokens;
  • First-Token- und End-to-End-Latenz als p50 und p95;
  • gemeldete Modell-ID und Gesamtbetrag;
  • Minuten für menschliches Review oder Repair.

Wähle 4.7, wenn Kosten je akzeptierter Aufgabe sinken oder wichtige Fehler verschwinden. Bleibe bei 4.6, wenn die Ergebnisse gleich sind und die bestehende Route einfacher läuft. Für Modellfamilien nutze den Leitfaden zu Coding-Agent-Modellen.

Häufige Fehler in Grok-4.7-Tests

Herstellerwerte als unabhängigen Test bezeichnen

Die Tabelle ist nützlich, aber SpaceXAI hat sie ausgewählt und ausgeführt. Quelle und effort gehören sichtbar dazu.

2.1T Parameter als Fakt nennen

Die Zahl kursierte vor dem Release, steht aber weder im Launch-Post noch im aktuellen Entwicklervertrag. Bestätigt ist nur „new, larger base model“.

500K Kontext als kostenlos behandeln

Es ist die maximale Promptkapazität. Ab 200K Tokens fällt die gesamte Anfrage in die höhere Preisstufe.

Fast für eine öffentliche API-ID halten

Fast ist eine Serving-Option in Cursor und Grok Build. Die öffentliche xAI API dokumentiert grok-4.7, keinen Fast-Slug.

Release mit OmniaKey-Verfügbarkeit gleichsetzen

Provider-Release und Gateway-Onboarding sind getrennt. Am Prüftag gab es keine öffentliche OmniaKey-Route für 4.7.

Häufige Fragen

Wann wurde Grok 4.7 veröffentlicht?

Am 21. September 2026. Die direkte API-Modell-ID lautet grok-4.7.

Ist Grok 4.7 besser als Grok 4.6?

Es ist der stärkere erste Testkandidat. xAI meldet bei gleichem Direktpreis höhere Werte in jedem gezeigten Vergleich. Wegen effort, Tokenverbrauch, Tools und Fehlerarten ist ein gepaarter Workload-Test trotzdem nötig.

Was kostet die Grok 4.7 API?

Global kosten Prompts unter 200K je Million $2 Input, $0.50 Cache und $6 Output. Ab 200K gelten $4, $1 und $12.

Wie groß ist das Kontextfenster?

500,000 tokens. Der Start Guide nennt kein Text-Output-Limit, Rate-, Zeit- und Budgetgrenzen gelten dennoch.

Wie viele Parameter hat Grok 4.7?

SpaceXAI veröffentlicht im Launch-Post und auf der Modellseite keine Zahl. Bestätigt ist lediglich eine neue, größere Basis als bei 4.6.

Unterstützt Grok 4.7 Bilder und Tools?

Ja. Es akzeptiert Text und Bilder, gibt Text aus und dokumentiert Function Calling, strukturierte Ausgabe, Websuche, X-Suche und Codeausführung.

Ist Grok 4.7 bei OmniaKey verfügbar?

Nicht bei der Prüfung am 22. September. Der öffentliche Katalog führte Grok 4.6 und 4.5, aber nicht grok-4.7. Prüfe den Live-Katalog.

Geprüfte Quellen

Geprüft am 22. September 2026. Verfügbarkeit, dynamische Scores, Preise und Rollouts können sich ändern; prüfe Primärquellen und Live-Katalog vor einer Produktionsmigration erneut.