Gemini 4 Argon im Test: starker Start, noch keine öffentliche API
Argon wirkt wie ein ernstzunehmendes Frontier-Upgrade. Am Starttag sollte man jedoch die Belege bewerten und den aufrufbaren Vertrag abwarten, bevor Produktionsverkehr umgestellt wird.
Gemini 4 Argon ist Googles erstes Frontier-Modell der Gemini-4-Generation. Google kündigte es am 2026-09-30 für lang laufende Softwareentwicklung, Unternehmenswissen und defensive Cybersicherheit an. Der Start ist echt, der Zugang aber gestaffelt: Zuerst erhalten vertrauenswürdige Cyberabwehrteams über das Fairwind-Programm Zugriff, danach zahlende API-Kunden und Google-AI-Ultra-Abonnenten.
Dieser Artikel ist deshalb ein Starttest und kein eigener API-Benchmark. Google meldet starke Ergebnisse bei DeepSWE, AutomationBench, LVBench und Sicherheitsprüfungen. Artificial Analysis hat einen frühen unabhängigen Schnappschuss, dessen Geschwindigkeitsfeld noch fehlt. Wir haben keinen Gemini-Schlüssel verwendet und keinen kostenpflichtigen Argon-Aufruf ausgeführt; beim Faktencheck stand Argon nicht im öffentlichen OmniaKey-Katalog.
Faktencheck vom 2026-10-01. Startdaten und Anbieterwerte stammen aus Googles Ankündigung und Sicherheitsmaterial. Unabhängige Werte sind separat gekennzeichnet. Google hat noch keine stabile öffentliche model ID, keinen vollständigen Endpoint-Vertrag, keinen SDK-Migrationsleitfaden und keinen Termin für die allgemeine Verfügbarkeit veröffentlicht. Daher erfinden wir weder ein Request-Beispiel noch einen Produktionszugang.
Die Antwort auf einen Blick
| Frage | Belegte Antwort am 2026-10-01 |
|---|---|
| Was wurde gestartet? | Gemini 4 Argon, ein Frontier-Modell für Code, Unternehmenswissen und Cyberabwehr. |
| Kann es heute jeder aufrufen? | Nein. Der Rollout beginnt bei vertrauenswürdigen Cyberabwehrern und geht danach zu zahlenden API-Kunden und Google-AI-Ultra-Abonnenten. |
| Wie lautet die API-model-ID? | Der Produktname ist bekannt, aber Google hat in den Startmaterialien keine stabile öffentliche API-ID genannt. gemini-4-argon darf nicht geraten werden. |
| Wie groß sind Kontext oder Ausgabe? | Google nennt ein Ausgabelimit von 1M Tokens, gegenüber 64K bei früheren Gemini-Modellen. Der endgültige Eingabevertrag fehlt. |
| Wie hoch ist der Einführungspreis? | $2 pro 1M Eingabetokens und $10 pro 1M Ausgabetokens; Cache-Eingaben sind 95% günstiger. |
| Was gilt danach? | Google nennt danach $4 Eingabe und $20 Ausgabe pro 1M Tokens. |
| Gibt es einen reproduzierbaren öffentlichen Benchmark? | Google berichtet Anbieterwerte; Artificial Analysis zeigt früh einen Intelligence Index von 53. Wir haben keinen eigenen kostenpflichtigen Benchmark ausgeführt. |
| Routet OmniaKey Argon? | Am Prüftag war die Route im öffentlichen OmniaKey-Katalog nicht vorhanden. Vor einer Gateway-Migration den Live-Katalog prüfen. |
Das kurze Urteil lautet vielversprechend, aber noch kein Modell für einen ungeprüften Produktionswechsel. Sobald ein Konto es aufrufen kann, gehört Argon an die Spitze der Evaluationsliste. Bis dahin bleibt eine geprüfte Route wie Gemini 3.8 Flash die bessere Basis.
Was Google angekündigt hat
Google nennt Argon sein neues Frontier-Modell und setzt es laut eigener Aussage bereits intern ein. Die erste externe Gruppe sind vertrauenswürdige Cyberabwehrteams im Fairwind-Programm. Der Zugang soll „so bald wie möglich“ auf Entwickler, Unternehmen und Verbraucher ausgeweitet werden, beginnend mit zahlenden API-Kunden und Google-AI-Ultra-Abonnenten.
Eine Ankündigung belegt die Existenz des Modells, aber nicht, dass jedes AI-Studio-Projekt, jede Region, jedes SDK, jeder Gateway und jedes Konto es aufrufen kann. Der frühere Statusartikel zu Gemini 4 trennte zu Recht ein benanntes Trainingsprogramm von einem aufrufbaren API-Modell. Argon ist jetzt ein angekündigtes Produkt; die breite API-Verfügbarkeit bleibt eine eigene Prüfung.
Fähigkeitsprofil
| Fähigkeit | Veröffentlichte Aussage | Einordnung |
|---|---|---|
| Langhorizont-Reasoning | Tiefes Reasoning für komplexe, mehrstufige Abläufe | Ein Zielgebiet, keine Garantie für jeden langen Prompt. |
| Softwareentwicklung | DeepSWE v1.1 mit 77.9% in Googles Bericht | Anbieterwert mit bestimmtem Harness und Setup. |
| Unternehmensarbeit | Code, Finanzen, Rechtsrecherche, Schreiben und visuelle Analyse | Braucht domänenspezifische Abnahmetests. |
| Multimodalität | Grafiken, Dokumente und lange Videos verstehen | Das vollständige Eingabeschema steht nicht im Startartikel. |
| Cyberabwehr | Schwachstellen finden, prüfen und patchen | Zugang und Schutzmechanismen unterscheiden sich nach Nutzergruppe. |
| Ausgaberaum | Laut Google bis zu 1M Ausgabetokens | Eine Obergrenze, keine Empfehlung für eine Million Tokens. |
Google nennt interne Beispiele: Argon übertraf eine veröffentlichte Quanten-Optimierungsbasislinie um 40%, gab nach einer Flottenanalyse über 300 TiB Speicher frei und machte eine Rust-Portierung des libgav1-Decoders 2,7-mal schneller als die vorhandene Rust-Implementierung. Das sind Google-Workflow-Angaben, keine unabhängigen Messungen. Große Umschreibungen wurden vor dem Rollout automatisch und manuell geprüft.
Der praktische Fokus ist dennoch klar: Argon zielt auf Aufgaben, die planen, Werkzeuge nutzen, lange Belege prüfen und über viele Schritte konsistent bleiben müssen. Eine kurze Chatfrage misst diesen Vorteil nicht.
Benchmarks: starkes Signal, enger Aussagebereich
| Evaluation | Gemini 4 Argon | Was laut Google gemessen wird |
|---|---|---|
| DeepSWE v1.1 | 77.9% | Lang laufende Softwareentwicklung |
| AutomationBench | 51.3% | End-to-End-Ausführung von Geschäftsabläufen |
| LVBench | 91.7% | Verständnis langer Videos |
| CWE-bench v1 | 68% | Schwachstellenbehebung, geteilter erster Platz |
| Vals Finance Agent v2 | Führendes Ergebnis behauptet | Mehrstufige Finanzrecherche |
| Harvey Legal Agent Benchmark | Führendes Ergebnis behauptet | Rechtsrecherche und -entwurf |
Die Werte stützen eine begrenzte Aussage: Google zielt auf Aufgaben, bei denen langer Kontext, Werkzeuge und dauerhaftes Reasoning zählen. Sie beweisen kein universelles Ranking. DeepSWE nutzt Googles Setup; Prompts, Harness, Retries, Tool-Rechte und Stoppkriterien können sich zwischen Anbietern unterscheiden.
9to5Google fasste Googles DeepSWE-Vergleich mit 77.9% für Argon, 74.2% für Claude Opus 5.5 und 74.1% für GPT-6 Astra zusammen. Das ist Startkontext und kein unabhängiger Test unter gleichen Bedingungen. Artificial Analysis zeigt für seine High-Reasoning-Snapshot einen Intelligence Index von 53; Geschwindigkeit ist dort noch nicht verfügbar.
Für eine echte Entscheidung protokollieren Sie Modell, Reasoning-Einstellung, Werkzeuge, Kontext, Retries, Ausgabetokens, Latenz, akzeptiertes Ergebnis und menschliche Korrekturzeit. Ein Benchmarkwert ohne diese Felder sagt wenig über Kosten oder Zuverlässigkeit Ihres Agents.
Warum Cybersicherheit die Veröffentlichung begrenzt
Google behandelt Argon nicht wie einen gewöhnlichen Modellstart. Vertrauenswürdige Verteidiger und interne Teams sollen eine Version ohne Cyber-Schutzmechanismen erhalten, während vor dem breiten Start Schutz gegen Missbrauch verstärkt wird.
Die Ankündigung nennt vier Bereiche:
- Missbrauch verhindern. Überwachung von Cyber- und CBRN-Missbrauch bei Erhalt legitimer Dual-Use-Forschung.
- Indirekte Prompt-Injection. Red Teaming und adversariales Training gegen versteckte Anweisungen in abgerufenen Inhalten.
- Fehlausrichtung überwachen. Reasoning und Aktionen beobachten und die Ausführung bei überschrittener Nutzerabsicht stoppen.
- Umgebungen härten. Sandboxes vor Hochrisiko-Evaluationen isolieren und versiegeln.
Das sind Sicherheits- und Rollout-Aussagen, keine Erlaubnis, fremde Systeme offensiv zu testen. Verwenden Sie eigenen Code, synthetische Schwachstellen, ein isoliertes Netz und ein klares Stoppsignal.
Preis und API-Status
| Abrechnung | Von Google veröffentlichter Argon-Preis |
|---|---|
| Einführung, Eingabe | $2.00 / 1M Tokens |
| Einführung, Ausgabe | $10.00 / 1M Tokens |
| Cache-Eingabe | 95% unter dem Eingabepreis, also $0.10 / 1M zum Einführungspreis |
| Nach der Einführung | $4.00 Eingabe / $20.00 Ausgabe pro 1M Tokens |
Das ist ein Anbieterpreis und kein OmniaKey-Angebot. Google hat in der Ankündigung außerdem weder den Termin für die allgemeine Verfügbarkeit noch die exakte model ID, akzeptierte Endpoints, Rate-Limit-Stufen, Batch-Bedingungen, regionale Regeln oder den finalen Cache-Vertrag festgelegt.
Setzen Sie gemini-4-argon nicht blind in einen Client. Wenn die Modellseite erscheint, prüfen Sie exakte Zeichenfolge, API-Version, SDK-Verhalten, Thinking-Steuerung, Streaming, Tool-Schemas und Output-Abrechnung gemeinsam. Für OmniaKey sind Live-Katalog und aktueller Gatewaypreis maßgeblich; am 1. Oktober war Argon nicht gelistet.
Die beiden Kataloge lassen sich prüfen, ohne einen Schlüssel in die URL zu schreiben:
set -o pipefail
curl --fail-with-body --silent --show-error \
https://generativelanguage.googleapis.com/v1beta/models \
-H "x-goog-api-key: $GEMINI_API_KEY" \
| jq -r '.models[]?.name | sub("^models/"; "") | select(. == "gemini-4-argon" or startswith("gemini-4-argon-"))'
set -o pipefail
curl --fail-with-body --silent --show-error https://api.omniakey.com/v1/models \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
| jq -r '.data[]?.id | select(. == "gemini-4-argon" or startswith("gemini-4-argon-"))'
Eine leere Ausgabe gilt nur für dieses Konto und diesen Zeitpunkt. Sie widerlegt keinen privaten Testzugang und rechtfertigt keine erfundene Produktions-Alias.
Was der frühe unabhängige Schnappschuss zeigt
Artificial Analysis führt Gemini 4 Argon (High) als Reasoning-Modell mit Text- und Bildeingabe, Textausgabe und 1M-Token-Kontext. Der Intelligence Index liegt bei 53, deutlich über dem Median von ungefähr 26; die geschätzten Kosten liegen bei $1.99 pro Index-Aufgabe. In der Index-Evaluation wurden 110M Tokens erzeugt, gegenüber einem Median von 82M.
Die Seite kennzeichnet die Ausgabegeschwindigkeit als nicht verfügbar und Providerpreise als vorläufig. Das ist ein erstes Signal für Qualität und Verbosität, keine Latenzgarantie und kein Ersatz für Googles Preisliste. Bei jedem Zitat das Prüfdatum festhalten.
So evaluieren Sie Argon nach der Freischaltung
Verwenden Sie ein festes Set statt einer Sammlung von Launch-Prompts:
- Repository-Änderung. Eine begrenzte Funktion mit deterministischen Tests und prüfbarem Diff.
- Lange Fehlersuche. Ein Modul-übergreifender Fehler mit bekanntem, aber nicht offensichtlichem Ursprung.
- Tool-Rechte. Erlaubtes Lesen, verweigertes Schreiben, falsches Argument, Abbruch und Retry.
- Wissensarbeit. Ein Finanz- oder Rechtsdokument mit Quellen und Bewertungsrubrik.
- Multimodaler Kontext. Langes Video, Diagramme oder Dokumente mit bekannter Antwort.
- Sicherheits-Sandbox. Synthetische Schwachstellen und ein Stopptest an der Grenze.
Speichern Sie je Lauf Modell-ID und Provider, Reasoning und Tools, Eingabe-, Cache-, Reasoning- und sichtbare Ausgabetokens, Zeit bis zum ersten Token, Gesamtlatenz, Retries und Fehler, Bestehen beim ersten Versuch, Korrekturminuten sowie direkte oder Gateway-Kosten.
Vergleichen Sie mit Gemini 3.8 Flash, Claude Opus 5.5 oder GPT-6 Astra bei gleichem Commit und gleichen Tools. Ein besserer Score mit mehr Retries oder Korrektur kann teurer sein; kurze Antworten sind kein Beweis für lange Aufgaben.
Fazit: einplanen, nicht automatisch migrieren
Gemini 4 Argon ist eine der wichtigeren Modellankündigungen 2026. Die Werte für DeepSWE, Unternehmensarbeit, Video und Cybersicherheit passen zum Ziel langer, toolreicher Aufgaben. Sobald die API öffnet, machen 1M Ausgabetokens und der Einführungspreis $2/$10 einen messbaren Pilot möglich.
Es bleiben harte Grenzen: Google kontrolliert die Haupttabelle, öffentliche model ID und SDK-Vertrag fehlen, der Zugang ist gestaffelt und unabhängige Geschwindigkeitsdaten sind nicht bereit. Fixieren Sie jetzt eine Basis, beantragen Sie Zugang über den dokumentierten Weg und wechseln Sie erst nach bestandenem Akzeptanzset. Den aktuellen OmniaKey-Status liefert der Modellkatalog; bis Argon breiter verfügbar ist, bleibt der Gemini-3.8-Flash-Preisguide die aktuelle Google-Kostenreferenz.
Häufige Fragen
Ist Gemini 4 Argon für alle verfügbar?
Nein. Der Start erfolgt bei vertrauenswürdigen Fairwind-Cyberabwehrern, danach bei zahlenden API-Kunden und Google-AI-Ultra-Abonnenten. Ein Termin für die allgemeine Verfügbarkeit fehlt.
Wie lautet die API-model-ID von Gemini 4 Argon?
Google hat den Produktnamen angekündigt, aber in den Startmaterialien keine stabile öffentliche ID veröffentlicht. Behandeln Sie gemini-4-argon als Suchstring, bis Modellseite und Models API eine exakte ID liefern.
Was kostet Gemini 4 Argon?
Einführung: $2 pro 1M Eingabetokens und $10 pro 1M Ausgabetokens; Cache-Eingaben sind 95% günstiger. Danach nennt Google $4 und $20. Das ist kein OmniaKey-Preis.
Hat Argon ein 1M-Token-Kontextfenster?
Google nennt ausdrücklich ein Ausgabelimit von 1M, zuvor waren es 64K. Artificial Analysis führt 1M Kontext. Vor einer Budgetierung den endgültigen Ein- und Ausgabevertrag in Googles API-Doku prüfen.
Soll ich Gemini 3.8 Flash jetzt ersetzen?
Nein, nicht automatisch. Behalten Sie die geprüfte Route als Basis und wiederholen Sie die gleichen Aufgaben, sobald Argon-Zugang, Preis und SDK-Verhalten dokumentiert sind.
Geprüfte Quellen
Offizielle Quellen:
- Google: Gemini-4-Argon-Ankündigung — Umfang, Fähigkeiten, Preis, Benchmarks und Sicherheits-Rollout
- Google Gemini API-Modellkatalog — öffentliche Modellliste
- Google Gemini API Models-Referenz — kontoabhängige Verfügbarkeit
Unabhängige und sekundäre Quellen:
- Artificial Analysis: Gemini 4 Argon (High) — früher Intelligence Index, Aufgabenpreis, Kontext und Geschwindigkeitsstatus
- 9to5Google: Gemini-4-Argon-Ankündigung — Benchmarkvergleich und Rollout
- Ars Technica: Warum Argon noch nicht allgemein nutzbar ist — Zugang und Sicherheit
- TechCrunch: Start von Gemini 4 Argon — unabhängige Startberichterstattung
Geprüft am 2026-10-01. Preise, Verfügbarkeit, model IDs und Ergebnisse können sich ändern. Vor einer Produktionsänderung Googles aktuelle Modellseite und den OmniaKey-Livekatalog lesen.