Opus 5.5 vs Sonnet 5.5
Geprüfte Ergebnisse und Gesamtkosten entscheiden.
Bei Claude Opus 5.5 gegen Sonnet 5.5 zählen geprüfte Ergebnisse und die gesamten Aufgabenkosten. Sonnet eignet sich als Ausgangspunkt für die Bewertung klar begrenzter Änderungen, reproduzierbarer Fehler und Aufgaben mit Abnahmetests. Opus lohnt einen Versuch, wenn die Ursache unklar bleibt, mehrere Systeme betroffen sind oder eine plausible Fehlentscheidung viel Nacharbeit verursachen würde. Das ist eine Bewertungsstrategie, keine allgemeingültige Rangliste.
Sonnets Standardpreise für Ein- und Ausgabe liegen bei der Hälfte, Cache-Lesezugriffe kosten jedoch gleich viel. Auch die veröffentlichten Coding-Benchmarks zeigen keinen durchgängigen Sieger.
Offizielle Quellen geprüft am 29. September 2026. Wir haben keinen eigenen direkten Modelltest durchgeführt. Die Werte stammen aus benannten Veröffentlichungen; Kostenbeispiele halten Tokenmengen konstant und sind keine gemessenen Rechnungen. OmniaKey veröffentlicht diesen Vergleich und bietet ein API-Gateway mit eigenen Preisen an.
Unterschiede bei Spezifikationen und Voreinstellungen
Opus 5.5 erschien am 22. September 2026, Sonnet 5.5 am 28. September. Der Vergleich mit Sonnet 5 behandelt weiterhin die ältere Version.
| Merkmal | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Claude-API-Modell-ID | claude-sonnet-5-5 | claude-opus-5-5 |
| Kontext / reguläre maximale Ausgabe | 1M / 128K Token | 1M / 128K Token |
| Eingabe → Ausgabe | Text und Bilder → Text | Text und Bilder → Text |
| API-Standard für Effort | high | medium |
| Denken | Adaptive; between_tools möglich | Adaptive, immer aktiv |
| Latenzkategorie des Anbieters | Fast | Moderate |
| Eingabe / Ausgabe je Million Token | $2 / $10 | $4 / $20 |
| Cache-Lesen je Million Token | $0.20 | $0.20 |
Quelle ist die offizielle Modellübersicht. Gleiche Kapazität bedeutet nicht gleiche Genauigkeit beim Nutzen langer Dokumente. Ein- und Ausgabe müssen innerhalb des Kontextbudgets bleiben. Die 300K-Ausgabe ist eine separate Betaoption der Batch API, nicht das normale synchrone Limit.
Wann lohnt sich der Aufpreis für Opus?
Sonnet lässt sich gut an kleinen, testbaren Features, gezielten Reviews und strukturierter Extraktion prüfen. Der niedrigere Preis hilft, wenn dieselbe Qualitätsanforderung zuverlässig erfüllt wird. Für schwierige Diagnosen, langwierige Untersuchungen und Migrationen mit empfindlichen Kompatibilitätsregeln ist Opus ein sinnvoller zusätzlicher Kandidat. Beide erhalten dieselben Informationen und Prüfungen; der Preis allein garantiert weder Richtigkeit noch Sicherheit.
Bei langen Dokumenten sind nachvollziehbare Quellen und fehlende Bedingungen wichtiger als die nominelle Kontextgröße. Bildaufgaben sollten an den benötigten Screenshots oder Diagrammen geprüft werden; Bildeingabe ist keine native Bilderzeugung. Unsere Strategie berücksichtigt Kosten. Anthropic empfiehlt in seinem allgemeinen Leitfaden dagegen, für die meisten Aufgaben mit Opus 5.5 zu starten. Bei höherer Gewichtung der Qualität ist das ebenfalls nachvollziehbar. Weitere Auswahlkriterien bietet der Modellleitfaden für Claude Code.
Coding-Benchmarks mit ihren Grenzen
Diese Tabelle übernimmt den direkten Vergleich aus der Sonnet-5.5-Ankündigung. OmniaKey hat die Ergebnisse nicht nachgemessen.
| Evaluation | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% (max) | 66.4% (xhigh) |
| FrontierCode 1.1 Main | 46.2% (max); 52.1% (xhigh) | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 | 1844 | 1846 |
Die System Card, Abschnitt 8.5, nennt für Terminal-Bench 66 Aufgaben mit je fünf Versuchen: 330 pro Modell. Unter der Annahme unabhängiger Versuche beträgt der Standardfehler ±2,5 Punkte bei Sonnet und ±2,6 bei Opus. Verwendet wurde Claude Code im Modus --bare, mit Schutzmechanismen und teilweise Ersatzmodellen. Der Anteil betroffener Versuche unterschied sich. Aus 4,2 Punkten Vorsprung folgt weder allgemeine Coding-Überlegenheit noch ohne weitere Daten statistische Signifikanz.
FrontierCode zeigt, warum mehr Denken nicht automatisch hilft: Sonnet erreicht bei max weniger als bei xhigh. Laut Fußnote führte ein häufiger genutzter Review-Ablauf in untersuchten Fällen zu einem Timeout oder Änderungen außerhalb des Auftrags.
GDPval-Werte sind Punktzahlen, keine Prozente. Für Sonnets GDPval-AA und AA-Briefcase wurde außerdem ein inzwischen behobener Fehler bei strukturierten Ausgaben in einer Vorabbereitstellung offengelegt. Einzelheiten stehen in den Besprechungen zu Sonnet 5.5 und Opus 5.5.
API-Preise einschließlich Cache
Die offizielle Preisliste nennt folgende globale Standardpreise der direkten API in USD je Million Token. Steuern, Tools, regionale Optionen und Gebühren anderer Plattformen kommen gegebenenfalls hinzu.
| Abrechnung | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Ungecachte Eingabe | $2 | $4 |
| Berechnete Ausgabe | $10 | $20 |
| Cache-Schreiben, 5 Minuten | $2.50 | $5 |
| Cache-Schreiben, 1 Stunde | $4 | $8 |
| Cache-Lesen | $0.20 | $0.20 |
Zur berechneten Ausgabe gehört auch das Denken. Beide Modelle können Prompts ab 512 Token cachen; einen Treffer belegen erst die Usage-Felder. Diese Rechenbeispiele nutzen feste Mengen, gegebenenfalls über mehrere Requests. Jeder Request muss seine Limits einhalten.
| Gleiche Tokenmenge | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 100K ungecachte Eingabe + 20K Ausgabe | $0.40 | $0.80 |
| Zusätzlich 800K erster Cache-Schreibvorgang, 5 Minuten | $2.40 | $4.80 |
| 100K ungecacht + 800K gültiges Cache-Lesen + 20K Ausgabe | $0.56 | $0.96 |
Die letzte Zeile ergibt für Sonnet 0.1 × 2 + 0.8 × 0.20 + 0.02 × 10 = $0.56, für Opus 0.1 × 4 + 0.8 × 0.20 + 0.02 × 20 = $0.96. Der Faktor beim Lesen ist etwa 1,71; das vorherige Schreiben kostet zusätzlich. Geschriebene Cache-Token dürfen nicht noch einmal als ungecachte Eingabe zählen.
In echten Aufgaben unterscheiden sich Tokenverbrauch und Wiederholungen. Aussagekräftiger sind sämtliche Gebühren einschließlich Fehlschlägen geteilt durch akzeptierte Ergebnisse. Tatsächlich gemessene menschliche Korrekturzeit wird separat erfasst und nur mit offengelegtem Stundensatz umgerechnet.
Geschwindigkeit und Effort richtig vergleichen
Sonnets Angaben „30%+ schnellere Ausgabe“ und „bis zu 30% geringere Aufgabenkosten“ beziehen sich auf Sonnet 5, nicht Opus 5.5. Die API-Tokenpreise wurden nicht um 30% gesenkt. Opus 5.5s genannter typischer Kostenvorteil von etwa 40% bezieht sich wiederum auf Opus 5.
Sonnet startet in der API mit high, in Claude Code und den Apps mit medium; Opus API mit medium. Client und Effort gehören in jeden Vergleich. Gleiche Namen bedeuten kein gleiches Rechenbudget. Zeit bis zur ersten brauchbaren Ausgabe und Zeit bis zum geprüften Abschluss sind getrennte Messgrößen.
Vor dem Modellwechsel
Die Migrationsleitfäden für Sonnet und Opus sind Teil der Entscheidung. Sonnet kann mit between_tools bei high oder darunter das anfängliche Denken auslassen, aber nicht jede Denkphase abschalten. Opus behält adaptive thinking bei.
Beide lehnen erzwungenes tool_choice mit any oder tool ab. Strenge Argumentvalidierung erzwingt keinen Toolaufruf; der Plattformumfang ist separat zu prüfen. Thinking blocks haben modell-, konto- und verlaufsabhängige Erhaltungsregeln. Für einen isolierten Vergleich wird eine neue Unterhaltung begonnen. Fortschritt zwischen Tools kann in standardmäßig ausgeblendeten thinking blocks stehen: Blocktypen und Streaming prüfen, statt Stille als Stillstand zu deuten. Ein ID-Wechsel belegt keine vollständige Gateway-Kompatibilität.
Eigene Aufgaben nachvollziehbar testen
Ein vorgeschlagenes Design nutzt je sechs Aufgaben aus begrenzter Implementierung, schwieriger Fehlersuche/Refactoring, Toolabläufen und Dokument-/Bildarbeit. 24 Aufgaben × 2 Modelle × 3 Wiederholungen sind 144 Aufgabenläufe, möglicherweise deutlich mehr API-Aufrufe. Dies ist kein bereits durchgeführter Test.
Commit, Prompts, Tools, Region, Rechte, Zeit-/Schrittlimits und Abnahmetests werden vorher fixiert. Umgebung und Unterhaltung werden zurückgesetzt, die Modellreihenfolge wechselt. Ein expliziter medium-Vergleich bleibt getrennt von Standard- oder höheren Einstellungen. Fehler, Ablehnungen, Wiederholungen, sichtbare Fallbacks, Token, Gebühren, Dauer und echte Korrekturen werden protokolliert. Verdeckte Tests und Quellenkontrolle ersetzen die Selbstauskunft „fertig“. Drei Wiederholungen erlauben keine präzise P95-Schätzung je Aufgabe; ohne Erfolg gibt es keinen Erfolgspreis von null.
Häufige Fragen
Ist Sonnet 5.5 beim Programmieren besser?
Im veröffentlichten Terminal-Bench liegt Sonnet vorn, in den anderen genannten Coding-Evaluationen Opus. Einstellungen und Unsicherheit verhindern eine pauschale Aussage.
Kostet Sonnet insgesamt halb so viel?
Die normalen Ein-/Ausgaberaten sind halbiert, Cache-Lesen nicht. Verbrauch, Wiederholungen, Tools und Nacharbeit bestimmen die Gesamtkosten.
Welches Modell gehört in Claude Code?
Sonnet für klar begrenzte Arbeit und Opus für schwierige Untersuchungen sind sinnvolle Prüfkandidaten. Qualität zuerst kann auch Opus als Ausgangspunkt bedeuten. Abo und API sind getrennt; siehe Claude-Code-Preise.
Bietet Opus mehr Kontext?
Beide nennen 1M Kontext und regulär maximal 128K Ausgabe. Entscheidend ist die Nutzung der Informationen.
Aktuelle Angebote und Quellen
Die Seiten zu Sonnet 5.5, Opus 5.5 und der Modellkatalog zeigen OmniaKeys aktuelle Routen und Preise. Direkte API-Rechenbeispiele sind keine Gateway-Angebote oder geprüften Live-Aufrufe. Die verlinkten Anthropic-Originalquellen sind englischsprachig.