GPT-6 Sol & Claude Opus 5.5 kini tersediaGPT-6 Sol: setengah harga 5.6 Sol
blog
Perbandingan

Opus 5.5 vs Sonnet 5.5

Pilih berdasarkan hasil terverifikasi dan total biaya.

11 menit bacaOmniaKey
Claude Opus 5.5Claude Sonnet 5.5PerbandinganCodingHarga API

Claude Opus 5.5 vs Sonnet 5.5 sebaiknya dinilai dari hasil yang lolos pemeriksaan dan total biaya tugas. Mulailah mengevaluasi Sonnet untuk perubahan yang jelas, bug yang dapat direproduksi, dan fitur dengan tes penerimaan. Pertimbangkan Opus saat penyebab masalah belum jelas, perubahan melibatkan beberapa sistem, atau solusi yang tampak benar bisa menimbulkan perbaikan mahal. Ini strategi evaluasi, bukan peringkat untuk semua pekerjaan.

Tarif input dan output standar Sonnet separuh Opus, tetapi pembacaan cache sama harganya. Hasil benchmark coding yang diterbitkan pun tidak menunjukkan satu pemenang di semua pengujian.

Sumber resmi diperiksa pada 29 September 2026. Kami belum melakukan uji perbandingan sendiri. Skor berasal dari sumber yang disebutkan, sedangkan biaya dihitung dengan jumlah token tetap, bukan tagihan tugas terukur. OmniaKey menerbitkan panduan ini dan menyediakan gateway API dengan tarif terpisah dari API langsung Anthropic.

Perbedaan Opus 5.5 dan Sonnet 5.5

Opus 5.5 dirilis pada 22 September 2026 dan Sonnet 5.5 pada 28 September. Perbandingan dengan Sonnet 5 tetap membahas versi sebelumnya.

SpesifikasiSonnet 5.5Opus 5.5
ID Claude APIclaude-sonnet-5-5claude-opus-5-5
Konteks / output maksimum standar1M / 128K token1M / 128K token
Input → outputTeks dan gambar → teksTeks dan gambar → teks
Effort bawaan APIhighmedium
PenalaranAdaptive; mendukung between_toolsAdaptive, selalu aktif
Kategori latensi vendorFastModerate
Input / output per juta token$2 / $10$4 / $20
Baca cache per juta token$0.20$0.20

Sumber: ringkasan model resmi. Kapasitas sama tidak menjamin akurasi pengambilan informasi sama. Input dan output tetap harus mematuhi anggaran konteks. Output 300K adalah opsi beta Batch API, bukan batas panggilan sinkron biasa.

Pilih yang mana untuk coding?

Sonnet dapat diuji pada fitur kecil, review terarah, dan ekstraksi terstruktur yang mudah diperiksa. Tarif rendah bermanfaat jika hasil memenuhi standar yang sama. Opus layak diuji pada kegagalan antarlayanan yang ambigu, migrasi dengan aturan kompatibilitas rumit, dan investigasi panjang. Berikan bahan serta tes yang sama dan lihat apakah kebutuhan perbaikan berkurang. Harga lebih tinggi tidak menjamin ketepatan atau keamanan.

Untuk dokumen panjang, periksa rujukan dan syarat yang terlewat. Untuk visual, gunakan screenshot atau grafik yang benar-benar dibutuhkan; input gambar tidak berarti menghasilkan gambar secara native. Strategi kami mempertimbangkan biaya. Panduan umum Anthropic menyarankan memulai sebagian besar pekerjaan dengan Opus 5.5, yang juga masuk akal jika kualitas menjadi prioritas. Lihat panduan model Claude Code untuk pilihan yang lebih luas.

Benchmark coding dan batas penafsirannya

Angka berikut berasal dari tabel perbandingan pada pengumuman Sonnet 5.5. Kami tidak menjalankan ulang pengujiannya.

EvaluasiSonnet 5.5Opus 5.5
Terminal-Bench 4.070.6% (max)66.4% (xhigh)
FrontierCode 1.1 Main46.2% (max); 52.1% (xhigh)54.4%
CursorBench 4.055.5%57.8%
GDPval-AA v2.118441846

System card, §8.5, menyebut 66 tugas Terminal-Bench, masing-masing diulang lima kali: 330 percobaan per model. Dengan asumsi percobaan independen, galat standar adalah ±2,5 poin untuk Sonnet dan ±2,6 untuk Opus. Claude Code memakai mode --bare, dengan pengamanan produksi dan model cadangan untuk sebagian permintaan. Proporsi percobaan yang terdampak berbeda. Selisih 4,2 poin tidak membuktikan keunggulan pada seluruh pekerjaan coding atau signifikansi statistik tanpa data tambahan.

Pada FrontierCode, Sonnet di max justru di bawah xhigh. Catatan pengumuman menjelaskan bahwa alur review yang lebih sering pada beberapa kasus yang dianalisis menyebabkan timeout atau perubahan di luar cakupan. Lebih banyak penalaran tidak selalu memperbaiki hasil.

GDPval adalah skor, bukan persentase. Hasil Sonnet untuk GDPval-AA dan AA-Briefcase juga perlu dibaca bersama catatan bug output terstruktur pada deployment prarilis yang kemudian diperbaiki. Detail versi ada di ulasan Sonnet 5.5 dan ulasan Opus 5.5.

Harga API dan biaya cache

Dokumentasi harga memuat tarif global standar API langsung dalam USD per juta token. Pajak, alat, opsi regional, dan biaya platform lain terpisah. Ini bukan harga tetap dalam rupiah.

KomponenSonnet 5.5Opus 5.5
Input tanpa cache$2$4
Output tertagih$10$20
Tulis cache 5 menit$2.50$5
Tulis cache 1 jam$4$8
Baca cache$0.20$0.20

Output tertagih mencakup penalaran. Minimum prompt yang bisa disimpan ke cache adalah 512 token pada kedua model, tetapi cache hit harus dibuktikan melalui data usage. Contoh berikut menetapkan jumlah token yang sama; jumlah bisa terakumulasi dari beberapa permintaan, dengan batas tiap permintaan tetap berlaku.

Beban token identikSonnet 5.5Opus 5.5
Input tanpa cache 100K + output 20K$0.40$0.80
Di atas + penulisan cache awal 800K, 5 menit$2.40$4.80
Input tanpa cache 100K + pembacaan cache valid 800K + output 20K$0.56$0.96

Baris terakhir menghitung Sonnet sebagai 0.1 × 2 + 0.8 × 0.20 + 0.02 × 10 = $0.56 dan Opus sebagai 0.1 × 4 + 0.8 × 0.20 + 0.02 × 20 = $0.96. Rasionya sekitar 1,71 pada tahap pembacaan; biaya penulisan sebelumnya terpisah. Jangan menghitung token penulisan lagi sebagai input tanpa cache.

Tugas nyata memakai token dan percobaan ulang yang berbeda. Bagi seluruh biaya, termasuk kegagalan, dengan jumlah hasil yang diterima. Ukur waktu perbaikan manusia secara terpisah sebelum mengonversinya memakai tarif per jam yang dinyatakan.

Kecepatan dan pengaturan penalaran

Klaim Sonnet 5.5 berupa output 30%+ lebih cepat dan biaya per tugas hingga 30% lebih rendah membandingkannya dengan Sonnet 5. Bukan dengan Opus 5.5 dan bukan pemotongan tarif API 30%. Penghematan tugas tipikal sekitar 40% yang diumumkan untuk Opus 5.5 membandingkannya dengan Opus 5.

Sonnet memakai high secara bawaan pada API, tetapi medium pada Claude Code dan aplikasi. Opus API memakai medium. Sebutkan klien dan effort: nama yang sama tidak menjamin anggaran komputasi sama. Ukur waktu sampai output berguna pertama dan sampai tugas selesai diverifikasi secara terpisah.

Periksa integrasi sebelum beralih

Baca panduan migrasi Sonnet dan Opus. Sonnet mendukung between_tools pada high atau di bawahnya untuk meniadakan penalaran awal, bukan seluruh penalaran. Opus tetap memakai adaptive thinking.

Keduanya menolak tool_choice paksa bertipe any atau tool. Validasi argumen yang ketat tidak memaksa panggilan alat; dukungan platform perlu diperiksa. Thinking blocks memiliki aturan pelestarian terkait model, akun, dan percakapan. Mulai percakapan baru untuk perbandingan. Kemajuan di antara panggilan alat dapat muncul dalam thinking blocks yang disembunyikan secara bawaan: periksa tipe blok dan streaming sebelum menganggap agen macet. Mengganti ID tidak membuktikan semua gateway kompatibel.

Cara menguji dengan pekerjaan Anda

Rancangan yang dapat diulang: enam tugas dari masing-masing empat kelompok, yaitu implementasi terbatas, debugging/refactoring sulit, alur alat, serta dokumen/visual. 24 tugas × 2 model × 3 pengulangan menghasilkan 144 eksekusi tugas, mungkin jauh lebih banyak permintaan API. Ini usulan, bukan eksperimen yang kami lakukan.

Tetapkan commit, prompt, alat, wilayah, izin, batas waktu/langkah, dan tes sebelum melihat hasil. Reset ruang kerja dan percakapan, lalu selang-seling urutan model. Pisahkan pengujian eksplisit medium dari bawaan atau effort lebih tinggi. Catat kesalahan, penolakan, percobaan ulang, fallback yang teramati, token, biaya, waktu, dan perbaikan manusia yang benar-benar dilakukan. Gunakan tes tersembunyi untuk kode dan sumber untuk dokumen. Tiga pengulangan tidak cukup untuk P95 yang presisi per tugas; jika tidak ada yang lolos, jangan tulis biaya per keberhasilan nol.

Pertanyaan umum

Apakah Sonnet 5.5 lebih baik untuk coding?

Sonnet lebih tinggi pada Terminal-Bench yang dipublikasikan, sedangkan Opus unggul pada evaluasi coding lain di tabel. Pengaturan dan ketidakpastian perlu dipertahankan.

Apakah biaya tugas selalu separuhnya?

Hanya tarif standar input tanpa cache dan output yang separuh. Pembacaan cache sama; penggunaan, percobaan, alat, serta koreksi mengubah tagihan.

Model mana untuk Claude Code?

Evaluasi Sonnet untuk tugas jelas dan Opus untuk investigasi sulit, atau mulai dengan Opus bila kualitas prioritas utama. Langganan dan API terpisah; lihat harga Claude Code.

Apakah konteks Opus lebih besar?

Keduanya mencantumkan konteks 1M dan output maksimum standar 128K. Uji bagaimana informasi dimanfaatkan.

Penawaran terkini dan sumber

Halaman Sonnet 5.5, Opus 5.5, dan katalog model menunjukkan rute dan harga OmniaKey. Perhitungan API langsung bukan penawaran harga gateway atau pengujian panggilan nyata. Sumber resmi Anthropic yang ditautkan berbahasa Inggris.