Model Jev kini terintegrasi dan sudah tersedia · Selamat menggunakan
blog
Pengendalian biaya

Harga API Gemini 3.8 Flash dan biaya tugas agen

Google Standard saat ini mengenakan $0.75 per satu juta token input dan $3.75 untuk output; OmniaKey mencantumkan $0.45 dan $2.25, tetapi biaya hasil yang lolos juga ditentukan oleh pemikiran dan percobaan ulang.

11 menit bacaOmniaKey
Gemini 3.8 Flashharga APIbiaya agentoken pemikirankontrol biaya

Harga API Gemini 3.8 Flash pada API Standard berbayar Google adalah $0.75 per satu juta token input dan $3.75 per satu juta token output hingga 31 Desember 2026. Google mencantumkan $1.50 dan $7.50 mulai 1 Januari 2027. Halaman model OmniaKey saat ini menampilkan penawaran gateway terpisah: $0.45 untuk input, $2.25 untuk output, dan $0.045 untuk input cache.

Angka dan tanggal jalur langsung berasal dari tabel harga Gemini API Google saat ini.

Tarif token saja belum cukup untuk menganggarkan agen. Angka yang berguna adalah total belanja semua percobaan berhasil dan gagal dibagi jumlah tugas yang lolos pemeriksaan penerimaan. Dua panggilan murah yang gagal dapat lebih mahal daripada satu panggilan lebih mahal yang langsung lolos.

Diperiksa pada 20 September 2026. Harga, tanggal, batas token, level pemikiran, cache, dan perilaku Batch diverifikasi dari dokumentasi Google terbaru. Angka OmniaKey berasal dari katalog live dan merupakan penawaran gateway yang terpisah. Ini analisis biaya berbasis riset; kami tidak menjalankan benchmark sendiri atau pengujian produksi berbayar dan tidak mengklaim tingkat keberhasilan model.

Ringkasan harga Gemini 3.8 Flash

Semua angka dalam dolar AS per satu juta token. “Input cache” adalah tarif baca yang lebih rendah, bukan biaya penyimpanan cache Google yang terpisah.

Jalur penagihanInputInput cacheOutput termasuk pemikiranCakupan
Google Standard sampai 31-12-2026$0.75$0.075$3.75Gemini API berbayar secara langsung
Google Batch atau Flex sampai 31-12-2026$0.375$0.0375$1.875Pekerjaan langsung yang dapat menunggu atau memakai kapasitas fleksibel
Google Priority sampai 31-12-2026$1.35$0.135$6.75Pemrosesan langsung prioritas
Google Standard mulai 01-01-2027$1.50$0.15$7.50Tarif Standard langsung yang dijadwalkan
Katalog OmniaKey saat ini$0.45$0.045$2.25Penawaran Standard gateway saat ini

Penawaran OmniaKey saat ini 40% di bawah tarif Standard Google saat ini. Itu bukan janji bahwa harganya akan selalu 60% dari Google setelah 1 Januari. Keduanya mengelola katalog masing-masing. Periksa kembali tabel harga live sebelum menyetujui anggaran produksi.

Google Batch dan Flex saat ini lebih rendah daripada OmniaKey Standard, tetapi permukaannya berbeda. Batch bersifat asinkron, memiliki target penyelesaian 24 jam, dan didokumentasikan Google untuk generateContent. Jangan menganggap Batch, Flex, atau Priority Google tersedia pada gateway tanpa dokumentasi jalur tersebut.

Penyimpanan cache, grounding, alat eksternal, browser, basis data, infrastruktur, pajak, dan tinjauan manusia dapat menambah biaya di luar tabel token.

Rumus biaya per tugas agen yang lolos

Mulai dari jalur yang benar-benar digunakan:

text
biaya model per percobaan
  = juta input x tarif input
  + juta input cache x tarif cache
  + juta output x tarif output

biaya total per percobaan
  = model + alat + grounding + infrastruktur + tinjauan

biaya teramati per tugas yang lolos
  = belanja semua percobaan berhasil dan gagal
  / jumlah tugas yang lolos pemeriksaan

Untuk perkiraan saat tiap percobaan berbiaya hampir sama dan peluang lolosnya independen:

text
biaya harapan per tugas yang lolos = biaya percobaan / tingkat lolos

Rumus terakhir adalah pendekatan. Kegagalan dapat berhenti cepat, berputar lebih lama, memanggil alat lain, atau memerlukan perbaikan manusia. Di produksi, gunakan seluruh belanja yang teramati sebagai pembilang.

Tentukan “lolos” sebelum pengujian: patch melewati unit test, JSON valid terhadap schema, hasil ekstraksi cocok dengan label yang ditinjau, atau jawaban memenuhi rubrik manusia. HTTP 200 bukan pemeriksaan kualitas.

Contoh: 20K input, 5K output, tingkat lolos 70%

Anggap satu percobaan lengkap memakai 20,000 token input tanpa cache dan 5,000 token output. Output mencakup token pemikiran yang ditagih. Alat, penyimpanan, pajak, dan tinjauan dikecualikan agar perhitungan dapat direproduksi.

Jalur penagihanBiaya per percobaanBiaya harapan per tugas lolos pada 70%
Google Standard selama 20260.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard mulai 20270.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex selama 20260.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
Katalog OmniaKey saat ini0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

Dengan jumlah token tetap, Standard langsung menjadi dua kali lipat pada 1 Januari 2027. Baris OmniaKey hanya memakai penawaran saat ini dan tidak memprediksi harga gateway mendatang. Batch/Flex menunjukkan mengapa mode konsumsi harus ikut dibandingkan: pekerjaan langsung yang dapat menunggu bisa memiliki tagihan token lebih rendah daripada permintaan gateway interaktif.

Pada Google Standard saat ini, percobaan $0.03375 menjadi $0.0375 per tugas lolos pada 90%, $0.0482 pada 70%, dan $0.0675 pada 50%. Meningkatkan tingkat lolos dapat lebih berarti daripada memangkas prompt kecil.

Token pemikiran dapat mendominasi biaya output

Google mendukung low, medium, dan high untuk gemini-3.8-flash; default-nya medium. minimal tidak didukung dan menghasilkan error. Harga output mencakup jawaban yang terlihat serta token pemikiran.

Dokumentasi model mencantumkan batas input 1,048,576 token dan output 65,536 token. Itu batas kapasitas, bukan kuota gratis; token yang ditagih tetap masuk ke biaya tugas.

Ada tiga dampak penting:

  1. Jawaban terlihat singkat dapat memiliki biaya output tinggi setelah penalaran panjang.
  2. max_output_tokens yang terlalu kecil bisa menghentikan penalaran, mengembalikan hasil tidak lengkap atau kosong, sementara token pemikiran yang sudah dibuat tetap ditagih.
  3. high hanya ekonomis bila peningkatan tingkat lolos menutup tambahan output dan latensi.

Uji low, medium, dan high pada kumpulan tugas yang sama. Kunci prompt, alat, izin, kebijakan retry, dan perintah penerimaan. Pilih level termurah yang mencapai tingkat lolos yang dibutuhkan, bukan sekadar level pertama yang menghasilkan teks.

Satukan cache, retry, dan alat dalam anggaran

Google mendokumentasikan cache implisit Gemini 3.8 Flash dengan prefix minimum 4,096 token. Jika klien mempertahankan prefix, letakkan instruksi stabil dan schema alat sebelum data tugas yang berubah, lalu periksa penggunaan cache yang dilaporkan penyedia. Teks yang mirip bukan bukti cache hit.

Catat alasan retry: error transport, argumen alat tidak valid, pemeriksaan penerimaan gagal, dan revisi yang diminta manusia adalah kategori berbeda. Retry tanpa batas diam-diam memperbesar pembilang.

Untuk agen yang memakai alat, simpan setidaknya:

  • model ID yang diminta dan dikembalikan;
  • input, cache, token pemikiran, dan output terlihat saat protokol menyediakannya;
  • nama alat, biaya alat, dan jumlah putaran;
  • latensi, kategori error, dan jumlah retry;
  • hasil penerimaan serta pemeriksaan tepatnya;
  • jumlah akhir yang ditagih pada jalur tersebut.

Protokol Gemini native dan kompatibel OpenAI dapat memakai nama field usage berbeda. Cocokkan respons jalur nyata dengan dasbor penggunaan OmniaKey, jangan mengasumsikan schema penyedia lain.

Memilih Google langsung atau OmniaKey

KebutuhanMulai denganAlasan
Tarif publik terendah untuk batch yang dapat menungguGoogle BatchBatch langsung saat ini 50% dari Standard dan asinkron
Grounding atau kontrol khusus GoogleGoogle langsungKontrak langsung mendokumentasikan fitur tersebut
Satu key dan jalur kompatibel OpenAIOmniaKeyKatalog menawarkan gemini-3.8-flash dengan penawaran gateway terpisah
Agen interaktif dengan target latensi ketatUkur keduanyaHarga token tidak membuktikan antrean, keandalan, atau tingkat lolos
Produksi setelah 01-01-2027Periksa ulang keduanyaPerubahan Google dijadwalkan; harga gateway mendatang belum diketahui

Ini bukan peringkat universal. Kebijakan data, wilayah, rate limit, dukungan, transparansi routing, dan protokol klien dapat mengubah keputusan.

Memanggil Gemini 3.8 Flash melalui OmniaKey

Pastikan gemini-3.8-flash ada di katalog model live, buat kredensial terbatas di API Keys, lalu panggil endpoint kompatibel OpenAI:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

Panduan cepat API berbahasa Inggris menjelaskan autentikasi dan base URL. Simpan key asli di environment variable, bukan di source, prompt, log benchmark, atau tangkapan layar.

Pertanyaan umum

Berapa harga API Gemini 3.8 Flash?

Google Standard adalah $0.75 per satu juta token input dan $3.75 untuk output hingga akhir 2026, lalu $1.50 dan $7.50 mulai 1 Januari 2027. OmniaKey saat ini mencantumkan tarif terpisah $0.45 dan $2.25.

Apakah token pemikiran ditagih sebagai output?

Ya. Google memasukkannya dalam harga output. Gunakan data usage penyedia, bukan panjang jawaban yang terlihat.

Apakah OmniaKey selalu lebih murah daripada Google langsung?

Tidak. OmniaKey Standard saat ini di bawah Google Standard, tetapi Google Batch dan Flex lebih rendah untuk beban yang memenuhi syarat. Ketersediaan, latensi, protokol, dan harga masa depan adalah keputusan terpisah.

Mengapa biaya dibagi tingkat lolos?

Kegagalan menghabiskan uang tanpa menghasilkan tugas yang diterima. Jika biaya percobaan stabil, membaginya dengan probabilitas memberi perkiraan biaya satu keberhasilan. Setelah ada data produksi, bagi total belanja dengan tugas yang lolos.

Level pemikiran mana yang sebaiknya dipakai agen?

Mulai dengan low untuk pekerjaan terbatas dan dapat diperiksa, lalu uji medium dan high jika kegagalan mahal. Gemini 3.8 Flash tidak mendukung minimal. Level yang tepat adalah yang termurah dan tetap lolos pemeriksaan yang sama secara andal.

Sumber primer

Sumber dan perhitungan diperiksa pada 20 September 2026. Harga, batas, dan ketersediaan jalur dapat berubah. Periksa sumber primer dan katalog live OmniaKey sebelum menetapkan belanja produksi.