Jev modeli artık entegre ve kullanımda · Hoş geldiniz
Blog
Maliyet kontrolü

Gemini 3.8 Flash API Fiyatlandırması ve Agent Maliyeti

Google Standard şu anda milyon giriş tokenı başına $0.75, çıkış için $3.75 alıyor; OmniaKey $0.45 ve $2.25 listeliyor, ancak kabul edilen sonuç maliyetini tekrarlar ve düşünme belirliyor.

11 dk okumaOmniaKey
Gemini 3.8 FlashAPI fiyatlandırmasıagent maliyetidüşünme tokenlarımaliyet kontrolü

Gemini 3.8 Flash API fiyatlandırması, Google'ın ücretli Standard API'sinde 31 Aralık 2026'ya kadar milyon giriş tokenı başına $0.75, milyon çıkış tokenı başına $3.75 şeklindedir. Google, 1 Ocak 2027'den itibaren $1.50 ve $7.50 listeliyor. OmniaKey model sayfasındaki bağımsız güncel gateway teklifi giriş için $0.45, çıkış için $2.25 ve önbellek okuması için $0.045'tir.

Doğrudan ücretler ve tarihler Google'ın güncel Gemini API fiyat tablosundan alınmıştır.

Token tarifesi agent bütçesinin yalnızca başlangıcıdır. Asıl ölçü başarılı ve başarısız tüm denemelerin toplam harcamasının kabul testini geçen görev sayısına bölünmesidir. İki ucuz başarısız çağrı, ilk seferde geçen daha pahalı bir çağrıdan fazla tutabilir.

20 Eylül 2026 tarihinde doğrulandı. Google fiyatları, tarihler, token sınırları, düşünme seviyeleri, önbellek ve Batch davranışı güncel resmi belgelerden kontrol edildi. OmniaKey rakamları canlı katalogdan gelir ve ayrı bir gateway teklifidir. Bu, kaynaklara dayalı maliyet analizidir; kendi benchmark testimizi veya ücretli üretim testini çalıştırmadık ve model için bir başarı oranı iddia etmiyoruz.

Gemini 3.8 Flash API ücretleri

Aşağıdaki tutarlar milyon token başına ABD dolarıdır. “Önbellekli giriş” indirimli okuma ücretidir; Google'ın ayrıca fiyatlandırdığı önbellek depolamasını içermez.

Faturalandırma yoluGirişÖnbellekli girişDüşünme dahil çıkışKapsam
Google Standard, 31.12.2026'ya kadar$0.75$0.075$3.75Doğrudan ücretli Gemini API
Google Batch veya Flex, 31.12.2026'ya kadar$0.375$0.0375$1.875Gecikmeye ya da esnek kapasiteye uygun doğrudan işler
Google Priority, 31.12.2026'ya kadar$1.35$0.135$6.75Doğrudan öncelikli işleme
Google Standard, 01.01.2027'den itibaren$1.50$0.15$7.50Planlanan doğrudan Standard tarifesi
Güncel OmniaKey kataloğu$0.45$0.045$2.25Gateway'in güncel Standard teklifi

OmniaKey'in güncel teklifi Google'ın bugünkü Standard token ücretinden %40 düşüktür. Bu, 1 Ocak'tan sonra da Google fiyatının %60'ında kalacağına dair bir taahhüt değildir. İki katalog bağımsız yönetilir. Üretim bütçesini onaylamadan önce canlı fiyat tablosunu yeniden kontrol edin.

Google Batch ve Flex bugün OmniaKey Standard'dan daha düşük listelenir, ancak aynı ürün değildir. Batch eşzamansızdır, hedef tamamlanma süresi 24 saattir ve Google bunu generateContent için belgeler. Bir gateway açıkça sunmuyorsa Google Batch, Flex veya Priority modlarının orada bulunduğunu varsaymayın.

Önbellek depolama, grounding, dış araçlar, tarayıcı, veritabanı, barındırma, vergi ve insan incelemesi token tablosunun dışında ek maliyet oluşturabilir.

Kabul edilen agent görevi başına maliyet formülü

Model adından önce gerçek rotayı hesaplayın:

text
deneme başına model maliyeti
  = giriş milyonları x giriş ücreti
  + önbellekli giriş milyonları x önbellek ücreti
  + çıkış milyonları x çıkış ücreti

deneme başına toplam maliyet
  = model + araçlar + grounding + altyapı + inceleme

kabul edilen görev başına gözlenen maliyet
  = başarılı ve başarısız tüm denemelerin harcaması
  / kabul testini geçen görev sayısı

Her denemenin maliyeti yaklaşık aynı ve geçme olasılığı bağımsızsa tahmin:

text
kabul edilen görev başına beklenen maliyet = deneme maliyeti / geçme oranı

Bu son formül yaklaşımdır. Başarısız çalışma erken bitebilir, daha uzun dönebilir, başka araçlar çağırabilir veya insan düzeltmesi isteyebilir. Üretimde paya gözlenen tüm harcamayı koyun.

“Kabul” koşulunu testten önce belirleyin: bir patch'in testleri geçmesi, JSON'un schema doğrulaması, çıkarımın incelenmiş etiketlerle eşleşmesi ya da yanıtın insan rubriğini geçmesi. HTTP 200 bir kalite kapısı değildir.

Örnek: 20K giriş, 5K çıkış, %70 geçme oranı

Her tam denemenin 20,000 önbelleksiz giriş ve 5,000 çıkış tokenı kullandığını varsayalım. Çıkışa sağlayıcının faturaladığı düşünme tokenları dahildir. Hesabı tekrarlanabilir tutmak için araçları, depolamayı, vergiyi ve insan incelemesini dışarıda bırakıyoruz.

Faturalandırma yoluDeneme başına maliyet%70 geçmede kabul edilen görev maliyeti
Google Standard, 2026 sonuna kadar0.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard, 2027'den itibaren0.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex, 2026 sonuna kadar0.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
Güncel OmniaKey kataloğu0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

Aynı token kullanımıyla doğrudan Standard maliyeti 1 Ocak 2027'de iki katına çıkar. OmniaKey satırı yalnızca bugünkü katalog teklifidir; gelecekteki gateway fiyatını öngörmez. Batch/Flex satırı tüketim modunun önemini gösterir: gecikmeli doğrudan iş, etkileşimli gateway çağrısından daha düşük token faturası çıkarabilir.

Bugünkü Google Standard'da $0.03375'lik aynı deneme, %90 geçmede kabul edilen görev başına $0.0375, %70'te $0.0482 ve %50'de $0.0675 tutar. Geçme oranını artırmak küçük bir prompt'u kısaltmaktan daha değerli olabilir.

Düşünme tokenları çıkış faturasını büyütebilir

Google, gemini-3.8-flash için low, medium ve high seviyelerini destekler; varsayılan mediumdur. minimal desteklenmez ve hata döndürür. Çıkış fiyatına görünür yanıt ile düşünme tokenları birlikte girer.

Resmi model sayfası 1,048,576 giriş ve 65,536 çıkış tokenı sınırı belirtir. Bunlar kapasite tavanıdır, ücretsiz kullanım değildir; faturalandırılan tokenlar görev maliyetine eklenir.

Üç sonuç önemlidir:

  1. Görünür yanıt kısa olsa bile uzun düşünme yüksek çıkış maliyeti yaratabilir.
  2. Düşük max_output_tokens, düşünme sırasında yanıtı kesip eksik veya boş sonuç üretirken oluşmuş düşünme tokenlarını yine faturalandırabilir.
  3. high, ancak geçme oranındaki artış ek çıkış ve gecikmeyi karşılıyorsa ekonomiktir.

Aynı görev kümesinde low, medium ve high deneyin. Prompt, araç, izin, tekrar politikası ve kabul komutlarını sabit tutun. Yalnızca metin döndüren değil, gerekli geçme oranına ulaşan en düşük seviyeyi seçin.

Önbellek, tekrar ve araçları birlikte ölçün

Google, Gemini 3.8 Flash örtük önbelleği için 4,096 tokenlık en düşük uygun önek belirtir. İstemci öneki koruyabiliyorsa sabit talimatları ve araç schemalarını değişken görev verisinin önüne koyun; ardından sağlayıcının bildirdiği önbellek kullanımını kontrol edin. Benzer metin, önbellek isabeti kanıtı değildir.

Tekrarları nedenle etiketleyin: aktarım hatası, geçersiz araç argümanı, kabul testi başarısızlığı ve insanın istediği revizyon farklıdır. Sınırsız tekrar, payı sessizce büyütür.

Araç kullanan agent için en az şunları kaydedin:

  • istenen ve dönen model ID'si;
  • protokol sunuyorsa giriş, önbellek, düşünme tokenları ve görünür çıkış;
  • araç adları, araç ücretleri ve tur sayısı;
  • gecikme, hata türü ve tekrar sayısı;
  • kabul sonucu ve sonucu üreten tam kontrol;
  • rotanın nihai faturası.

Gemini native ve OpenAI uyumlu protokoller farklı usage alan adları kullanabilir. Başka bir sağlayıcının schemasını varsaymak yerine gerçek rota alanlarını OmniaKey kullanım paneliyle uzlaştırın.

Google direct mi, OmniaKey mi?

İhtiyaçÖnce bunu deneyinNeden
Gecikmeye uygun toplu işte en düşük listelenen fiyatGoogle BatchDoğrudan Batch şu anda Standard'ın %50'sidir ve eşzamansızdır
Google'a özgü grounding veya tüketim kontrolüGoogle directBu yüzeyleri doğrudan sözleşme belgeler
Tek anahtar ve OpenAI uyumlu rotaOmniaKeyKatalog gemini-3.8-flash modelini ayrı gateway teklifiyle sunar
Katı gecikme hedefli etkileşimli agentİkisini de ölçünToken fiyatı sıra, güvenilirlik veya geçme oranını kanıtlamaz
01.01.2027 sonrası üretimİkisini yeniden kontrol edinGoogle değişikliği planladı; gelecekteki gateway fiyatı bilinmiyor

Bu evrensel bir kazanan tablosu değildir. Veri politikası, bölgesel erişim, oran sınırı, destek, yönlendirme şeffaflığı ve istemci protokolü kararı değiştirebilir.

OmniaKey ile Gemini 3.8 Flash çağırma

Canlı model kataloğunda gemini-3.8-flash rotasını doğrulayın, API anahtarları bölümünde sınırlı bir anahtar oluşturun ve OpenAI uyumlu endpoint'i çağırın:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

API hızlı başlangıç rehberi kimlik doğrulama ve base URL'yi açıklar. Gerçek anahtarı kaynak koda, prompt'a, benchmark loguna veya ekran görüntüsüne değil ortam değişkenine koyun.

Sık sorulan sorular

Gemini 3.8 Flash API ne kadar?

Google Standard, 31 Aralık 2026'ya kadar milyon giriş tokenı başına $0.75, çıkış için $3.75'tir. 1 Ocak 2027'den itibaren $1.50 ve $7.50 listelenir. OmniaKey'in güncel bağımsız teklifi $0.45 ve $2.25'tir.

Düşünme tokenları çıkış ücretine dahil mi?

Evet. Google çıkış fiyatının düşünme tokenlarını içerdiğini belirtir. Görünür yanıt uzunluğu yerine sağlayıcı usage verisini kullanın.

OmniaKey her zaman Google direct'ten ucuz mu?

Hayır. Güncel OmniaKey Standard, Google Standard'dan düşüktür; fakat uygun işler için Google Batch ve Flex daha düşüktür. Erişim, gecikme, protokol ve gelecekteki fiyatlar ayrı kararlardır.

Neden maliyeti geçme oranına bölüyoruz?

Başarısız denemeler para harcar, kabul edilen sonuç üretmez. Deneme maliyeti sabitse geçme olasılığına bölmek bir kabulün arkasındaki harcamayı tahmin eder. Üretim verisi geldiğinde toplam harcamayı kabul edilen görevlere bölün.

Agent hangi düşünme seviyesini kullanmalı?

Sınırlı ve kontrol edilebilir işte low ile başlayın; hata pahalıysa medium ve high deneyin. Gemini 3.8 Flash minimal desteklemez. Doğru seviye aynı kabul kapısını güvenilir biçimde geçen en ucuz seçenektir.

Birincil kaynaklar

Kanıtlar ve hesaplar 20 Eylül 2026'da kontrol edildi. Fiyatlar, sınırlar ve rota erişimi değişebilir; üretim harcamasından önce birincil kaynakları ve OmniaKey kataloğunu yeniden inceleyin.