DeepSeek V4 Flash Vision Exp
DeepSeek'in deneysel multimodal API modeli, V4-Flash fiyat kademesinde görsel girdi ekliyor. Yetenekleri, maliyeti ve sınırları burada.
DeepSeek V4 Flash Vision Exp hakkında arama yaptığınızda iki farklı konu birbirine karışıyor: Bu model bir görsel üretim aracı değil ve normal V4-Flash modelinin sadece yeni adı da değil. Bu, API için yayınlanan deneysel bir multimodal model; V4-Flash'ın metin yeteneklerini koruyor ve görsel girdisi ekliyor.
21 Ağustos 2026 itibarıyla kısa cevap:
- Model ID:
deepseek-v4-flash-vision-exp; - ekran görüntülerini, fotoğrafları, belgeleri ve grafikleri anlayabilir;
- agent, reasoning ve genel bilgi dahil metin yetenekleri V4-Flash ile aynı seviyededir;
- API fiyatlandırması V4-Flash ile aynı kademededir ve yoğun/yoğun olmayan saatlere göre değişir;
- model hâlâ Exp sürümüdür; üretimde varsayılan model yapmadan önce kendi örneklerinizle test etmelisiniz.
Bu yazıda DeepSeek V4 Flash Vision Exp fiyatını, API'nin nasıl kullanıldığını, OCR ve görüntü tanıma yeteneklerini, görsel yükleme seçeneklerini, teknik sınırları ve V4-Flash ile V4-Pro arasındaki farkı pratik şekilde ele alıyorum.
DeepSeek V4 Flash Vision Exp nedir?
DeepSeek-V4-Flash-Vision-Exp, 21 Ağustos 2026'da DeepSeek API Platform üzerinde kullanıma açıldı. Aynı istekte metin ve görsel kabul ediyor; ardından metin yanıtı üretebiliyor veya araçlarla bir agent akışına devam edebiliyor.
DeepSeek, modelin metin yeteneklerinin V4-Flash ile eşleştiğini söylüyor. Buna agent yetenekleri, akıl yürütme ve genel dünya bilgisi dahil. Şirket ayrıca multimodal agent benchmark'larında V4-Flash'a göre büyük bir sıçrama ve Opus-4.8'e yaklaşan bir performans bildirdi.
Bu benchmark ifadesini bağlamından koparmamak gerekir. Sonuçlar DeepSeek'in kendi değerlendirmesine dayanıyor; tüm görevler için bağımsız ve evrensel bir sıralama anlamına gelmiyor. Görsel agent sonucu, modelin her metin, kod veya araç çağrısı işinde V4-Pro'dan iyi olduğunu kanıtlamaz.
Resmî model tablosunda 1M token bağlam penceresi ve en fazla 384K token çıktı yer alıyor. Thinking ve non-thinking modları, JSON Output, Tool Calls, Responses API ve Anthropic API destekleniyor. FIM Completion desteklenmediği için bir coding agent'ın API ile çalışması, otomatik kod tamamlama desteği olduğu anlamına gelmez.
DeepSeek Harness 0.1.1 de aynı gün yeni model için yerleşik destekle yayımlandı. Diğer agent framework'lerinde görsel içerik bloklarının ve araç sonuçlarının doğru aktarılıp aktarılmadığını ayrıca test etmek gerekir.
DeepSeek V4 Flash Vision neler yapabilir?
Resmî Vision dokümanı görsel açıklama, ekran görüntüsündeki metni okuma ve grafik analizi örneklerini veriyor. Gerçek projelerde en anlamlı kullanım alanları şunlar.
Ekran görüntüsü ile hata ayıklama ve UI inceleme
Tarayıcı ekran görüntüsünü, hata mesajını ve beklenen davranışı birlikte gönderebilirsiniz. Model önce arayüzdeki durumu görür, sonra hangi log veya aracın kontrol edilmesi gerektiğini önerebilir. UI testi ve tarayıcı agent'ları için bu, ekrandaki durumu baştan insanın tarif etmesinden daha kullanışlıdır.
OCR ve belge alanı çıkarma
Ekran görüntülerinden, taramalardan, fişlerden, formlardan ve etiketlerden metin okuyup yapılandırılmış alanlar döndürebilir. Bunu kesin bir OCR motoru gibi değil, doğrulanması gereken bir ilk çıkarım olarak kullanın. Küçük yazı, parlama, eğiklik, bulanıklık ve yoğun tablolar hata oranını artırabilir.
Sağlık, finans veya hukuk belgelerinde model çıktısı insan kontrolünden geçmeden karar sürecine girmemelidir.
Grafik ve dashboard analizi
Çizgi ve çubuk grafiklerdeki eğilimleri açıklayabilir, tablo ekran görüntülerindeki değerleri karşılaştırabilir ve dashboard'daki görsel anomalileri işaretleyebilir. İş sonucu para veya operasyon kararıysa kaynak sayıları saklayın ve yorumu ayrıca doğrulayın.
Görsel bağlam kullanan agent'lar
Asıl yenilik yalnızca “bu resimde ne var?” sorusuna cevap vermesi değil. Agent bir ekran görüntüsünü görüp sayfadaki öğeyi bulabilir, tasarımı referansla karşılaştırabilir veya gördüğü duruma göre araç çağrılarına devam edebilir.
Toplu görsel sınıflandırma
Tek bir istekte en fazla 600 görsel gönderilebilir. Ürünleri gruplama, medya arşivini ayıklama ve toplu açıklama üretimi için işe yarayabilir. Üretimde daha küçük gruplar, yeniden deneme ve manuel kontrol açısından daha güvenlidir.
DeepSeek V4 Flash görsel destekliyor mu?
Normal deepseek-v4-flash metin modelidir. Görsel göndermek için tam olarak şu model ID'sini seçin:
deepseek-v4-flash-vision-exp
V4-Flash veya V4-Pro'ya görsel gönderirseniz API, modelin görsel desteklemediğini belirten bir 400 hatası döndürür. Model adında “V4” geçmesi tek başına görsel desteği anlamına gelmez; belirleyici olan model ID'sidir.
DeepSeek görsel oluşturuyor mu?
Hayır. DeepSeek V4 Flash Vision Exp görselleri anlar ve metin ya da araç çağrıları üretir. Poster, avatar, illüstrasyon veya ürün render'ı oluşturmak için ayrı bir image-generation modeli gerekir.
DeepSeek V4 Flash Vision Exp fiyatı ve API fiyatlandırması
Resmî İngilizce fiyat sayfası ücretleri 1 milyon token başına ABD doları olarak veriyor. Vision Exp, V4-Flash ile aynı fiyat kademesini kullanıyor.
| Ücret kalemi | Yoğun olmayan saatler | Yoğun saatler |
|---|---|---|
| Girdi, cache hit | $0.007 / 1M token | $0.014 / 1M token |
| Girdi, cache miss | $0.22 / 1M token | $0.44 / 1M token |
| Çıktı | $0.66 / 1M token | $1.32 / 1M token |
Yoğun saatler 01:00-04:00 ve 06:00-10:00 UTC aralığıdır. Diğer saatlerde yoğun olmayan fiyat uygulanır ve bu fiyat yoğun saatlerin yarısıdır. Fiyat sayfası değişebileceği için uzun süreli kullanım bütçesini güncel tabloya göre hesaplayın.
Bir görselin maliyeti ne kadar?
Görseller boyutlarına göre giriş token'larına dönüştürülür. Her görsel için mevcut üst sınır 384 token'dır. Cache miss giriş fiyatıyla, üst sınıra ulaşan bir görselin yalnızca görsel kısmı yaklaşık olarak şöyledir:
- Yoğun olmayan saatlerde:
384 / 1,000,000 x $0.22 = $0.00008448; - Yoğun saatlerde:
384 / 1,000,000 x $0.44 = $0.00016896.
Bu, tam isteğin toplam fiyatı değildir. Metin prompt'u, çıktı, konuşma geçmişi, reasoning token'ları ve araç çağrıları ayrıca ücretlendirilir. Agent akışlarında maliyeti çoğu zaman görselden çok uzun çıktı ve tekrarlanan çağrılar artırır.
Files API ile dosya yüklemek ve aynı dosyayı yeniden kullanmak ücretsizdir. Ancak görseli modelin analiz etmesi yine ücretli giriş token'ları tüketir.
DeepSeek V4 Flash Vision Exp API nasıl kullanılır?
Dokümantasyonda üç görsel gönderme yöntemi bulunuyor:
- Yerel dosyalar için Base64 data URL;
- Herkese açık bir görsel URL'si;
- Büyük dosyalar veya tekrar kullanılacak görseller için Files API.
OpenAI uyumlu istemciyle, herkese açık bir URL kullanan en küçük Python örneği:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": "Hata mesajını oku ve sonraki hata ayıklama adımını öner.",
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/screenshot.png",
"detail": "high",
},
},
],
}
],
)
print(response.choices[0].message.content)
Örnek URL'yi gerçekten erişilebilen bir görselle değiştirin veya yerel dosya için Base64 data URL kullanın. Aynı üç yöntem Responses API'de de geçerlidir. Anthropic Messages uyumlu API'de görsel içerik bloğunun yapısı farklıdır; OpenAI bloğunu doğrudan kopyalamayın.
Görsel detail seviyesi nasıl seçilir?
detail alanı image_url girdisinin işlenme biçimini belirler:
| Değer | Davranış | Ne zaman kullanılmalı |
|---|---|---|
low | Çıkarımdan önce 512 x 512'ye küçültür | Hızlı sınıflandırma, küçük ayrıntı gerekmiyorsa |
high | Orijinal görseli korur | Küçük yazı, tablo veya arayüz ayrıntısı varsa |
original | Orijinal görseli korur | Tam ayrıntı davranışını açıkça seçmek istiyorsanız |
auto | Şu anda original ile aynı | Varsayılan davranışı kullanmak istiyorsanız |
Aynı görseli birden fazla kez analiz edecekseniz Files API ile bir kez yükleyip file_id değerini yeniden kullanın. Tek seferlik küçük bir ekran görüntüsünde URL veya inline yöntem daha basittir.
DeepSeek V4 Flash Vision görsel yükleme sınırları
| Sınır | Güncel değer |
|---|---|
| Desteklenen formatlar | JPEG, PNG, GIF, WebP |
| İstek başına görsel sayısı | En fazla 600 |
| İstek gövdesi | 48 MiB |
| Base64 veya harici URL ile tek görsel | En fazla 32 MiB |
| Files API ile tek görsel | En fazla 64 MiB |
| İstek başına toplam görsel boyutu | file_id olmadan 64 MiB; file_id görselleriyle 200 MiB'ye kadar |
| Maksimum görsel boyutu | Her kenarda 8192 px |
| 15 veya daha fazla görsel gönderilirse | Her kenarda 4096 px |
| Harici URL uzunluğu | En fazla 8192 karakter |
| Harici görsel indirme süresi | 60 saniye içinde tamamlanmalı |
Görseller çıkarımdan önce yeniden boyutlandırılır. Büyük görseller yaklaşık 800 x 800 toplam piksel alanına küçültülür; bu nedenle görsel başına 384 token üst sınırı vardır ve çok küçük yazılarda ayrıntı kaybı yaşanabilir.
Standart Chat Completions ve Anthropic Messages isteklerinde görsel user mesajında bulunmalıdır. Görseli system veya assistant mesajına koymak 400 hatası döndürür. Responses API'de user, developer ve araç çıktısı için ayrı içerik kuralları vardır.
PDF, desteklenen görsel formatları arasında listelenmiyor. PDF kullanacaksanız metni çıkarın veya ilgili sayfaları JPEG/PNG'ye dönüştürüp örnek sayfalarla kaliteyi kontrol edin.
DeepSeek V4 Flash Vision ve V4-Pro farkı
| Görev | Başlangıç için daha uygun model | Neden |
|---|---|---|
| Yalnızca metin, toplu iş ve düşük maliyetli agent | V4-Flash | Görsel işleme olmadan aynı metin kademesi |
| Ekran görüntüsü, fotoğraf, grafik ve görsel araçlar | V4-Flash-Vision-Exp | V4-Flash fiyat kademesinde görsel giriş |
| Karmaşık metin akıl yürütme ve son mimari inceleme | V4-Pro | Zor metin görevleri için daha fazla kapasite |
Vision Exp, V4-Flash'ın daha pahalı bir sürümü değildir. Flash'ın metin ve fiyat seviyesini korur, yalnızca görsel giriş ekler. Görev tamamen metinse sırf model adı yeni diye geçiş yapmak gereksizdir.
V4-Pro'nun da otomatik alternatifi değildir. Opus-4.8'e yaklaşma ifadesi multimodal agent benchmark'ları için kullanılıyor. Gerçek uygulamada modelleri aynı görsel seti, prompt'lar, araçlar, gecikme hedefi ve kabul kriterleriyle karşılaştırın.
DeepSeek V4 Flash Vision ücretsiz mi? Yerel çalıştırılabilir mi?
API ücretlidir. Metin girdisi, görsel token'ları, çıktı ve araç çağrıları ücretlendirilir. Files API'nin ücretsiz olması, model çıkarımının ücretsiz olduğu anlamına gelmez.
Resmî duyuru API Platform kullanılabilirliğini doğruluyor. Deneysel görsel modelin tüketici web arayüzünde veya uygulamada bulunduğunu söylemiyor. V4-Pro için görünen “Expert Mode” seçeneğinin Vision Exp'i içerdiğini varsaymayın.
Yerel kurulum desteği varsayılmamalı. DeepSeek metin V4 modelleri için açık ağırlık bilgileri yayımladı, ancak Vision Exp duyurusunda bu deneysel model için açık ağırlık veya lisans açıklanmadı. “API üzerinden kullanılabilir” ile “indirilip yerel çalıştırılabilir” aynı iddia değildir.
Sık sorulan sorular
DeepSeek V4 Flash Vision görsel oluşturuyor mu?
Hayır. Görselleri anlar ve metin ya da araç çağrısı üretir. Yeni görsel oluşturmak için image-generation modeli gerekir.
DeepSeek V4 Flash Vision OCR destekliyor mu?
Ekran görüntüsü ve belgelerdeki metni okuyabilir, ancak deterministik bir OCR motoru değildir. Küçük, döndürülmüş, bulanık veya kritik metinleri ikinci bir yöntemle doğrulayın.
Normal DeepSeek V4 Flash görsel kabul ediyor mu?
Hayır. deepseek-v4-flash-vision-exp model ID'sini kullanın; diğer DeepSeek modelleri görsel girdiyi reddeder.
DeepSeek V4 Flash Vision Exp ile Claude Code veya Codex kullanılabilir mi?
Model Responses API, Anthropic API ve tool calls desteklediği için bir agent akışına eklenebilir. Ancak gerçek kararlılık, istemcinin görsel içeriği ve araç sonuçlarını doğru taşımasına bağlıdır; kullandığınız istemciyle test yapın.
DeepSeek V4 Flash Vision Exp open source mu?
Mevcut duyuru API sürümünü doğruluyor, açık ağırlık sürümünü değil. Metin V4 duyurularındaki bilgileri bu deneysel görsel modele otomatik olarak uygulamayın.
DeepSeek'te resim yüklenmiyorsa veya metin okunmuyorsa ne yapmalı?
Dosyanın JPEG, PNG, GIF veya WebP olduğundan, boyut sınırlarını aşmadığından ve harici URL'nin erişilebilir olduğundan emin olun. Küçük yazılar için detail=high veya original deneyin; büyük ya da tekrar kullanılacak görsellerde Files API kullanın. Kritik alanları ayrıca doğrulayın.
Sonuç
DeepSeek-V4-Flash-Vision-Exp; tarayıcı ekranı, grafik, fiş, taranmış form veya fotoğrafı görmesi gereken agent'lar için denenmeye değer. Pratik önerisi net: V4-Flash metin seviyesi, görsel giriş ve V4-Flash fiyatlandırması.
V4-Pro, GPT, Claude, profesyonel OCR veya görsel üretim modellerinin evrensel alternatifi değildir. Önce 20-50 gerçek görselle doğruluk, gecikme, araç çağrısı başarısı ve toplam maliyeti ölçün; Exp etiketi devam ederken bir yedek model bulundurun.
Kendi ana akışımda Claude, GPT ve Gemini çağrılarını ve maliyetlerini OmniAKey üzerinden görünür tutuyor, bu DeepSeek modelini ise görsel uzmanı olarak ayrı bir test grubunda deniyorum. Böylece yeni bir model yayınlandı diye tüm üretim akışını ölçmeden değiştirmemiş oluyorum.