Model Jev kini terintegrasi dan sudah tersedia · Selamat menggunakan
blog
Panduan

DeepSeek V4 Flash Vision Exp

DeepSeekmultimodal eksperimentalAPImodel menambahkan input gambar ke V4-Flash pada tingkat harga yang sama. Inilah yang dapat dilakukannya, berapa biayanya, dan di mana batasannya.

12 menit bacaOmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

DeepSeek-V4-Flash-Vision-Exp mudah disalahpahami. Ini bukan generator gambar, dan bukan sekadar model V4-Flash biasa dengan nama baru. Ini adalah model multimodal API eksperimental yang mempertahankan kemampuan teks V4-Flash dan menambahkan input gambar.

Pada bulan Agustus 21, 2026, ringkasan praktisnya adalah:

  • Model ID: deepseek-v4-flash-vision-exp.
  • Perilaku teks: selaras dengan DeepSeek-V4-Flash, termasuk agen, penalaran, dan pengetahuan dunia.
  • Visi: campuran input teks dan gambar untuk tangkapan layar, bagan, dokumen, dan alur kerja agen visual.
  • Harga: tingkat yang sama dengan V4-Flash, dengan tarif puncak dan di luar jam sibuk.
  • Status: eksperimental. Uji dengan contoh nyata sebelum menjadikannya default produksi.

Panduan ini menjawab pencarian yang paling mungkin dilakukan pengembang: Apa itu DeepSeek V4 Flash Vision? Dapatkah DeepSeek V4 Flash melihat gambar? Berapa harga DeepSeek Vision API? Bagaimana cara mengirim gambar? Apakah ini mendukung OCR, PDF, Kode Claude, atau Codex? Dan apakah ini lebih baik daripada V4-Pro, GPT, atau Claude untuk tugas visual?

Bagi siapa pun yang mencari pengenalan gambar DeepSeek API, analisis gambar API, atau titik akhir input gambar, ini adalah model yang harus dievaluasi terlebih dahulu.

Apa itu DeepSeek V4 Flash Vision Exp?

DeepSeek-V4-Flash-Vision-Exp sekarang aktif di Platform DeepSeek API. Ia menerima gambar bersama teks, lalu mengembalikan jawaban atau melanjutkan alur kerja agen dengan alat.

DeepSeek menggambarkan model tersebut sebagai pencocokan V4-Flash pada kemampuan teks. Pada tolok ukur agen multimodal, perusahaan mengatakan bahwa mereka membuat lompatan besar atas V4-Flash dan mendekati Opus-4.8.. Ini adalah konteks yang berguna, namun ini masih merupakan klaim tolok ukur vendor dan bukan peringkat universal. Hasil benchmark visual tidak membuktikan bahwa model tersebut merupakan pilihan terbaik untuk setiap tugas teks, pengkodean, atau penggunaan alat.

Halaman model resmi mencantumkan jendela konteks token 1M dan hingga token keluaran 384K. Mendukung mode berpikir dan non-berpikir, keluaran JSON, panggilan alat, Responses API, dan Anthropic API. Penyelesaian FIM tidak didukung, jadi alat pengkodean yang bergantung pada FIM tidak boleh dianggap kompatibel secara otomatis.

DeepSeek Harness 0.1.1 dirilis dengan dukungan siap pakai pada hari yang sama dengan modelnya. Kerangka kerja agen lainnya masih memerlukan pemeriksaan kompatibilitasnya sendiri, terutama seputar blok konten gambar dan hasil alat.

Apa yang Dapat Dilakukan Penglihatan Flash DeepSeek V4?

Panduan Vision resmi menyebutkan deskripsi gambar, pengenalan teks tangkapan layar, dan analisis grafik. Dalam alur kerja pengembang sebenarnya, kasus penggunaan terkuat sedikit lebih spesifik.

Debug tangkapan layar dan tinjauan UI

Berikan model tangkapan layar browser, pesan kesalahan, dan perilaku yang diharapkan. Itu dapat memeriksa keadaan yang terlihat sebelum memutuskan log atau alat mana yang akan digunakan selanjutnya. Ini lebih berguna daripada model yang hanya dapat mendeskripsikan gambar setelah manusia mendiagnosis masalahnya.

OCR dan ekstraksi dokumen

Model dapat membaca teks dari tangkapan layar, pindaian, tanda terima, formulir, dan label, lalu mengembalikan bidang terstruktur. Perlakukan keluaran tersebut sebagai draf ekstraksi, bukan sebagai hasil OCR yang deterministik. Font kecil, silau, miring, buram, dan tabel padat masih memerlukan verifikasi.

Bagan dan dasbor

Itu dapat membaca diagram garis, diagram batang, tangkapan layar tabel, atau dasbor analitik dan menjelaskan tren atau anomali. Untuk keputusan finansial, medis, atau operasional, simpan nomor sumbernya dan mintalah seseorang memeriksa kesimpulannya.

Agen visual

Model ini dapat menggabungkan gambar dengan alat, sehingga berguna untuk agen browser, pengujian UI, pencarian visual, dan alur kerja yang perlu bertindak berdasarkan apa yang ada di layar. Peningkatan yang penting bukan sekedar menjawab “apa yang ada di gambar ini?”; itu memberikan konteks visual kepada agen saat ia bekerja.

Klasifikasi gambar batch

API memungkinkan hingga gambar 600 dalam satu permintaan. Hal ini dapat berfungsi untuk pengelompokan produk, triase aset, dan deskripsi massal, meskipun batch yang lebih kecil lebih mudah untuk dicoba ulang dan ditinjau.

Apakah Flash DeepSeek V4 Memiliki Penglihatan?

Model deepseek-v4-flash biasa adalah model teks. Untuk mengirim gambar, gunakan ID model vision yang tepat:

text
deepseek-v4-flash-vision-exp

Jika klien mengirim gambar ke V4-Flash atau V4-Pro, API mengembalikan kesalahan model-tidak-mendukung-gambar. Jangan menyimpulkan dukungan penglihatan hanya dari kata "V4"; ID model itu penting.

Apakah Ini Model Pembuatan Gambar?

Tidak. DeepSeek-V4-Flash-Vision-Exp adalah model pemahaman gambar. Ia membaca gambar dan menghasilkan teks atau panggilan alat. Ini bukan titik akhir yang tepat untuk membuat poster, avatar, render produk, atau gambar baru lainnya.

DeepSeek V4 Flash Vision Exp Harga API

Halaman harga resmi dalam bahasa Inggris mencantumkan harga per token 1M dalam dolar AS. Model visi menggunakan kecepatan yang sama dengan V4-Flash:

Item penagihanDi luar jam sibukPuncak
Masukan, cache tercapaiToken $0.007 / 1MToken $0.014 / 1M
Masukan, cache hilangToken $0.22 / 1MToken $0.44 / 1M
KeluaranToken $0.66 / 1MToken $1.32 / 1M

Jam sibuk adalah 01:00-04:00 dan 06:00-10:00 UTC. Semua jam lainnya di luar jam sibuk, dan tarif di luar jam sibuk adalah setengah dari tarif jam sibuk. Halaman resmi dapat berubah, jadi periksa kembali sebelum menganggarkan aplikasi yang sudah berjalan lama.

Berapa harga satu gambar?

Gambar dikonversi menjadi token masukan berdasarkan dimensinya. Batas atas saat ini adalah token 384 per gambar. Pada tingkat input cache-miss, gambar berukuran maksimum berkontribusi kira-kira:

  • Di luar jam sibuk: 384 / 1,000,000 x $0.22 = $0.00008448;
  • Puncak: 384 / 1,000,000 x $0.44 = $0.00016896.

Itu hanya komponen masukan gambar. Perintah teks, keluaran, riwayat percakapan, token penalaran, dan panggilan alat ditagih secara terpisah. Dalam alur kerja agen, keluaran yang panjang dan panggilan berulang biasanya memakan biaya lebih besar daripada gambar itu sendiri.

File API gratis digunakan untuk mengunggah dan menggunakan kembali file. Hal ini tidak membuat inferensi model bebas: membaca gambar masih menggunakan token masukan yang dapat ditagih.

Cara Menggunakan DeepSeek V4 Flash Vision Exp API

API mendukung tiga metode masukan gambar:

  1. URL data Base64 untuk gambar lokal;
  2. URL gambar eksternal publik;
  3. File API untuk gambar besar atau gambar digunakan kembali di seluruh permintaan.

Ini yang terkecilOpenAI-kompatibelPythoncontoh menggunakan URL gambar publik:

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Read the error message and suggest the next debugging step.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Ganti URL contoh dengan gambar yang dapat dijangkau publik, atau gunakan URL data Base64 untuk file lokal. Tiga metode masukan yang sama tersedia melalui Responses API. Permintaan Pesan yang kompatibel dengan Anthropic menggunakan bentuk blok konten gambar yang berbeda, jadi jangan menyalin blok OpenAI ke dalam permintaan Anthropic tanpa perubahan.

Memilih detail gambar

Bidang detail mengontrol prapemrosesan untuk input image_url:

NilaiPerilakuGunakan kapan
lowTurunkan skala ke 512 x 512 sebelum inferensiAnda membutuhkan kecepatan dan detail halus tidak penting
highMenyimpan gambar aslinyaDetail teks atau bagan kecil penting
originalMenyimpan gambar aslinyaAnda menginginkan perilaku detail penuh yang eksplisit
autoSaat ini setara dengan originalAnda menginginkan perilaku default

Untuk analisis berulang pada gambar yang sama, unggah sekali melalui File API dan gunakan kembali file_id-nya. Untuk tangkapan layar kecil satu kali, gambar sebaris atau URL publik lebih sederhana.

Batas Input Gambar Penglihatan Flash DeepSeek V4

Batasan ini lebih penting dalam produksi dibandingkan judul peluncuran:

BatasiNilai saat ini
Format yang didukungJPEG, PNG, GIF, WebP
Gambar maksimum per permintaan600
Permintaan tubuh48 MiB
Satu gambar melalui Base64 atau URL eksternal32 MiB
Satu gambar melalui File API64 MiB
Total ukuran gambar per permintaan64 MiB tanpa file_id; hingga 200 MiB dengan gambar file_id
Dimensi gambar maksimum8192 piksel per sisi
Dengan gambar 15 atau lebih4096 piksel per sisi
Panjang URL eksternalkarakter 8192
Pengunduhan gambar eksternalHarus selesai dalam 60 detik

Gambar diubah ukurannya sebelum inferensi. Gambar kecil diperbesar dengan tetap menjaga rasio aspek; gambar yang lebih besar diperkecil hingga kira-kira jumlah piksel gambar 800 x 800. Itulah sebabnya setiap gambar memiliki batas atas token 384, dan juga mengapa teks kecil harus diperiksa dengan cermat.

Untuk permintaan Pesan Chat Completions dan Anthropic standar, gambar termasuk dalam pesan pengguna. Gambar dalam pesan sistem atau asisten menampilkan kesalahan 400. Responses API memiliki aturan terdokumentasi sendiri untuk bagian gambar pengguna, pengembang, dan alat-output.

PDF tidak tercantum di antara format gambar yang didukung. Jika masukannya adalah PDF, ekstrak teks yang relevan atau render halaman ke JPEG/PNG terlebih dahulu, lalu uji hasilnya pada halaman yang representatif.

DeepSeek V4 Flash Vision vs V4 Flash vs V4 Pro

TugasTitik awal yang lebih baikMengapa
Pekerjaan massal hanya teks dan agen berbiaya rendahV4-FlashTingkat teks yang sama tanpa pemrosesan gambar
Tangkapan layar, foto, bagan, dan alat visualV4-Flash-Vision-ExpMenambahkan input gambar pada tingkat harga V4-Flash
Penalaran teks yang kompleks dan tinjauan arsitektur akhirV4-ProLebih banyak ruang untuk tugas-tugas sulit yang hanya berupa teks

Vision Exp bukanlah upgrade V4-Flash yang lebih mahal. Itu mempertahankan tingkat teks Flash dan menambahkan input visual. Jika tugas tidak berisi gambar, tidak ada alasan untuk beralih hanya karena modelnya lebih baru.

Ini juga bukan jaminan pengganti V4-Pro. Pernyataan resmi "mendekati Opus-4.8" adalah tentang tolok ukur agen multimodal. Untuk aplikasi nyata, bandingkan model pada kumpulan gambar, perintah, alat, target latensi, dan kriteria penerimaan yang sama. DeepSeek telah merilis rute Flash yang lebih baru. DeepSeek V4.1 Flash review mencakup ID model saat ini, kontrak native vision, harga, dan status V4 Pro terpisah.

Apakah DeepSeek V4 Flash Vision Gratis? Bisakah Anda Menjalankannya Secara Lokal?

API berbayar. Input, token gambar, output, dan panggilan alat ditagih. Fitur unggah File API gratis, tetapi inferensi tidak.

Pengumuman peluncuran mengonfirmasi ketersediaan pada Platform DeepSeek API. Tidak disebutkan bahwa model visi eksperimental ini tersedia di antarmuka web atau aplikasi konsumen, jadi jangan berasumsi bahwa pemilih "Mode Pakar" V4-Pro menyertakannya.

Jangan berasumsi penerapan lokal. DeepSeek telah menerbitkan informasi bobot terbuka untuk model teks V4, namun catatan peluncuran Vision Exp tidak mengumumkan bobot terbuka untuk model API eksperimental ini. Hingga kartu model dan lisensi resmi tersedia, "tersedia melalui API" dan "dapat diunduh untuk inferensi lokal" harus diperlakukan sebagai klaim yang berbeda.

Daftar Periksa Produksi

Sebelum menggunakan model untuk lalu lintas sebenarnya, uji setidaknya gambar representatif 20-50 dan catat:

  • Akurasi OCR pada bidang yang benar-benar penting;
  • keakuratan interpretasi bagan dan tabel;
  • tingkat keberhasilan pemanggilan alat setelah gambar diberikan;
  • perilaku latensi dan batas waktu;
  • input, output, dan alasan penggunaan token;
  • perilaku fallback ketika model eksperimental gagal.

Pertahankan gambar asli dan respons model agar pengulas dapat melihat apa yang sebenarnya dilihat model. Untuk dokumen sensitif, minimalkan penyimpanan dan batasi akses sebelum mengirimkannya ke model yang dihosting.

Pertanyaan Umum

Bisakah DeepSeek V4 Flash Vision menghasilkan gambar?

Tidak. Ia memahami gambar dan mengembalikan teks atau panggilan alat. Gunakan model pembuatan gambar untuk aset visual baru.

Apakah DeepSeek V4 Flash Vision mendukung OCR?

Itu dapat membaca teks di tangkapan layar dan dokumen, tetapi ini bukan mesin OCR yang deterministik. Validasi teks kecil, diputar, buram, atau berisiko tinggi dengan metode kedua.

Berapa harga DeepSeek V4 Flash Vision API?

Tarif resmi saat ini adalah $0.22 per 1M token masukan yang tidak di-cache dan $0.66 per token keluaran 1M di luar jam sibuk. Tarif puncaknya adalah $0.44 dan $1.32. Input cache-hit lebih murah. Token gambar menggunakan harga V4-Flash yang sama.

Apakah Flash DeepSeek V4 biasa mendukung gambar?

Tidak. Gunakan ID model deepseek-v4-flash-vision-exp yang tepat. Model DeepSeek lainnya menolak masukan gambar.

Bisakah saya menggunakannya dengan Kode Claude atau Codex?

Model ini mendukung Responses API, Anthropic API, dan panggilan alat, sehingga dapat disesuaikan dengan alur kerja agen. Apakah klien tertentu dapat bekerja dengan andal bergantung pada konten gambar dan implementasi hasil alatnya. Uji klien sebenarnya daripada berasumsi bahwa kompatibilitas protokol sama dengan pengalaman pengguna yang baik.

Apakah DeepSeek V4 Flash Vision sumber terbuka?

Pengumuman peluncuran Vision Exp saat ini mengonfirmasi rilis API, bukan rilis open-weight. Jangan menyimpulkan dukungan penerapan lokal dari pengumuman model teks V4 yang terpisah.

Bagaimana jika DeepSeek tidak mengunggah gambar atau melewatkan teks?

Periksa apakah file tersebut berformat JPEG, PNG, GIF, atau WebP, apakah tetap dalam batas ukuran, dan apakah URL eksternal dapat dijangkau. Untuk teks kecil, coba detail=high atau original; gunakan File API untuk gambar berukuran besar atau file yang akan Anda gunakan kembali. Verifikasi bidang penting dengan metode kedua.

Intinya

DeepSeek-V4-Flash-Vision-Exp paling menarik ketika agen perlu melihat: layar browser, bagan, tanda terima, formulir yang dipindai, atau gambar produk. Promosi praktisnya sederhana: perilaku teks V4-Flash, input gambar, dan harga V4-Flash.

Ini bukan pengganti universal untuk V4-Pro, GPT, Claude, OCR profesional, atau model pembuatan gambar. Mulailah dengan set pengujian gambar tetap, ukur akurasi dan total biaya alur kerja, dan pertahankan fallback saat model masih membawa label Exp.

Di tumpukan saya sendiri, saya tetap menggunakan penggunaan dan penagihan Claude, GPT, dan Gemini yang terlihat melalui OmniaKey, sambil menguji model DeepSeek ini secara terpisah sebagai spesialis visual. Hal ini membuat perbandingannya dapat diukur alih-alih mengubah pengumuman peluncuran menjadi migrasi produksi yang belum teruji.

Sumber Resmi