DeepSeek V4.1 Flash
Flash baru lebih murah dan naik di beberapa pengujian agen, tetapi data resmi tidak membuktikan bahwa ia mengalahkan V4 Pro pada setiap jenis tugas.
Ulasan DeepSeek V4.1 Flash ini memisahkan arsitektur model, benchmark yang dipublikasikan DeepSeek, dan kontrak API yang penting saat integrasi nyata.
Kesimpulan singkatnya: V4.1 Flash layak menjadi kandidat pertama untuk agen coding dengan konteks panjang, loop alat, gambar, dan volume tinggi. API langsung DeepSeek mengenakan $0.15 per satu juta token input tanpa cache dan $0.60 untuk output pada waktu nonpuncak. Itu tidak membuktikan bahwa model ini menggantikan V4 Pro untuk semua tugas. Artikel ini tidak mengklaim pengalaman produksi, eksekusi berbayar independen, atau pengujian kecepatan sendiri.
Pemeriksaan fakta: 10 September 2026. Ulasan ini menggunakan catatan rilis, harga, panduan API, dan model card publik DeepSeek. Nilai benchmark berstatus vendor-reported, yaitu dilaporkan oleh penyedia dan bukan direproduksi secara independen oleh OmniaKey.
Kapan V4.1 Flash diuji lebih dulu?
Mulailah dengan model ini untuk agen coding dengan prompt panjang dan tool call berulang, debugging berbasis tangkapan layar, OCR atau ekstraksi dokumen yang memiliki validasi lanjutan, serta otomasi batch yang sensitif pada throughput dan biaya token.
Lakukan regresi terlebih dahulu bila alur kerja bergantung pada perilaku V4 Pro, format tool call yang stabil, atau identitas model tetap untuk audit. DeepSeek mengumumkan bahwa deepseek-v4-pro akan dialihkan ke V4.1 Flash mulai 2026-09-14 04:00 UTC. ID yang sama tidak lagi menjalankan model yang sama.
Fakta yang terkonfirmasi saat peluncuran
| Item | Informasi terverifikasi |
|---|---|
| Rilis resmi | 2026-09-10 |
| ID API DeepSeek kanonis | deepseek-flash |
| ID kompatibilitas lama | deepseek-v4-flash, deepseek-v4-flash-vision-exp |
| Transisi Pro | deepseek-v4-pro dialihkan ke V4.1 Flash pada 2026-09-14 04:00 UTC |
| Arsitektur | MoE multimodal 552B parameter, Causal Encoder-Decoder |
| Parameter aktif | 8B saat prefill, 16B saat decode |
| Kapasitas | konteks 1M, output maksimum 384K |
| API | Chat Completions, Responses API, Anthropic API |
| Lisensi | bobot dan repositori berlisensi MIT |
V4 Flash dan V4 Flash Vision Exp sudah dihentikan. deepseek-v4-flash dan deepseek-v4-flash-vision-exp hanya jalur kompatibilitas sementara; integrasi baru sebaiknya memakai deepseek-flash.
DeepSeek juga melaporkan KV Cache global sebesar 890 bytes per token, sekitar 1/4 dari V4 Flash, serta jejak cache persisten sekitar 1/8. Ini adalah penghematan memori serving, bukan janji bahwa token yang ditagih otomatis menjadi seperempat.
Harga API langsung
Halaman harga berbahasa Inggris DeepSeek mencantumkan tarif API langsung berikut per satu juta token:
| Penggunaan yang ditagih | Nonpuncak | Puncak |
|---|---|---|
| Input cache hit | $0.003 | $0.006 |
| Input tanpa cache | $0.15 | $0.30 |
| Output | $0.60 | $1.20 |
Jam puncak adalah Senin sampai Jumat pukul 01:00-04:00 dan 06:00-10:00 UTC. Waktu lain, termasuk akhir pekan, merupakan nonpuncak. Nilai tersebut adalah harga langsung DeepSeek, bukan harga OmniAKey.
Untuk 100.000 token input tanpa cache dan 20.000 token output:
V4.1 Flash nonpuncak = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash puncak = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro nonpuncak = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro puncak = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112
Untuk campuran token tepat ini, V4.1 Flash sekitar 74% lebih murah dari V4 Pro. Itu adalah aritmetika harga, bukan skor kualitas: percobaan ulang dan koreksi manusia dapat mengubah biaya per tugas yang diterima. Snapshot harga Pro Agustus tersedia di panduan harga DeepSeek V4 Pro (bahasa Inggris).
Apa yang sebenarnya ditunjukkan benchmark?
Pada tabel resmi yang sama, V4.1 Flash mengungguli V4 Pro pada beberapa tugas agen, tetapi tidak pada semua uji pengetahuan dan penalaran.
| Benchmark | V4 Flash | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| HLE, hanya teks | 37.8 | 42.7 | 39.1 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| CyberGym | 76.7 | 83.3 | 88.1 |
| HLE dengan alat | 51.5 | 60.0 | 63.9 |
| AutomationBench | 37.7 | 43.2 | 54.8 |
Kesimpulan yang dapat dipertahankan adalah peningkatan kuat pada skenario coding, keamanan, otomasi, dan penggunaan alat yang dilaporkan, bukan kemenangan universal. Ada juga konflik sumber: update log menyebut 65.4 untuk NL2Repo-Bench, sedangkan model card langsung menyebut 64.0. Nilai itu tidak digunakan dalam kesimpulan sebelum DeepSeek menjelaskan perbedaannya.
Framework agen mengubah hasil
Pada V4.1 Flash yang sama, DeepSWE v1.1 berubah dari 65.5 dengan OpenCode ke 74.2 dengan mini-SWE-agent, selisih 8.7 poin. Terminal-Bench 2.1 berubah dari 84.1 dengan Codex ke 90.6 dengan DeepSeek Harness Minimal, selisih 6.5 poin.
DeepSeek mendokumentasikan N=8 sampel per tugas DeepSWE, N=3 untuk Terminal-Bench, kontainer Linux, maksimal 500 langkah agen, dan reasoning effort maksimum. Format prompt, loop alat, kebijakan retry, dan pengelolaan konteks ikut menentukan hasil. Bandingkan dalam agen yang benar-benar akan digunakan.
Vision dan batas integrasi
V4.1 Flash menerima JPEG, PNG, GIF, dan WebP melalui base64, URL publik, atau Files API. Input gambar berfungsi pada Chat Completions, Responses API, dan Anthropic API. Setelah pengubahan ukuran otomatis, satu gambar menggunakan paling banyak 1,024 token input.
Ini adalah pemahaman gambar, bukan pembuat gambar. Teks kecil, tabel rapat, serta bidang kontrak atau keuangan penting memerlukan pemeriksaan deterministik atau manusia. Saat memakai tools dalam mode thinking, seluruh reasoning_content harus dikembalikan pada permintaan berikutnya; dokumentasi menjelaskan respons 400 bila tidak dilakukan. FIM completion hanya tersedia saat thinking dimatikan.
Ketersediaan di OmniAKey
Saat diperiksa pada 2026-09-10, katalog model OmniAKey belum mencantumkan rute kanonis deepseek-flash. Artikel ini tidak menyatakan V4.1 Flash sudah tersedia melalui OmniAKey atau memiliki harga OmniAKey saat ini.
Jika ID tepat sudah muncul di katalog, buat kunci terpisah dengan batas di API Keys. Setelah smoke test pertama, periksa model, input, cache, output, dan biaya. Baca juga panduan penagihan transparan (bahasa Inggris) serta panduan mulai cepat API (bahasa Inggris).
Checklist migrasi dari V4 Pro
- Tetapkan 10 sampai 30 tugas representatif dan kriteria penerimaannya.
- Simpan token, latensi, retry, dan hasil
deepseek-v4-prosaat ini. - Ulangi tugas dengan
deepseek-flash, alat dan izin yang sama. - Uji
highdanmaxterpisah, dengan satu variabel berubah tiap kali. - Masukkan tool loop panjang dan, bila relevan, tugas gambar nyata.
- Bandingkan biaya per tugas yang diterima, bukan hanya harga respons pertama.
- Perbarui allowlist, pemantauan, dan label audit sebelum 14 September.
Pertanyaan umum
Apa ID model yang baru?
Untuk API langsung DeepSeek, gunakan deepseek-flash. Dua ID V4 Flash lama hanya alias kompatibilitas.
Apakah V4.1 Flash selalu lebih baik daripada V4 Pro?
Tidak. Ia memimpin beberapa metrik agen resmi, tetapi V4 Pro tetap lebih tinggi pada GPQA Diamond dan HLE hanya teks. Tugas dan framework agen harus menentukan pilihan.
Apakah V4.1 Flash open source?
Repositori dan bobotnya menggunakan MIT. Menjalankan MoE 552B tetap membutuhkan perangkat keras khusus, prompt encoding yang benar, dan validasi operasional.
Sumber primer
- Catatan rilis DeepSeek V4.1 Flash (bahasa Inggris)
- Model dan harga DeepSeek (bahasa Inggris)
- Model card DeepSeek V4.1 Flash (bahasa Inggris)
- Laporan teknis DeepSeek V4.1 (bahasa Inggris)
- Panduan pemahaman gambar (bahasa Inggris)
- Panduan thinking mode (bahasa Inggris)
- Log pembaruan DeepSeek (bahasa Inggris)
Fakta dan perhitungan diverifikasi pada 10 September 2026. Tidak ada panggilan model berbayar independen, tes kecepatan, atau tes keandalan produksi yang dilakukan. Periksa kembali ID, harga, waktu transisi, dan ketersediaan gateway sebelum deployment.