DeepSeek V4.1 Flash
Il nuovo Flash costa meno e sale in vari test per agenti, ma i dati ufficiali non dimostrano che superi V4 Pro in ogni attività.
Questa Recensione DeepSeek V4.1 Flash separa architettura, benchmark pubblicati da DeepSeek e contratto API che conta in una vera integrazione.
Il giudizio breve è che V4.1 Flash merita di essere il primo candidato per agenti di coding con contesto lungo, strumenti, immagini e carichi elevati. Sull'API diretta DeepSeek il prezzo off-peak è $0.15 per un milione di token input senza cache e $0.60 per l'output. Questo non prova che rimpiazzi V4 Pro in ogni lavoro. L'articolo non dichiara esperienze inventate, esecuzioni a pagamento indipendenti o test di velocità propri.
Verifica dei fatti: 10 settembre 2026. L'analisi usa nota di rilascio, listino, guide API e model card pubblica di DeepSeek. I benchmark sono vendor-reported: riportati dal fornitore e non riprodotti in modo indipendente da OmniaKey.
Quando provare prima V4.1 Flash
È un buon primo modello per agenti di codice con prompt lunghi e tool call ripetute, debug tramite screenshot, OCR o estrazione documentale con verifica successiva e automazioni batch in cui throughput e costo per token contano.
Prima eseguite una regressione se il flusso dipende dal comportamento di V4 Pro, da tool call molto stabili o da un'identità modello fissa per audit. DeepSeek annuncia che deepseek-v4-pro sarà inoltrato a V4.1 Flash dal 2026-09-14 04:00 UTC. Lo stesso ID non eseguirà più lo stesso modello.
Informazioni confermate al lancio
| Voce | Informazione verificata |
|---|---|
| Rilascio ufficiale | 2026-09-10 |
| ID API DeepSeek canonico | deepseek-flash |
| ID legacy compatibili | deepseek-v4-flash, deepseek-v4-flash-vision-exp |
| Transizione Pro | deepseek-v4-pro passa a V4.1 Flash il 2026-09-14 04:00 UTC |
| Architettura | MoE multimodale da 552B parametri, Causal Encoder-Decoder |
| Parametri attivi | 8B nel prefill, 16B nel decode |
| Capacità | contesto 1M, output massimo 384K |
| API | Chat Completions, Responses API, Anthropic API |
| Licenza | pesi e repository MIT |
V4 Flash e V4 Flash Vision Exp sono ritirati. deepseek-v4-flash e deepseek-v4-flash-vision-exp sono solo percorsi temporanei di compatibilità; una nuova integrazione deve usare deepseek-flash.
DeepSeek descrive un KV Cache globale da 890 bytes per token, circa 1/4 di V4 Flash, e un'impronta persistente di circa 1/8. È un vantaggio di memoria lato serving, non la promessa che i token fatturati diventino automaticamente un quarto.
Prezzi dell'API diretta
La pagina inglese di DeepSeek pubblica queste tariffe dell'API diretta per milione di token:
| Uso fatturabile | Off-peak | Peak |
|---|---|---|
| Input cache hit | $0.003 | $0.006 |
| Input senza cache | $0.15 | $0.30 |
| Output | $0.60 | $1.20 |
Le ore di punta sono dal lunedì al venerdì, 01:00-04:00 e 06:00-10:00 UTC. Gli altri orari, inclusi i weekend, sono off-peak. Sono prezzi diretti DeepSeek, non un listino OmniAKey.
Con 100.000 token input senza cache e 20.000 token output:
V4.1 Flash off-peak = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash peak = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro off-peak = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro peak = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112
Con questa miscela, V4.1 Flash costa circa il 74% in meno di V4 Pro. È aritmetica dei prezzi, non un punteggio di qualità: retry e correzione umana possono cambiare il costo per attività accettata. Lo snapshot di prezzo Pro di agosto resta nella guida prezzi DeepSeek V4 Pro (in inglese).
Cosa mostrano davvero i benchmark
Nella stessa tabella della model card ufficiale, V4.1 Flash supera V4 Pro in varie attività di agenti, ma non in tutti i test di conoscenza e ragionamento.
| Benchmark | V4 Flash | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| HLE, solo testo | 37.8 | 42.7 | 39.1 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| CyberGym | 76.7 | 83.3 | 88.1 |
| HLE con strumenti | 51.5 | 60.0 | 63.9 |
| AutomationBench | 37.7 | 43.2 | 54.8 |
La conclusione sostenibile è un forte miglioramento negli scenari riportati di codice, sicurezza, automazione e tool use, non una vittoria universale. C'è anche una divergenza: l'update log riporta 65.4 per NL2Repo-Bench, mentre la model card live riporta 64.0. Il valore è escluso dal giudizio finché DeepSeek non chiarisce la differenza.
Il framework dell'agente cambia il risultato
Con lo stesso V4.1 Flash, DeepSWE v1.1 passa da 65.5 con OpenCode a 74.2 con mini-SWE-agent, una differenza di 8.7 punti. Terminal-Bench 2.1 passa da 84.1 con Codex a 90.6 con DeepSeek Harness Minimal, una differenza di 6.5 punti.
DeepSeek documenta N=8 campioni per task DeepSWE, N=3 per Terminal-Bench, container Linux, massimo 500 passi dell'agente e reasoning effort massimo. Formato del prompt, ciclo strumenti, retry e gestione del contesto sono parte del risultato. Confrontate nel framework che userete davvero.
Visione e limiti di integrazione
V4.1 Flash accetta JPEG, PNG, GIF e WebP tramite base64, URL pubblica o Files API. L'input immagine funziona in Chat Completions, Responses API e Anthropic API. Dopo il ridimensionamento automatico, un'immagine usa al massimo 1,024 token di input.
È comprensione visiva, non generazione di immagini. Testo piccolo, tabelle dense e campi contrattuali o finanziari importanti richiedono controllo deterministico o revisione umana. Con tools in thinking mode occorre restituire tutto reasoning_content alle richieste successive; la guida descrive una risposta 400 se non avviene. FIM completion è disponibile solo senza thinking.
Disponibilità in OmniAKey
Alla verifica del 2026-09-10, il catalogo modelli OmniAKey non mostrava ancora la route canonica deepseek-flash. Questo articolo non afferma quindi disponibilità corrente o prezzo OmniAKey per V4.1 Flash.
Quando l'ID preciso appare nel catalogo, create una chiave separata con limite in API Keys. Dopo il primo smoke test, controllate modello, input, cache, output e costo. Consultate anche la guida alla fatturazione trasparente (in inglese) e l'avvio rapido API (in inglese).
Checklist di migrazione da V4 Pro
- Fissate da 10 a 30 attività rappresentative e relativi criteri di accettazione.
- Salvate token, latenza, retry e risultato di
deepseek-v4-pro. - Ripetete l'attività con
deepseek-flash, stessi strumenti e permessi. - Provate
highemaxseparatamente, cambiando una variabile alla volta. - Includete un tool loop lungo e, se necessario, una vera attività con immagine.
- Confrontate il costo per attività accettata, non solo il prezzo della prima risposta.
- Aggiornate allowlist, monitoraggio ed etichette di audit prima del 14 settembre.
Domande frequenti
Qual è il nuovo ID del modello?
Per l'API diretta DeepSeek è deepseek-flash. I due ID V4 Flash precedenti sono solo alias di compatibilità.
V4.1 Flash è sempre migliore di V4 Pro?
No. Guida diverse metriche ufficiali per agenti, ma V4 Pro resta avanti in GPQA Diamond e HLE solo testo. Devono decidere attività e framework dell'agente.
V4.1 Flash è open source?
Repository e pesi usano MIT. Eseguire un MoE da 552B richiede comunque hardware specializzato, prompt encoding corretto e validazione operativa.
Fonti primarie
- Nota di rilascio DeepSeek V4.1 Flash (in inglese)
- Modelli e prezzi DeepSeek (in inglese)
- Model card DeepSeek V4.1 Flash (in inglese)
- Rapporto tecnico DeepSeek V4.1 (in inglese)
- Guida alla comprensione immagini (in inglese)
- Guida thinking mode (in inglese)
- Registro aggiornamenti DeepSeek (in inglese)
Fatti e calcoli sono stati verificati il 10 settembre 2026. Non è stata eseguita una chiamata a pagamento indipendente, un test di velocità o una prova di affidabilità in produzione. Prima del deploy verificate di nuovo ID, prezzi, data della transizione e disponibilità del gateway.