GPT-5.4 e GPT-5.4 Mini sono stati ritirati · Passa a un altro modello disponibile
Blog
Guida

DeepSeek V4.1 Flash

Il nuovo Flash costa meno e sale in vari test per agenti, ma i dati ufficiali non dimostrano che superi V4 Pro in ogni attività.

12 min di letturaOmniaKey
DeepSeek V4.1 Flashrecensione modelloprezzi APImultimodaleagente di coding

Questa Recensione DeepSeek V4.1 Flash separa architettura, benchmark pubblicati da DeepSeek e contratto API che conta in una vera integrazione.

Il giudizio breve è che V4.1 Flash merita di essere il primo candidato per agenti di coding con contesto lungo, strumenti, immagini e carichi elevati. Sull'API diretta DeepSeek il prezzo off-peak è $0.15 per un milione di token input senza cache e $0.60 per l'output. Questo non prova che rimpiazzi V4 Pro in ogni lavoro. L'articolo non dichiara esperienze inventate, esecuzioni a pagamento indipendenti o test di velocità propri.

Verifica dei fatti: 10 settembre 2026. L'analisi usa nota di rilascio, listino, guide API e model card pubblica di DeepSeek. I benchmark sono vendor-reported: riportati dal fornitore e non riprodotti in modo indipendente da OmniaKey.

Quando provare prima V4.1 Flash

È un buon primo modello per agenti di codice con prompt lunghi e tool call ripetute, debug tramite screenshot, OCR o estrazione documentale con verifica successiva e automazioni batch in cui throughput e costo per token contano.

Prima eseguite una regressione se il flusso dipende dal comportamento di V4 Pro, da tool call molto stabili o da un'identità modello fissa per audit. DeepSeek annuncia che deepseek-v4-pro sarà inoltrato a V4.1 Flash dal 2026-09-14 04:00 UTC. Lo stesso ID non eseguirà più lo stesso modello.

Informazioni confermate al lancio

VoceInformazione verificata
Rilascio ufficiale2026-09-10
ID API DeepSeek canonicodeepseek-flash
ID legacy compatibilideepseek-v4-flash, deepseek-v4-flash-vision-exp
Transizione Prodeepseek-v4-pro passa a V4.1 Flash il 2026-09-14 04:00 UTC
ArchitetturaMoE multimodale da 552B parametri, Causal Encoder-Decoder
Parametri attivi8B nel prefill, 16B nel decode
Capacitàcontesto 1M, output massimo 384K
APIChat Completions, Responses API, Anthropic API
Licenzapesi e repository MIT

V4 Flash e V4 Flash Vision Exp sono ritirati. deepseek-v4-flash e deepseek-v4-flash-vision-exp sono solo percorsi temporanei di compatibilità; una nuova integrazione deve usare deepseek-flash.

DeepSeek descrive un KV Cache globale da 890 bytes per token, circa 1/4 di V4 Flash, e un'impronta persistente di circa 1/8. È un vantaggio di memoria lato serving, non la promessa che i token fatturati diventino automaticamente un quarto.

Prezzi dell'API diretta

La pagina inglese di DeepSeek pubblica queste tariffe dell'API diretta per milione di token:

Uso fatturabileOff-peakPeak
Input cache hit$0.003$0.006
Input senza cache$0.15$0.30
Output$0.60$1.20

Le ore di punta sono dal lunedì al venerdì, 01:00-04:00 e 06:00-10:00 UTC. Gli altri orari, inclusi i weekend, sono off-peak. Sono prezzi diretti DeepSeek, non un listino OmniAKey.

Con 100.000 token input senza cache e 20.000 token output:

text
V4.1 Flash off-peak = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash peak     = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro off-peak     = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro peak         = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112

Con questa miscela, V4.1 Flash costa circa il 74% in meno di V4 Pro. È aritmetica dei prezzi, non un punteggio di qualità: retry e correzione umana possono cambiare il costo per attività accettata. Lo snapshot di prezzo Pro di agosto resta nella guida prezzi DeepSeek V4 Pro (in inglese).

Cosa mostrano davvero i benchmark

Nella stessa tabella della model card ufficiale, V4.1 Flash supera V4 Pro in varie attività di agenti, ma non in tutti i test di conoscenza e ragionamento.

BenchmarkV4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE, solo testo37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE con strumenti51.560.063.9
AutomationBench37.743.254.8

La conclusione sostenibile è un forte miglioramento negli scenari riportati di codice, sicurezza, automazione e tool use, non una vittoria universale. C'è anche una divergenza: l'update log riporta 65.4 per NL2Repo-Bench, mentre la model card live riporta 64.0. Il valore è escluso dal giudizio finché DeepSeek non chiarisce la differenza.

Il framework dell'agente cambia il risultato

Con lo stesso V4.1 Flash, DeepSWE v1.1 passa da 65.5 con OpenCode a 74.2 con mini-SWE-agent, una differenza di 8.7 punti. Terminal-Bench 2.1 passa da 84.1 con Codex a 90.6 con DeepSeek Harness Minimal, una differenza di 6.5 punti.

DeepSeek documenta N=8 campioni per task DeepSWE, N=3 per Terminal-Bench, container Linux, massimo 500 passi dell'agente e reasoning effort massimo. Formato del prompt, ciclo strumenti, retry e gestione del contesto sono parte del risultato. Confrontate nel framework che userete davvero.

Visione e limiti di integrazione

V4.1 Flash accetta JPEG, PNG, GIF e WebP tramite base64, URL pubblica o Files API. L'input immagine funziona in Chat Completions, Responses API e Anthropic API. Dopo il ridimensionamento automatico, un'immagine usa al massimo 1,024 token di input.

È comprensione visiva, non generazione di immagini. Testo piccolo, tabelle dense e campi contrattuali o finanziari importanti richiedono controllo deterministico o revisione umana. Con tools in thinking mode occorre restituire tutto reasoning_content alle richieste successive; la guida descrive una risposta 400 se non avviene. FIM completion è disponibile solo senza thinking.

Disponibilità in OmniAKey

Alla verifica del 2026-09-10, il catalogo modelli OmniAKey non mostrava ancora la route canonica deepseek-flash. Questo articolo non afferma quindi disponibilità corrente o prezzo OmniAKey per V4.1 Flash.

Quando l'ID preciso appare nel catalogo, create una chiave separata con limite in API Keys. Dopo il primo smoke test, controllate modello, input, cache, output e costo. Consultate anche la guida alla fatturazione trasparente (in inglese) e l'avvio rapido API (in inglese).

Checklist di migrazione da V4 Pro

  1. Fissate da 10 a 30 attività rappresentative e relativi criteri di accettazione.
  2. Salvate token, latenza, retry e risultato di deepseek-v4-pro.
  3. Ripetete l'attività con deepseek-flash, stessi strumenti e permessi.
  4. Provate high e max separatamente, cambiando una variabile alla volta.
  5. Includete un tool loop lungo e, se necessario, una vera attività con immagine.
  6. Confrontate il costo per attività accettata, non solo il prezzo della prima risposta.
  7. Aggiornate allowlist, monitoraggio ed etichette di audit prima del 14 settembre.

Domande frequenti

Qual è il nuovo ID del modello?

Per l'API diretta DeepSeek è deepseek-flash. I due ID V4 Flash precedenti sono solo alias di compatibilità.

V4.1 Flash è sempre migliore di V4 Pro?

No. Guida diverse metriche ufficiali per agenti, ma V4 Pro resta avanti in GPQA Diamond e HLE solo testo. Devono decidere attività e framework dell'agente.

V4.1 Flash è open source?

Repository e pesi usano MIT. Eseguire un MoE da 552B richiede comunque hardware specializzato, prompt encoding corretto e validazione operativa.

Fonti primarie

Fatti e calcoli sono stati verificati il 10 settembre 2026. Non è stata eseguita una chiamata a pagamento indipendente, un test di velocità o una prova di affidabilità in produzione. Prima del deploy verificate di nuovo ID, prezzi, data della transizione e disponibilità del gateway.