GPT-5.4 e GPT-5.4 Mini foram descontinuados · Mude para outro modelo disponível
Blogue
Guia

DeepSeek V4.1 Flash

O novo Flash reduz o custo e sobe em vários testes de agentes, mas os dados oficiais não mostram uma vitória sobre o V4 Pro em todo tipo de trabalho.

12 min de leituraOmniaKey
DeepSeek V4.1 Flashanálise de modelopreço de APImultimodalagente de código

Esta Análise DeepSeek V4.1 Flash separa a arquitetura, os benchmarks publicados pela DeepSeek e o contrato de API que importa em uma integração real.

O veredito curto é que o V4.1 Flash merece ser a primeira opção de comparação para agentes de código com contexto longo, ferramentas, imagens e alto volume. Na API direta da DeepSeek, o preço fora do pico é $0.15 por milhão de tokens de entrada sem cache e $0.60 por saída. Isso não prova que ele substitui o V4 Pro em toda tarefa. Este artigo não inventa experiência própria, teste pago independente ou medição de velocidade.

Verificação dos fatos: 10 de setembro de 2026. A análise usa a nota de lançamento, os preços, os guias de API e o model card público da DeepSeek. Os benchmarks são vendor-reported, isto é, reportados pelo fornecedor, não reproduzidos de forma independente pela OmniaKey.

Quando testar o V4.1 Flash primeiro

Comece por ele em agentes de código com prompts longos e tool calls repetidas, depuração a partir de capturas de tela, OCR ou extração de documentos com validação posterior e automação em lote na qual throughput e custo por token são relevantes.

Faça regressão antes quando o fluxo depende do comportamento específico do V4 Pro, de tool calls estáveis ou de uma identidade de modelo fixa para auditoria. A DeepSeek anunciou que deepseek-v4-pro será roteado para o V4.1 Flash a partir de 2026-09-14 04:00 UTC. O mesmo ID deixará de executar o mesmo modelo.

Fatos confirmados no lançamento

ItemInformação confirmada
Lançamento oficial2026-09-10
ID canônico da API DeepSeekdeepseek-flash
IDs antigos de compatibilidadedeepseek-v4-flash, deepseek-v4-flash-vision-exp
Transição Prodeepseek-v4-pro passa a V4.1 Flash em 2026-09-14 04:00 UTC
ArquiteturaMoE multimodal de 552B parâmetros, Causal Encoder-Decoder
Parâmetros ativos8B no prefill, 16B no decode
Capacidadecontexto de 1M, saída máxima de 384K
Superfícies de APIChat Completions, Responses API, Anthropic API
Licençapesos e repositório sob MIT

V4 Flash e V4 Flash Vision Exp foram desativados. deepseek-v4-flash e deepseek-v4-flash-vision-exp são somente caminhos de compatibilidade temporária; uma integração nova deve usar deepseek-flash.

A DeepSeek também descreve KV Cache global de 890 bytes por token, cerca de 1/4 do V4 Flash, e pegada persistente de cache de cerca de 1/8. Isso é uma redução de memória no serving, não uma promessa de que a chamada cobrará automaticamente um quarto dos tokens.

Preço da API direta

A página em inglês da DeepSeek publica estas tarifas da API direta por milhão de tokens:

Uso cobradoFora do picoPico
Entrada com cache hit$0.003$0.006
Entrada sem cache$0.15$0.30
Saída$0.60$1.20

O pico ocorre de segunda a sexta, entre 01:00-04:00 e 06:00-10:00 UTC. Os outros horários, incluindo fins de semana, são fora do pico. São preços diretos da DeepSeek, não uma cotação da OmniaKey.

Com 100.000 tokens de entrada sem cache e 20.000 de saída:

text
V4.1 Flash fora do pico = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash no pico      = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro fora do pico     = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro no pico          = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112

Nessa mistura exata, o V4.1 Flash custa cerca de 74% menos que o V4 Pro. É cálculo de preço, não nota de qualidade: reexecuções e correção humana podem mudar o custo por tarefa aceita. A fotografia de preços do Pro em agosto está no guia de preços DeepSeek V4 Pro (em inglês).

O que os benchmarks realmente mostram

No mesmo quadro do model card oficial, o V4.1 Flash supera o V4 Pro em várias tarefas de agente, mas não em todos os testes de conhecimento e raciocínio.

BenchmarkV4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE, somente texto37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE com ferramentas51.560.063.9
AutomationBench37.743.254.8

A conclusão defensável é melhoria forte nos cenários reportados de código, segurança, automação e ferramentas, não uma vitória universal. Há ainda uma divergência: o update log mostra 65.4 para NL2Repo-Bench e o model card ao vivo mostra 64.0. O valor não entra no veredito até a DeepSeek esclarecer a diferença.

O framework do agente altera o resultado

Com o mesmo V4.1 Flash, DeepSWE v1.1 vai de 65.5 no OpenCode a 74.2 no mini-SWE-agent, diferença de 8.7 pontos. Terminal-Bench 2.1 vai de 84.1 no Codex a 90.6 no DeepSeek Harness Minimal, diferença de 6.5 pontos.

A DeepSeek documenta N=8 amostras por tarefa DeepSWE, N=3 no Terminal-Bench, containers Linux, no máximo 500 passos de agente e esforço máximo de raciocínio. Prompt, loop de ferramentas, política de retry e gestão de contexto fazem parte do resultado. Compare no agente que será usado de verdade.

Visão e limites de integração

O V4.1 Flash aceita JPEG, PNG, GIF e WebP via base64, URL pública ou Files API. A entrada de imagem funciona em Chat Completions, Responses API e Anthropic API. Depois do redimensionamento automático, uma imagem usa no máximo 1,024 tokens de entrada.

Trata-se de entendimento de imagem, não geração de imagens. Texto pequeno, tabelas densas e campos contratuais ou financeiros importantes precisam de validação determinística ou revisão humana. Com tools no modo thinking, é preciso devolver todo reasoning_content às solicitações seguintes; a documentação aponta resposta 400 quando isso não ocorre. FIM completion só funciona sem thinking.

Disponibilidade na OmniAKey

Na verificação de 2026-09-10, o catálogo de modelos da OmniaKey ainda não listava a rota canônica deepseek-flash. Por isso, este artigo não afirma disponibilidade atual nem preço da OmniaKey para V4.1 Flash.

Quando o ID exato aparecer no catálogo, crie uma chave limitada separada em API Keys. Depois do primeiro smoke test, confira modelo, entrada, cache, saída e custo. Veja também o guia de faturamento transparente (em inglês) e o início rápido da API (em inglês).

Checklist para migrar do V4 Pro

  1. Fixe 10 a 30 tarefas representativas e seus critérios de aceitação.
  2. Salve tokens, latência, retries e resultado de deepseek-v4-pro.
  3. Repita a mesma tarefa com deepseek-flash, as mesmas ferramentas e permissões.
  4. Teste high e max separadamente, mudando uma variável por vez.
  5. Inclua um loop longo de ferramentas e, se aplicável, uma imagem real.
  6. Compare custo por tarefa aceita, não apenas o preço da primeira resposta.
  7. Atualize allowlists, alertas e rótulos de auditoria antes de 14 de setembro.

Perguntas frequentes

Qual é o novo ID do modelo?

Na API direta da DeepSeek, use deepseek-flash. Os dois IDs antigos de V4 Flash são aliases de compatibilidade.

V4.1 Flash é sempre melhor que V4 Pro?

Não. Ele lidera várias métricas oficiais de agentes, mas V4 Pro continua à frente em GPQA Diamond e HLE somente texto. A tarefa e o framework devem decidir.

V4.1 Flash é open source?

O repositório e os pesos usam MIT. Operar um MoE de 552B continua exigindo hardware especializado, prompt encoding correto e validação operacional.

Fontes primárias

Fatos e cálculos foram verificados em 10 de setembro de 2026. Não houve chamada paga independente, teste de velocidade ou teste de confiabilidade em produção. Confirme novamente IDs, preços, data da transição e disponibilidade do gateway antes do deploy.