DeepSeek V4.1 Flash
O novo Flash reduz o custo e sobe em vários testes de agentes, mas os dados oficiais não mostram uma vitória sobre o V4 Pro em todo tipo de trabalho.
Esta Análise DeepSeek V4.1 Flash separa a arquitetura, os benchmarks publicados pela DeepSeek e o contrato de API que importa em uma integração real.
O veredito curto é que o V4.1 Flash merece ser a primeira opção de comparação para agentes de código com contexto longo, ferramentas, imagens e alto volume. Na API direta da DeepSeek, o preço fora do pico é $0.15 por milhão de tokens de entrada sem cache e $0.60 por saída. Isso não prova que ele substitui o V4 Pro em toda tarefa. Este artigo não inventa experiência própria, teste pago independente ou medição de velocidade.
Verificação dos fatos: 10 de setembro de 2026. A análise usa a nota de lançamento, os preços, os guias de API e o model card público da DeepSeek. Os benchmarks são vendor-reported, isto é, reportados pelo fornecedor, não reproduzidos de forma independente pela OmniaKey.
Quando testar o V4.1 Flash primeiro
Comece por ele em agentes de código com prompts longos e tool calls repetidas, depuração a partir de capturas de tela, OCR ou extração de documentos com validação posterior e automação em lote na qual throughput e custo por token são relevantes.
Faça regressão antes quando o fluxo depende do comportamento específico do V4 Pro, de tool calls estáveis ou de uma identidade de modelo fixa para auditoria. A DeepSeek anunciou que deepseek-v4-pro será roteado para o V4.1 Flash a partir de 2026-09-14 04:00 UTC. O mesmo ID deixará de executar o mesmo modelo.
Fatos confirmados no lançamento
| Item | Informação confirmada |
|---|---|
| Lançamento oficial | 2026-09-10 |
| ID canônico da API DeepSeek | deepseek-flash |
| IDs antigos de compatibilidade | deepseek-v4-flash, deepseek-v4-flash-vision-exp |
| Transição Pro | deepseek-v4-pro passa a V4.1 Flash em 2026-09-14 04:00 UTC |
| Arquitetura | MoE multimodal de 552B parâmetros, Causal Encoder-Decoder |
| Parâmetros ativos | 8B no prefill, 16B no decode |
| Capacidade | contexto de 1M, saída máxima de 384K |
| Superfícies de API | Chat Completions, Responses API, Anthropic API |
| Licença | pesos e repositório sob MIT |
V4 Flash e V4 Flash Vision Exp foram desativados. deepseek-v4-flash e deepseek-v4-flash-vision-exp são somente caminhos de compatibilidade temporária; uma integração nova deve usar deepseek-flash.
A DeepSeek também descreve KV Cache global de 890 bytes por token, cerca de 1/4 do V4 Flash, e pegada persistente de cache de cerca de 1/8. Isso é uma redução de memória no serving, não uma promessa de que a chamada cobrará automaticamente um quarto dos tokens.
Preço da API direta
A página em inglês da DeepSeek publica estas tarifas da API direta por milhão de tokens:
| Uso cobrado | Fora do pico | Pico |
|---|---|---|
| Entrada com cache hit | $0.003 | $0.006 |
| Entrada sem cache | $0.15 | $0.30 |
| Saída | $0.60 | $1.20 |
O pico ocorre de segunda a sexta, entre 01:00-04:00 e 06:00-10:00 UTC. Os outros horários, incluindo fins de semana, são fora do pico. São preços diretos da DeepSeek, não uma cotação da OmniaKey.
Com 100.000 tokens de entrada sem cache e 20.000 de saída:
V4.1 Flash fora do pico = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash no pico = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro fora do pico = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro no pico = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112
Nessa mistura exata, o V4.1 Flash custa cerca de 74% menos que o V4 Pro. É cálculo de preço, não nota de qualidade: reexecuções e correção humana podem mudar o custo por tarefa aceita. A fotografia de preços do Pro em agosto está no guia de preços DeepSeek V4 Pro (em inglês).
O que os benchmarks realmente mostram
No mesmo quadro do model card oficial, o V4.1 Flash supera o V4 Pro em várias tarefas de agente, mas não em todos os testes de conhecimento e raciocínio.
| Benchmark | V4 Flash | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| HLE, somente texto | 37.8 | 42.7 | 39.1 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| CyberGym | 76.7 | 83.3 | 88.1 |
| HLE com ferramentas | 51.5 | 60.0 | 63.9 |
| AutomationBench | 37.7 | 43.2 | 54.8 |
A conclusão defensável é melhoria forte nos cenários reportados de código, segurança, automação e ferramentas, não uma vitória universal. Há ainda uma divergência: o update log mostra 65.4 para NL2Repo-Bench e o model card ao vivo mostra 64.0. O valor não entra no veredito até a DeepSeek esclarecer a diferença.
O framework do agente altera o resultado
Com o mesmo V4.1 Flash, DeepSWE v1.1 vai de 65.5 no OpenCode a 74.2 no mini-SWE-agent, diferença de 8.7 pontos. Terminal-Bench 2.1 vai de 84.1 no Codex a 90.6 no DeepSeek Harness Minimal, diferença de 6.5 pontos.
A DeepSeek documenta N=8 amostras por tarefa DeepSWE, N=3 no Terminal-Bench, containers Linux, no máximo 500 passos de agente e esforço máximo de raciocínio. Prompt, loop de ferramentas, política de retry e gestão de contexto fazem parte do resultado. Compare no agente que será usado de verdade.
Visão e limites de integração
O V4.1 Flash aceita JPEG, PNG, GIF e WebP via base64, URL pública ou Files API. A entrada de imagem funciona em Chat Completions, Responses API e Anthropic API. Depois do redimensionamento automático, uma imagem usa no máximo 1,024 tokens de entrada.
Trata-se de entendimento de imagem, não geração de imagens. Texto pequeno, tabelas densas e campos contratuais ou financeiros importantes precisam de validação determinística ou revisão humana. Com tools no modo thinking, é preciso devolver todo reasoning_content às solicitações seguintes; a documentação aponta resposta 400 quando isso não ocorre. FIM completion só funciona sem thinking.
Disponibilidade na OmniAKey
Na verificação de 2026-09-10, o catálogo de modelos da OmniaKey ainda não listava a rota canônica deepseek-flash. Por isso, este artigo não afirma disponibilidade atual nem preço da OmniaKey para V4.1 Flash.
Quando o ID exato aparecer no catálogo, crie uma chave limitada separada em API Keys. Depois do primeiro smoke test, confira modelo, entrada, cache, saída e custo. Veja também o guia de faturamento transparente (em inglês) e o início rápido da API (em inglês).
Checklist para migrar do V4 Pro
- Fixe 10 a 30 tarefas representativas e seus critérios de aceitação.
- Salve tokens, latência, retries e resultado de
deepseek-v4-pro. - Repita a mesma tarefa com
deepseek-flash, as mesmas ferramentas e permissões. - Teste
highemaxseparadamente, mudando uma variável por vez. - Inclua um loop longo de ferramentas e, se aplicável, uma imagem real.
- Compare custo por tarefa aceita, não apenas o preço da primeira resposta.
- Atualize allowlists, alertas e rótulos de auditoria antes de 14 de setembro.
Perguntas frequentes
Qual é o novo ID do modelo?
Na API direta da DeepSeek, use deepseek-flash. Os dois IDs antigos de V4 Flash são aliases de compatibilidade.
V4.1 Flash é sempre melhor que V4 Pro?
Não. Ele lidera várias métricas oficiais de agentes, mas V4 Pro continua à frente em GPQA Diamond e HLE somente texto. A tarefa e o framework devem decidir.
V4.1 Flash é open source?
O repositório e os pesos usam MIT. Operar um MoE de 552B continua exigindo hardware especializado, prompt encoding correto e validação operacional.
Fontes primárias
- Nota de lançamento do DeepSeek V4.1 Flash (em inglês)
- Modelos e preços DeepSeek (em inglês)
- Model card DeepSeek V4.1 Flash (em inglês)
- Relatório técnico DeepSeek V4.1 (em inglês)
- Guia de entendimento de imagem (em inglês)
- Guia de thinking mode (em inglês)
- Registro de atualizações DeepSeek (em inglês)
Fatos e cálculos foram verificados em 10 de setembro de 2026. Não houve chamada paga independente, teste de velocidade ou teste de confiabilidade em produção. Confirme novamente IDs, preços, data da transição e disponibilidade do gateway antes do deploy.