O modelo Jev agora está integrado e disponível · Boas-vindas
Blogue
Guia

DeepSeek V4 Flash Vision Exp

O modelo multimodal experimental API do DeepSeek adiciona entrada de imagem ao V4-Flash na mesma faixa de preço. Aqui está o que pode fazer, quanto custa e onde estão os limites.

12 min de leituraOmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

DeepSeek-V4-Flash-Vision-Exp é fácil de interpretar mal. Não é um gerador de imagens e não é simplesmente o modelo V4-Flash normal com um novo nome. É um modelo experimental multimodal API que mantém os recursos de texto do V4-Flash e adiciona entrada de imagem.

Em agosto 21, 2026, o resumo prático é:

  • Model ID: deepseek-v4-flash-vision-exp.
  • Comportamento de texto: alinhado com DeepSeek-V4-Flash, incluindo agentes, raciocínio e conhecimento mundial.
  • Visão: entrada mista de texto e imagem para capturas de tela, gráficos, documentos e fluxos de trabalho de agentes visuais.
  • Preço: o mesmo nível do V4-Flash, com taxas de pico e fora de pico.
  • Situação: experimental. Teste-o em exemplos reais antes de torná-lo um padrão de produção.

Este guia responde às pesquisas que os desenvolvedores provavelmente farão: O que é DeepSeek V4 Flash Vision? O DeepSeek V4 Flash pode visualizar imagens? Quanto custa o DeepSeek Vision API? Como você envia uma imagem? Ele suporta OCR, PDFs, código Claude ou Codex? E é realmente melhor que V4-Pro, GPT ou Claude para tarefas visuais?

Para quem procura um reconhecimento de imagem DeepSeek API, análise de imagem API ou endpoint de entrada de imagem, este é o modelo a ser avaliado primeiro.

O que é DeepSeek V4 Flash Vision Exp?

DeepSeek-V4-Flash-Vision-Exp agora está disponível na plataforma DeepSeek API. Ele aceita imagens junto com texto e, em seguida, retorna uma resposta ou continua o fluxo de trabalho do agente com ferramentas.

DeepSeek descreve o modelo como compatível com V4-Flash em recursos de texto. Em benchmarks de agentes multimodais, a empresa diz que dá um grande salto em relação ao V4-Flash e se aproxima do Opus-4.8.. Esse é um contexto útil, mas ainda é uma afirmação de benchmark do fornecedor, em vez de uma classificação universal. Um resultado de benchmark visual não prova que o modelo é a melhor escolha para cada tarefa de texto, codificação ou uso de ferramenta.

A página oficial do modelo lista uma janela de contexto do token 1M e até tokens de saída 384K. Ele suporta modos de pensamento e não pensamento, saída JSON, chamadas de ferramentas, Responses API e Anthropic API. A conclusão do FIM não é suportada, portanto, uma ferramenta de codificação que depende do FIM não deve ser tratada como automaticamente compatível.

O chicote de fios DeepSeek 0.1.1 foi lançado com suporte pronto para uso no mesmo dia do modelo. Outras estruturas de agente ainda precisam de sua própria verificação de compatibilidade, especialmente em torno de blocos de conteúdo de imagem e resultados de ferramentas.

O que a visão flash DeepSeek V4 pode fazer?

O guia oficial do Vision nomeia descrição de imagem, reconhecimento de texto de captura de tela e análise de gráfico. Em um fluxo de trabalho real de desenvolvedor, os casos de uso mais fortes são um pouco mais específicos.

Depuração de captura de tela e revisão da IU

Forneça ao modelo uma captura de tela do navegador, uma mensagem de erro e o comportamento esperado. Ele pode inspecionar o estado visível antes de decidir quais logs ou ferramentas usar em seguida. Isso é mais útil do que um modelo que só pode descrever uma imagem depois que um humano já tiver diagnosticado o problema.

OCR e extração de documentos

O modelo pode ler texto de capturas de tela, digitalizações, recibos, formulários e etiquetas e, em seguida, retornar campos estruturados. Trate essa saída como um rascunho de extração, não como um resultado determinístico OCR. Fontes pequenas, brilho, distorção, desfoque e tabelas densas ainda precisam de verificação.

Gráficos e painéis

Ele pode ler um gráfico de linhas, gráfico de barras, captura de tela de tabela ou painel analítico e explicar tendências ou anomalias. Para decisões financeiras, médicas ou operacionais, preserve os números das fontes e peça a uma pessoa que verifique a conclusão.

Agentes visuais

O modelo pode combinar uma imagem com ferramentas, o que o torna útil para agentes de navegador, testes de UI, pesquisa visual e fluxos de trabalho que precisam agir de acordo com o que está na tela. A atualização importante não é apenas responder “o que há nesta imagem?”; é fornecer contexto visual ao agente enquanto ele trabalha.

Classificação de imagens em lote

O API permite até imagens 600 em uma solicitação. Isso pode funcionar para agrupamento de produtos, triagem de ativos e descrições em massa, embora lotes menores sejam mais fáceis de tentar novamente e revisar.

O Flash DeepSeek V4 tem visão?

O modelo deepseek-v4-flash comum é o modelo de texto. Para enviar uma imagem, use o ID exato do modelo de visão:

text
deepseek-v4-flash-vision-exp

Se um cliente enviar uma imagem para V4-Flash ou V4-Pro, o API retornará um erro de modelo não suporta imagem. Não deduza o suporte visual apenas da palavra “V4”; o ID do modelo é importante.

É um modelo de geração de imagens?

Não. DeepSeek-V4-Flash-Vision-Exp é um modelo de compreensão de imagem. Ele lê imagens e produz texto ou chamadas de ferramentas. Não é o ponto final certo para gerar um pôster, avatar, renderização de produto ou outra imagem nova.

Preço DeepSeek V4 Flash Vision Exp API

A página oficial de preços em inglês lista os preços por token 1M em dólares americanos. O modelo de visão usa as mesmas taxas do V4-Flash:

Item de cobrançaFora do horário de picoPico
Entrada, ocorrência de cacheTokens $0.007/1MTokens $0.014/1M
Entrada, falta de cacheTokens $0.22/1MTokens $0.44/1M
SaídaTokens $0.66/1MTokens $1.32/1M

Os horários de pico são 01:00-04:00 e 06:00-10:00 UTC. Todas as outras horas estão fora de pico e as tarifas fora de pico são metade das tarifas de pico. A página oficial pode mudar, então verifique-a novamente antes de orçar um aplicativo de longa duração.

Quanto custa uma imagem?

As imagens são convertidas em tokens de entrada com base em suas dimensões. O limite superior atual são tokens 384 por imagem. Na taxa de entrada cache-miss, uma imagem de tamanho máximo contribui aproximadamente:

  • Fora do horário de pico: 384 / 1,000,000 x $0.22 = $0.00008448;
  • Pico: 384 / 1,000,000 x $0.44 = $0.00016896.

Esse é apenas o componente de entrada de imagem. O prompt de texto, a saída, o histórico de conversas, os tokens de raciocínio e as chamadas de ferramentas são cobrados separadamente. Em um fluxo de trabalho de agente, chamadas longas e repetidas geralmente custam mais do que a própria imagem.

O Files API é gratuito para fazer upload e reutilizar um arquivo. Isso não torna a inferência do modelo livre: a leitura da imagem ainda consome tokens de entrada faturáveis.

Como usar o DeepSeek V4 Flash Vision Exp API

O API oferece suporte a três métodos de entrada de imagem:

  1. URLs de dados Base64 para imagens locais;
  2. URLs de imagens externas públicas;
  3. Os Arquivos API para imagens grandes ou imagens reutilizadas em solicitações.

Aqui está o menor exemplo de Python compatível com OpenAI usando um URL de imagem pública:

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Read the error message and suggest the next debugging step.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Substitua o URL de exemplo por uma imagem acessível publicamente ou use um URL de dados Base64 para um arquivo local. Os mesmos três métodos de entrada estão disponíveis através do Responses API. As solicitações de mensagens compatíveis com Anthropic usam um formato de bloco de conteúdo de imagem diferente, portanto, não copie um bloco OpenAI em uma solicitação Anthropic inalterado.

Escolhendo detalhes da imagem

O campo detail controla o pré-processamento para entradas image_url:

ValorComportamentoUse-o quando
lowReduz para 512 x 512 antes da inferênciaVocê precisa de velocidade e detalhes não são importantes
highMantém a imagem originalPequenos detalhes de texto ou gráfico são importantes
originalMantém a imagem originalVocê deseja um comportamento explícito e detalhado
autoAtualmente equivalente a originalVocê quer o comportamento padrão

Para análise repetida da mesma imagem, carregue-a uma vez através dos Arquivos API e reutilize seu file_id. Para uma pequena captura de tela única, uma imagem embutida ou URL público é mais simples.

Limites de entrada de imagem de visão flash DeepSeek V4

Esses limites são mais importantes na produção do que no título de lançamento:

LimiteValor atual
Formatos suportadosJPEG, PNG, GIF, WebP
Máximo de imagens por solicitação600
Solicitar corpo48 MiB
Uma imagem via Base64 ou URL externa32 MiB
Uma imagem via arquivos API64 MiB
Tamanho total da imagem por solicitação64 MiB sem file_id; até 200 MiB com imagens file_id
Dimensão máxima da imagem8192 px por lado
Com 15 ou mais imagens4096 px por lado
Comprimento do URL externoCaracteres 8192
Download de imagem externaDeve terminar em 60 segundos

As imagens são redimensionadas antes da inferência. Imagens pequenas são ampliadas preservando a proporção; imagens maiores são reduzidas aproximadamente à contagem de pixels de uma imagem 800 x 800. É por isso que cada imagem tem um teto de token 384 e também por que textos minúsculos devem ser verificados com cuidado.

Para solicitações de mensagens Chat Completions e Anthropic padrão, as imagens pertencem às mensagens do usuário. As imagens nas mensagens do sistema ou do assistente retornam um erro 400. O Responses API tem suas próprias regras documentadas para usuário, desenvolvedor e partes de imagem de saída de ferramenta.

PDF não está listado entre os formatos de imagem suportados. Se a entrada for um PDF, extraia o texto relevante ou renderize as páginas em JPEG/PNG primeiro e depois teste o resultado em páginas representativas.

DeepSeek Visão Flash V4 vs Flash V4 vs V4 Pro

TarefaMelhor ponto de partidaPor que
Trabalho em massa somente texto e agentes de baixo custoV4-FlashMesma camada de texto sem processamento de imagem
Capturas de tela, fotos, gráficos e ferramentas visuaisV4-Flash-Vision-ExpAdiciona entrada de imagem no nível de preço V4-Flash
Raciocínio de texto complexo e revisão final da arquiteturaV4-ProMais espaço para tarefas difíceis somente de texto

Vision Exp não é uma atualização V4-Flash mais cara. Ele mantém a camada de texto Flash e adiciona entrada visual. Se uma tarefa não contiver imagem, não há razão para mudar só porque o modelo é mais recente.

Também não é uma substituição garantida do V4-Pro. A declaração oficial “perto de Opus-4.8” é sobre benchmarks de agentes multimodais. Para uma aplicação real, compare os modelos no mesmo conjunto de imagens, prompts, ferramentas, meta de latência e critérios de aceitação. Desde então, DeepSeek lançou uma rota Flash mais recente. A análise do Flash DeepSeek V4.1 cobre seu ID de modelo atual, contrato de visão nativa, preços e status separado do V4 Pro.

O DeepSeek V4 Flash Vision é gratuito? Você pode executá-lo localmente?

O API é pago. Entrada, tokens de imagem, saída e chamadas de ferramentas são cobradas. O recurso de upload de arquivos API é gratuito, mas a inferência não é.

O anúncio de lançamento confirma a disponibilidade na plataforma DeepSeek API. Ele não diz que este modelo de visão experimental está disponível na web do consumidor ou na interface do aplicativo, portanto, não presuma que o seletor "Modo Especialista" do V4-Pro o inclua.

Não presuma implantação local. DeepSeek publicou informações de peso aberto para modelos de texto V4, mas a nota de lançamento do Vision Exp não anuncia pesos abertos para este modelo experimental API. Até que um modelo oficial de cartão e licença estejam disponíveis, "disponível através do API" e "disponível para download para inferência local" devem ser tratados como reivindicações diferentes.

Lista de verificação de produção

Antes de usar o modelo para tráfego real, teste pelo menos imagens representativas 20-50 e registre:

  • Precisão OCR nos campos que realmente importam;
  • precisão na interpretação de gráficos e tabelas;
  • taxa de sucesso de chamada de ferramenta após o fornecimento de uma imagem;
  • comportamento de latência e tempo limite;
  • uso de token de entrada, saída e raciocínio;
  • comportamento de fallback quando o modelo experimental falha.

Mantenha a imagem original e a resposta do modelo juntas para que um revisor possa ver o que o modelo realmente viu. Para documentos confidenciais, minimize a retenção e restrinja o acesso antes de enviá-los para qualquer modelo hospedado.

Perguntas frequentes

O DeepSeek V4 Flash Vision pode gerar imagens?

Não. Ele entende imagens e retorna mensagens de texto ou chamadas de ferramentas. Use um modelo de geração de imagens para novos recursos visuais.

O DeepSeek V4 Flash Vision é compatível com OCR?

Ele pode ler texto em capturas de tela e documentos, mas não é um mecanismo OCR determinístico. Valide texto pequeno, girado, desfocado ou com riscos altos com um segundo método.

Qual é o preço do DeepSeek V4 Flash Vision API?

A taxa oficial atual é $0.22 por tokens de entrada sem cache 1M e $0.66 por tokens de saída 1M fora do horário de pico. As taxas de pico são $0.44 e $1.32. A entrada de acerto de cache é mais barata. Os tokens de imagem usam o mesmo preço V4-Flash.

O Flash DeepSeek V4 normal suporta imagens?

Não. Use o ID exato do modelo deepseek-v4-flash-vision-exp. Outros modelos DeepSeek rejeitam a entrada de imagem.

Posso usá-lo com código Claude ou Codex?

O modelo suporta Responses API, Anthropic API e chamadas de ferramenta, para que possa se adequar ao fluxo de trabalho de um agente. O funcionamento confiável de um determinado cliente depende do conteúdo da imagem e da implementação do resultado da ferramenta. Teste o cliente real em vez de presumir que a compatibilidade do protocolo equivale a uma boa experiência do usuário.

O DeepSeek V4 Flash Vision é de código aberto?

O anúncio de lançamento atual do Vision Exp confirma um lançamento API, não um lançamento aberto. Não deduza o suporte à implantação local a partir dos anúncios separados do modelo de texto V4.

E se DeepSeek não fizer upload de uma imagem ou perder o texto?

Verifique se o arquivo é JPEG, PNG, GIF ou WebP, se permanece dentro dos limites de tamanho e se um URL externo está acessível. Para textos pequenos, experimente detail=high ou original; use os Arquivos API para uma imagem grande ou um arquivo que você irá reutilizar. Verifique os campos importantes com um segundo método.

Conclusão

DeepSeek-V4-Flash-Vision-Exp é mais interessante quando um agente precisa ver: uma tela do navegador, um gráfico, um recibo, um formulário digitalizado ou uma imagem de produto. Seu argumento prático é simples: comportamento de texto do V4-Flash, entrada de imagem e preço do V4-Flash.

Não é um substituto universal para V4-Pro, GPT, Claude, OCR profissional ou modelos de geração de imagem. Comece com um conjunto de teste de imagem fixo, meça a precisão e o custo total do fluxo de trabalho e mantenha um substituto enquanto o modelo ainda carrega o rótulo Exp.

Em minha própria pilha, mantenho o uso e o faturamento estabelecidos de Claude, GPT e Gemini visíveis por meio de OmniaKey, enquanto testo este modelo DeepSeek separadamente como especialista visual. Isso torna a comparação mensurável, em vez de transformar um anúncio de lançamento numa migração de produção não testada.

Fontes Oficiais