DeepSeek V4 Flash ya está disponible · Nuestro precio de GLM-5.2 baja al 50% del oficial
Blog
Guía

DeepSeek V4 Flash Vision Exp

El modelo multimodal experimental de DeepSeek añade imágenes a V4-Flash con la misma tarifa. Esto es lo que puede hacer, cuesta y limita.

12 min de lecturaOmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

Si buscas información sobre DeepSeek V4 Flash Vision Exp, es fácil encontrar dos confusiones: algunos artículos lo presentan como un generador de imágenes y otros lo describen como si fuera el DeepSeek V4 Flash normal. En realidad, es un modelo multimodal experimental para la API: mantiene las capacidades de texto de V4-Flash y añade entrada de imágenes.

La respuesta rápida, con la información oficial disponible el 21 de agosto de 2026:

  • ID exacto del modelo: deepseek-v4-flash-vision-exp;
  • entiende capturas de pantalla, fotografías, documentos y gráficos;
  • conserva las capacidades de texto de V4-Flash, incluidos los agentes y el razonamiento;
  • tiene el mismo nivel de precio que V4-Flash, con tarifas punta y fuera de punta;
  • sigue siendo una versión experimental, así que conviene probarla antes de convertirla en el modelo principal.

En esta guía explico el precio de DeepSeek V4 Flash Vision Exp, cómo usar la API, si sirve para OCR y reconocimiento de imágenes, cómo subir imágenes, cuáles son sus límites y cuándo conviene elegir V4-Flash o V4-Pro.

¿Qué es DeepSeek V4 Flash Vision Exp?

DeepSeek-V4-Flash-Vision-Exp está disponible en la plataforma API de DeepSeek. Acepta texto e imágenes en la misma solicitud y puede responder con texto o continuar un flujo de agente usando herramientas.

DeepSeek afirma que sus capacidades de texto están alineadas con V4-Flash: agentes, razonamiento y conocimiento general. En pruebas de agentes multimodales, la compañía dice que el modelo mejora mucho frente a V4-Flash y se acerca a Opus-4.8.

Ese último dato debe leerse con contexto. Es una afirmación basada en evaluaciones publicadas por DeepSeek, no una clasificación universal e independiente. Un resultado visual no demuestra que el modelo sea mejor que V4-Pro, GPT o Claude en cualquier tarea de texto, código o herramientas.

La página oficial de modelos indica una ventana de contexto de 1M tokens y hasta 384K tokens de salida. También aparecen los modos thinking y non-thinking, JSON Output, Tool Calls, Responses API y Anthropic API. FIM Completion no está disponible, por lo que la compatibilidad con un agente de programación no implica que funcione como modelo de autocompletado FIM.

DeepSeek Harness 0.1.1 se publicó el mismo día con soporte integrado. En otros frameworks de agentes hay que comprobar por separado el formato de los bloques de imagen y la forma en que se devuelven los resultados de las herramientas.

¿Qué puede hacer DeepSeek V4 Flash Vision?

La guía oficial menciona descripción de imágenes, lectura de texto en capturas y análisis de gráficos. En proyectos reales, estos son los casos de uso más útiles.

Depurar capturas de pantalla y revisar interfaces

Puedes enviar una captura del navegador, el mensaje de error y el comportamiento esperado. El modelo ve el estado de la interfaz antes de sugerir qué registro o herramienta revisar. Para pruebas de UI y agentes de navegador, esto es más útil que describirle manualmente lo que ya aparece en pantalla.

OCR y extracción de documentos

Puede leer texto de capturas, escaneos, recibos, formularios y etiquetas, y devolver campos estructurados. Úsalo como un primer borrador de extracción, no como un OCR determinista. Las letras pequeñas, los reflejos, la inclinación, el desenfoque y las tablas densas requieren una revisión adicional.

En documentos médicos, financieros o legales, la salida debe pasar por una persona antes de convertirse en una decisión.

Gráficos y paneles de datos

El modelo puede explicar tendencias en gráficos de líneas o barras, comparar valores de una tabla y señalar anomalías visibles en un panel. Conserva los números originales y verifica la interpretación si afecta a una decisión operativa o económica.

Agentes con contexto visual

La ventaja principal no es responder otra vez «¿qué aparece en esta imagen?». Un agente puede recibir una captura, encontrar un elemento, comparar un diseño con una referencia o continuar una cadena de llamadas a herramientas usando lo que ve.

Clasificación de muchas imágenes

La API permite hasta 600 imágenes en una solicitud. Puede servir para agrupar productos, ordenar recursos gráficos o crear descripciones en lote. Para producción, los lotes pequeños son más fáciles de reintentar y revisar.

¿DeepSeek V4 Flash puede ver imágenes?

El modelo normal deepseek-v4-flash es el modelo de texto. Para enviar una imagen debes seleccionar exactamente:

text
deepseek-v4-flash-vision-exp

Si envías una imagen a V4-Flash o V4-Pro, la API devuelve un error de modelo no compatible con imágenes. No des por hecho que todos los modelos V4 tienen visión: el ID exacto es lo que determina la capacidad.

¿DeepSeek puede generar imágenes?

No. DeepSeek V4 Flash Vision Exp entiende imágenes y devuelve texto o llamadas a herramientas. No es el modelo adecuado para crear un póster, un avatar, una ilustración o un render de producto.

DeepSeek V4 Flash Vision Exp: precio de la API

La página oficial en inglés muestra los precios por 1M de tokens en dólares estadounidenses. Vision Exp utiliza la misma tarifa que V4-Flash:

ConceptoFuera de puntaEn punta
Entrada, cache hit$0.007 / 1M tokens$0.014 / 1M tokens
Entrada, cache miss$0.22 / 1M tokens$0.44 / 1M tokens
Salida$0.66 / 1M tokens$1.32 / 1M tokens

Las horas punta son 01:00-04:00 y 06:00-10:00 UTC. El resto del día es fuera de punta y cuesta la mitad. La página oficial puede cambiar, así que conviene comprobarla antes de presupuestar una aplicación de uso continuo.

¿Cuánto cuesta una imagen?

Las imágenes se convierten en tokens de entrada según sus dimensiones. El límite actual es de 384 tokens por imagen. Con la tarifa de entrada sin caché, el componente de una imagen que llega al máximo cuesta aproximadamente:

  • Fuera de punta: 384 / 1,000,000 x $0.22 = $0.00008448;
  • En punta: 384 / 1,000,000 x $0.44 = $0.00016896.

Ese cálculo solo cubre la imagen. El texto del prompt, la respuesta, el historial, los tokens de razonamiento y las llamadas a herramientas se cobran por separado. En un agente, la salida larga y las llamadas repetidas suelen costar más que la imagen.

Files API se puede usar gratis para subir y reutilizar un archivo. Eso no significa que el análisis sea gratuito: leer la imagen sigue consumiendo tokens de entrada facturables.

¿Cómo usar DeepSeek V4 Flash Vision Exp por API?

La documentación ofrece tres formas de enviar una imagen:

  1. una data URL en Base64 para archivos locales;
  2. una URL pública de imagen;
  3. Files API para archivos grandes o imágenes que se reutilizan.

Este es un ejemplo mínimo con el cliente compatible con OpenAI y una URL pública:

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Lee el mensaje de error y sugiere el siguiente paso.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Sustituye la URL de ejemplo por una imagen accesible públicamente o utiliza una data URL en Base64 para un archivo local. Los mismos tres métodos están disponibles en Responses API. Anthropic Messages usa otra estructura para el bloque de imagen; no copies el bloque de OpenAI sin adaptarlo.

Cómo elegir el nivel de detalle

El campo detail controla el preprocesamiento de las entradas image_url:

ValorQué haceCuándo usarlo
lowReduce la imagen a 512 x 512 antes de inferirClasificación rápida sin detalles pequeños
highConserva la imagen originalTexto pequeño, tablas y detalles de interfaz
originalConserva la imagen originalQuieres indicar explícitamente el modo completo
autoActualmente equivale a originalQuieres usar el valor predeterminado

Si vas a analizar la misma imagen varias veces, súbela una vez mediante Files API y reutiliza su file_id. Para una captura pequeña de un solo uso, una URL o una imagen inline es más sencilla.

Límites de DeepSeek V4 Flash Vision

LímiteValor actual
Formatos compatiblesJPEG, PNG, GIF, WebP
Imágenes por solicitud600 como máximo
Tamaño del cuerpo de la solicitud48 MiB
Una imagen por Base64 o URL externa32 MiB como máximo
Una imagen mediante Files API64 MiB como máximo
Tamaño total de imágenes64 MiB sin file_id; hasta 200 MiB con imágenes file_id
Dimensión máxima8192 px por lado
Con 15 imágenes o más4096 px por lado
Longitud de URL externa8192 caracteres
Descarga de URL externaDebe terminar en 60 segundos

Antes de la inferencia, las imágenes se redimensionan. Las imágenes grandes se reducen aproximadamente al número de píxeles de una imagen de 800 x 800, por eso existe un tope de 384 tokens y también por eso el texto muy pequeño puede perder precisión.

En Chat Completions y Anthropic Messages, las imágenes deben estar en mensajes de usuario. Si las colocas en system o assistant, la API devuelve un error 400. Responses API tiene reglas propias para las partes de imagen en mensajes y resultados de herramientas.

PDF no aparece entre los formatos de imagen admitidos. Si tienes un PDF, extrae el texto o convierte las páginas necesarias a JPEG/PNG y comprueba el resultado con páginas representativas.

DeepSeek V4 Flash Vision frente a V4-Flash y V4-Pro

TareaPunto de partida recomendadoMotivo
Trabajo masivo solo con texto y agentes de bajo costeV4-FlashMisma categoría de texto sin procesar imágenes
Capturas, fotos, gráficos y herramientas visualesV4-Flash-Vision-ExpAñade imágenes con el precio de V4-Flash
Razonamiento textual complejo y revisión finalV4-ProMás margen para tareas de texto difíciles

Vision Exp no es una versión más cara de V4-Flash. Mantiene el nivel de texto y precio de Flash, y añade entrada visual. Si tu tarea no contiene imágenes, no hay motivo para migrar solo porque el nombre sea nuevo.

Tampoco es un reemplazo garantizado de V4-Pro. La comparación con Opus-4.8 se refiere a benchmarks de agentes multimodales. Para una aplicación real, compara los modelos con el mismo conjunto de imágenes, prompts, herramientas, objetivo de latencia y criterios de aceptación.

¿DeepSeek V4 Flash Vision es gratis? ¿Se puede ejecutar localmente?

La API es de pago. Se cobran las entradas de texto, los tokens de imagen, la salida y las llamadas a herramientas. Files API es gratuita para subir y reutilizar archivos, no para ejecutar inferencia.

El anuncio confirma la disponibilidad en la plataforma API de DeepSeek. No afirma que este modelo experimental aparezca ya en la web o en la aplicación para consumidores. No des por hecho que el selector “Expert Mode” de V4-Pro incluye Vision Exp.

No hay que asumir que se puede instalar localmente. DeepSeek ha publicado información de pesos abiertos para modelos de texto V4, pero el anuncio de Vision Exp no presenta pesos abiertos ni una licencia para este modelo experimental. “Disponible por API” y “descargable para inferencia local” son afirmaciones distintas.

Preguntas frecuentes

¿DeepSeek V4 Flash Vision puede generar imágenes?

No. Comprende imágenes y devuelve texto o llamadas a herramientas. Para crear imágenes necesitas un modelo de generación.

¿DeepSeek V4 Flash Vision sirve para OCR?

Puede leer texto en capturas y documentos, pero no es un motor OCR determinista. Comprueba las partes pequeñas, giradas, borrosas o importantes.

¿Qué precio tiene DeepSeek Vision API?

La tarifa oficial actual fuera de punta es de $0.22 por 1M tokens de entrada sin caché y $0.66 por 1M tokens de salida. En horas punta son $0.44 y $1.32. Las imágenes usan la misma tarifa de entrada de V4-Flash.

¿DeepSeek V4 Flash normal acepta imágenes?

No. Utiliza el ID exacto deepseek-v4-flash-vision-exp; los demás modelos DeepSeek rechazan la entrada de imágenes.

¿Puedo usarlo con Claude Code o Codex?

El modelo ofrece Responses API, Anthropic API y llamadas a herramientas, por lo que puede integrarse en un flujo de agente. La estabilidad depende de que el cliente transmita correctamente la imagen y los resultados de las herramientas; hay que probar el cliente concreto.

¿DeepSeek V4 Flash Vision Exp es open source?

El anuncio actual confirma un lanzamiento por API, no un lanzamiento de pesos abiertos. No extrapoles la información de los modelos de texto V4 a esta versión experimental.

¿Qué hago si DeepSeek no me deja subir imágenes o no extrae el texto?

Comprueba que el archivo sea JPEG, PNG, GIF o WebP, que no supere los límites y que la URL externa sea accesible. Para texto pequeño prueba detail=high u original; si la imagen es grande o se reutiliza, usa Files API. Los campos importantes deben revisarse con otra herramienta o por una persona.

Conclusión

DeepSeek-V4-Flash-Vision-Exp merece una prueba cuando un agente necesita ver una pantalla del navegador, un gráfico, un recibo, un formulario escaneado o una fotografía. Su propuesta práctica es clara: comportamiento textual de V4-Flash, entrada de imágenes y precio de V4-Flash.

No es un reemplazo universal de V4-Pro, GPT, Claude, un OCR profesional o un generador de imágenes. Empieza con 20-50 imágenes reales, mide precisión, latencia, éxito de las llamadas a herramientas y coste total, y conserva un modelo de respaldo mientras siga siendo una versión Exp.

En mi flujo principal mantengo visibles en OmniAKey los costes y las llamadas de Claude, GPT y Gemini, y pruebo este modelo de DeepSeek por separado como especialista visual. Así la comparación se basa en datos, no en el entusiasmo de un lanzamiento.

Fuentes oficiales