GPT-5.4 y GPT-5.4 Mini se han retirado · Cambia a otro modelo disponible
Blog
Guía

DeepSeek V4.1 Flash

El nuevo Flash baja el coste y sube en varias pruebas de agentes, pero la evidencia oficial no demuestra que supere a V4 Pro en toda tarea.

12 min de lecturaOmniaKey
DeepSeek V4.1 Flashanálisis de modeloprecio de APImultimodalagente de código

Este Análisis de DeepSeek V4.1 Flash separa la arquitectura, los benchmarks publicados por DeepSeek y los contratos de API que importan al integrar el modelo.

La respuesta breve es que V4.1 Flash merece ser la primera alternativa en agentes de código con contexto largo, bucles de herramientas, imágenes y mucho volumen. La API directa de DeepSeek cobra $0.15 por millón de tokens de entrada sin caché y $0.60 por salida en horario valle. No significa que sustituya a V4 Pro en todo caso: este artículo no ejecutó una prueba independiente de pago ni afirma experiencia de producción propia.

Verificación de hechos: 10 de septiembre de 2026. Este análisis usa la nota de lanzamiento, precios, guías API y model card públicos de DeepSeek. Las cifras de benchmark son vendor-reported: las reporta el proveedor, no una reproducción independiente de OmniaKey.

Cuándo probar V4.1 Flash primero

Es una buena primera ruta para agentes de código con prompts largos y llamadas repetidas a herramientas, depuración con capturas de pantalla, extracción OCR con validación posterior y automatización por lotes donde importan el rendimiento y el precio por token.

Primero hay que hacer regresión si el flujo depende de comportamiento específico de V4 Pro, de formato de tool calls estable o de una identidad de modelo fija. DeepSeek anuncia que deepseek-v4-pro pasará a V4.1 Flash desde 2026-09-14 04:00 UTC. El mismo ID dejará de ejecutar el mismo modelo.

Datos confirmados en el lanzamiento

ElementoInformación verificada
Lanzamiento2026-09-10
ID oficial de DeepSeek APIdeepseek-flash
IDs antiguos compatiblesdeepseek-v4-flash, deepseek-v4-flash-vision-exp
Transición Prodeepseek-v4-pro pasa a V4.1 Flash el 2026-09-14 04:00 UTC
ArquitecturaMoE multimodal de 552B parámetros, Causal Encoder-Decoder
Parámetros activos8B en prefill, 16B en decode
Capacidadcontexto de 1M y salida máxima de 384K
APIChat Completions, Responses API, Anthropic API
Licenciapesos y repositorio bajo MIT

V4 Flash y V4 Flash Vision Exp están retirados. deepseek-v4-flash y deepseek-v4-flash-vision-exp son rutas temporales de compatibilidad; una integración nueva debe usar deepseek-flash.

DeepSeek describe un KV Cache global de 890 bytes por token, aproximadamente 1/4 del de V4 Flash, y una huella persistente de aproximadamente 1/8. Eso reduce memoria de serving; no significa que una llamada facture automáticamente una cuarta parte de tokens.

Precio de la API directa

La página en inglés de DeepSeek publica estos precios por millón de tokens para la API directa:

Uso facturableVallePico
Entrada con cache hit$0.003$0.006
Entrada sin cache$0.15$0.30
Salida$0.60$1.20

Las horas pico son de lunes a viernes, 01:00-04:00 y 06:00-10:00 UTC. El resto, incluidos los fines de semana, es valle. Son precios directos de DeepSeek, no una cotización de OmniAKey.

Para 100.000 tokens de entrada sin caché y 20.000 de salida:

text
V4.1 Flash valle = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash pico  = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro valle     = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro pico      = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112

Con esa mezcla concreta, V4.1 Flash cuesta aproximadamente 74% menos que V4 Pro. Es aritmética de precios, no una puntuación de calidad: reintentos y corrección humana pueden cambiar el coste por tarea aceptada. La instantánea de tarifas Pro de agosto sigue en la guía de precios de DeepSeek V4 Pro.

Qué muestran realmente los benchmarks

La model card oficial sitúa V4.1 Flash por delante de V4 Pro en varios resultados de agentes, pero no en todas las pruebas de conocimiento y razonamiento.

BenchmarkV4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE, subconjunto solo texto37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE con herramientas51.560.063.9
AutomationBench37.743.254.8

La conclusión defendible es una mejora clara en los escenarios de código, seguridad, automatización y herramientas reportados, no una victoria universal. Hay otra advertencia: el update log indica 65.4 para NL2Repo-Bench y la model card en vivo indica 64.0. El artículo no usa ese valor hasta que DeepSeek resuelva la discrepancia.

El framework del agente cambia el resultado

Con el mismo V4.1 Flash, DeepSWE v1.1 va de 65.5 con OpenCode a 74.2 con mini-SWE-agent, una diferencia de 8.7 puntos. Terminal-Bench 2.1 va de 84.1 con Codex a 90.6 con DeepSeek Harness Minimal, 6.5 puntos.

DeepSeek documenta N=8 muestras por tarea DeepSWE, N=3 para Terminal-Bench, contenedores Linux, hasta 500 pasos de agente y esfuerzo máximo de razonamiento. El prompt, el bucle de herramientas, los reintentos y la gestión de contexto cambian el resultado. Compare en el agente que realmente utilizará.

Visión y límites de integración

V4.1 Flash acepta JPEG, PNG, GIF y WebP mediante base64, URL pública o Files API. La entrada de imagen funciona en Chat Completions, Responses API y Anthropic API. Tras redimensionado automático, una imagen consume como máximo 1,024 tokens de entrada.

Es comprensión de imágenes, no generación de imágenes. Texto pequeño, tablas densas y campos contractuales o financieros requieren una comprobación determinista o humana. Con tools en modo thinking, la guía exige devolver todo reasoning_content en las solicitudes posteriores o la API devuelve 400. La compleción FIM solo está disponible sin thinking.

Disponibilidad en OmniAKey

En la comprobación del 2026-09-10, el catálogo de modelos de OmniAKey todavía no listaba la ruta canónica deepseek-flash. Este artículo no afirma disponibilidad actual ni precio de V4.1 Flash en OmniAKey.

Cuando aparezca el ID exacto, cree una clave con límite separado en API Keys y, tras el primer smoke test, revise modelo, entrada, caché, salida y coste. Consulte también la guía de facturación transparente y el inicio rápido de la API.

Checklist de migración desde V4 Pro

  1. Fije de 10 a 30 tareas representativas y sus criterios de aceptación.
  2. Guarde tokens, latencia, reintentos y resultado de deepseek-v4-pro.
  3. Repita la tarea con deepseek-flash, las mismas herramientas y permisos.
  4. Pruebe high y max por separado, cambiando una variable cada vez.
  5. Incluya un bucle de herramientas largo y una imagen real si corresponde.
  6. Compare coste por tarea aceptada, no solo el precio de la primera respuesta.
  7. Actualice allowlists, alertas y etiquetas de auditoría antes del 14 de septiembre.

Preguntas frecuentes

¿Cuál es el nuevo ID?

En la API directa de DeepSeek es deepseek-flash. Los IDs V4 Flash anteriores solo son alias de compatibilidad.

¿V4.1 Flash siempre es mejor que V4 Pro?

No. Lidera varias métricas oficiales de agentes, pero V4 Pro sigue por delante en GPQA Diamond y HLE solo texto. La decisión depende de la tarea y del framework.

¿V4.1 Flash es open source?

El repositorio y los pesos tienen licencia MIT. Operar un MoE de 552B sigue requiriendo hardware especializado, prompt encoding correcto y validación operativa.

Fuentes primarias

Los hechos y cálculos se verificaron el 10 de septiembre de 2026. No hubo llamada de pago independiente, prueba de velocidad ni prueba de fiabilidad en producción. Antes de desplegar, vuelva a comprobar IDs, precios, fecha de transición y disponibilidad del gateway.