DeepSeek V4 Flash ya está disponible · Nuestro precio de GLM-5.2 baja al 50% del oficial
Blog
Control de costos

Precios de la API de DeepSeek V4 Pro

DeepSeek V4 Pro cuesta $0.66 por millón de tokens de entrada y $1.98 de salida en horario valle; en dos franjas UTC diarias sube a $1.32 y $3.96.

12 min de lecturaOmniaKey
DeepSeek V4 ProAPI pricing0813cost control

Los nuevos precios de la API de DeepSeek V4 Pro dependen de la hora del día. En la API directa de DeepSeek, un millón de tokens de entrada con acierto de caché cuesta $0.022, la entrada sin acierto cuesta $0.66 y la salida cuesta $1.98 en horario valle. Durante las horas punta, las tarifas se duplican a $0.044, $1.32 y $3.96.

La instantánea publicada el 13 de agosto se llama DeepSeek-V4-Pro-0813, pero el ID del modelo en la API sigue siendo deepseek-v4-pro. No añadas 0813 a la solicitud.

Verificado el 18 de agosto de 2026. DeepSeek lanzó V4 Pro 0813 el 13 de agosto y activó los nuevos precios por horario el 16 de agosto a las 16:00 UTC. Las tablas muestran tarifas directas de DeepSeek, no una promesa sobre un precio permanente de OmniAKey. Comprueba la ruta en vivo antes de cerrar un presupuesto de producción.

DeepSeek V4 Pro 0813 de un vistazo

ElementoValor oficial actual
Pesos / instantáneaDeepSeek-V4-Pro-0813
ID del modelo APIdeepseek-v4-pro
Fecha de lanzamiento13 de agosto de 2026
Ventana de contexto1M tokens
Salida máxima384K tokens
Pensamiento predeterminadoActivado en high
Esfuerzo de razonamientolow, high o max
Interfaces nativasChat Completions, Responses API, Anthropic API
Valle: caché / entrada nueva / salida$0.022 / $0.66 / $1.98
Punta: caché / entrada nueva / salida$0.044 / $1.32 / $3.96
Franjas punta01:00-04:00 y 06:00-10:00 UTC

Todos los precios son dólares estadounidenses por un millón de tokens. Cualquier hora fuera de las dos franjas indicadas es valle y cuesta la mitad de la tarifa punta.

Tabla oficial de precios de DeepSeek V4 Pro

Uso facturadoHorario valleHorario puntaMultiplicador
Entrada con acierto de caché$0.022$0.0442x
Entrada sin acierto de caché$0.66$1.322x
Salida$1.98$3.962x

La fórmula general es:

text
coste = millones_de_entrada_en_caché x tarifa_de_caché
      + millones_de_entrada_nueva x tarifa_de_entrada
      + millones_de_salida x tarifa_de_salida

DeepSeek define las franjas en UTC, pero esta página de precios no explica cómo divide una solicitud larga que cruza un límite. Mantén presupuestos y registros en UTC, usa el consumo facturado como referencia y confirma ese caso antes de programar solicitudes largas junto a una transición.

La página de DeepSeek V4 Pro mantiene el precio actual de OmniAKey, la disponibilidad y el ejemplo de solicitud. La tabla anterior solo describe la facturación directa de DeepSeek. El precio de una pasarela y la tarifa directa por horario son relaciones distintas, así que consulta el catálogo de modelos en vivo en lugar de asumir que coinciden.

Qué significa “0813”

DeepSeek-V4-Pro-0813 es la instantánea GA descargable que sustituye a V4 Pro Preview. DeepSeek mantuvo el mismo alias para la API alojada:

json
{
  "model": "deepseek-v4-pro"
}

La versión conserva la arquitectura Preview e incorpora un módulo de decodificación especulativa DSpark. DeepSeek también publica los pesos con licencia MIT. Eso importa al alojar el modelo, pero no vuelve gratuita la inferencia local: hardware, servicio, almacenamiento y operaciones siguen teniendo coste.

Para quienes usan la API alojada, los cambios prácticos son:

  • mejores resultados de agentes según el informe del proveedor;
  • tres niveles explícitos: low, high y max;
  • Responses API nativa con optimización para Codex;
  • contexto de 1M y salida máxima recomendada de 384K para high y max;
  • una nueva tabla con horas punta y valle.

El alias estable facilita la actualización, pero es menos reproducible que una instantánea fija. Registra la fecha, el ID de API, el esfuerzo de razonamiento, la versión del harness y la prueba de aceptación cuando compares resultados.

Ejemplo 1: entrada sin acierto de caché

Supongamos que una tarea de programación usa 100 000 tokens de entrada sin acierto y produce 20 000 tokens de salida.

PeriodoCálculo
Valle0.1 x $0.66 + 0.02 x $1.98 = $0.1056
Punta0.1 x $1.32 + 0.02 x $3.96 = $0.2112

Mover exactamente la misma carga fuera de las franjas punta ahorra $0.1056. La tarea no usa menos tokens: solo cambia la tarifa aplicada.

Ejemplo 2: entrada con acierto de caché

Ahora supongamos que los mismos 100 000 tokens de entrada aciertan en caché y el modelo sigue produciendo 20 000 tokens de salida.

PeriodoCálculo
Valle0.1 x $0.022 + 0.02 x $1.98 = $0.0418
Punta0.1 x $0.044 + 0.02 x $3.96 = $0.0836

En este caso, la salida domina la factura. Un prefijo caliente ayuda, pero el razonamiento extenso, las respuestas largas, los bucles de herramientas y los reintentos pueden superar el ahorro de caché.

Cómo funciona la caché de contexto de DeepSeek

DeepSeek activa por defecto la caché de contexto en disco. Una solicitud posterior solo recibe la tarifa reducida cuando su prefijo coincide por completo con una unidad de prefijo ya persistida. Un texto parecido o un archivo reutilizado parcialmente no garantiza un acierto.

Revisa los campos usage de la respuesta:

  • prompt_cache_hit_tokens informa los tokens de entrada cobrados como aciertos;
  • prompt_cache_miss_tokens informa los tokens de entrada cobrados como fallos.

La caché funciona en modalidad best effort. Su creación tarda un tiempo y los datos sin uso suelen eliminarse tras unas horas o días. Presupuesta con los campos informados, no con los tokens que esperabas reutilizar.

Las instrucciones de sistema estables, los esquemas de herramientas, las reglas del repositorio y los documentos de referencia grandes son buenos candidatos. Coloca las instrucciones cambiantes después del prefijo estable si el cliente permite controlar la estructura.

Los tokens de razonamiento se cobran como salida

El modo de pensamiento está activado por defecto en high. DeepSeek asigna los niveles medium y xhigh de estilo OpenAI a high; los niveles reales del modelo son low, high y max.

En Chat Completions, configura uno de esos tres niveles mediante el parámetro reasoning_effort.

En Responses API, el consumo de razonamiento aparece en usage.output_tokens_details.reasoning_tokens. Forma parte de la salida, así que no calcules el coste solo con el texto visible. Una respuesta final breve puede contener mucho razonamiento.

Empieza con low para extracción o transformación sencillas, usa high para agentes cotidianos y prueba max solo cuando una mayor tasa de tareas aceptadas justifique más salida, latencia y coste. 384K es capacidad, no un valor predeterminado recomendable.

La guía para reducir tokens explica cómo quitar contexto obsoleto y salidas de herramientas sin límite antes de reducir la calidad del modelo.

Cambios en los benchmarks de V4 Pro 0813

DeepSeek comunica estas mejoras respecto a V4 Pro Preview:

BenchmarkV4 Pro PreviewV4 Pro 0813
Terminal Bench 2.172.187.9
DeepSWE12.862.7
Toolathlon-Verified55.974.1
HLE con herramientas48.260.0

Fuente: DeepSeek (vendor-reported; sin reproducción independiente). Para los benchmarks públicos de agentes de código, DeepSeek usó el modo minimal de DeepSeek Harness, esfuerzo max, temperature = 1.0 y top_p = 0.95. DSBench-FullStack y DSBench-Hard, incluidos en la misma tabla, son conjuntos internos.

Estos números respaldan que 0813 mejoró frente a Preview bajo la configuración de DeepSeek. No prueban que gane con cada modelo, cliente, repositorio o carga de producción. Repite una tarea representativa con las mismas entradas, permisos, herramientas y prueba de aprobado.

La guía de configuración de DeepSeek Harness se ocupa de la instalación y del proveedor personalizado. Este artículo se ocupa del precio y de la decisión sobre 0813.

DeepSeek V4 Flash cuesta un tercio

DeepSeek publica V4 Flash aproximadamente a un tercio de Pro. La entrada sin caché y la salida son exactamente un tercio en la tabla; el valor redondeado de acierto de caché queda ligeramente por debajo:

Uso de V4 FlashVallePunta
Entrada con acierto de caché$0.007$0.014
Entrada sin acierto$0.22$0.44
Salida$0.66$1.32

Su ID de API es deepseek-v4-flash y la instantánea actual es DeepSeek-V4-Flash-0731. También tiene un límite de concurrencia publicado mayor: 2 500 frente a 500 para Pro.

Flash es la primera prueba más barata para trabajo de gran volumen y bien especificado. Eso no demuestra la misma calidad. Compara el coste por tarea aceptada, incluidos reintentos y correcciones, antes de fijar el enrutamiento.

Llamar a DeepSeek V4 Pro mediante OmniAKey

Crea una clave con límite propio en el panel de API Keys, confirma que deepseek-v4-pro aparece en el catálogo en vivo y llama a la ruta compatible con OpenAI:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Encuentra la suposición de mayor riesgo en este plan de migración."}
    ],
    "stream": true
  }'

Usa el ID exacto mostrado por la pasarela. El inicio rápido de la API documenta el endpoint y la autenticación.

Después de una tarea representativa, revisa el panel de uso. No apliques la tabla punta o valle directa de DeepSeek a un registro de OmniAKey salvo que el precio en vivo de OmniAKey indique expresamente esa regla.

La guía de facturación transparente explica cómo conciliar modelo, tokens, caché y coste por llamada.

Política práctica de horario y presupuesto

Sigue este orden:

  1. Prioriza la latencia en trabajos urgentes o de usuario; no los retrases solo por un descuento.
  2. Con DeepSeek directo, mueve evaluaciones por lotes, indexación y análisis reintentables fuera de 01:00-04:00 y 06:00-10:00 UTC.
  3. Registra por separado aciertos, fallos, razonamiento y salida.
  4. Define un límite por persona, entorno o rol de automatización.
  5. Compara Pro y Flash con la misma prueba de tarea aceptada.
  6. Revisa de nuevo la página oficial antes de cambiar un horario de producción.

Un límite de gasto reduce la exposición, pero no el consumo de tokens. Optimiza primero la solicitud y deja margen para la variación normal de una tarea correcta.

Errores comunes con el precio de DeepSeek V4 Pro

Enviar DeepSeek-V4-Pro-0813 como modelo API

Ese es el nombre de la instantánea. La API alojada sigue usando deepseek-v4-pro.

Tratar todas las horas como valle

El precio punta se aplica de 01:00 a 04:00 y de 06:00 a 10:00 UTC. Las otras 17 horas usan la tabla a mitad de precio.

Suponer que cualquier texto repetido entra en caché

La solicitud debe coincidir por completo con una unidad persistida. Confía en prompt_cache_hit_tokens, no en el parecido visual.

Tratar 1M de contexto o 384K de salida como crédito incluido

Son límites de capacidad. Los tokens dentro de esas ventanas se siguen cobrando.

Ignorar el razonamiento no visible

Los tokens de razonamiento forman parte de la salida. Una respuesta visible breve no implica una salida barata.

Presentar benchmarks del proveedor como evidencia independiente

Las mejoras de 0813 son resultados vendor-reported con Harness y max declarados. Sirven como señal de actualización, no como ranking universal.

Preguntas frecuentes

¿Cuánto cuesta la API de DeepSeek V4 Pro?

En horario valle, DeepSeek cobra $0.022 por millón de tokens de entrada con acierto de caché, $0.66 sin acierto y $1.98 de salida. Las tarifas punta son $0.044, $1.32 y $3.96.

¿Cuándo es el horario valle de DeepSeek V4 Pro?

Todas las horas UTC salvo 01:00-04:00 y 06:00-10:00. Las tarifas valle son un 50% menores.

¿Cuál es el ID API de DeepSeek V4 Pro 0813?

Usa deepseek-v4-pro. DeepSeek-V4-Pro-0813 identifica los pesos y la instantánea publicados, no el ID de solicitud de la API alojada.

¿DeepSeek V4 Pro admite un millón de tokens?

Sí. DeepSeek indica una ventana de contexto de 1M y una salida máxima de 384K. Son límites, no asignaciones gratuitas.

¿DeepSeek V4 Pro es más barato que V4 Flash?

No. Las tarifas publicadas de Flash son aproximadamente un tercio de Pro en ambos periodos. Pro debe justificar la prima con una mayor tasa de tareas aceptadas.

¿0813 mejoró el rendimiento de agentes de código?

DeepSeek informa mejoras grandes sobre Pro Preview en Terminal Bench 2.1, DeepSWE y Toolathlon-Verified. Las pruebas públicas usaron DeepSeek Harness minimal y esfuerzo max. Trátalas como resultados vendor-reported hasta reproducirlas en tus tareas.

Fuentes verificadas

Datos verificados el 18 de agosto de 2026. Los precios, franjas, alias, disponibilidad de la pasarela y funciones pueden cambiar. Revisa las fuentes primarias y el catálogo en vivo antes de comprometer un presupuesto de producción.