Precios de la API de DeepSeek V4 Pro
DeepSeek V4 Pro cuesta $0.66 por millón de tokens de entrada y $1.98 de salida en horario valle; en dos franjas UTC diarias sube a $1.32 y $3.96.
Los nuevos precios de la API de DeepSeek V4 Pro dependen de la hora del día. En la API directa de DeepSeek, un millón de tokens de entrada con acierto de caché cuesta $0.022, la entrada sin acierto cuesta $0.66 y la salida cuesta $1.98 en horario valle. Durante las horas punta, las tarifas se duplican a $0.044, $1.32 y $3.96.
La instantánea publicada el 13 de agosto se llama DeepSeek-V4-Pro-0813, pero el ID del modelo en la API sigue siendo deepseek-v4-pro. No añadas 0813 a la solicitud.
Verificado el 18 de agosto de 2026. DeepSeek lanzó V4 Pro 0813 el 13 de agosto y activó los nuevos precios por horario el 16 de agosto a las 16:00 UTC. Las tablas muestran tarifas directas de DeepSeek, no una promesa sobre un precio permanente de OmniAKey. Comprueba la ruta en vivo antes de cerrar un presupuesto de producción.
DeepSeek V4 Pro 0813 de un vistazo
| Elemento | Valor oficial actual |
|---|---|
| Pesos / instantánea | DeepSeek-V4-Pro-0813 |
| ID del modelo API | deepseek-v4-pro |
| Fecha de lanzamiento | 13 de agosto de 2026 |
| Ventana de contexto | 1M tokens |
| Salida máxima | 384K tokens |
| Pensamiento predeterminado | Activado en high |
| Esfuerzo de razonamiento | low, high o max |
| Interfaces nativas | Chat Completions, Responses API, Anthropic API |
| Valle: caché / entrada nueva / salida | $0.022 / $0.66 / $1.98 |
| Punta: caché / entrada nueva / salida | $0.044 / $1.32 / $3.96 |
| Franjas punta | 01:00-04:00 y 06:00-10:00 UTC |
Todos los precios son dólares estadounidenses por un millón de tokens. Cualquier hora fuera de las dos franjas indicadas es valle y cuesta la mitad de la tarifa punta.
Tabla oficial de precios de DeepSeek V4 Pro
| Uso facturado | Horario valle | Horario punta | Multiplicador |
|---|---|---|---|
| Entrada con acierto de caché | $0.022 | $0.044 | 2x |
| Entrada sin acierto de caché | $0.66 | $1.32 | 2x |
| Salida | $1.98 | $3.96 | 2x |
La fórmula general es:
coste = millones_de_entrada_en_caché x tarifa_de_caché
+ millones_de_entrada_nueva x tarifa_de_entrada
+ millones_de_salida x tarifa_de_salida
DeepSeek define las franjas en UTC, pero esta página de precios no explica cómo divide una solicitud larga que cruza un límite. Mantén presupuestos y registros en UTC, usa el consumo facturado como referencia y confirma ese caso antes de programar solicitudes largas junto a una transición.
La página de DeepSeek V4 Pro mantiene el precio actual de OmniAKey, la disponibilidad y el ejemplo de solicitud. La tabla anterior solo describe la facturación directa de DeepSeek. El precio de una pasarela y la tarifa directa por horario son relaciones distintas, así que consulta el catálogo de modelos en vivo en lugar de asumir que coinciden.
Qué significa “0813”
DeepSeek-V4-Pro-0813 es la instantánea GA descargable que sustituye a V4 Pro Preview. DeepSeek mantuvo el mismo alias para la API alojada:
{
"model": "deepseek-v4-pro"
}
La versión conserva la arquitectura Preview e incorpora un módulo de decodificación especulativa DSpark. DeepSeek también publica los pesos con licencia MIT. Eso importa al alojar el modelo, pero no vuelve gratuita la inferencia local: hardware, servicio, almacenamiento y operaciones siguen teniendo coste.
Para quienes usan la API alojada, los cambios prácticos son:
- mejores resultados de agentes según el informe del proveedor;
- tres niveles explícitos:
low,highymax; - Responses API nativa con optimización para Codex;
- contexto de 1M y salida máxima recomendada de 384K para
highymax; - una nueva tabla con horas punta y valle.
El alias estable facilita la actualización, pero es menos reproducible que una instantánea fija. Registra la fecha, el ID de API, el esfuerzo de razonamiento, la versión del harness y la prueba de aceptación cuando compares resultados.
Ejemplo 1: entrada sin acierto de caché
Supongamos que una tarea de programación usa 100 000 tokens de entrada sin acierto y produce 20 000 tokens de salida.
| Periodo | Cálculo |
|---|---|
| Valle | 0.1 x $0.66 + 0.02 x $1.98 = $0.1056 |
| Punta | 0.1 x $1.32 + 0.02 x $3.96 = $0.2112 |
Mover exactamente la misma carga fuera de las franjas punta ahorra $0.1056. La tarea no usa menos tokens: solo cambia la tarifa aplicada.
Ejemplo 2: entrada con acierto de caché
Ahora supongamos que los mismos 100 000 tokens de entrada aciertan en caché y el modelo sigue produciendo 20 000 tokens de salida.
| Periodo | Cálculo |
|---|---|
| Valle | 0.1 x $0.022 + 0.02 x $1.98 = $0.0418 |
| Punta | 0.1 x $0.044 + 0.02 x $3.96 = $0.0836 |
En este caso, la salida domina la factura. Un prefijo caliente ayuda, pero el razonamiento extenso, las respuestas largas, los bucles de herramientas y los reintentos pueden superar el ahorro de caché.
Cómo funciona la caché de contexto de DeepSeek
DeepSeek activa por defecto la caché de contexto en disco. Una solicitud posterior solo recibe la tarifa reducida cuando su prefijo coincide por completo con una unidad de prefijo ya persistida. Un texto parecido o un archivo reutilizado parcialmente no garantiza un acierto.
Revisa los campos usage de la respuesta:
prompt_cache_hit_tokensinforma los tokens de entrada cobrados como aciertos;prompt_cache_miss_tokensinforma los tokens de entrada cobrados como fallos.
La caché funciona en modalidad best effort. Su creación tarda un tiempo y los datos sin uso suelen eliminarse tras unas horas o días. Presupuesta con los campos informados, no con los tokens que esperabas reutilizar.
Las instrucciones de sistema estables, los esquemas de herramientas, las reglas del repositorio y los documentos de referencia grandes son buenos candidatos. Coloca las instrucciones cambiantes después del prefijo estable si el cliente permite controlar la estructura.
Los tokens de razonamiento se cobran como salida
El modo de pensamiento está activado por defecto en high. DeepSeek asigna los niveles medium y xhigh de estilo OpenAI a high; los niveles reales del modelo son low, high y max.
En Chat Completions, configura uno de esos tres niveles mediante el parámetro reasoning_effort.
En Responses API, el consumo de razonamiento aparece en usage.output_tokens_details.reasoning_tokens. Forma parte de la salida, así que no calcules el coste solo con el texto visible. Una respuesta final breve puede contener mucho razonamiento.
Empieza con low para extracción o transformación sencillas, usa high para agentes cotidianos y prueba max solo cuando una mayor tasa de tareas aceptadas justifique más salida, latencia y coste. 384K es capacidad, no un valor predeterminado recomendable.
La guía para reducir tokens explica cómo quitar contexto obsoleto y salidas de herramientas sin límite antes de reducir la calidad del modelo.
Cambios en los benchmarks de V4 Pro 0813
DeepSeek comunica estas mejoras respecto a V4 Pro Preview:
| Benchmark | V4 Pro Preview | V4 Pro 0813 |
|---|---|---|
| Terminal Bench 2.1 | 72.1 | 87.9 |
| DeepSWE | 12.8 | 62.7 |
| Toolathlon-Verified | 55.9 | 74.1 |
| HLE con herramientas | 48.2 | 60.0 |
Fuente: DeepSeek (vendor-reported; sin reproducción independiente). Para los benchmarks públicos de agentes de código, DeepSeek usó el modo minimal de DeepSeek Harness, esfuerzo max, temperature = 1.0 y top_p = 0.95. DSBench-FullStack y DSBench-Hard, incluidos en la misma tabla, son conjuntos internos.
Estos números respaldan que 0813 mejoró frente a Preview bajo la configuración de DeepSeek. No prueban que gane con cada modelo, cliente, repositorio o carga de producción. Repite una tarea representativa con las mismas entradas, permisos, herramientas y prueba de aprobado.
La guía de configuración de DeepSeek Harness se ocupa de la instalación y del proveedor personalizado. Este artículo se ocupa del precio y de la decisión sobre 0813.
DeepSeek V4 Flash cuesta un tercio
DeepSeek publica V4 Flash aproximadamente a un tercio de Pro. La entrada sin caché y la salida son exactamente un tercio en la tabla; el valor redondeado de acierto de caché queda ligeramente por debajo:
| Uso de V4 Flash | Valle | Punta |
|---|---|---|
| Entrada con acierto de caché | $0.007 | $0.014 |
| Entrada sin acierto | $0.22 | $0.44 |
| Salida | $0.66 | $1.32 |
Su ID de API es deepseek-v4-flash y la instantánea actual es DeepSeek-V4-Flash-0731. También tiene un límite de concurrencia publicado mayor: 2 500 frente a 500 para Pro.
Flash es la primera prueba más barata para trabajo de gran volumen y bien especificado. Eso no demuestra la misma calidad. Compara el coste por tarea aceptada, incluidos reintentos y correcciones, antes de fijar el enrutamiento.
Llamar a DeepSeek V4 Pro mediante OmniAKey
Crea una clave con límite propio en el panel de API Keys, confirma que deepseek-v4-pro aparece en el catálogo en vivo y llama a la ruta compatible con OpenAI:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Encuentra la suposición de mayor riesgo en este plan de migración."}
],
"stream": true
}'
Usa el ID exacto mostrado por la pasarela. El inicio rápido de la API documenta el endpoint y la autenticación.
Después de una tarea representativa, revisa el panel de uso. No apliques la tabla punta o valle directa de DeepSeek a un registro de OmniAKey salvo que el precio en vivo de OmniAKey indique expresamente esa regla.
La guía de facturación transparente explica cómo conciliar modelo, tokens, caché y coste por llamada.
Política práctica de horario y presupuesto
Sigue este orden:
- Prioriza la latencia en trabajos urgentes o de usuario; no los retrases solo por un descuento.
- Con DeepSeek directo, mueve evaluaciones por lotes, indexación y análisis reintentables fuera de 01:00-04:00 y 06:00-10:00 UTC.
- Registra por separado aciertos, fallos, razonamiento y salida.
- Define un límite por persona, entorno o rol de automatización.
- Compara Pro y Flash con la misma prueba de tarea aceptada.
- Revisa de nuevo la página oficial antes de cambiar un horario de producción.
Un límite de gasto reduce la exposición, pero no el consumo de tokens. Optimiza primero la solicitud y deja margen para la variación normal de una tarea correcta.
Errores comunes con el precio de DeepSeek V4 Pro
Enviar DeepSeek-V4-Pro-0813 como modelo API
Ese es el nombre de la instantánea. La API alojada sigue usando deepseek-v4-pro.
Tratar todas las horas como valle
El precio punta se aplica de 01:00 a 04:00 y de 06:00 a 10:00 UTC. Las otras 17 horas usan la tabla a mitad de precio.
Suponer que cualquier texto repetido entra en caché
La solicitud debe coincidir por completo con una unidad persistida. Confía en prompt_cache_hit_tokens, no en el parecido visual.
Tratar 1M de contexto o 384K de salida como crédito incluido
Son límites de capacidad. Los tokens dentro de esas ventanas se siguen cobrando.
Ignorar el razonamiento no visible
Los tokens de razonamiento forman parte de la salida. Una respuesta visible breve no implica una salida barata.
Presentar benchmarks del proveedor como evidencia independiente
Las mejoras de 0813 son resultados vendor-reported con Harness y max declarados. Sirven como señal de actualización, no como ranking universal.
Preguntas frecuentes
¿Cuánto cuesta la API de DeepSeek V4 Pro?
En horario valle, DeepSeek cobra $0.022 por millón de tokens de entrada con acierto de caché, $0.66 sin acierto y $1.98 de salida. Las tarifas punta son $0.044, $1.32 y $3.96.
¿Cuándo es el horario valle de DeepSeek V4 Pro?
Todas las horas UTC salvo 01:00-04:00 y 06:00-10:00. Las tarifas valle son un 50% menores.
¿Cuál es el ID API de DeepSeek V4 Pro 0813?
Usa deepseek-v4-pro. DeepSeek-V4-Pro-0813 identifica los pesos y la instantánea publicados, no el ID de solicitud de la API alojada.
¿DeepSeek V4 Pro admite un millón de tokens?
Sí. DeepSeek indica una ventana de contexto de 1M y una salida máxima de 384K. Son límites, no asignaciones gratuitas.
¿DeepSeek V4 Pro es más barato que V4 Flash?
No. Las tarifas publicadas de Flash son aproximadamente un tercio de Pro en ambos periodos. Pro debe justificar la prima con una mayor tasa de tareas aceptadas.
¿0813 mejoró el rendimiento de agentes de código?
DeepSeek informa mejoras grandes sobre Pro Preview en Terminal Bench 2.1, DeepSWE y Toolathlon-Verified. Las pruebas públicas usaron DeepSeek Harness minimal y esfuerzo max. Trátalas como resultados vendor-reported hasta reproducirlas en tus tareas.
Fuentes verificadas
- Lanzamiento GA de DeepSeek V4 Pro
- Modelos y precios de DeepSeek
- Alias de modelos de la API de DeepSeek
- Modo de pensamiento de DeepSeek
- Caché de contexto de DeepSeek
- Ficha y pesos de DeepSeek-V4-Pro-0813
- Página de DeepSeek V4 Pro en OmniAKey
- Inicio rápido de la API de OmniAKey
Datos verificados el 18 de agosto de 2026. Los precios, franjas, alias, disponibilidad de la pasarela y funciones pueden cambiar. Revisa las fuentes primarias y el catálogo en vivo antes de comprometer un presupuesto de producción.