Precios API DeepSeek
Compara tarifas, caché y horarios para calcular el coste.
El precio de la API de DeepSeek depende del modelo, la entrada que acierta en caché, la salida y la franja horaria. El 28 de septiembre de 2026, la tabla directa oficial incluye deepseek-flash y deepseek-v4-pro. Flash tiene tarifas inferiores; Pro debe justificar su coste en tus tareas.
Importes en USD por un millón de tokens de la API directa de DeepSeek, revisados el 28 de septiembre de 2026. No son una cotización de OmniaKey. Los ejemplos son cálculos, no facturas medidas ni pruebas de calidad.
Tabla actual de precios
| Modelo API | Entrada sin caché: valle / punta | Entrada con caché: valle / punta | Salida: valle / punta |
|---|---|---|---|
deepseek-flash | $0.15 / $0.30 | $0.003 / $0.006 | $0.60 / $1.20 |
deepseek-v4-pro | $0.66 / $1.32 | $0.022 / $0.044 | $1.98 / $3.96 |
Fuente: modelos y precios oficiales. Un acierto de caché es una categoría de entrada, no un descuento para toda la petición o la salida.
Actualmente deepseek-flash sirve DeepSeek-V4.1-Flash, mientras que deepseek-v4-pro sirve DeepSeek-V4-Pro-0813. DeepSeek mantiene los nombres directos antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp, pero ya los atiende V4.1 Flash con tarifas Flash. No presupongas que todos los gateways hacen esa misma correspondencia.
Consulta el análisis de V4.1 Flash para sus capacidades y la guía de precios de V4 Pro para los detalles de ese modelo.
Horarios punta y valle en UTC
La franja punta vigente es 01:00–04:00 y 06:00–10:00 UTC, de lunes a viernes, excepto festivos oficiales de China. Las demás horas son valle; los fines de semana y festivos chinos lo son durante todo el día. Las tarifas valle son la mitad de las punta correspondientes.
Convierte las horas con una zona horaria real. El lunes UTC puede coincidir con el domingo por la tarde en otro país, y el horario de verano puede cambiar la conversión. No confundas UTC con la hora de Pekín o del navegador. Cerca de un límite, verifica el calendario oficial y el uso facturado; aquí no suponemos cómo se cobra una petición que cruza la frontera horaria.
Calcula la factura por categorías de tokens
coste = entrada_sin_cache / 1,000,000 × tarifa_entrada
+ entrada_con_cache / 1,000,000 × tarifa_cache
+ salida_facturada / 1,000,000 × tarifa_salida
Incluye los tokens de razonamiento facturados, no solo el texto visible. El número de caracteres o la longitud de la respuesta final no sustituyen a los campos de uso de la API.
| Carga idéntica de tokens | Flash valle | Flash punta | Pro valle | Pro punta |
|---|---|---|---|---|
| 100K entrada sin caché + 20K salida | $0.027 | $0.054 | $0.1056 | $0.2112 |
| 90K entrada con caché + 10K sin caché + 20K salida | $0.01377 | $0.02754 | $0.04818 | $0.09636 |
Flash en la primera fila cuesta 0.1 × $0.15 + 0.02 × $0.60 = $0.027; con la mezcla de la segunda fila, 0.09 × $0.003 + 0.01 × $0.15 + 0.02 × $0.60 = $0.01377. Son escenarios alternativos, no dos cargos de una misma petición.
Se excluyen reintentos, cargos adicionales de herramientas o proveedores y conversión de moneda. Se asumen los mismos tokens para ambos modelos y un acierto de caché confirmado. Las tareas reales pueden consumir cantidades distintas y necesitar más intentos.
La caché reutiliza un prefijo coincidente
La caché de contexto aprovecha prefijos que coinciden. Cuando tu aplicación lo permita, coloca instrucciones y referencias estables al principio y las preguntas variables al final. Repetir un tema parecido no demuestra un acierto.
Consulta prompt_cache_hit_tokens y prompt_cache_miss_tokens. Presupuesta la primera llamada como fallo de caché salvo evidencia en su uso. La caché no promete memoria permanente ni un acierto futuro garantizado. Elimina primero contexto irrelevante, limita la salida y mide los reintentos: un prompt enorme con caché puede costar más que uno pequeño que sí era suficiente.
Flash o Pro: coste por tarea aceptada
En horario valle directo, Pro cuesta 4.4× más en entrada sin caché, 3.3× en salida y aproximadamente 7.33× en lectura de caché. No hay un multiplicador único para todas las mezclas.
Evalúa tareas representativas con las mismas herramientas, verificaciones y presupuesto de tiempo. Registra coste total, intentos, latencia y correcciones humanas. El indicador útil es coste facturado total dividido por tareas que cumplen los criterios. Un token barato puede perder su ventaja con muchos fallos; un modelo caro no garantiza mejores resultados. La tabla directa actual marca visión en Flash y no en Pro, por lo que el tipo de entrada también decide.
Facturación directa y facturación de OmniaKey
Una llamada a OmniaKey utiliza su clave y el endpoint de la guía de inicio; no consume saldo de una cuenta separada de DeepSeek. La clave de DeepSeek pertenece al servicio directo.
Compara el identificador exacto, las tarifas, el tratamiento de la caché y el registro de uso de la ruta que utilizas. El horario, los alias y el saldo concedido de DeepSeek no se aplican automáticamente a un intermediario. Consulta los precios actuales de OmniaKey y tu panel, sin asumir un descuento fijo sobre la tabla oficial.
Preguntas frecuentes
¿La API de DeepSeek es gratuita?
Se factura por consumo. DeepSeek indica que se descuenta del saldo recargado o concedido, con prioridad para el concedido si existe. Eso no promete créditos gratuitos para todas las cuentas. El chat gratuito, las promociones y el saldo API son condiciones distintas.
¿Se paga una mensualidad o por tokens?
Esta tabla describe tokens de la API directa. Una suscripción de chat o un plan «premium» de terceros no sustituye estas tarifas; revisa las condiciones de cada compra.
¿La caché abarata también la salida?
No. Cambia el coste de la entrada correspondiente. La salida, incluido el razonamiento facturado, conserva su propia tarifa.
¿Los fines de semana son siempre valle?
Así lo indica la regla directa revisada. Comprueba UTC y las condiciones vigentes; no es una promesa sobre el gateway ni sobre el inicio de tu fin de semana local.
¿Puedo seguir usando el nombre Flash antiguo?
Los alias directos compatibles ahora llegan a V4.1 Flash. Prefiere el ID documentado y reevalúa el comportamiento cuando cambie el modelo. El catálogo del gateway se comprueba aparte.