Precios de la API de DeepSeek V4: Pro vs. Flash, ventana de contexto y ejemplos de costes
Índice de contenidos

El precio de la API de DeepSeek V4 depende de más factores que la tarifa más baja por token. El coste real proviene de la versión del modelo, los tokens de entrada, la entrada en caché, la longitud de salida y el contexto repetido. Para chatbots, agentes de programación, sistemas de generación aumentada por recuperación y flujos de trabajo de contexto largo, la elección clave suele ser entre DeepSeek-V4-Pro y DeepSeek-V4-Flash. Este artículo explica sus precios, ID de modelo, ventana de contexto, ejemplos de costes y puntos de comparación de proveedores.
DeepSeek V4 Pro frente a DeepSeek V4 Flash
DeepSeek V4 series está disponible en dos potentes modelos: DeepSeek-V4-Pro y DeepSeek-V4-Flash. Ambos son modelos Mixture-of-Experts (MoE), lo que significa que cada solicitud activa solo una parte del conjunto completo de parámetros. Este diseño ayuda a equilibrar la capacidad del modelo, la eficiencia de la inferencia y el coste de servicio.
Debido a que DeepSeek V4 se presenta como una versión preliminar, los equipos deberían probar ambas versiones con prompts reales, contexto real y criterios de éxito reales antes de utilizarlas en el enrutamiento de producción.
DeepSeek-V4-Pro está diseñado para cargas de trabajo de mayor complejidad. Con 1.6T de parámetros totales y 49B de parámetros activados, se adapta mejor a razonamientos más profundos, tareas de programación, planificación de múltiples pasos y flujos de trabajo de agentes donde el valor del negocio depende directamente de la calidad de la respuesta.
DeepSeek-V4-Flash se centra en la eficiencia y la escala. Con 284B de parámetros totales y 13B de parámetros activados, está diseñado para casos de uso más rápidos, de menor coste y alto rendimiento donde cada solicitud no necesita la ruta de razonamiento más sólida.
Para los equipos de producción, la elección del modelo debe comenzar con el valor de la tarea. Las solicitudes sencillas, repetitivas y de gran volumen suelen adaptarse mejor a Flash. El razonamiento difícil, la depuración de código, el seguimiento de instrucciones complejas o el trabajo de agentes de múltiples pasos pueden justificar la prueba de Pro.
Una regla práctica es sencilla: utilizar Flash para escala y probar Pro cuando la calidad de la respuesta tenga un valor comercial directo.
ID de modelos de DeepSeek V4 en SiliconFlow
Los ID de modelo son importantes porque las llamadas a la API necesitan nombres de modelo exactos. El uso del ID de modelo exacto garantiza que cada solicitud de API se enrute a la variante de DeepSeek V4 prevista en lugar de a un modelo con nombre similar o a una versión anterior de DeepSeek.

Los ID de modelo de DeepSeek V4 son:
Modelo | ID de modelo |
|---|---|
DeepSeek-V4-Pro | deepseek-ai/DeepSeek-V4-Pro |
DeepSeek-V4-Flash | deepseek-ai/DeepSeek-V4-Flash |
Al integrarse con un cliente compatible con OpenAI, el ID de modelo debe colocarse en el campo de modelo de la solicitud de chat completion. Los equipos también deben mantener los ID de modelo centralizados en archivos de configuración o variables de entorno en lugar de codificarlos de forma fija en múltiples servicios.
Esto facilita las pruebas futuras. Por ejemplo, una aplicación puede enrutar conversaciones estándar de usuarios a Flash y enrutar tareas complejas de revisión de código o razonamiento de formato largo a Pro sin tener que reescribir toda la capa de la API.
Input, Output, lectura de caché y ventana de contexto en SiliconFlow
En SiliconFlow, el uso de la API de DeepSeek V4 se tarifa en tres categorías de tokens: tokens de input, tokens de input en caché y tokens de output. La ventana de contexto y las tarifas de tokens a continuación reflejan las configuraciones actuales de DeepSeek-V4-Pro y DeepSeek-V4-Flash disponibles a través de SiliconFlow.

Los tokens de input son los nuevos tokens enviados al modelo. Incluyen mensajes de usuario, prompts de sistema, documentos recuperados, resultados de herramientas e historial de conversaciones que no se lee de la caché.
Los tokens de input en caché son tokens de input repetidos que se pueden leer de la caché. El precio de la caché es importante cuando una aplicación reutiliza prompts grandes, instrucciones de políticas, documentos, catálogos de productos, contexto de base de código o memoria de agentes a largo plazo en múltiples solicitudes.
Los tokens de output son los tokens generados por el modelo. El coste de output puede convertirse en un factor importante en aplicaciones que producen respuestas largas, informes estructurados, archivos de código, resúmenes o respuestas de múltiples pasos.
Modelo | Ventana de contexto | Input / 1M de tokens | Input en caché / 1M de tokens | Output / 1M de tokens |
|---|---|---|---|---|
DeepSeek-V4-Pro | 1049K | 1,60 $ | 0,135 $ | 3,135 $ |
DeepSeek-V4-Flash | 1049K | 0,13 $ | 0,028 $ | 0,28 $ |
Nota sobre el precio: Los precios se basan en la estructura de tarifas actual al momento de escribir este artículo y pueden cambiar con el tiempo. Antes del despliegue en producción, los equipos siempre deben confirmar las tarifas más recientes, la disponibilidad del modelo y las reglas de uso.
La ventana de contexto también es importante. Una ventana de contexto de 1049K significa que el modelo puede trabajar con aproximadamente un millón de tokens en una sola solicitud. Esto es útil para documentos largos, repositorios de código de gran tamaño, análisis de múltiples archivos, registros legales o financieros, colecciones de investigación y memoria de agentes.
Sin embargo, una gran ventana de contexto no debe tratarse como capacidad gratuita. Las llamadas de contexto largo pueden resultar costosas si cada solicitud envía una gran cantidad de input nuevo. Para controlar el coste, los equipos deben utilizar la recuperación, la fragmentación, la compresión de prompts y el diseño de prompts optimizado para caché.
La fórmula de coste básica es:
Coste estimado = tokens de input / 1.000.000 × precio de input + tokens de input en caché / 1.000.000 × precio de input en caché + tokens de output / 1.000.000 × precio de output
Esta fórmula facilita la estimación de los precios de la API de DeepSeek V4 antes de trasladar una carga de trabajo a producción.

Ejemplos de costes de la API de DeepSeek V4 para tres casos de uso comunes
Según las tarifas de tokens actuales de SiliconFlow, los siguientes ejemplos estiman los costes de la API de DeepSeek V4 para tres casos de uso comunes. Los cálculos muestran cómo afectan los tokens de input, input en caché y output al coste total.
Todas las cifras de tokens a continuación representan el uso acumulado en múltiples solicitudes de API, no una única solicitud.
Ejemplo 1: Chatbot ligero
Supongamos que un chatbot de atención al cliente utiliza:
1M de tokens de input
0 tokens de input en caché
0,5M de tokens de output
Modelo | Cálculo | Coste estimado |
|---|---|---|
DeepSeek-V4-Flash | 1 × 0,13 $ + 0,5 × 0,28 $ | 0,27 $ |
DeepSeek-V4-Pro | 1 × 1,60 $ + 0,5 × 3,135 $ | 3,1675 $ |
Para este tipo de carga de trabajo, Flash tiene una gran ventaja de coste. Los bots de atención al cliente, los centros de ayuda internos, los asistentes de incorporación y los agentes sencillos de preguntas frecuentes suelen gestionar muchas solicitudes cortas o medianas. Si la tarea no requiere un razonamiento avanzado en cada turno, Flash suele ser la opción predeterminada más eficiente.
Ejemplo 2: Flujo de trabajo de RAG de contexto largo
Supongamos que un sistema de generación aumentada por recuperación utiliza:

2M de nuevos tokens de input
8M de tokens de input en caché
1M de tokens de output
La generación aumentada por recuperación, o RAG, es un método que recupera información externa relevante antes de generar una respuesta. Se utiliza habitualmente para bases de conocimientos, asistentes de documentos y sistemas de búsqueda empresarial.
Modelo | Cálculo | Coste estimado |
|---|---|---|
DeepSeek-V4-Flash | 2 × 0,13 $ + 8 × 0,028 $ + 1 × 0,28 $ | 0,764 $ |
DeepSeek-V4-Pro | 2 × 1,60 $ + 8 × 0,135 $ + 1 × 3,135 $ | 7,415 $ |
Este ejemplo muestra por qué es importante el precio de los tokens de input en caché. Muchos sistemas RAG reutilizan el mismo prompt de sistema, instrucciones, definiciones de esquema y contexto de documento. Si el flujo de trabajo está diseñado para beneficiarse de las lecturas de caché, el coste total puede disminuir considerablemente.
Flash sigue siendo más económico aquí, pero se puede probar Pro para tareas de conocimiento de mayor valor. Por ejemplo, Pro puede ser útil cuando el sistema debe comparar muchos documentos, identificar contradicciones, razonar a través de largas cadenas de evidencia o producir resultados profesionales altamente estructurados.
Ejemplo 3: Carga de trabajo de un agente de programación
Supongamos que un agente de programación utiliza:
5M de nuevos tokens de input
20M de tokens de input en caché
5M de tokens de output
Un agente de programación es un flujo de trabajo de IA que puede leer código, inspeccionar archivos, razonar a través de tareas y generar o revisar código con múltiples pasos.
Modelo | Cálculo | Coste estimado |
|---|---|---|
DeepSeek-V4-Flash | 5 × 0,13 $ + 20 × 0,028 $ + 5 × 0,28 $ | 2,61 $ |
DeepSeek-V4-Pro | 5 × 1,60 $ + 20 × 0,135 $ + 5 × 3,135 $ | 26,375 $ |
Los agentes de programación pueden generar un uso intensivo de tokens porque leen archivos, inspeccionan registros, llaman a herramientas, revisan código y producen outputs largos. Para explicaciones de código básicas, formateo, generación de pruebas o refactorización sencilla, Flash puede ser una opción muy rentable.
Aun así, vale la pena probar Pro cuando la tarea requiera razonamiento de arquitectura, depuración de múltiples archivos, planificación de migraciones complejas o revisión de código de producción de alta importancia. En estos casos, la pregunta correcta no es solo «¿Qué modelo es más barato?», sino también «¿Qué modelo reduce los intentos fallidos, las llamadas repetidas y el tiempo de revisión humana?»
Dónde tiene Flash la mayor ventaja de coste
DeepSeek-V4-Flash tiene la mayor ventaja de coste cuando las cargas de trabajo son frecuentes, predecibles y no dependen en gran medida de un razonamiento de máxima calidad.
Los ejemplos comunes incluyen:
Respuestas de chatbot de alto volumen
Enrutamiento sencillo de atención al cliente
Preguntas y respuestas de bases de conocimientos internas
Tareas cortas de resumen
Generación de descripciones de productos
Clasificación y etiquetado
Extracción de datos rutinaria
Acciones ligeras de agentes
Borradores de contenido de primera pasada
Respuestas RAG estándar
Flash también es un candidato fuerte cuando el volumen de output es alto. Dado que los tokens de output suelen ser más caros que los de input, un precio de output más bajo puede marcar una gran diferencia en aplicaciones que generan respuestas largas.
Flash debería ser a menudo el primer modelo probado para el escalado de producción. Si la calidad es suficiente, puede reducir el coste sin obligar a los equipos a rediseñar la aplicación. Si la calidad no es suficiente para ciertas tareas, enrutar esas tareas a Pro puede crear una estrategia de modelos equilibrada.
Un patrón de despliegue inteligente no es «Flash o Pro para siempre». Es el enrutamiento de modelos. Utilizar Flash para la mayoría de las solicitudes estándar y reservar Pro para casos complejos o de alto valor.
Cuándo vale la pena considerar Pro
DeepSeek-V4-Pro es más costoso, pero el precio por sí solo no decide el valor del modelo. Vale la pena considerar Pro cuando el fallo de la tarea es más costoso que el uso de tokens.
Los casos de uso típicos de Pro incluyen:
Razonamiento complejo
Programación avanzada
Flujos de trabajo agénticos
Uso de herramientas de múltiples pasos
Análisis de documentos de contexto largo
Generación de informes técnicos
Revisión legal, financiera o con alta carga de conformidad
Automatización empresarial de alto valor
Seguimiento de instrucciones difíciles
Análisis a nivel de base de código
Pro también puede reducir costes ocultos. Un modelo más barato puede requerir más reintentos, más ingeniería de prompts, más lógica de respaldo o más corrección humana. Si Pro produce una respuesta correcta en menos intentos, el coste total del flujo de trabajo puede ser más competitivo de lo que sugiere el precio del token.
Para los desarrolladores que comparan los precios de la API de DeepSeek V4, el mejor enfoque es realizar una evaluación controlada utilizando los mismos prompts, documentos, outputs esperados y criterios de éxito para ambos modelos.
DeepSeek-V4-Pro y DeepSeek-V4-Flash se pueden probar en el playground de SiliconFlow antes de evaluarse a través de la API compatible con OpenAI. Realice un seguimiento de la calidad del output, la latencia, el uso de tokens, la frecuencia de reintentos y el coste total para completar cada tarea con éxito.
Los resultados pueden guiar el enrutamiento de modelos. Las solicitudes estándar y de gran volumen se pueden asignar a Flash, mientras que los flujos de trabajo complejos de razonamiento, programación y agentes que implican llamadas de herramientas repetidas y contexto largo se pueden enrutar a Pro cuando una planificación más sólida reduzca los reintentos y los pasos innecesarios.
Pruebe ambos modelos en el playground de SiliconFlow, luego traslade la configuración seleccionada a su flujo de trabajo de la API.
SiliconFlow frente a otros proveedores de API: qué comprobar
El precio del token es solo una parte de la comparación de proveedores de DeepSeek V4. Los equipos también deben considerar con qué facilidad pueden probar ambos modelos, integrarlos en una aplicación existente, gestionar los costes de contexto largo y escalar la carga de trabajo después del despliegue.

Probar Pro y Flash con una sola configuración
Tanto DeepSeek-V4-Pro como DeepSeek-V4-Flash están disponibles a través de SiliconFlow. Los desarrolladores pueden compararlos en el playground utilizando los mismos prompts y luego llamar al modelo seleccionado a través del mismo entorno de API.
Mantener ambos modelos bajo una sola configuración facilita las pruebas controladas y el enrutamiento de modelos. Las solicitudes estándar se pueden asignar a Flash, mientras que las tareas difíciles de razonamiento, programación o agentes se pueden probar con Pro sin tener que reconstruir la integración.
Utilizar una API compatible con OpenAI
SiliconFlow proporciona un endpoint de API compatible con OpenAI, lo que permite a los desarrolladores utilizar patrones de SDK familiares y estructuras de solicitudes de chat completion. Las aplicaciones existentes y las herramientas de desarrollo que admiten proveedores personalizados compatibles con OpenAI suelen conectarse simplemente cambiando la clave de API, la URL base y el ID del modelo.
Esto reduce el trabajo necesario para probar DeepSeek V4 en herramientas y aplicaciones ya creadas en torno a interfaces de estilo OpenAI.
Comparar costes de Input, lectura de caché y Output
El precio de DeepSeek V4 en SiliconFlow separa los tokens de input, input en caché y output. Esto hace posible estimar los costes en función de la mezcla real de tokens de un chatbot, un sistema RAG o un agente de programación, en lugar de depender de una única tarifa de referencia.
Ambos modelos de DeepSeek V4 están disponibles actualmente con una ventana de contexto de 1049K, mientras que el precio de lectura de caché puede reducir el coste de prompts, instrucciones, documentos o contextos de código reutilizados repetidamente.
Comenzar con acceso Serverless y probar con niveles de uso reales
La API Serverless permite a los desarrolladores llamar a DeepSeek V4 sin tener que configurar ni gestionar infraestructura de GPU. El uso se factura por tokens, lo cual es práctico para pruebas iniciales, tráfico variable y aplicaciones que aún no han alcanzado una demanda predecible.
Antes de seleccionar un proveedor, los equipos deben probar la latencia, la calidad del output, el rendimiento, el comportamiento de reintento y el coste con sus propios prompts. Las especificaciones publicadas del modelo no pueden representar completamente el rendimiento de una aplicación real.
Revisar las opciones de despliegue más allá de las pruebas iniciales de API
Los requisitos de producción pueden cambiar a medida que crece el uso. Además del acceso Serverless, SiliconFlow ofrece opciones de despliegue que incluyen endpoints dedicados y capacidad de GPU reservada.
Esto ofrece a los equipos un camino desde las pruebas de API de pago por uso hacia una infraestructura con una capacidad más predecible cuando aumenta el volumen de la carga de trabajo, los requisitos de rendimiento o las necesidades de despliegue empresarial.
Preguntas comunes sobre el precio de la API de DeepSeek V4: Pro frente a Flash, ventana de contexto y ejemplos de costes
Q1. ¿Es DeepSeek-V4-Flash siempre la mejor opción?
No. Flash suele ser mejor para tareas de gran volumen, sensibles al coste y rutinarias. Aun así, vale la pena probar Pro para razonamiento avanzado, programación, análisis de contexto largo y flujos de trabajo de agentes donde la calidad de la respuesta afecta a los resultados comerciales.
Q2. ¿Cómo afecta el Input en caché al precio de la API de DeepSeek V4?
El input en caché puede reducir el coste cuando el mismo prompt, documento, conjunto de instrucciones o contexto se reutiliza en varias solicitudes. Esto es especialmente útil para sistemas RAG, agentes de programación y asistentes empresariales que hacen referencia repetidamente a la misma información de fondo.
Q3. ¿Por qué es tan importante el precio del Output?
Los tokens de output pueden convertirse en un factor de coste importante porque muchas aplicaciones de IA generan respuestas largas. Los informes, archivos de código, resúmenes y respuestas de múltiples pasos pueden producir grandes volúmenes de output. Al estimar el precio de la API de DeepSeek V4, siempre se debe incluir la longitud del output.
Q4. ¿Cómo deben elegir los desarrolladores entre Pro y Flash?
Comience probando Flash para solicitudes estándar y luego pruebe Pro con prompts difíciles donde la calidad importe más que el precio del token. Compare el coste por tarea exitosa, no solo el coste por millón de tokens. Una estrategia de enrutamiento híbrida suele ofrecer el mejor equilibrio entre coste y capacidad.
Crear un flujo de trabajo de API de DeepSeek V4 optimizado para el coste
El precio de la API de DeepSeek V4 resulta mucho más fácil de gestionar cuando los equipos comprenden la combinación completa de tokens detrás de cada carga de trabajo. Flash ofrece una gran eficiencia de costes para aplicaciones rutinarias, de gran volumen y con un uso intensivo de output. Pro se adapta mejor a razonamientos complejos, programación, trabajos de contexto largo y tareas de agentes de mayor valor.
La mejor elección de modelo no siempre es el modelo más barato ni el más potente. Es el modelo que ofrece el resultado requerido al menor coste total del flujo de trabajo.
Comience probando DeepSeek-V4-Flash para solicitudes estándar y luego enrute las tareas de razonamiento complejo, programación y contexto largo a DeepSeek-V4-Pro. Con la API compatible con OpenAI de SiliconFlow, los equipos pueden evaluar ambos modelos bajo un mismo flujo de trabajo de integración y crear una configuración de producción consciente de los costes.
