DeepSeek V4.1 Flash: arquitectura, benchmarks, precios y migración de API

Índice de contenidos

DeepSeek V4.1 Flash es un modelo nativo multimodal de mezcla de expertos diseñado para agentes de codificación, razonamiento de contexto largo y flujos de trabajo de herramientas de gran volumen. Su arquitectura base de 552B activa 8B de parámetros mientras procesa el input y 16B mientras genera el output. En comparación con V4 Flash, añade una arquitectura asimétrica de codificador-decodificador causal, reduce la caché KV global a 890 bytes por token y unifica la comprensión de text e Image en un solo modelo.

Los equipos que utilizan la API directa de DeepSeek pueden migrar las cargas de trabajo de V4 Flash cambiando el ID del modelo a deepseek-flash, pero el cambio de alias no debe ser todo el plan de migración. El comportamiento de las instrucciones, las llamadas a herramientas, la longitud del razonamiento, el manejo de Image, la latencia y el coste por tarea aceptada aún deben volver a probarse. Los ID de la API, los precios y los parámetros admitidos son específicos del proveedor, así que asegúrese siempre de que las instrucciones coincidan con el despliegue que utiliza.

¿Qué es DeepSeek V4.1 Flash?

Lanzado el 10 de septiembre de 2026, DeepSeek V4.1 Flash es el modelo lanzado más pequeño de la nueva familia de arquitectura V4.1 de DeepSeek. "Más pequeño" es relativo a esa familia: el modelo todavía tiene una estructura base de 552B de parámetros, 196B de parámetros de memoria condicional Engram y requisitos de servidor sustanciales. Por lo tanto, la inferencia alojada será la opción práctica para la mayoría de los equipos de desarrollo.

Especificaciones principales de DeepSeek V4.1 Flash

Especificación

DeepSeek V4.1 Flash

Arquitectura

MoE Multimodal con codificador-decodificador causal de 40 capas

Parámetros de la estructura base

552B

Parámetros activos

8B durante el prellenado; 16B durante la descodificación

Ventana de contexto

Hasta 1M de tokens

Output máximo en la API de DeepSeek

384K tokens

Input y output

Input de text e Image; output de text

Razonamiento

Modos de pensamiento y no pensamiento

Caché KV global

890 bytes por token

Licencia

MIT

ID del modelo de la API directa de DeepSeek

deepseek-flash

Los pesos y el repositorio lanzados utilizan la licencia MIT. Los desarrolladores pueden inspeccionarlos, modificarlos y autoalojarlos, aunque "pesos abiertos" es más preciso que dar a entender que todos los artefactos de entrenamiento son públicos. La tarjeta oficial del modelo contiene la arquitectura, la configuración de evaluación, la licencia y la guía de autoalojamiento.

Los precios de DeepSeek V4.1 Flash también dependen del proveedor de la API. A partir del 18 de septiembre de 2026, la página de precios en inglés de DeepSeek detalla las siguientes tarifas para la API directa de DeepSeek:

Tipo de token

Precio en horas de menor actividad por 1M de tokens

Precio en horas pico por 1M de tokens

Input almacenado en caché

$0.003

$0.006

Input no almacenado en caché

$0.15

$0.30

Output

$0.60

$1.20

Los periodos pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes. Todos los demás periodos utilizan tarifas de horas de menor actividad. Para una carga de trabajo hipotética con 10 millones de tokens de input no almacenados en caché y 2 millones de tokens de output, el coste sería de $2.70 en horas de menor actividad: (10 × $0.15) + (2 × $0.60). A tarifas pico, sería de $5.40. Las coincidencias en caché, los reintentos y las ejecuciones fallidas modificarían el total. Consulte los precios actuales de la API de DeepSeek antes de elaborar el presupuesto.

DeepSeek V4.1 Flash frente a V4 Flash

V4.1 Flash conserva el objetivo de contexto largo de V4 Flash al tiempo que cambia la forma de gestionar el input, el output, la atención y los estados almacenados en caché.

Factor de decisión

V4 Flash

V4.1 Flash

Parámetros de la estructura base

284B

552B

Parámetros activos por token

13B

8B de input; 16B de output

Ventana de contexto

Hasta 1M de tokens

Hasta 1M de tokens

Vision

Variante experimental independiente

Input nativo de text e Image

Caché KV global

Línea base de generación anterior

890 bytes por token, aproximadamente una cuarta parte de V4 Flash

Estado de la API directa de DeepSeek

Retirado; los alias heredados se dirigen temporalmente a V4.1

Objetivo actual de deepseek-flash

Que la estructura base sea más grande no significa automáticamente un mayor coste de servidor. V4.1 procesa prompts largos con menos parámetros activos que V4 Flash y almacena una caché KV mucho más pequeña, lo que resulta especialmente relevante para los agentes que leen repetidamente contextos grandes.

¿Cómo funciona la arquitectura de DeepSeek V4.1?

V4.1 separa el procesamiento del input de la generación del output de forma más agresiva que un modelo convencional de solo decodificador. El objetivo es reducir el coste de los prompts largos manteniendo una mayor capacidad de razonamiento y generación.

Arquitectura asimétrica de codificador-decodificador causal

El modelo de 40 capas contiene un codificador causal de 20 capas seguido de un decodificador de 20 capas. El codificador procesa el prompt con 8B de parámetros activos por token. El decodificador activa 16B de parámetros por token generado.

En lugar de derivar una caché KV global completa independiente de cada capa del decodificador, el decodificador proyecta su caché KV global a partir de los estados ocultos finales del codificador. Esto reduce el almacenamiento de contexto duplicado en cargas de trabajo donde el input es mucho mayor que la respuesta, como el análisis de repositorios, la revisión de múltiples documentos y los agentes de codificación de larga duración.

V4.1 Flash también utiliza la memoria condicional Engram, a la que se accede mediante búsqueda basada en tokens, y la descodificación especulativa DSpark. Estos componentes añaden capacidad de memoria y aceleran la generación sin necesidad de activar cada parámetro almacenado para cada token.


Asymmetric encoder-decoder architecture processing interleaved code, document, and image inputs before text generation

Compresión de caché KV y atención dispersa

Tres mecanismos impulsan una menor huella de atención y almacenamiento en caché:

  • SWA Bounded Replay reconstruye los estados de atención de ventana deslizante perdidos al reproducir una ventana de tokens reciente, evitando el almacenamiento persistente en SSD para esos estados.

  • Compressed Sparse Attention 2 asigna capas de atención a los modos Full, Reindex o Reuse, lo que permite que las capas compartan representaciones KV y reutilicen índices seleccionados de atención dispersa.

  • El almacenamiento en caché KV en FP4 guarda la caché KV principal en un formato de menor precisión con escalas agrupadas.

En conjunto, estos métodos reducen la caché KV global a aproximadamente una cuarta parte del nivel de V4 Flash. Esto mejora la viabilidad económica de las solicitudes largas e iterativas, aunque la recuperación, la depuración del contexto y la medición de la latencia siguen siendo importantes en producción.


Long token sequences compressed into a smaller KV cache with sliding windows, sparse attention, and reused representations

¿Qué rendimiento ofrece DeepSeek V4.1 Flash?

Los resultados de DeepSeek muestran las mejoras más claras en tareas de codificación y de agentes. La siguiente comparación utiliza los resultados del modelo de instrucciones reportados por el proveedor con el máximo esfuerzo de razonamiento y la configuración de evaluación establecida en el informe técnico de DeepSeek V4.1.

Puntos de referencia de codificación y agentes

Punto de referencia

V4 Flash

V4.1 Flash

Señal práctica

Clasificación Codeforces

3,289

3,471

Rendimiento de codificación competitiva más sólido

Terminal-Bench 2.1 Pass@1

82.7

90.6

Mejor ejecución del agente de línea de comandos

DeepSWE v1.1 resuelto

54.4

74.2

Mayor ganancia en tareas de software a nivel de repositorio

Puntuación de NL2Repo-Bench

54.2

64.0

Mejor trabajo de lenguaje natural a repositorio

AutomationBench Pass@1

37.7

54.8

Mejor finalización de automatización de varios pasos

Agent’s Last Exam Pass@1

25.2

31.8

Mejora en tareas agénticas amplias

La estructura del agente afecta materialmente al resultado. DeepSeek reportó puntuaciones de DeepSWE v1.1 de 65.5 a 74.2 en los entornos probados, incluso con el mismo modelo. Por lo tanto, la evaluación de producción debe cubrir todo el sistema: modelo, formato de prompt, herramientas, entorno de pruebas (sandbox), política de reintentos y criterios de aceptación.

Las pruebas independientes añaden un contexto útil. Artificial Analysis midió una puntuación del Índice de Inteligencia v4.3 de 40 con el máximo esfuerzo de razonamiento y unos 207 tokens de output por segundo a través de la API de DeepSeek. El modelo también utilizó más tokens de output que la mediana de comparación, por lo que una tasa de tokens baja no garantiza el coste más bajo por tarea completada.

Capacidades nativas multimodales

V4.1 Flash procesa inputs intercalados de Image y text a través de un codificador de Vision entrenado con el modelo de lenguaje. DeepSeek reporta puntuaciones del modelo base de 56.5 en MMMU-Pro, 77.9 en CVBench, 95.6 on DocVQA y 86.0 en RefCOCO-average.

Estos resultados respaldan casos de uso como la lectura de documentos, la interpretación de gráficos, la localización visual (visual grounding) y la inspección de interfaces. No obstante, no indican generación de Image: el modelo devuelve text. Antes de la implementación, pruebe los inputs visuales reales que recibe su aplicación, ya que los formularios escaneados, los paneles densos, las etiquetas de interfaz de usuario pequeñas y las fotografías naturales presentan diferentes patrones de fallo.


Multimodal coding agent reviewing code, terminal tasks, documents, charts, and interface screenshots with human oversight

Cómo usar la API de DeepSeek V4.1 Flash

La API directa de DeepSeek utiliza una interfaz compatible con OpenAI. El siguiente ejemplo se dirige al endpoint ascendente de DeepSeek con el ID de modelo deepseek-flash. No debe copiarse sin cambios para otro proveedor de API.

Ejemplo de API de Python

Instale el paquete de Python de OpenAI, guarde la clave de la API en una variable de entorno y utilice una longitud de output limitada:

import os

from openai import APIConnectionError, APIStatusError, OpenAI, RateLimitError

api_key = os.environ.get("DEEPSEEK_API_KEY")
if not api_key:
    raise RuntimeError("Establezca la variable de entorno DEEPSEEK_API_KEY.")

client = OpenAI(
    api_key=api_key,
    base_url="https://api.deepseek.com",
    timeout=60.0,
    max_retries=2,
)

try:
    response = client.chat.completions.create(
        model="deepseek-flash",
        messages=[
            {
                "role": "system",
                "content": "Es un asistente de ingeniería de software meticuloso.",
            },
            {
                "role": "user",
                "content": "Revise este plan de migración e identifique los riesgos de reversión.",
            },
        ],
        reasoning_effort="high",
        extra_body={"thinking": {"type": "enabled"}},
        max_tokens=4096,
        stream=False,
    )
    print(response.choices[0].message.content)
except RateLimitError:
    print("La solicitud siguió limitada por la tasa tras los intentos de reintento del SDK.")
except APIConnectionError as exc:
    print(f"Fallo de conexión: {exc}")
except APIStatusError as exc:
    print(f"La API devolvió {exc.status_code}: {exc.response}")
import os

from openai import APIConnectionError, APIStatusError, OpenAI, RateLimitError

api_key = os.environ.get("DEEPSEEK_API_KEY")
if not api_key:
    raise RuntimeError("Establezca la variable de entorno DEEPSEEK_API_KEY.")

client = OpenAI(
    api_key=api_key,
    base_url="https://api.deepseek.com",
    timeout=60.0,
    max_retries=2,
)

try:
    response = client.chat.completions.create(
        model="deepseek-flash",
        messages=[
            {
                "role": "system",
                "content": "Es un asistente de ingeniería de software meticuloso.",
            },
            {
                "role": "user",
                "content": "Revise este plan de migración e identifique los riesgos de reversión.",
            },
        ],
        reasoning_effort="high",
        extra_body={"thinking": {"type": "enabled"}},
        max_tokens=4096,
        stream=False,
    )
    print(response.choices[0].message.content)
except RateLimitError:
    print("La solicitud siguió limitada por la tasa tras los intentos de reintento del SDK.")
except APIConnectionError as exc:
    print(f"Fallo de conexión: {exc}")
except APIStatusError as exc:
    print(f"La API devolvió {exc.status_code}: {exc.response}")
import os

from openai import APIConnectionError, APIStatusError, OpenAI, RateLimitError

api_key = os.environ.get("DEEPSEEK_API_KEY")
if not api_key:
    raise RuntimeError("Establezca la variable de entorno DEEPSEEK_API_KEY.")

client = OpenAI(
    api_key=api_key,
    base_url="https://api.deepseek.com",
    timeout=60.0,
    max_retries=2,
)

try:
    response = client.chat.completions.create(
        model="deepseek-flash",
        messages=[
            {
                "role": "system",
                "content": "Es un asistente de ingeniería de software meticuloso.",
            },
            {
                "role": "user",
                "content": "Revise este plan de migración e identifique los riesgos de reversión.",
            },
        ],
        reasoning_effort="high",
        extra_body={"thinking": {"type": "enabled"}},
        max_tokens=4096,
        stream=False,
    )
    print(response.choices[0].message.content)
except RateLimitError:
    print("La solicitud siguió limitada por la tasa tras los intentos de reintento del SDK.")
except APIConnectionError as exc:
    print(f"Fallo de conexión: {exc}")
except APIStatusError as exc:
    print(f"La API devolvió {exc.status_code}: {exc.response}")

La estructura de la solicitud sigue los parámetros actuales del modo de pensamiento de DeepSeek. En SiliconFlow, conserve el endpoint de la API de SiliconFlow y la clave de la API, y luego utilice el ID de despliegue exacto y los parámetros admitidos que se muestran en el catálogo de modelos de SiliconFlow actual. Los ID y precios ascendentes de DeepSeek no se aplican automáticamente a un despliegue de SiliconFlow.

Migración desde V4 Flash o V4 Pro

Utilice una migración controlada en lugar de depender indefinidamente de alias de compatibilidad:

  1. Fije el proveedor y el ID del modelo. En la API directa de DeepSeek, traslade las llamadas de V4 Flash a deepseek-flash. Utilice el ID documentado para cualquier otro proveedor.

  2. Vuelva a probar los prompts y las herramientas. Compare la estructura de respuesta, el éxito de las llamadas a herramientas, la longitud del razonamiento y el manejo de errores con tareas de producción representativas.

  3. Establezca límites de coste. Limite el contexto y el output de acuerdo con el valor de la tarea, y luego realice un seguimiento de los tokens y los reintentos por resultado aceptado.

  4. Valide las imágenes por separado. Pruebe el OCR, la lectura de gráficos, el tamaño de la Image y los inputs de baja calidad antes de habilitar el tráfico multimodal.

  5. Realice un seguimiento del tráfico de producción (shadowing). Mida la tasa de tareas aceptadas, la latencia p95, la finalización de herramientas y el coste antes de cambiar la ruta principal. Mantenga la configuración anterior disponible para una posible reversión.

Los usuarios de V4 Flash deben migrar porque DeepSeek ha retirado el modelo anterior y actualmente dirige sus alias heredados a V4.1 Flash. V4 Pro sigue siendo una opción independiente. Aunque originalmente el anuncio de lanzamiento describía una retirada progresiva, la documentación actual de DeepSeek indica que deepseek-v4-pro continuará después del 14 de septiembre de 2026. Consérvelo únicamente donde los resultados de la evaluación justifiquen el precio más elevado.


Controlled API migration with shadow traffic, prompt and tool tests, cost checks, multimodal validation, rollback, and production approval

Mejores casos de uso para DeepSeek V4.1 Flash

DeepSeek V4.1 Flash se adapta mejor a cargas de trabajo en las que coinciden un input largo, el uso de herramientas y el control de costes:

  • Agentes de codificación a escala de repositorio: revisión de bases de código grandes, planificación de cambios, uso de herramientas de desarrollo e iteración sobre fallos de pruebas.

  • Flujos de trabajo de documentos de contexto largo: análisis de documentación técnica, colecciones de investigación, contratos o historiales de soporte con controles de recuperación y origen.

  • Análisis visual de documentos e interfaces: lectura de formularios, gráficos, capturas de pantalla y páginas escaneadas junto con instrucciones de text.

  • Automatización de gran volumen: ejecución de flujos de trabajo repetidos de agentes donde el input almacenado en caché y la programación fuera de las horas pico pueden reducir el coste de la API directa.

Elija V4.1 Flash cuando estas cargas de trabajo superen su umbral de calidad con un coste total menor o un tiempo de finalización más rápido. Conserve V4 Pro u otra opción cuando las evaluaciones privadas muestren una ventaja significativa en tareas de alto valor. Las acciones irreversibles, las decisiones de seguridad y las afirmaciones objetivas deben seguir requiriendo validación y la aprobación humana correspondiente.

Preguntas frecuentes sobre la arquitectura, los puntos de referencia, los precios y la migración de la API de DeepSeek V4.1 Flash

P1. ¿Es DeepSeek V4.1 Flash de código abierto?

Sí, aunque "pesos abiertos" es más preciso. DeepSeek lanzó los pesos y el repositorio bajo la licencia MIT, lo que permite su uso comercial, modificación y redistribución. El lanzamiento no proporciona todos los conjuntos de datos de entrenamiento ni los artefactos de desarrollo.

P2. ¿Es compatible DeepSeek V4.1 Flash con imágenes?

Sí. Acepta inputs de text e Image y genera text. Las tareas adecuadas incluyen el análisis de documentos asistido por OCR, la interpretación de gráficos, la localización visual (visual grounding) y la revisión de capturas de pantalla. No genera ni edita imágenes.

P3. ¿Cuál es su ventana de contexto?

El modelo admite hasta un millón de tokens de contexto. La API directa de DeepSeek permite actualmente hasta 384K tokens de output, pero los límites utilizables y los topes de output pueden variar según el proveedor de inferencia.

P4. ¿Sustituye V4.1 Flash a V4 Pro?

No. DeepSeek sigue ofreciendo V4 Pro como una opción de API independiente. V4.1 Flash ofrece un mejor rendimiento en varios de los puntos de referencia de agentes reportados y cuesta menos a través de la API directa de DeepSeek, pero la evaluación específica de la tarea debe determinar la opción de producción.

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?