Índice de contenidos

TL;DR
DeepSeek-V4-Flash-0731 ya está disponible en SiliconFlow: El lanzamiento oficial de DeepSeek V4 Flash — mismo tamaño y arquitectura que la versión preliminar, re-entrenado posteriormente para un salto significativo en la capacidad de agentes.
Por qué es importante: Las pruebas independientes respaldan la propia afirmación de DeepSeek. En el Intelligence Index de Artificial Analysis, 0731 obtiene una puntuación de 50 — seis puntos por delante del modelo insignia de DeepSeek — y se sitúa a solo un punto de GLM-5.2. El conjunto de pruebas de referencia para agentes publicado por la propia DeepSeek muestra la misma historia con más detalle: 0731 supera a
DeepSeek-V4-Proen cada una de las pruebas de referencia enumeradas, al tiempo que reduce la distancia con Opus 4.8.Cuál es su coste: 0,028 $ / M de tokens para lecturas de caché, 0,13 $ / M de tokens de Input y 0,28 $ / M de tokens de Output en SiliconFlow.
Primeros pasos: SiliconFlow proporciona una API compatible con OpenAI para 0731 — con la cadena de modelo
deepseek-ai/DeepSeek-V4-Flash-0731—, por lo que se integra directamente en Claude Code, Cline, OpenCode, Hermes Agent, Codex a través de CC Switch y en tus herramientas actuales en cuestión de segundos.
DeepSeek lanzó V4 Flash como una versión preliminar en abril de 2026. Tres meses después, 0731 es el lanzamiento oficial: la misma arquitectura de 284B totales y 13B activados, re-entrenada posteriormente de forma específica para tareas de agentes. El salto es lo suficientemente grande como para que el propio conjunto de pruebas de referencia de DeepSeek muestre a 0731 superando a DeepSeek V4 Pro en cada prueba de referencia enumerada y reduciendo significativamente la distancia con Opus 4.8.
DeepSeek V4 Flash 0731 combina la velocidad y los precios de la categoría Flash con una capacidad para agentes que se acerca a la del modelo insignia — y ya está disponible en SiliconFlow. Esto es con lo que vas a trabajar:
Cadena de Modelo | deepseek-ai/DeepSeek-V4-Flash-0731 |
Lanzamiento | Versión oficial de DeepSeek-V4-Flash-preview |
Arquitectura | Mixture-of-Experts — atención híbrida CSA + HCA, mHC — sin cambios respecto a la versión preliminar |
Parámetros Totales | 284B |
Parámetros Activados | 13B |
Longitud de Contexto | 1049K |
Output Máximo | 393K |
Precisión en SiliconFlow | FP8 |
Modos de Razonamiento | Non-Think / Think High / Think Max |
Capacidades | Llamadas a herramientas / JSON Mode / finalización de prefijo de Chat |
Precios en SiliconFlow | Lectura de caché 0,028 $ / M; 0,14 $ de Input / 0,28 $ de Output por M de tokens |
Por qué destaca DeepSeek V4 Flash 0731
Capacidades de Agente Mejoradas
DeepSeek no aumentó el tamaño de V4 Flash para el lanzamiento oficial. V4 Flash 0731 conserva el mismo tamaño de modelo y arquitectura que la versión preliminar; la mejora proviene por completo de una nueva ronda de post-entrenamiento enfocada en tareas de agentes — desde la planificación y el uso de herramientas hasta la ejecución en múltiples pasos y la recuperación ante intentos fallidos.
El resultado es un gran salto cualitativo en todo el conjunto de pruebas de referencia para agentes de DeepSeek. V4 Flash 0731 supera tanto a DeepSeek V4 Flash como a DeepSeek V4 Pro en cada prueba de la lista, con mejoras que abarcan la codificación a nivel de repositorio, el trabajo en terminal, el uso de herramientas, la ciberseguridad, la automatización y el desarrollo full-stack. Sigue estando por detrás de Opus 4.8 en general, pero la diferencia es ahora sustancialmente menor — todo ello sin que el modelo deje de tener el tamaño o el precio de la categoría Flash.
Prueba de Referencia | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Flash-Preview | DeepSeek-V4-Pro-Preview | GLM-5.2 | Opus-4.8 |
Codificación | |||||
Terminal-Bench 2.1 | 82.7 | 61.8 | 72.1 | 81 | 85 |
NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58 |
DSBench-FullStack† | 68.7 | 37 | 41.8 | 61.8 | 71.6 |
DSBench-Hard† | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
Agente | |||||
Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
Agents' Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
Seguridad | |||||
Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
Fuente: Registro oficial de cambios de DeepSeek y la tarjeta de modelo de DeepSeek-V4-Flash-0731. Opus 4.8 lidera en todas las filas superiores — esta tabla muestra hasta qué punto el 0731 acorta esa distancia frente a la propia versión preliminar insignia de DeepSeek y su predecesora, no se trata de liderar el sector.
Velocidad y Precios Flash
A pesar del gran avance en las capacidades de los agentes, V4 Flash 0731 mantiene la velocidad y los precios de un modelo de categoría Flash. En SiliconFlow, sigue costando 0,028 $ / M de tokens para lecturas de caché, 0,14 $ / M de tokens de Input y 0,28 $ / M de tokens de Output.
El seguimiento independiente de Artificial Analysis refuerza ese posicionamiento. Entre los 36 despliegues de SiliconFlow que rastrea, V4 Flash 0731 Max ocupa el segundo lugar en inteligencia con una puntuación en el Índice de Inteligencia de 52, ofrece la salida más rápida a 136 tokens por segundo, y es el modelo con el precio combinado más bajo a 0,1 $ por millón de tokens.

Tres niveles de razonamiento, un modelo
No todas las tareas requieren la misma cantidad de razonamiento.
DeepSeek V4 Flash 0731 ahora admite tres niveles de esfuerzo de razonamiento:
Modo | Ideal para |
low | Iteración rápida, ediciones rutinarias, llamadas sencillas a herramientas |
high | Depuración compleja, planificación y resolución de problemas de varios pasos |
max | Agentes de largo horizonte y las tareas de codificación o razonamiento más difíciles |
Utiliza low para explorar e iterar; pasa a high o max cuando la tarea requiera una planificación más profunda o una ejecución autónoma más prolongada — sin cambiar de modelo.
Ejecuta DeepSeek V4 Flash 0731 con tus herramientas habituales
Las pruebas de referencia y el contexto histórico solo dicen una parte de la historia — la forma más rápida de saber si el 0731 cambia tu flujo de trabajo es ejecutarlo tú mismo. Solo te llevará unos minutos.
Pruébalo primero, sin configuración
Abre el Playground de SiliconFlow y chatea con DeepSeek-V4-Flash-0731 directamente en tu navegador. Prueba una pregunta de codificación, pega un error autocontenido o pide al modelo que resuelva un problema técnico paso a paso. Para ver la diferencia directamente, ejecuta el mismo prompt de forma paralela en DeepSeek-V4-Pro o GLM-5.2.
Conéctalo a tus herramientas
La API de SiliconFlow es compatible con OpenAI, por lo que 0731 se integra directamente en cualquier herramienta que admita un proveedor personalizado — mismo SDK, mismo código, solo la URL base de SiliconFlow y la cadena de modelo.
Herramienta | Guía de Integración de SiliconFlow |
Codex | Ejecuta modelos de SiliconFlow en Codex a través de CC Switch |
Claude Code | Asistente de IA por línea de comandos para flujos de trabajo de codificación en terminal |
Cline | |
OpenCode | Agente de codificación de IA de código abierto para flujos de trabajo de desarrollo flexibles |
Hermes Agent | |
Y más |
Qué necesitas para conectarte
URL Base | |
Cadena de Modelo | deepseek-ai/DeepSeek-V4-Flash-0731 |
Clave API |
💡 Un consejo para Codex: Mantén habilitado el enrutamiento local de CC Switch mientras utilizas el proveedor de SiliconFlow. La capa de enrutamiento debe permanecer activa para traducir las solicitudes y las respuestas en streaming entre ambos protocolos.
Comienza de inmediato
Pruébalo: Comienza a usar DeepSeek-V4-Flash-0731 en SiliconFlow — ejecuta consultas de inmediato, paga solo por el uso.
Intégralo: Utiliza nuestra API compatible con OpenAI. Explora las especificaciones completas de la API en la documentación de la API de SiliconFlow. DeepSeek recomienda
temperature = 1.0ytop_p = 1.0para uso general.
