DeepSeek V4 Flash 0731 ya está disponible en SiliconFlow

Índice de contenidos

TL;DR

  • DeepSeek-V4-Flash-0731 ya está disponible en SiliconFlow: El lanzamiento oficial de DeepSeek V4 Flash — mismo tamaño y arquitectura que la versión preliminar, re-entrenado posteriormente para un salto significativo en la capacidad de agentes.

  • Por qué es importante: Las pruebas independientes respaldan la propia afirmación de DeepSeek. En el Intelligence Index de Artificial Analysis, 0731 obtiene una puntuación de 50 — seis puntos por delante del modelo insignia de DeepSeek — y se sitúa a solo un punto de GLM-5.2. El conjunto de pruebas de referencia para agentes publicado por la propia DeepSeek muestra la misma historia con más detalle: 0731 supera a DeepSeek-V4-Pro en cada una de las pruebas de referencia enumeradas, al tiempo que reduce la distancia con Opus 4.8.

  • Cuál es su coste: 0,028 $ / M de tokens para lecturas de caché, 0,13 $ / M de tokens de Input y 0,28 $ / M de tokens de Output en SiliconFlow.

  • Primeros pasos: SiliconFlow proporciona una API compatible con OpenAI para 0731 — con la cadena de modelo deepseek-ai/DeepSeek-V4-Flash-0731 —, por lo que se integra directamente en Claude Code, Cline, OpenCode, Hermes Agent, Codex a través de CC Switch y en tus herramientas actuales en cuestión de segundos.

DeepSeek lanzó V4 Flash como una versión preliminar en abril de 2026. Tres meses después, 0731 es el lanzamiento oficial: la misma arquitectura de 284B totales y 13B activados, re-entrenada posteriormente de forma específica para tareas de agentes. El salto es lo suficientemente grande como para que el propio conjunto de pruebas de referencia de DeepSeek muestre a 0731 superando a DeepSeek V4 Pro en cada prueba de referencia enumerada y reduciendo significativamente la distancia con Opus 4.8.

DeepSeek V4 Flash 0731 combina la velocidad y los precios de la categoría Flash con una capacidad para agentes que se acerca a la del modelo insignia — y ya está disponible en SiliconFlow. Esto es con lo que vas a trabajar:

DeepSeek-V4-Flash-0731 en SiliconFlow

Cadena de Modelo

deepseek-ai/DeepSeek-V4-Flash-0731

Lanzamiento

Versión oficial de DeepSeek-V4-Flash-preview

Arquitectura

Mixture-of-Experts — atención híbrida CSA + HCA, mHC — sin cambios respecto a la versión preliminar

Parámetros Totales

284B

Parámetros Activados

13B

Longitud de Contexto

1049K

Output Máximo

393K

Precisión en SiliconFlow

FP8

Modos de Razonamiento

Non-Think / Think High / Think Max

Capacidades

Llamadas a herramientas / JSON Mode / finalización de prefijo de Chat

Precios en SiliconFlow

Lectura de caché 0,028 $ / M; 0,14 $ de Input / 0,28 $ de Output por M de tokens

Por qué destaca DeepSeek V4 Flash 0731

Capacidades de Agente Mejoradas

DeepSeek no aumentó el tamaño de V4 Flash para el lanzamiento oficial. V4 Flash 0731 conserva el mismo tamaño de modelo y arquitectura que la versión preliminar; la mejora proviene por completo de una nueva ronda de post-entrenamiento enfocada en tareas de agentes — desde la planificación y el uso de herramientas hasta la ejecución en múltiples pasos y la recuperación ante intentos fallidos.

El resultado es un gran salto cualitativo en todo el conjunto de pruebas de referencia para agentes de DeepSeek. V4 Flash 0731 supera tanto a DeepSeek V4 Flash como a DeepSeek V4 Pro en cada prueba de la lista, con mejoras que abarcan la codificación a nivel de repositorio, el trabajo en terminal, el uso de herramientas, la ciberseguridad, la automatización y el desarrollo full-stack. Sigue estando por detrás de Opus 4.8 en general, pero la diferencia es ahora sustancialmente menor — todo ello sin que el modelo deje de tener el tamaño o el precio de la categoría Flash.

Prueba de Referencia

DeepSeek-V4-Flash-0731

DeepSeek-V4-Flash-Preview

DeepSeek-V4-Pro-Preview

GLM-5.2

Opus-4.8

Codificación

Terminal-Bench 2.1

82.7

61.8

72.1

81

85

NL2Repo

54.2

39.4

38.5

48.9

69.7

DeepSWE

54.4

7.3

12.8

46.2

58

DSBench-FullStack†

68.7

37

41.8

61.8

71.6

DSBench-Hard†

59.6

25.8

31.1

54.5

71.7

Agente

Toolathlon-Verified

70.3

49.7

55.9

59.9

76.2

Agents' Last Exam

25.2

15.8

16.5

23.8

25.7

AutomationBench Public

25.1

10.8

12.8

12.9

27.2

Seguridad

Cybergym

76.7

38.7

52.7

83.1

Fuente: Registro oficial de cambios de DeepSeek y la tarjeta de modelo de DeepSeek-V4-Flash-0731. Opus 4.8 lidera en todas las filas superiores — esta tabla muestra hasta qué punto el 0731 acorta esa distancia frente a la propia versión preliminar insignia de DeepSeek y su predecesora, no se trata de liderar el sector.

Velocidad y Precios Flash

A pesar del gran avance en las capacidades de los agentes, V4 Flash 0731 mantiene la velocidad y los precios de un modelo de categoría Flash. En SiliconFlow, sigue costando 0,028 $ / M de tokens para lecturas de caché, 0,14 $ / M de tokens de Input y 0,28 $ / M de tokens de Output.

El seguimiento independiente de Artificial Analysis refuerza ese posicionamiento. Entre los 36 despliegues de SiliconFlow que rastrea, V4 Flash 0731 Max ocupa el segundo lugar en inteligencia con una puntuación en el Índice de Inteligencia de 52, ofrece la salida más rápida a 136 tokens por segundo, y es el modelo con el precio combinado más bajo a 0,1 $ por millón de tokens.

Tres niveles de razonamiento, un modelo

No todas las tareas requieren la misma cantidad de razonamiento.

DeepSeek V4 Flash 0731 ahora admite tres niveles de esfuerzo de razonamiento:

Modo

Ideal para

low

Iteración rápida, ediciones rutinarias, llamadas sencillas a herramientas

high

Depuración compleja, planificación y resolución de problemas de varios pasos

max

Agentes de largo horizonte y las tareas de codificación o razonamiento más difíciles

Utiliza low para explorar e iterar; pasa a high o max cuando la tarea requiera una planificación más profunda o una ejecución autónoma más prolongada — sin cambiar de modelo.

Ejecuta DeepSeek V4 Flash 0731 con tus herramientas habituales

Las pruebas de referencia y el contexto histórico solo dicen una parte de la historia — la forma más rápida de saber si el 0731 cambia tu flujo de trabajo es ejecutarlo tú mismo. Solo te llevará unos minutos.

Pruébalo primero, sin configuración

Abre el Playground de SiliconFlow y chatea con DeepSeek-V4-Flash-0731 directamente en tu navegador. Prueba una pregunta de codificación, pega un error autocontenido o pide al modelo que resuelva un problema técnico paso a paso. Para ver la diferencia directamente, ejecuta el mismo prompt de forma paralela en DeepSeek-V4-Pro o GLM-5.2.

Conéctalo a tus herramientas

La API de SiliconFlow es compatible con OpenAI, por lo que 0731 se integra directamente en cualquier herramienta que admita un proveedor personalizado — mismo SDK, mismo código, solo la URL base de SiliconFlow y la cadena de modelo.

Herramienta

Guía de Integración de SiliconFlow

Codex

Ejecuta modelos de SiliconFlow en Codex a través de CC Switch

Claude Code

Asistente de IA por línea de comandos para flujos de trabajo de codificación en terminal

Cline

Agente de codificación autónomo para VS Code

OpenCode

Agente de codificación de IA de código abierto para flujos de trabajo de desarrollo flexibles

Hermes Agent

Agente de servidor autónomo que recuerda, ejecuta y mejora

Y más

Guías de integración de SiliconFlow

Qué necesitas para conectarte

URL Base

https://api.siliconflow.com/v1

Cadena de Modelo

deepseek-ai/DeepSeek-V4-Flash-0731

Clave API

Crear una clave API de SiliconFlow

💡 Un consejo para Codex: Mantén habilitado el enrutamiento local de CC Switch mientras utilizas el proveedor de SiliconFlow. La capa de enrutamiento debe permanecer activa para traducir las solicitudes y las respuestas en streaming entre ambos protocolos.

Comienza de inmediato

  1. Pruébalo: Comienza a usar DeepSeek-V4-Flash-0731 en SiliconFlow — ejecuta consultas de inmediato, paga solo por el uso.

  2. Intégralo: Utiliza nuestra API compatible con OpenAI. Explora las especificaciones completas de la API en la documentación de la API de SiliconFlow. DeepSeek recomienda temperature = 1.0 y top_p = 1.0 para uso general.

import requests

url = "https://api.siliconflow.com/v1/chat/completions"

payload = {
    "model": "deepseek-ai/DeepSeek-V4-Flash-0731",
    "stream": False,
    "messages": [
        {
            "role": "user",
            "content": "A test in this repo is failing intermittently. Investigate the failure, form a hypothesis, and propose a fix — explain your reasoning before changing code."
        }
    ],
    "max_tokens": 4096,
    "temperature": 1.0,
    "top_p": 1.0
}
headers = {
    "Authorization": "Bearer <token>",
    "Content-Type": "application/json"
}

response = requests.request("POST", url, json=payload, headers=headers)

print(response.text)
import requests

url = "https://api.siliconflow.com/v1/chat/completions"

payload = {
    "model": "deepseek-ai/DeepSeek-V4-Flash-0731",
    "stream": False,
    "messages": [
        {
            "role": "user",
            "content": "A test in this repo is failing intermittently. Investigate the failure, form a hypothesis, and propose a fix — explain your reasoning before changing code."
        }
    ],
    "max_tokens": 4096,
    "temperature": 1.0,
    "top_p": 1.0
}
headers = {
    "Authorization": "Bearer <token>",
    "Content-Type": "application/json"
}

response = requests.request("POST", url, json=payload, headers=headers)

print(response.text)
import requests

url = "https://api.siliconflow.com/v1/chat/completions"

payload = {
    "model": "deepseek-ai/DeepSeek-V4-Flash-0731",
    "stream": False,
    "messages": [
        {
            "role": "user",
            "content": "A test in this repo is failing intermittently. Investigate the failure, form a hypothesis, and propose a fix — explain your reasoning before changing code."
        }
    ],
    "max_tokens": 4096,
    "temperature": 1.0,
    "top_p": 1.0
}
headers = {
    "Authorization": "Bearer <token>",
    "Content-Type": "application/json"
}

response = requests.request("POST", url, json=payload, headers=headers)

print(response.text)

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow