Kimi K3 ya está disponible en SiliconFlow: el primer modelo abierto de la clase 3T con rendimiento de vanguardia

Índice de contenidos

TL;DR

  • Kimi K3 ya está disponible en SiliconFlow: el modelo más capaz de Moonshot AI hasta la fecha, con 2,8 billones de parámetros en total, Vision nativa con un contexto de 1 millón de tokens.

  • Por qué es importante: es el primer modelo abierto de la clase de 3 billones de parámetros del mundo —obteniendo resultados de nivel de frontera en pruebas de rendimiento de software (benchmarks) de programación, agénticos y Multimodales, y clasificándose como el #1 en Frontend Code Arena de Arena en su lanzamiento, por delante de los principales modelos cerrados en una tarea de producto real.

  • Cuál es su coste: 3,0 $ por millón de tokens de Input y 15,0 $ por millón de tokens de Output, con lecturas de caché a 0,3 $ por millón.

  • Primeros pasos: SiliconFlow proporciona API compatibles con OpenAI y Anthropic para Kimi K3, por lo que se integra directamente en Claude Code, Cline, Hermes Agent, OpenCode y sus herramientas existentes en cuestión de minutos.

Hasta este mes, los modelos de pesos abiertos más grandes alcanzaban un máximo de alrededor de un billón de parámetros. Entonces Moonshot AI lanzó Kimi K3: con 2,8 billones de parámetros, es el primer modelo abierto del mundo en la categoría de 3 billones de parámetros. Pero el tamaño no lo es todo. En el Intelligence Index independiente de Artificial Analysis, K3 ocupa el tercer puesto general —solo por detrás de Claude Fable 5 y GPT-5.6 Sol, y por delante de Claude Opus 4.8— y lidera la Frontend Code Arena de Arena. Eso es capacidad de nivel de frontera a precios de modelo abierto, y ya está disponible en SiliconFlow

Esto es con lo que está trabajando:

Kimi K3 en SiliconFlow

Nombre del modelo (Model String)

moonshotai/Kimi-K3

Arquitectura

Mixture-of-Experts — Kimi Delta Attention (KDA) + Attention Residuals (AttnRes)

Parámetros totales

2.8T (el primer modelo abierto de la clase de 3T del mundo)

Activación de expertos

16 de 896 expertos, vía Stable LatentMoE

Longitud de contexto

1049K

Output máximo

1049K

Precisión

FP8

Modalidad

Input de Text + Image (Vision nativa), output de Text

Razonamiento

Esfuerzo máximo de pensamiento por defecto (modos bajo/alto a continuación)

Capacidades

Llamadas a herramientas / JSON Mode / input de Image

Precios en SiliconFlow

lectura de caché 0,3 $ / M; 3,0 $ in / 15,0 $ out por millón de tokens

Por qué destaca Kimi K3

Primer modelo abierto de la clase de 3T

Con 2,8 billones de parámetros, Kimi K3 es el modelo abierto más grande lanzado hasta la fecha—casi 3 veces el tamaño de su predecesor. También prolonga la racha de Kimi estableciendo la frontera para la escala de modelos abiertos en nueve de los últimos doce meses.

Los modelos de este tamaño suelen implicar un compromiso: son caros de entrenar y lentos de ejecutar. K3 reduce esa brecha. Kimi Delta Attention acelera la decodificación de contexto largo (hasta 6,3 veces más rápida con un millón de tokens, según Moonshot), Attention Residuals reduce el coste de entrenamiento en torno a un 25% por menos de un 2% de cómputo adicional, y su arquitectura dispersa Mixture-of-Experts activa solo 16 de 896 expertos por token. Juntas, estas mejoras ofrecen una eficiencia de escalado 2,5 veces mejor que la de Kimi K2—lo que hace que un modelo de la clase de 3T sea práctico incluso con longitudes de contexto de un millón de tokens.

Capacidades de programación de frontera

K3 destaca en tareas de largo recorrido—desde sesiones de programación prolongadas y repositorios grandes hasta flujos de trabajo agénticos e investigación profunda. Esas son también las áreas donde registra sus resultados más sólidos en las pruebas de rendimiento (benchmarks).

Aunque sigue siendo competitivo con los mejores modelos cerrados en una amplia gama de tareas, Moonshot reconoce abiertamente que K3 todavía está por detrás de Fable 5 y GPT-5.6 Sol en general. Pero acercar tanto el rendimiento a los modelos de código cerrado es el hito más importante. Consulte la tabla completa de benchmarks de Moonshot para obtener más detalles.

Benchmark

Kimi K3

Claude Fable 5

GPT 5.6 Sol

Claude Opus 4.8

GLM-5.2

Programación

Terminal-Bench 2.1

88.3

84.6

88.8

84.6

82.7

Program Bench

77.8

76.8

77.6

71.9

63.7

SWE Marathon

42

35

39

40

13

FrontierSWE

81.2

86.6

71.3

66.7

67.3

Agéntico

BrowseComp

91.2

88

90.4

84.3

DeepSearchQA

95

94.2

93.1

Automation Bench

30.8

29.1

29.7

27.2

12.9

MCP Atlas

84.2

84.7

83.6

83.6

82.6

Razonamiento

GPQA-Diamond

93.5

92.6

94.1

91

91.2

Vision

MMMU-Pro

81.6

81.2

83

78.9

OmniDocBench

91.1

89.8

85.8

87.9

número en negrita = mejor puntuación en cada fila

Vision nativa en el proceso

K3 puede ver de forma nativa lo que está haciendo. En lugar de depender de descripciones de texto, puede inspeccionar una captura de pantalla, actualizar la interfaz, reiniciar la aplicación y verificar el resultado, manteniendo así Vision en el bucle de retroalimentación agéntico durante toda la tarea. Eso hace que los flujos de trabajo iterativos como el desarrollo frontend, la creación de videojuegos y el CAD sean significativamente más fiables.

Las mismas capacidades nativas de Vision también potencian la comprensión de documentos, gráficos y diagramas. Como K3 razona directamente sobre el contenido visual —no a través de un proceso de OCR independiente—, maneja los documentos ricos en imágenes de forma tan natural como el texto plano.

Vea Kimi K3 en acción

Las pruebas de rendimiento (benchmarks) solo cuentan una parte de la historia. Para ver cómo rinde K3 en el mundo real, le proporcionamos un único prompt con cuatro objetivos conectados: investigar Cities: Skylines, diseñar una especificación reutilizable para un constructor de ciudades en 3D exclusivo para frontend, crear el juego desde cero y mantener todo en un estilo de ciencia ficción low-poly.

En lugar de saltar directamente al código, K3 investigó la tarea, generó su propio plano de implementación y luego construyó el juego de principio a fin. Cuando encontró errores durante el desarrollo, diagnosticó los problemas, los solucionó y continuó, todo sin necesidad de recibir prompts adicionales.

El resultado fue un constructor de ciudades en 3D jugable con generación procedimental, una simulación funcional y un estilo visual cohesivo, todo a partir de una única sesión. Más que el juego final, lo que destacó fue el flujo de trabajo: K3 planificó, construyó, probó e iteró mientras se mantenía enfocado a lo largo de una tarea de larga duración.

La presentación de lanzamiento de Moonshot lo lleva aún más lejos, desde el diseño autónomo de chips hasta la reproducción de investigaciones científicas publicadas; consulte las demos oficiales de Kimi K3 para saber más.

Ejecute Kimi K3 con sus herramientas habituales

Las pruebas de rendimiento y las historias de fondo solo le dirán una parte; la forma más rápida de saber si K3 se adapta a su flujo de trabajo es ejecutarlo usted mismo. Solo le llevará unos minutos.

Pruébelo primero, sin configuración

Abra el SiliconFlow Playground y chatee con Kimi K3 directamente en su navegador. Ajuste la temperatura y top-p, o ejecútelo cara a cara contra Kimi K2.7 Code o GLM-5.2 en el mismo prompt de programación para ver cómo rinde.

Conéctelo a sus herramientas

Las API de SiliconFlow son compatibles tanto con OpenAI como con Anthropic, por lo que K3 se integra directamente en cualquier herramienta que admita un proveedor personalizado: mismo SDK, mismo código, simplemente una nueva URL base y un nuevo model string. Listo en unos minutos.

Herramienta

Guía de integración de SiliconFlow

Claude Code

Asistente de IA por línea de comandos para flujos de trabajo de programación en terminal

Cline

Agente autónomo para VS Code

OpenCode

Agente de programación de IA de código abierto para flujos de trabajo de desarrollo flexibles

Hermes Agent

Agente de servidor autónomo que recuerda, ejecuta y mejora

Y más

Continuar… — guías de integración

Qué necesita para conectarse:

URL base

https://api.siliconflow.com o https://api.siliconflow.com/v1

SiliconFlow API Key

Obtenga su SiliconFlow API Key

Model string

moonshotai/Kimi-K3

💡Un consejo para los flujos de trabajo de agentes: K3 está entrenado para conservar su historial de pensamiento dentro de una sesión. Para obtener los resultados más estables, mantenga la sesión completa con K3 y evite cambiar una conversación en curso desde otro modelo a K3 a mitad del flujo. El uso de un arnés con compatibilidad verificada de K3 le brindará la experiencia más fluida.

Comience inmediatamente

  1. Pruébelo: comience a usar Kimi K3 en SiliconFlow — realice consultas de inmediato, pague solo por el uso.

  2. Integre: use nuestra API compatible con OpenAI. Explore todas las especificaciones de la API en la documentación de la API de SiliconFlow. Moonshot recomienda ejecutar K3 con temperature = 1.0 y top_p = 1.0.

import requests

url = "https://api.siliconflow.com/v1/chat/completions"

payload = {
    "model": "moonshotai/Kimi-K3",
    "stream": False,
    "messages": [
        {
            "role": "user",
            "content": "Refactor this module for readability and add unit tests. Explain your plan before writing code."
        }
    ],
    "max_tokens": 4096,
    "temperature": 1.0,
    "top_p": 1.0
}
headers = {
    "Authorization": "Bearer <token>",
    "Content-Type": "application/json"
}

response = requests.request("POST", url, json=payload, headers=headers)

print(response.text)
import requests

url = "https://api.siliconflow.com/v1/chat/completions"

payload = {
    "model": "moonshotai/Kimi-K3",
    "stream": False,
    "messages": [
        {
            "role": "user",
            "content": "Refactor this module for readability and add unit tests. Explain your plan before writing code."
        }
    ],
    "max_tokens": 4096,
    "temperature": 1.0,
    "top_p": 1.0
}
headers = {
    "Authorization": "Bearer <token>",
    "Content-Type": "application/json"
}

response = requests.request("POST", url, json=payload, headers=headers)

print(response.text)
import requests

url = "https://api.siliconflow.com/v1/chat/completions"

payload = {
    "model": "moonshotai/Kimi-K3",
    "stream": False,
    "messages": [
        {
            "role": "user",
            "content": "Refactor this module for readability and add unit tests. Explain your plan before writing code."
        }
    ],
    "max_tokens": 4096,
    "temperature": 1.0,
    "top_p": 1.0
}
headers = {
    "Authorization": "Bearer <token>",
    "Content-Type": "application/json"
}

response = requests.request("POST", url, json=payload, headers=headers)

print(response.text)

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow