Índice de contenidos

Kimi K3 es el modelo insignia de 2,8 billones de parámetros de Moonshot AI para programación de largo horizonte, trabajo de conocimiento, análisis visual y razonamiento complejo. Combina una arquitectura dispersa de tipo Mezcla de Expertos (Mixture-of-Experts) con comprensión visual nativa y una ventana de contexto de aproximadamente 1 millón de tokens.
Kimi K3 está disponible a través de la API Serverless de SiliconFlow bajo el ID de modelo moonshotai/Kimi-K3. Los desarrolladores pueden usar el modelo a través de una interfaz compatible con OpenAI sin necesidad de aprovisionar o mantener la gran infraestructura informática requerida para la inferencia autohospedada. El soporte actual incluye entrada de imágenes, llamada a herramientas, JSON Mode, streaming y salida de razonamiento.

Elemento | Kimi K3 en SiliconFlow |
|---|---|
ID de Modelo | moonshotai/Kimi-K3 |
Arquitectura | Mezcla de Expertos |
Parámetros Totales | 2,8 billones |
Longitud de Contexto | 1049K tokens |
Entrada Estándar | $3,00 por 1M de tokens |
Entrada en Caché | $0,30 por 1M de tokens |
Salida | $15,00 por 1M de tokens |
Entrada de Imagen | Soportado |
Llamada a Herramientas | Soportado |
JSON Mode | Soportado |
Salidas Estructuradas | No soportado actualmente |
¿Qué es Kimi K3?
Kimi K3 está diseñado para tareas que se extienden a lo largo de múltiples pasos, archivos, herramientas o fuentes de información. Sus principales áreas de enfoque incluyen ingeniería de software, investigación técnica, análisis de documentos, razonamiento visual y flujos de trabajo de agentes automatizados.
Aunque los usuarios puedan buscar un «modelo de programación Kimi K3», K3 no se limita a la programación. Es un modelo insignia general que combina la programación con el razonamiento, la entrada visual y el trabajo de conocimiento. Moonshot AI mantiene una línea de modelos separada y enfocada en la programación para los desarrolladores que necesitan un modelo de programación más especializado.
Arquitectura del modelo Kimi K3
Kimi K3 utiliza una arquitectura dispersa de Mezcla de Expertos con 2,8 billones de parámetros totales. Durante el cálculo, activa eficazmente 16 de los 896 expertos.
Su arquitectura incluye:
Kimi Delta Attention: Un mecanismo de atención lineal híbrido diseñado para mejorar la eficiencia en secuencias largas.
Atención Residual (Attention Residuals): Un método que recupera selectivamente representaciones a lo largo de la profundidad del modelo en lugar de acumularlas de manera uniforme.
Stable LatentMoE: Un marco diseñado para soportar un enrutamiento estable con un alto nivel de dispersión de expertos.
Juntos, estos componentes están destinados a mejorar el flujo de información tanto a lo largo de la secuencia como de la profundidad del modelo. Moonshot AI informa que la arquitectura ofrece una mejora de aproximadamente 2,5 veces en la eficiencia de escalamiento general en comparación con Kimi K2.
Autohospedar un modelo de esta escala requiere una infraestructura sustancial. Moonshot AI recomienda configuraciones de supernodo con al menos 64 aceleradores para su despliegue. SiliconFlow elimina ese requisito de configuración al proporcionar Kimi K3 a través de un endpoint Serverless disponible de inmediato.
Ventana de contexto de 1M de Kimi K3
Kimi K3 admite una ventana de contexto de aproximadamente 1 millón de tokens. En SiliconFlow, la longitud del contexto se especifica como 1049K tokens.
Esta capacidad de contexto es útil cuando una aplicación necesita trabajar con:
Grandes repositorios de software
Especificaciones técnicas y archivos fuente
Múltiples informes o artículos de investigación
Historiales extensos de conversaciones y herramientas
Registros extensos y archivos operativos
Tareas de comparación entre documentos
La ventana de contexto es un límite de capacidad, no una recomendación para incluir cada archivo disponible. El contenido duplicado, desactualizado o irrelevante puede aumentar el costo y dificultar la priorización de instrucciones importantes. Las aplicaciones de producción deben seguir utilizando la recuperación de información, la selección de archivos, la compresión de contexto y una organización clara de las fuentes.
La especificación del modelo de SiliconFlow muestra actualmente 1049K tanto para la longitud del contexto como para el máximo de tokens. Sin embargo, los límites de salida a nivel de solicitud también pueden depender del endpoint de la API actual, las reglas de parámetros y la configuración de la cuenta. Los desarrolladores deben seguir la referencia de la API más reciente en lugar de asumir que el máximo total del modelo mostrado se puede generar en una sola respuesta.
Capacidades multimodales de Kimi K3
Kimi K3 tiene capacidades visuales nativas y su endpoint de SiliconFlow admite la entrada de imágenes.
Esto permite a los desarrolladores combinar imágenes y texto para tareas como:
Lectura de gráficos y diagramas técnicos
Revisión de capturas de pantalla de interfaces
Comparación de una referencia de diseño con una implementación
Análisis de figuras de artículos de investigación
Inspección de paneles de control e informes visuales
Uso de capturas de pantalla como retroalimentación durante el desarrollo frontend
Moonshot AI describe a Kimi K3 como un modelo multimodal nativo que puede entender texto, imágenes y video. La especificación actual del modelo de SiliconFlow confirma explícitamente la entrada de imágenes. Las aplicaciones no deben asumir que todos los formatos de entrada disponibles a través de otro producto de Kimi son compatibles con la API de SiliconFlow.
¿Cuáles son las características principales de Kimi K3?
Kimi K3 está diseñado para tareas que requieren una ejecución sostenida en lugar de una única respuesta aislada. Sus puntos fuertes principales son la programación de largo horizonte, el trabajo con agentes basados en herramientas, el análisis intensivo de conocimiento y el razonamiento visual.
Programación de largo horizonte
Kimi K3 puede seguir trabajando en tareas de ingeniería de software que involucran investigación, implementación, pruebas, corrección y revisión.
Las cargas de trabajo relevantes incluyen:
Navegación por grandes repositorios
Rastreo de dependencias entre archivos
Planificación y aplicación de refactorizaciones
Depuración de sistemas de múltiples componentes
Ejecución e interpretación de pruebas
Optimización de kernels o código de infraestructura
Revisión de código de frontend a partir de capturas de pantalla
Conversión de investigación técnica en código ejecutable
Moonshot AI informa que Kimi K3 puede sostener sesiones extendidas de ingeniería, navegar por grandes repositorios y coordinar herramientas de terminal con una supervisión humana limitada. Sus demostraciones publicadas incluyen la optimización de kernels de GPU, desarrollo de compiladores, diseño de chips, desarrollo de juegos visuales y computación científica.
Estos ejemplos describen la capacidad del modelo, no el acceso automático a un entorno de desarrollo. Las aplicaciones aún deben proporcionar archivos, herramientas de repositorio, funciones de terminal, sandboxes y controles de aprobación.
Tareas de agentes complejas
Kimi K3 puede actuar como la capa de razonamiento en un agente que realiza varias acciones conectadas.
Por ejemplo, una aplicación puede otorgar al modelo acceso a funciones para:
Buscar en una base de conocimientos
Consultar una base de datos
Leer archivos aprobados
Realizar cálculos
Llamar a servicios internos
Ejecutar código en un entorno seguro (sandbox)
El modelo puede determinar cuándo una herramienta es relevante y generar los argumentos para la llamada a una función. La aplicación sigue siendo responsable de validar esos argumentos, ejecutar la función, devolver el resultado, manejar los errores y aplicar los controles de acceso.
SiliconFlow admite la llamada a funciones a través de un formato de herramientas compatible con OpenAI. Un modelo puede solicitar la llamada a una función, pero no puede acceder de forma independiente a un navegador, terminal, base de datos o sistema de archivos local a menos que la aplicación proporcione esa capacidad.
Trabajo de conocimiento de extremo a extremo
Kimi K3 también está diseñado para flujos de trabajo que combinan investigación, análisis, manejo de datos, redacción y comunicación visual.
Las tareas posibles incluyen:
Comparación de políticas, contratos o normas técnicas
Revisión de literatura científica
Extracción de pruebas a partir de informes extensos
Producción de resúmenes de investigación
Análisis de documentos financieros u operativos
Creación de recomendaciones a partir de múltiples fuentes
Conversión de investigaciones en informes y paneles de control
Moonshot AI ha demostrado el rendimiento de Kimi K3 en tareas de investigación extensas que involucran miles de búsquedas, grandes colecciones de documentos, procesamiento de datos basado en terminales, subagentes concurrentes y visualización interactiva. Estos casos muestran la capacidad del modelo para coordinar trabajos complejos, aunque las conclusiones importantes siempre deben verificarse con las fuentes primarias.
Llamada a herramientas y JSON Mode
Kimi K3 admite tanto la llamada a herramientas como el JSON Mode en SiliconFlow.
El JSON Mode puede servir para:
Extracción de información
Clasificación de contenido
Enrutamiento de solicitudes
Procesamiento de formularios
Generación de cargas útiles (payloads) de API
Componentes de informes estructurados
Una solicitud puede habilitar el JSON Mode con:
response_format={"type": "json_object"}
El JSON Mode está diseñado para devolver un JSON válido cuando se configura correctamente, pero no impone un JSON Schema específico. Las salidas estructuradas no están soportadas actualmente para Kimi K3 en SiliconFlow.
Las aplicaciones deben validar los campos obligatorios, los tipos de datos, los valores permitidos y las reglas de negocio antes de utilizar el JSON generado por el modelo. También deben gestionar las salidas incompletas cuando una respuesta se corta.
¿Cómo rinde Kimi K3?
Moonshot AI reporta resultados de nivel de frontera en evaluaciones de programación, agentes, trabajo de conocimiento y evaluación multimodal. La empresa también reconoce que la experiencia general del usuario todavía está por detrás de los sistemas propietarios más potentes en algunas áreas.
Rendimiento de programación de Kimi K3
Kimi K3 ha sido evaluado en pruebas de referencia (benchmarks) de programación como:
DeepSWE v1.1
Terminal-Bench 2.1
Program Bench
SWE Marathon
FrontierSWE
PostTrain Bench
MLS Bench Lite
Kimi Code Bench 2.0
Estas evaluaciones cubren la modificación de repositorios, la operación de terminales, la síntesis de programas, la ingeniería de larga duración, el post-entrenamiento de modelos y el trabajo con sistemas de aprendizaje automático.
Los resultados deben interpretarse con cautela. Según la prueba de referencia, los modelos se evaluaron a través de diferentes entornos de agentes, incluidos KimiCode, Claude Code, Codex y Terminus. Algunos resultados también provienen de tablas de clasificación externas, mientras que otros se produjeron a través de la propia configuración de evaluación de Moonshot AI.
Para tomar decisiones en entornos de producción, los resultados de las pruebas de referencia deben considerarse como una señal inicial de capacidad. Los equipos también deberían probar Kimi K3 en sus propios repositorios, lenguajes, definiciones de herramientas, requisitos de prueba y criterios de finalización.
Rendimiento de agentes de Kimi K3
Las evaluaciones de agentes cubren tareas que involucran investigación web, automatización, hojas de cálculo, documentos de oficina y herramientas externas. El conjunto de evaluaciones publicado por Moonshot AI incluye BrowseComp, AutomationBench, SpreadsheetBench 2, OfficeQA Pro, MCP Atlas, GDPval-AA y AA-Briefcase.
Estas tareas miden más que la respuesta directa a preguntas. Es posible que un modelo necesite recopilar pruebas, operar herramientas, mantener el estado de la tarea, actualizar archivos o coordinar varias acciones.
El rendimiento del agente en el mundo real también depende del sistema que lo rodea. Unas descripciones de herramientas claras, APIs fiables, límites de permisos, políticas de reintento y comprobaciones de resultados intermedios pueden ser tan importantes como el modelo subyacente.
Rendimiento multimodal de Kimi K3
Kimi K3 también ha sido evaluado en percepción visual, razonamiento multimodal, interpretación de gráficos y tareas visuales asistidas por herramientas. Los materiales de evaluación de Moonshot AI incluyen MMMU-Pro, PerceptionBench, CharXiv y ZeroBench.
Sus capacidades visuales son especialmente relevantes cuando las imágenes forman parte de un flujo de trabajo más amplio. Un agente puede inspeccionar una captura de pantalla, actualizar el código, ejecutar la aplicación y revisar el siguiente resultado visual.
La salida visual aún requiere verificación cuando una tarea depende de etiquetas pequeñas, mediciones exactas, distinciones visuales finas o decisiones críticas para la seguridad.
Precios de Kimi K3 y disponibilidad en SiliconFlow
Kimi K3 está disponible a través de la API Serverless de SiliconFlow. Los desarrolladores pueden probarlo sin configurar un despliegue de modelo dedicado y pagar según el uso de tokens.
Precios de la API de Kimi K3
Los precios actuales de Kimi K3 son:
Tipo de Token | Precio por 1 millón de tokens |
|---|---|
Entrada Estándar | $3.00 |
Entrada en Caché | $0.30 |
Salida | $15.00 |
Por ejemplo, una solicitud que utilice 100 000 tokens de entrada estándar y genere 20 000 tokens de salida tendría el siguiente coste estimado:
Entrada:
100 000 ÷ 1 000 000 × $3.00 = $0.30
Salida:
20 000 ÷ 1 000 000 × $15.00 = $0.30
Total estimado:
$0.60
Este ejemplo solo ilustra la fórmula de precios. El coste real depende de si aplica la tarifa de caché, la longitud de la entrada, las entradas de imágenes, la salida de razonamiento, la longitud de la respuesta y el número de llamadas necesarias para finalizar el flujo de trabajo.
Un agente puede realizar varias llamadas al modelo y a las herramientas para una única solicitud de usuario. Por lo tanto, el control de costes debe realizarse a nivel de tarea o sesión, en lugar de hacerlo únicamente a nivel de solicitud de API individual.
Límites de contexto y salida de Kimi K3
El contexto disponible puede incluir:
Instrucciones del sistema
Mensajes del usuario y del asistente
Documentos fuente
Solicitudes de herramientas
Resultados de herramientas
Representaciones de imágenes
Salida generada
Las aplicaciones deben configurar max_tokens de acuerdo con la respuesta esperada en lugar de con la capacidad teórica total del modelo. Las revisiones de código cortas pueden necesitar solo unos pocos miles de tokens, mientras que los informes largos pueden requerir más.
Para repositorios de código o colecciones de documentos de gran tamaño, recuperar las secciones relevantes suele ser más eficiente que enviar repetidamente todo el corpus.
Características soportadas de la API de Kimi K3
Capacidad | Disponibilidad en SiliconFlow |
|---|---|
API Serverless | Soportado |
Razonamiento | Soportado |
Entrada de Imagen | Soportado |
Llamada a Herramientas | Soportado |
JSON Mode | Soportado |
Salidas Estructuradas | No soportado actualmente |
Ajuste Fino (Fine-Tuning) | No soportado actualmente |
Serverless LoRA | No soportado actualmente |
Embeddings | No soportado |
Reclasificación (Reranking) | No soportado |
Completado FIM | No soportado |
Completado de Prefijo de Chat | No soportado |
Estos límites afectan al diseño de la aplicación. Por ejemplo, los desarrolladores deben combinar el JSON Mode con la validación en el lado de la aplicación en lugar de depender de la aplicación de esquemas (schema enforcement).
Cómo usar la API de Kimi K3 en SiliconFlow
SiliconFlow proporciona una API compatible con OpenAI. Las aplicaciones que ya utilicen el SDK de Python de OpenAI pueden conectarse simplemente actualizando la API Key, la URL base y el ID del modelo.
Crear una API Key de SiliconFlow
Cree una cuenta en SiliconFlow o inicie sesión, abra la página de API Keys y genere una clave nueva.
Almacénela en una variable de entorno en lugar de colocarla directamente en el código fuente:
export SILICONFLOW_API_KEY="tu_api_key"
No suba las API Keys a repositorios públicos ni las exponga en aplicaciones frontend.
Llamar a Kimi K3 con el SDK de OpenAI
Instale o actualice el paquete de Python de OpenAI:
pip install --upgrade openai
A continuación, configure el cliente con la URL base de SiliconFlow:
Los valores de configuración necesarios son:
URL Base: https://api.siliconflow.com/v1
ID de Modelo: moonshotai/Kimi-K3
SiliconFlow proporciona acceso unificado a más de 200 modelos de lenguaje y multimodales. Los equipos pueden evaluar diferentes modelos sin tener que crear una integración de proveedor independiente para cada uno, aunque los parámetros específicos del modelo y los requisitos de historial deben gestionarse de forma individual.
Configurar Streaming y Razonamiento
El streaming permite que una aplicación muestre el contenido del texto a medida que se genera:
Las respuestas del modelo de razonamiento de SiliconFlow pueden contener reasoning_content junto con el contenido final. Dado que Kimi K3 es sensible al manejo del historial de razonamiento, los agentes que se ejecutan durante mucho tiempo deberían usar un framework con compatibilidad verificada de Kimi K3, en lugar de asumir que el estado de conversación de otro modelo de razonamiento se puede reutilizar sin cambios.
En el momento del lanzamiento, Kimi K3 utiliza por defecto el máximo esfuerzo de pensamiento. Moonshot AI ha anunciado opciones de menor esfuerzo de razonamiento para actualizaciones posteriores, pero los desarrolladores no deben asumir que los parámetros disponibles a través de otro endpoint de Kimi ya son compatibles a través de SiliconFlow.
Mejores casos de uso para Kimi K3
Kimi K3 es más adecuado cuando una tarea requiere realmente una ejecución prolongada, grandes cantidades de contexto, razonamiento visual o una coordinación compleja de herramientas.
Análisis de bases de código grandes
Utilice Kimi K3 cuando una tarea requiera razonamiento a través de muchos archivos conectados o mantener el progreso a lo largo de un flujo de trabajo de ingeniería extendido.
Proporcione:
Un mapa del repositorio
Directorios relevantes
Comandos de prueba disponibles
Criterios de aceptación claros
Permisos de herramientas
Reglas para la aprobación humana
Un modelo más pequeño puede ser más eficiente para cambios de sintaxis aislados, explicaciones de código cortas o tareas de formateo sencillas.
Procesamiento de documentos con contexto largo
Kimi K3 puede dar soporte a la comparación de grandes informes, contratos, normas técnicas, políticas o colecciones de investigación.

Para obtener resultados más fiables, indique al modelo que:
Identifique la fuente de los hallazgos principales
Separe las pruebas del razonamiento deductivo
Marque la información contradictoria
Señale las pruebas que faltan
Conserve la terminología importante
La recuperación sigue siendo útil cuando solo una pequeña parte de una gran colección es relevante para cada pregunta.
Agentes de IA y flujos de trabajo automatizados
Kimi K3 puede sustentar agentes de programación, asistentes de investigación, sistemas de revisión de documentos, flujos de trabajo de análisis de datos y automatización interna.
Los agentes en entornos de producción deben definir:
Herramientas permitidas
Pasos máximos de ejecución
Presupuestos de tokens y costes
Límites de acceso a datos
Tiempos de espera y límites de reintento
Acciones que requieren aprobación humana
Condiciones que obligan a detener al agente
El modelo puede razonar sobre las acciones y solicitar herramientas, mientras que la aplicación que lo rodea sigue siendo responsable de la ejecución, los permisos y las reglas de negocio.
Investigación y análisis multimodal
La entrada de imágenes hace que Kimi K3 sea útil para flujos de trabajo que involucran gráficos, capturas de pantalla, paneles de control, diagramas y documentos renderizados visualmente.
Un flujo de trabajo puede pedir al modelo que inspeccione una figura, recupere texto de apoyo, llame a una herramienta de cálculo y devuelva una explicación estructurada. Los hallazgos importantes deben poder vincularse a la imagen original y al material de origen.
Limitaciones de Kimi K3 y consideraciones de desarrollo
Gestión del historial de razonamiento
Kimi K3 fue entrenado con un historial de pensamiento preservado. Moonshot AI advierte que la calidad de la generación puede volverse inestable cuando un framework de agente no devuelve el contenido histórico de pensamiento requerido.
Para sesiones largas:
Utilice un framework probado con Kimi K3.
Conserve el estado del modelo de acuerdo con las directrices actuales de la API.
Evite reconstruir la sesión únicamente a partir de las respuestas mostradas.
Monitoree el crecimiento del contexto.
Reinicie la sesión deliberadamente cuando el historial deje de ser fiable.
No copie la implementación del historial de razonamiento de otro proveedor sin confirmar antes que es compatible con el endpoint de SiliconFlow.
Cambio de modelo y compatibilidad de sesiones
Evite cambiar una sesión activa de otro modelo de razonamiento a Kimi K3 mientras conserva trazas de razonamiento específicas del modelo.
Un proceso más seguro es:
Extraer los hechos verificados y las acciones completadas.
Eliminar el historial de razonamiento interno del modelo anterior.
Abrir una nueva sesión de Kimi K3.
Proporcionar un resumen conciso del estado actual de la tarea.
Adjuntar el material de origen necesario para continuar.
La API unificada de SiliconFlow reduce el trabajo de integración a nivel de proveedor, pero los estados internos de los diferentes modelos no son intercambiables automáticamente.
Control de la proactividad excesiva
Moonshot AI señala que Kimi K3 puede tomar decisiones inesperadas cuando encuentra obstáculos menores o instrucciones ambiguas. Este comportamiento está relacionado con su enfoque de entrenamiento en tareas largas y difíciles. Por lo tanto, las aplicaciones con límites operativos estrictos deben definir las acciones permitidas, los requisitos de aprobación, las condiciones de parada y las reglas de actuación ante la falta de información. También deben especificar si el modelo puede modificar archivos, realizar llamadas a sistemas externos o hacer suposiciones más allá de las pruebas suministradas. Estos límites pueden incluirse en el prompt del sistema, en la política del agente o en las instrucciones a nivel de proyecto como AGENTS.md.
Consideraciones de costes y latencia
Los prompts largos, los resultados del razonamiento, la entrada de imágenes y las llamadas repetidas a herramientas pueden incrementar tanto el tiempo de respuesta como el coste total. Los flujos de trabajo en producción deben controlar el tamaño del contexto, la longitud de la respuesta, la frecuencia de llamada a herramientas, el almacenamiento en caché y los presupuestos de ejecución en función de la complejidad de cada tarea. Una arquitectura multimodelo puede derivar el análisis de repositorios completos, la investigación extendida y el trabajo complejo con agentes a Kimi K3, mientras que asigna tareas clasificatorias, extractivas y de formateo rutinario a modelos más pequeños. Este enfoque ayuda a equilibrar la capacidad, la latencia y el coste en toda la aplicación.
Empiece a usar Kimi K3 en SiliconFlow
Kimi K3 está disponible en SiliconFlow bajo el ID de modelo:
moonshotai/Kimi-K3
Cree una API Key en SiliconFlow, pruebe el modelo con su propio código, documentos, imágenes y herramientas, y evalúe su calidad, latencia y coste en condiciones de rendimiento reales antes de pasar la aplicación a entornos de producción.
Preguntas frecuentes sobre Kimi K3 en SiliconFlow
Q1. ¿Tiene Kimi K3 los mismos límites de frecuencia para todas las cuentas?
No. Los límites de uso de Kimi K3 pueden variar según la cuenta, el modelo y la configuración actual del servicio. Compruebe los detalles del modelo o el panel de control antes de establecer objetivos de concurrencia, y añada colas de solicitudes, reintentos exponenciales y límites de reintento para gestionar las limitaciones temporales de velocidad.
Q2. ¿Puede Kimi K3 trabajar con agentes de programación de terceros?
Sí. Las herramientas de desarrollo que acepten un proveedor compatible con OpenAI pueden conectarse utilizando la URL base de SiliconFlow, la API Key y el ID del modelo. Confirme que la herramienta seleccionada admite los parámetros de contexto, imagen y salida que requiere su flujo de trabajo de Kimi K3.
Q3. ¿Se aplica el precio de entrada en caché a todos los prompts repetidos?
No. Repetir un texto similar no garantiza que cada token de entrada reciba la tarifa con descuento por caché. La facturación de caché solo se aplica cuando la solicitud cumple las condiciones requeridas para ello, por lo que debe revisar los registros de facturación reales en lugar de estimar los ahorros basándose únicamente en la similitud de los prompts.
Q4. ¿Deberían las aplicaciones en producción prepararse para cambios en el servicio de Kimi K3?
Sí. SiliconFlow puede ajustar la disponibilidad de los modelos y las capacidades del servicio a lo largo del tiempo. Los sistemas de producción deben supervisar los anuncios oficiales, probar los flujos de trabajo importantes tras las actualizaciones, gestionar los errores de disponibilidad del modelo y mantener una ruta de alternativa (fallback) en lugar de asumir que el endpoint actual permanecerá inalterado indefinidamente.
