SiliconFlow AI Cloud

Presta toda tu atención

para Construir, para Explorar, para Crear

Convertir la ambición de la IA en acción

Programación

Comprensión de código, generación de código, correcciones en línea, autocompletado en tiempo real, ediciones estructuradas y sugerencias con sintaxis segura

Agente

Razonamiento multi-paso, planificación, uso de herramientas y ejecución de flujos de trabajo, para gestionar tareas complejas mediante sistemas de agentes

RAG

Recuperación de información relevante de las bases de conocimientos, lo que permite respuestas precisas y en tiempo real

Generación de contenido

Generación de Text, Image y Video, creación de contenido para redes sociales, generación de informes analíticos

Asistentes de IA

Flujos de trabajo, multiagente, bots de atención al cliente, revisión de documentos, análisis de datos

Buscar

Comprensión de consultas, resúmenes de contexto largo, respuestas en tiempo real, recomendaciones personalizadas, entrega de información procesable

Modelos de IA

Inferencia de alta velocidad para

Text, Image, Video y más allá del Video y más allá

Una API para todos los LLM y modelos multimodales abiertos y comerciales

Moonshot AI

chat

Kimi-K3

Contexto total:

1049K

Output máx.:

1049K

Input:

$

3.0

/ M Tokens

Output:

$

15.0

/ M Tokens

Gato Largo

LongCat

chat

LongCat-2.0

Contexto total:

1049K

Output máx.:

131K

Input:

$

0.75

/ M Tokens

Output:

$

2.95

/ M Tokens

Tencent

chat

Hy3

Contexto total:

262K

Output máx.:

262K

Input:

$

0.0

/ M Tokens

Output:

$

0.0

/ M Tokens

Z.ai

chat

GLM-5.2

Contexto total:

1049K

Output máx.:

262K

Input:

$

1.302

/ M Tokens

Output:

$

4.092

/ M Tokens

Moonshot AI

chat

Kimi-K2.7-Code

Contexto total:

262K

Output máx.:

262K

Input:

$

0.85916

/ M Tokens

Output:

$

3.8

/ M Tokens

Google

chat

gemma-4-12B-it

Contexto total:

262K

Output máx.:

262K

Input:

$

0.1

/ M Tokens

Output:

$

0.3

/ M Tokens

Nex AGI

chat

Nex-N2-Pro

Contexto total:

262K

Output máx.:

256K

Input:

$

0.5

/ M Tokens

Output:

$

2.5

/ M Tokens

MiniMaxAI

chat

MiniMax-M3

Contexto total:

1049K

Output máx.:

131K

Input:

$

0.3

/ M Tokens

Output:

$

1.2

/ M Tokens

Qwen

chat

Qwen3.6-27B

Contexto total:

262K

Output máx.:

262K

Input:

$

0.3

/ M Tokens

Output:

$

3.2

/ M Tokens

Qwen

chat

Qwen3.6-35B-A3B

Contexto total:

262K

Output máx.:

262K

Input:

$

0.2

/ M Tokens

Output:

$

1.6

/ M Tokens

Qwen

chat

Qwen3.5-9B

Contexto total:

262K

Output máx.:

262K

Input:

$

0.1

/ M Tokens

Output:

$

0.15

/ M Tokens

Qwen

chat

Qwen3.5-122B-A10B

Contexto total:

262K

Output máx.:

262K

Input:

$

0.26

/ M Tokens

Output:

$

2.08

/ M Tokens

productos

Opciones de implementación flexibles,

Creado para cada caso de uso

Ejecuta modelos de forma serverless, en endpoints dedicados o arranca tu propia configuración.

Serverless

Serverless

Ejecuta cualquier modelo al instante, sin configuración, con una sola llamada a la API y pago por uso.

Ajuste fino

Ajuste fino

Personaliza modelos potentes para tu caso de uso, despliegue en un solo clic.

GPUs reservadas

GPUs reservadas

Capacidad de GPU garantizada para un rendimiento estable y una facturación predecible.

GPU elásticas

GPU elásticas

Despliegue flexible de FaaS con una inferencia fiable y escalable.

AI Gateway

AI Gateway

Acceso unificado con enrutamiento inteligente, límites de tarifa y control de costes.

Entrenar y ajustar

Acceso y procesamiento de datos, entrenamiento del modelo, ajuste del rendimiento...

Inferencia y despliegue

Motor de inferencia modal de desarrollo propio, optimización de extremo a extremo...

GPU de alto rendimiento

NVIDIA H100 / H200, AMD MI300, RTX 4090…

ventaja

Creado para lo que los desarrolladores

De verdad importa

Velocidad, precisión, fiabilidad y precios justos, sin concesiones.

Velocidad

Inferencia ultrarrápida para modelos tanto de lenguaje como multimodales.

Flexibilidad

Serverless, dedicado o personalizado: ejecuta modelos a tu manera.

Eficiencia

Mayor rendimiento, menor latencia y mejor precio.

Privacidad

No se almacenan datos, nunca. Tus modelos siguen siendo tuyos.

Control

Ajusta, despliega y escala tus modelos a tu manera, sin complicaciones de infraestructura ni permanencia.

Sencillez

Una sola API para todos los modelos, totalmente compatible con OpenAI.

Preguntas frecuentes

Preguntas frecuentes

¿Qué tipos de modelos puedo desplegar en su plataforma?

¿Cómo funciona vuestra estructura de precios?

¿Puedo personalizar los modelos para que se adapten a mis necesidades específicas?

¿Qué tipo de soporte ofrecéis a los desarrolladores?

¿Cómo garantizáis el rendimiento y la fiabilidad de vuestras API?

¿Es compatible su plataforma con los estándares de OpenAI?

¿Qué tipos de modelos puedo desplegar en su plataforma?

¿Cómo funciona vuestra estructura de precios?

¿Puedo personalizar los modelos para que se adapten a mis necesidades específicas?

¿Qué tipo de soporte ofrecéis a los desarrolladores?

¿Cómo garantizáis el rendimiento y la fiabilidad de vuestras API?

¿Es compatible su plataforma con los estándares de OpenAI?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow