Última generación

Biblioteca de modelos de IA

Una sola API para ejecutar inferencias en más de 200 modelos de IA de vanguardia y desplegarlos en segundos

Última generación

Biblioteca de modelos de IA

Una sola API para ejecutar inferencias en más de 200 modelos de IA de vanguardia y desplegarlos en segundos

Última generación

Biblioteca de modelos de IA

Una sola API para ejecutar inferencias en más de 200 modelos de IA de vanguardia y desplegarlos en segundos

Moonshot AI

Text Generation

Kimi-K3

Kimi K3 es el modelo más capaz de Kimi hasta la fecha, con 2,8 billones de parámetros. Basado en Kimi Delta Attention, un mecanismo de atención lineal híbrido, y Attention Residuals, es compatible de forma nativa con la comprensión visual y ofrece una ventana de contexto de 1 millón de tokens. Está diseñado para aplicaciones avanzadas de IA, como la ingeniería de software, el trabajo de conocimiento y el razonamiento profundo....

Contexto total:

1049K

Output máx.:

1049K

Input:

$

3.0

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

15.0

/ M Tokens

Gato Largo

LongCat

Text Generation

LongCat-2.0

LongCat-2.0 es un modelo fundacional de alto rendimiento diseñado para cargas de trabajo de agentes. Admite de forma nativa el uso de herramientas y tareas de contexto largo, con un sólido rendimiento en la generación de código, flujos de trabajo automatizados y ejecución de instrucciones complejas. Es compatible con Claude Code, OpenClaw y otras herramientas de productividad principales....

Contexto total:

1049K

Output máx.:

131K

Input:

$

0.75

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.95

/ M Tokens

Tencent

Text Generation

Hy3

Creado para escenarios empresariales del mundo real, Hy3 cuenta con una arquitectura MoE activa de 295B/21B, soporte nativo de contexto de 256K y tres modos de razonamiento. Mejora la codificación, la comprensión de textos largos, el diálogo multiturno y la ejecución de tareas agénticas, equilibrando la fiabilidad, la eficiencia y el coste tanto en interacciones de alta frecuencia como en flujos de trabajo complejos....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.0

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.0

/ M Tokens

Z.ai

Text Generation

GLM-5.2

GLM-5.2 es el modelo de código abierto más capaz de Z.ai hasta la fecha, diseñado para la ingeniería de agentes de largo alcance con una ventana de contexto de 1M de tokens que es verdaderamente utilizable. Mantiene intacto el estado del proyecto en tareas extremadamente largas, reduciendo la necesidad de comprimir o descartar el contexto: cuanto más larga es la tarea, más puede recordar y razonar....

Contexto total:

1049K

Output máx.:

262K

Input:

$

1.302

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

4.092

/ M Tokens

Moonshot AI

Text Generation

Kimi-K2.7-Code

Kimi K2.7 Code es un modelo agéntico centrado en la programación desarrollado sobre Kimi K2.6. Con mejoras sustanciales en tareas de programación complejas y de largo recorrido en el mundo real, potencia la resolución de tareas de extremo a extremo en flujos de trabajo de ingeniería de software complejos, al tiempo que mejora la eficiencia de tokens, reduciendo el uso de tokens de pensamiento en aproximadamente un 30% en comparación con Kimi K2.6....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.85916

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

3.8

/ M Tokens

Google

Text Generation

gemma-4-12B-it

Gemma 4 26B es el último modelo MoE de código abierto de Google DeepMind, desarrollado sobre una arquitectura de mezcla de expertos de 26B de parámetros que activa solo 3.8B de parámetros durante la inferencia para ofrecer un rendimiento de tokens excepcionalmente rápido. Diseñado específicamente para el razonamiento avanzado y los flujos de trabajo de agentes, se sitúa en el puesto número 6 entre todos los modelos abiertos en la clasificación de Arena AI (superando a modelos de hasta 20 veces su tamaño) con llamada a funciones nativas, contexto de 256K y licencia completa Apache 2.0....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.1

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.3

/ M Tokens

Nex AGI

Text Generation

Nex-N2-Pro

Nex-N2 es una familia de modelos de pensamiento con Pensamiento Agéntico. Deciden de manera adaptativa cuándo y con qué profundidad razonar, unificando la cognición del agente en la codificación, la búsqueda y el uso de herramientas en un único paradigma coherente. Afirmaciones Clave - SOTA entre los modelos abiertos en SWE-Verified, SWE-Pro, Terminal Bench 2.0, Tau3, WildClawBench, BFCL V4 - Nivel superior en codificación agéntica (bucles de desarrollo de extremo a extremo), búsqueda profunda (BrowserComp, Wild Search, FinSearch) y productividad en el mundo real (GDP Val) - Pensamiento Adaptativo: ajusta automáticamente la profundidad del razonamiento por paso, entre un 30 y un 50 % menos de tokens de pensamiento frente a la activación constante, con un rendimiento igual o mejor - Plug-and-play con Claude Code, Cursor, OpenClaw y entornos agénticos...

Contexto total:

262K

Output máx.:

256K

Input:

$

0.5

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.5

/ M Tokens

MiniMaxAI

Text Generation

MiniMax-M3

MiniMax-M3 es el modelo de codificación Multimodal y agéntico de vanguardia de MiniMax, creado sobre la arquitectura de atención dispersa de MiniMax (MSA). Soporta una ventana de contexto de hasta 1M de tokens y acepta Inputs de Video e Image. El modelo está diseñado para la generación de código, flujos de trabajo agénticos, uso de herramientas, comprensión de contexto largo y razonamiento multipaso, mostrando un fuerte rendimiento en pruebas de rendimiento como SWE-Bench Pro, Terminal-Bench 2.1 y MCP Atlas....

Contexto total:

1049K

Output máx.:

131K

Input:

$

0.3

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.2

/ M Tokens

Qwen

Text Generation

Qwen3.6-27B

Qwen3.6-27B es el primer modelo denso de tamaño pequeño a mediano y de pesos abiertos de la serie Qwen3.6, con mejoras específicas para la generación de código, flujos de trabajo de agentes y tareas de desarrollo del mundo real. En comparación con Qwen3.5-27B, ofrece mejoras claras en el desarrollo frontend, el razonamiento a nivel de repositorio, el uso de herramientas y la resolución de problemas complejos, al tiempo que añade soporte para preservar el contexto de razonamiento entre turnos para reducir el razonamiento redundante en flujos de trabajo iterativos. También es compatible con la comprensión de Vision con una longitud de contexto nativa de 262.144 tokens...

Contexto total:

262K

Output máx.:

262K

Input:

$

0.3

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

3.2

/ M Tokens

Qwen

Text Generation

Qwen3.6-35B-A3B

Qwen3.6-35B-A3B es un modelo de lenguaje grande de la serie Qwen3.6 de Alibaba, que cuenta con una arquitectura de Mezcla de Expertos (MoE) con 35.000 millones de parámetros en total y aproximadamente 3.000 millones de parámetros activos por inferencia, lo que ofrece un sólido rendimiento con un uso eficiente de la computación. El modelo es compatible tanto con el modo de pensamiento como con el de no pensamiento, ofreciendo una transición flexible entre una respuesta rápida y un razonamiento profundo....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.2

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.6

/ M Tokens

Qwen

Text Generation

Qwen3.5-9B

Qwen3.5-9B es un modelo de lenguaje grande Multimodal nativo del equipo Qwen con 9B de parámetros. Como modelo denso y ligero de la serie Qwen3.5, cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Gated Attention, admitiendo de forma nativa una longitud de contexto de 262K ampliable hasta ~1M de tokens. El modelo logra capacidades unificadas de lenguaje-visión mediante el entrenamiento de fusión temprana, admitiendo la comprensión de Text, Image y Video. Se activa por defecto en modo de pensamiento, admite llamadas a herramientas y cubre 201 idiomas y dialectos e idiomas y dialectos...

Contexto total:

262K

Output máx.:

262K

Input:

$

0.1

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.15

/ M Tokens

Qwen

Text Generation

Qwen3.5-122B-A10B

Qwen3.5-122B-A10B es un modelo de lenguaje grande Multimodal nativo del equipo Qwen, con 122B de parámetros totales y solo 10B activos. Cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Mixture-of-Experts (MoE) disperso, admitiendo de forma nativa una longitud de contexto de 256K ampliable hasta ~1M tokens. A través de un entrenamiento de fusión temprana, logra capacidades unificadas de lenguaje visual que admiten la comprensión de Text, Image y Video, con un sólido rendimiento en conocimiento, razonamiento, codificación, agentes, comprensión visual y evaluaciones comparativas multilingües, superando a GPT-5-mini y Qwen3-235B-A22B en múltiples métricas. Se activa de manera predeterminada en modo de pensamiento, admite llamadas a herramientas y cubre 201 idiomas y dialectos....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.26

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.08

/ M Tokens

Qwen

Text Generation

Qwen3.5-27B

Qwen3.5-27B es un modelo de lenguaje grande Multimodal nativo del equipo Qwen con 27B de parámetros. Cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Gated Attention, admitiendo de forma nativa una longitud de contexto de 256K ampliable hasta ~1M de tokens. El modelo logra capacidades unificadas de Vision-lenguaje a través de un entrenamiento de fusión temprana, admitiendo la comprensión de Text, Image y Video con un sólido rendimiento en evaluaciones de razonamiento, programación, agentes y comprensión visual, superando a Qwen3-235B-A22B y GPT-5-mini en múltiples métricas. Se activa por defecto en modo de pensamiento, admite la llamada a herramientas y cubre 201 idiomas y dialectos....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.25

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.0

/ M Tokens

Qwen

Text Generation

Qwen3.5-397B-A17B

Qwen3.5-397B-A17B es el último modelo de lenguaje-Vision de la serie Qwen, con una arquitectura Mixture-of-Experts (MoE) con 397B de parámetros totales y 17B de parámetros activados. Soporta de forma nativa una longitud de contexto de 256K, ampliable a aproximadamente 1M de tokens, con soporte para 201 idiomas, comprensión unificada de Vision-Text, llamada a herramientas y modo de razonamiento (pensamiento)...

Contexto total:

262K

Output máx.:

262K

Input:

$

0.39

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.34

/ M Tokens

Qwen

Text Generation

Qwen3.5-35B-A3B

Qwen3.5-35B-A3B es un modelo de lenguaje grande Multimodal nativo del equipo de Qwen, con 35B de parámetros totales y solo 3B activados. Cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Mixture-of-Experts (MoE) disperso, admitiendo de forma nativa una longitud de contexto de 262K ampliable hasta ~1M tokens. El modelo logra capacidades unificadas de lenguaje y Vision a través de un entrenamiento de fusión temprana, admitiendo la comprensión de Text, Image y Video con un sólido rendimiento en pruebas de rendimiento de razonamiento, codificación, agentes y comprensión visual. Se activa por defecto en modo de pensamiento, admite llamadas a herramientas y cubre 201 idiomas y dialectos...

Contexto total:

262K

Output máx.:

262K

Input:

$

0.24

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.8

/ M Tokens

DeepSeek

Text Generation

DeepSeek-V4-Pro

DeepSeek-V4-Pro es el modelo MoE de código abierto insignia de DeepSeek con un total de 1,6T de parámetros y 49B activos, diseñado específicamente para tareas de razonamiento, programación y agentes de nivel de frontera. Admite una ventana de contexto de 1M de tokens y tres modos de esfuerzo de razonamiento de hasta Think Max, logrando un rendimiento de primer nivel en bancos de pruebas de programación como LiveCodeBench y Codeforces —rivalizando con los principales modelos de código cerrado— y se publica bajo la Licencia MIT....

Contexto total:

1049K

Output máx.:

393K

Input:

$

1.50162

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

3.135

/ M Tokens

DeepSeek

Text Generation

DeepSeek-V4-Flash

DeepSeek-V4-Flash es el último modelo MoE de código abierto de DeepSeek, que cuenta con un total de 284B de parámetros, de los cuales solo 13B se activan durante la inferencia, lo que ofrece una generación de alta velocidad sin sacrificar la capacidad. Con soporte nativo para una ventana de contexto de 1M de tokens y tres modos de razonamiento intercambiables (Non-Think, Think High y Think Max), ofrece una escala de inteligencia flexible que va desde las tareas cotidianas hasta el razonamiento complejo, todo bajo la licencia MIT....

Contexto total:

1049K

Output máx.:

393K

Input:

$

0.13

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.28

/ M Tokens

Moonshot AI

Text Generation

Kimi-K2.6

Kimi K2.6 es un modelo de agentes Multimodal nativo y de código abierto creado por Moonshot AI, que alcanza el estado del arte en código abierto en evaluaciones de rendimiento como HLE con herramientas, SWE-Bench Pro y BrowseComp. Desarrollado sobre una arquitectura MoE con un total de 1T de parámetros y 32B activados, el modelo soporta una ventana de contexto de 256K token e Input multimodales (Image y Video) a través de su codificador de Vision MoonViT. K2.6 está optimizado para cargas de trabajo de agentes: soporta más de 4.000 llamadas a herramientas durante más de 12 horas de ejecución continua, escala a 300 subagentes paralelos × 4.000 pasos por ejecución para producir más de 100 archivos a partir de un único prompt, y es compatible tanto con los modos de inferencia de pensamiento (Thinking) como instantáneo (Instant) con llamada a funciones y persistencia de pensamiento (Preserve Thinking) en múltiples turnos...

Contexto total:

262K

Output máx.:

262K

Input:

$

0.77

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

3.4

/ M Tokens

Tencent

Text Generation

Hy3-preview

Hy3 preview es un modelo de lenguaje de mezcla de expertos (MoE) de 295B de parámetros de Tencent Hunyuan, desarrollado para cargas de trabajo de agentes de nivel de producción. Con solo 21B de parámetros activos por token y soporte nativo de un contexto de 256K, se encarga de tareas complejas como la refactorización de código entre diferentes archivos, el análisis de documentos largos y el uso de herramientas en varios pasos, en lugar de limitarse a generar diálogos fluidos. Hy3 alcanza puntuaciones casi a la vanguardia de la tecnología en SWE-bench Verified y en pruebas comparativas avanzadas de STEM, al tiempo que ofrece tres modos de inferencia (no_think, think_low, think_high) para equilibrar dinámicamente la latencia y la profundidad de razonamiento. Su arquitectura de activación dispersa ofrece una inteligencia competitiva a un coste de token significativamente menor....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.066

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.26

/ M Tokens

Google

Text Generation

gemma-4-26B-A4B-it

Gemma 4 26B es el último modelo MoE de código abierto de Google DeepMind, desarrollado sobre una arquitectura de mezcla de expertos de 26B de parámetros que activa solo 3.8B de parámetros durante la inferencia para ofrecer un rendimiento de tokens excepcionalmente rápido. Diseñado específicamente para el razonamiento avanzado y los flujos de trabajo de agentes, se sitúa en el puesto número 6 entre todos los modelos abiertos en la clasificación de Arena AI (superando a modelos de hasta 20 veces su tamaño) con llamada a funciones nativas, contexto de 256K y licencia completa Apache 2.0....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.12

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.4

/ M Tokens

Google

Text Generation

gemma-4-31B-it

Gemma 4 31B es el último modelo de código abierto de Google DeepMind, construido sobre una arquitectura densa de 31B a partir de la misma base de investigación que Gemini 3. Diseñado específicamente para el razonamiento avanzado y los flujos de trabajo de agentes, ocupa el puesto número 3 entre todos los modelos abiertos en la clasificación de Arena AI, superando a modelos de hasta 20 veces su tamaño, con llamada a funciones nativa, contexto de 256K y licencia completa Apache 2.0....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.13

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.4

/ M Tokens

Z.ai

Text Generation

GLM-5.1

GLM-5.1 es el modelo insignia de próxima generación de Z.ai, creado para la ingeniería de agentes. Está diseñado para ejecutarse de forma continua durante horas o incluso más tiempo, perfeccionando su estrategia a medida que trabaja: cuanto más tiempo se ejecuta, mejores son los resultados....

Contexto total:

205K

Output máx.:

131K

Input:

$

1.19

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

3.74

/ M Tokens

Z.ai

Text Generation

GLM-5V-Turbo

GLM-5V-Turbo es el último modelo fundacional multimodal insignia de Zhipu, optimizado para codificación multimodal y capacidades de agentes. Admite un contexto de hasta 200K tokens de Image, Video y Text, y, cuando se integra con frameworks como Claude Code y OpenClaw, puede manejar tareas complejas de programación a largo plazo y de asistente....

Contexto total:

205K

Output máx.:

131K

Input:

$

1.2

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

4.0

/ M Tokens

MiniMaxAI

Text Generation

MiniMax-M2.5

MiniMax-M2.5 es el último modelo de lenguaje grande de MiniMax, entrenado exhaustivamente con aprendizaje por refuerzo en cientos de miles de entornos complejos del mundo real. Basado en una arquitectura MoE de 229B de parámetros, alcanza un rendimiento SOTA en programación, uso de herramientas agénticas, búsqueda y tareas de oficina, obteniendo una puntuación del 80,2 % en SWE-Bench Verified con una inferencia un 37 % más rápida que M2.1....

Contexto total:

197K

Output máx.:

131K

Input:

$

0.3

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.2

/ M Tokens

Z.ai

Text Generation

GLM-5

GLM-5 es un modelo de código abierto de próxima generación para la ingeniería de sistemas complejos y tareas de agentes de largo horizonte, escalado a unos ~744B de parámetros dispersos (~40B activos) con unos ~28.5T de tokens de preentrenamiento. Integra la Atención Dispersa de DeepSeek (DSA) para mantener la capacidad de contexto largo mientras reduce el coste de inferencia, y aprovecha la pila de RL asíncrona "slime" para ofrecer un rendimiento sólido en razonamiento, codificación y evaluaciones de agentes....

Contexto total:

205K

Output máx.:

131K

Input:

$

0.95

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.55

/ M Tokens

StepFun

Text Generation

Step-3.5-Flash

Step 3.5 Flash es el modelo fundacional de código abierto más capaz de StepFun, creado sobre una arquitectura dispersa de Mezcla de Expertos (MoE) con 196B de parámetros totales y solo 11B activados por token. Soporta una ventana de contexto de 262K y alcanza un rendimiento de generación de 100-300 tok/s mediante la predicción multi-token de 3 vías (MTP-3). El modelo sobresale en tareas de programación y de agentes, alcanzando un 74.4% en SWE-bench Verified y un 51.0% en Terminal-Bench 2.0....

Contexto total:

262K

Output máx.:

66K

Input:

$

0.1

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.3

/ M Tokens

Moonshot AI

Text Generation

Kimi-K2.5

Kimi K2.5 es un modelo agentivo Multimodal nativo y de código abierto creado mediante el preentrenamiento continuo de aproximadamente 15 billones de tokens mixtos de texto y Vision sobre Kimi-K2-Base. Con una arquitectura MoE de 1T de parámetros (32B activos) y una longitud de contexto de 256K, integra a la perfección la comprensión de Vision y lenguaje con capacidades agentivas avanzadas, admitiendo tanto el modo instantáneo como el de pensamiento, así como los paradigmas conversacional y agentivo....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.45

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.25

/ M Tokens

Z.ai

Text Generation

GLM-4.7

GLM-4.7 es el modelo insignia de nueva generación de Zhipu, con un total de 355B de parámetros y 32B de parámetros activos, lo que ofrece mejoras integrales en conversación general, razonamiento y capacidades de agentes. Las respuestas son más concisas y naturales; la redacción se siente más inmersiva; las instrucciones de llamada a herramientas se siguen de manera más fiable; y se ha mejorado aún más el pulido de artefactos en el front-end y la programación con agentes, junto con la eficiencia en la ejecución de tareas de largo alcance....

Contexto total:

205K

Output máx.:

205K

Input:

$

0.42

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.2

/ M Tokens

Black Forest Labs

Text-to-Image

FLUX.2 [flex]

$

0.06

/ Image

Input almacenada en caché:

$

texto

/ Image

Black Forest Labs

Text-to-Image

FLUX.2 [pro]

$

0.03

/ Image

Input almacenada en caché:

$

texto

/ Image

DeepSeek

Text Generation

DeepSeek-V3.2

DeepSeek-V3.2 es un modelo que armoniza una alta eficiencia computacional con un rendimiento de razonamiento y de agente superior. Su enfoque se basa en tres avances técnicos clave: DeepSeek Sparse Attention (DSA), un mecanismo de atención eficiente que reduce sustancialmente la complejidad computacional al tiempo que preserva el rendimiento del modelo, optimizado específicamente para escenarios de contexto largo; un Marco de Aprendizaje por Refuerzo Escalable, que permite un rendimiento comparable al de GPT-5 y una competencia de razonamiento al nivel de Gemini-3.0-Pro en su variante de alto cómputo; y un Pipeline de Síntesis de Tareas Agénticas a Gran Escala para integrar el razonamiento en escenarios de uso de herramientas, mejorando el cumplimiento y la generalización en entornos interactivos complejos. El modelo ha logrado una medalla de oro en la Olimpiada Internacional de Matemáticas (IMO) de 2025 y en la Olimpiada Internacional de Informática (IOI)...

Contexto total:

164K

Output máx.:

164K

Input:

$

0.27

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.42

/ M Tokens

Tongyi-MAI

Text-to-Image

Z-Image-Turbo

$

0.005

/ Image

Input almacenada en caché:

$

texto

/ Image

Qwen

Text Generation

Qwen3-VL-32B-Thinking

Qwen3-VL-Thinking es una versión de la serie Qwen3-VL especialmente optimizada para tareas complejas de razonamiento visual. Incorpora un "Thinking Mode" (Modo de pensamiento), lo que le permite generar pasos detallados de razonamiento intermedio (Chain-of-Thought) antes de proporcionar una respuesta final. Este diseño mejora significativamente el rendimiento del modelo en la resolución de preguntas visuales (VQA) y otras tareas de Vision-language que requieren lógica de múltiples pasos, planificación y análisis profundo....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.2

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.5

/ M Tokens

Qwen

Text Generation

Qwen3-VL-32B-Instruct

Qwen3-VL es el modelo de lenguaje de visión de la serie Qwen3, que logra un rendimiento de última generación (SOTA) en varias pruebas de referencia de lenguaje de visión (VL). El modelo admite entradas de Image de alta resolución de hasta el nivel de megapíxeles y posee sólidas capacidades en comprensión visual general, OCR multilingüe, localización de objetos visuales a nivel de detalle (grounding) y diálogo visual. Como parte de la serie Qwen3, hereda una base de lenguaje potente, lo que le permite comprender y ejecutar instrucciones complejas....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.2

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.6

/ M Tokens

Qwen

Text Generation

Qwen3-VL-8B-Instruct

Qwen3-VL-8B-Instruct es el modelo de Vision-lenguaje de la serie Qwen3, que demuestra sólidas capacidades en comprensión visual general, diálogo centrado en lo visual y reconocimiento de Text en Image multilingüe....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.18

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.68

/ M Tokens

Qwen

Text Generation

Qwen3-VL-30B-A3B-Thinking

La serie Qwen3-VL ofrece una comprensión y generación de Text superior, una percepción visual y razonamiento más profundos, una longitud de contexto ampliada, una comprensión mejorada de la dinámica espacial y de Video, y capacidades de interacción de agentes más sólidas. Disponible en arquitecturas Dense y MoE que se escalan desde el extremo (edge) hasta la nube, con ediciones de instrucción (Instruct) y de pensamiento mejorado por razonamiento (Thinking)....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.29

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.0

/ M Tokens

DeepSeek

Text Generation

DeepSeek-V3.2-Exp

DeepSeek-V3.2-Exp es una versión experimental del modelo DeepSeek, basada en V3.1-Terminus. Estrena la tecnología DeepSeek Sparse Attention (DSA) para un entrenamiento e inferencia más rápidos y eficientes en contextos largos....

Contexto total:

164K

Output máx.:

164K

Input:

$

0.27

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.41

/ M Tokens

Qwen

Text Generation

Qwen3-VL-30B-A3B-Instruct

La serie Qwen3-VL ofrece una comprensión y generación de Text superior, una percepción visual y razonamiento más profundos, una longitud de contexto ampliada, una comprensión mejorada de la dinámica espacial y de Video, y capacidades de interacción de agentes más sólidas. Disponible en arquitecturas Dense y MoE que se escalan desde el extremo (edge) hasta la nube, con ediciones de instrucción (Instruct) y de pensamiento mejorado por razonamiento (Thinking)....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.29

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.0

/ M Tokens

DeepSeek

Text Generation

DeepSeek-V3.1-Terminus

DeepSeek-V3.1-Terminus es una versión actualizada creada sobre los puntos fuertes de V3.1 que, a su vez, aborda los comentarios clave de los usuarios. Mejora la coherencia lingüística, reduciendo los casos de texto mixto en chino e inglés y los caracteres anormales ocasionales. Además, también se actualiza con un rendimiento más sólido en Code Agent y Search Agent....

Contexto total:

164K

Output máx.:

164K

Input:

$

0.27

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.0

/ M Tokens

inclusionAI

Text Generation

Ling-flash-2.0

Ling-flash-2.0 es un modelo de lenguaje de inclusionAI con un total de 100.000 millones de parámetros, de los cuales 6.100 millones se activan por token (4.800 millones que no son de Embedding). Como parte de la serie de arquitectura Ling 2.0, está diseñado como un modelo de Mezcla de Expertos (MoE) ligero pero potente. Su objetivo es ofrecer un rendimiento comparable o incluso superior al de los modelos densos de nivel 40B y otros modelos MoE más grandes, pero con un número de parámetros activos significativamente menor. El modelo representa una estrategia centrada en lograr un alto rendimiento y eficiencia a través de un diseño arquitectónico y métodos de entrenamiento extremos...

Contexto total:

131K

Output máx.:

131K

Input:

$

0.14

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.57

/ M Tokens

Qwen

Text-to-Image

Qwen-Image-Edit

$

0.04

/ Image

Input almacenada en caché:

$

texto

/ Image

Qwen

Text-to-Image

Qwen-Image

$

0.02

/ Image

Input almacenada en caché:

$

texto

/ Image

IndexTeam

Text-to-Speech

IndexTTS-2

IndexTTS2 es un modelo de Text-to-Speech (TTS) zero-shot autorregresivo y revolucionario, diseñado para abordar el desafío del control preciso de la duración en sistemas TTS a gran escala, lo cual representa una limitación significativa en aplicaciones como el doblaje de Video. Introduce un método nuevo y general para el control de la duración del habla, que admite dos modos: uno que especifica explícitamente el número de tokens generados para una duración precisa y otro que genera el habla libremente de manera autorregresiva. Además, IndexTTS2 logra el desacoplamiento entre la expresión emocional y la identidad del hablante, lo que permite un control independiente del timbre y la emoción a través de indicaciones independientes. Para mejorar la claridad del habla en expresiones altamente emocionales, el modelo incorpora representaciones latentes de GPT y utiliza un paradigma de entrenamiento nuevo de tres etapas. Con el fin de reducir la barrera para el control emocional, también cuenta con un mecanismo de instrucciones suaves basado en descripciones de Text, desarrollado mediante el ajuste fino de Qwen3, para guiar de manera efectiva la generación de habla con el tono emocional deseado. Los resultados experimentales muestran que IndexTTS2 supera a los modelos TTS zero-shot más avanzados en tasa de error de palabras, similitud de hablante y fidelidad emocional en múltiples conjuntos de datos....

$

7.15

/ M UTF-8 bytes

Input almacenada en caché:

$

texto

/ M UTF-8 bytes

ByteDance

Text Generation

Seed-OSS-36B-Instruct

Seed-OSS es una serie de modelos de lenguaje grandes de código abierto desarrollados por el equipo ByteDance Seed, diseñados para un potente procesamiento de contexto largo, razonamiento, capacidades de agente y habilidades de propósito general. Dentro de esta serie, Seed-OSS-36B-Instruct es un modelo ajustado por instrucciones con 36 mil millones de parámetros que admite de forma nativa una longitud de contexto ultralarga, lo que le permite procesar documentos masivos o bases de código complejas en una sola pasada. El modelo está especialmente optimizado para el razonamiento, la generación de código y las tareas de agente (como el uso de herramientas), al tiempo que mantiene unas capacidades de propósito general equilibradas y excelentes. Una característica clave de este modelo es la función de "presupuesto de pensamiento" (Thinking Budget), que permite a los usuarios ajustar de forma flexible la longitud del razonamiento según sea necesario, mejorando así de forma eficaz la eficiencia de la inferencia en aplicaciones prácticas....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.21

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.57

/ M Tokens

DeepSeek

Text Generation

DeepSeek-V3.1

DeepSeek-V3.1 es un modelo híbrido que admite tanto el modo de pensamiento como el modo sin pensamiento. Gracias a la optimización posterior al entrenamiento, el rendimiento del modelo en el uso de herramientas y tareas de agentes ha mejorado significativamente. DeepSeek-V3.1-Think logra una calidad de respuesta comparable a la de DeepSeek-R1-0528, respondiendo además con mayor rapidez....

Contexto total:

164K

Output máx.:

164K

Input:

$

0.27

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.0

/ M Tokens

OpenAI

Text Generation

gpt-oss-20b

La serie gpt-oss representa los modelos de pesos abiertos de OpenAI, diseñados para un razonamiento potente, tareas de agentes y casos de uso versátiles para desarrolladores. gpt-oss-20b está pensado para una menor latencia, así como para casos de uso locales o especializados....

Contexto total:

131K

Output máx.:

8K

Input:

$

0.04

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.18

/ M Tokens

OpenAI

Text Generation

gpt-oss-120b

La serie gpt-oss corresponde a los modelos de peso abierto de OpenAI, diseñados para un razonamiento potente, tareas de agentes y casos de uso versátiles para desarrolladores. gpt-oss-120b está pensado para producción, propósito general y casos de uso de alto razonamiento que caben en una sola GPU de 80 GB (como NVIDIA H100 o AMD MI300X)....

Contexto total:

131K

Output máx.:

8K

Input:

$

0.05

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.45

/ M Tokens

Qwen

Text-to-Video

Wan2.2-T2V-A14B

$

0.29

/ Video

Input almacenada en caché:

$

texto

/ Video

Qwen

Image-to-Video

Wan2.2-I2V-A14B

$

0.29

/ Video

Input almacenada en caché:

$

texto

/ Video

Qwen

Text Generation

Qwen3-Coder-30B-A3B-Instruct

Qwen3-Coder-30B-A3B-Instruct es un modelo de código de la serie Qwen3 desarrollado por el equipo Qwen de Alibaba. Al ser un modelo simplificado y optimizado, mantiene un rendimiento y una eficiencia impresionantes a la vez que se centra en capacidades de programación mejoradas. Demuestra ventajas de rendimiento significativas entre los modelos de código abierto en tareas complejas como Agentic Coding, Agentic Browser-Use y otras tareas fundamentales de programación. El modelo admite de forma nativa un contexto largo de 256K tokens, que se puede ampliar hasta 1M de tokens, lo que permite una mejor comprensión y procesamiento a escala de repositorio. Además, proporciona un soporte robusto de programación agéntica para plataformas como Qwen Code y CLINE, contando con un formato de llamada a funciones diseñado especialmente...

Contexto total:

262K

Output máx.:

262K

Input:

$

0.07

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.28

/ M Tokens

Qwen

Text Generation

Qwen3-Coder-480B-A35B

Qwen3-Coder-480B-A35B-Instruct es el modelo de código más agéntico lanzado por Alibaba hasta la fecha. Se trata de un modelo de Mezcla de Expertos (MoE) con 480.000 millones de parámetros totales y 35.000 millones de parámetros activos, lo que equilibra eficiencia y rendimiento. El modelo admite de forma nativa una longitud de contexto de 256K (aproximadamente 262.144) tokens, que se puede ampliar hasta 1 millón de tokens mediante métodos de extrapolación como YaRN, lo que le permite gestionar bases de código a escala de repositorio y tareas de programación complejas. Qwen3-Coder está diseñado específicamente para flujos de trabajo de programación agénticos, en los que no solo genera código, sino que también interactúa de forma autónoma con las herramientas y entornos de desarrollo para resolver problemas complejos. Ha obtenido resultados de vanguardia entre los modelos abiertos en diversas pruebas de rendimiento de código y agentes, con un rendimiento comparable al de modelos líderes como Claude Sonnet 4. Junto con el modelo, Alibaba también ha publicado en código abierto Qwen Code, una herramienta de línea de comandos diseñada para liberar plenamente sus potentes capacidades agénticas de programación....

Contexto total:

262K

Output máx.:

262K

Input:

$

0.25

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.0

/ M Tokens

Qwen

Text Generation

Qwen3-30B-A3B-Instruct-2507

Qwen3-30B-A3B-Instruct-2507 es la versión actualizada del modo sin pensamiento de Qwen3-30B-A3B. Es un modelo de Mezcla de Expertos (MoE) con 30,5 mil millones de parámetros totales y 3,3 mil millones de parámetros activados. Esta versión presenta mejoras clave, que incluyen avances significativos en capacidades generales como el seguimiento de instrucciones, el razonamiento lógico, la comprensión de Text, las matemáticas, la ciencia, la programación y el uso de herramientas. También muestra mejoras sustanciales en la cobertura de conocimientos de cola larga en múltiples idiomas y ofrece una alineación notablemente mejor con las preferencias del usuario en tareas subjetivas y abiertas, lo que permite respuestas de mayor utilidad y una generación de Text de mayor calidad. Además, sus capacidades en la comprensión de contextos largos se han mejorado hasta 256K. Este modelo solo admite el modo sin pensamiento y no genera bloques `<think></think>` en su Output...

Contexto total:

262K

Output máx.:

262K

Input:

$

0.09

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.3

/ M Tokens

Z.ai

Text Generation

GLM-4.5-Air

Los modelos de la serie GLM-4.5 son modelos fundacionales diseñados para agentes inteligentes. GLM-4.5-Air adopta un diseño más compacto con un total de 106.000 millones de parámetros y 12.000 millones de parámetros activos. También es un modelo de razonamiento híbrido que ofrece tanto el modo de pensamiento como el de no pensamiento....

Contexto total:

131K

Output máx.:

131K

Input:

$

0.14

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.86

/ M Tokens

Black Forest Labs

Text-to-Image

FLUX 1.1 [pro]

$

0.04

/ Image

Input almacenada en caché:

$

texto

/ Image

Black Forest Labs

Text-to-Image

FLUX 1.1 [pro] Ultra

$

0.06

/ Image

Input almacenada en caché:

$

texto

/ Image

Black Forest Labs

Text-to-Image

FLUX.1 Kontext [max]

$

0.08

/ Image

Input almacenada en caché:

$

texto

/ Image

Black Forest Labs

Text-to-Image

FLUX.1 Kontext [pro]

$

0.04

/ Image

Input almacenada en caché:

$

texto

/ Image

Tencent

Text Generation

Hunyuan-A13B-Instruct

Hunyuan-A13B-Instruct activa solo 13 B de sus 80 B de parámetros, pero iguala a LLMs mucho más grandes en los principales benchmarks. Ofrece un razonamiento híbrido: modo "rápido" de baja latencia o modo "lento" de alta precisión, intercambiables por llamada. Un contexto nativo de 256 K-tokens le permite digerir documentos del tamaño de un libro sin degradación. Las habilidades de agente están ajustadas para el liderazgo en BFCL-v3, τ-Bench y C3-Bench, lo que lo convierte en un excelente motor para asistentes autónomos. La tecnología Grouped Query Attention junto con la cuantificación multiformato ofrece una inferencia ligera en memoria y eficiente en GPU para implementaciones en el mundo real, con soporte multilingüe integrado y una sólida alineación de seguridad para aplicaciones de nivel empresarial....

Contexto total:

131K

Output máx.:

131K

Input:

$

0.14

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.57

/ M Tokens

Black Forest Labs

Text-to-Image

FLUX.1-Kontext-dev

$

0.015

/ Image

Input almacenada en caché:

$

texto

/ Image

Qwen

Embedding

Qwen3-Embedding-8B

Qwen3-Embedding-8B es el modelo propietario más reciente de la serie Qwen3 Embedding, diseñado específicamente para tareas de clasificación y embedding de texto. Basado en los modelos fundacionales densos de la serie Qwen3, este modelo de 8B parámetros admite longitudes de contexto de hasta 32K y puede generar embeddings con dimensiones de hasta 4096. El modelo hereda unas capacidades multilingües excepcionales que admiten más de 100 idiomas, junto con habilidades de razonamiento y comprensión de textos largos. Ocupa el puesto número 1 en la clasificación multilingüe MTEB (a fecha de 5 de junio de 2025, con una puntuación de 70,58) y demuestra un rendimiento de vanguardia en diversas tareas, que incluyen la recuperación de texto, la recuperación de código, la clasificación de texto, la agrupación en clústeres y la minería de bitextos. El modelo ofrece dimensiones de vector flexibles (de 32 a 4096) y capacidades basadas en instrucciones para un rendimiento mejorado en tareas y escenarios específicos....

Input:

$

0.04

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Qwen

Embedding

Qwen3-Embedding-4B

Qwen3-Embedding-4B es el modelo propietario más reciente de la serie Qwen3 Embedding, diseñado específicamente para tareas de clasificación y text embedding. Basado en los modelos fundacionales densos de la serie Qwen3, este modelo de 4B de parámetros admite longitudes de contexto de hasta 32K y puede generar embeddings con dimensiones de hasta 2560. El modelo hereda capacidades multilingües excepcionales que admiten más de 100 idiomas, junto con habilidades de razonamiento y comprensión de textos largos. Logra un rendimiento excelente en la clasificación de MTEB multilingüe (puntuación de 69.45) y muestra resultados sobresalientes en diversas tareas, que incluyen recuperación de text, recuperación de código, clasificación de text, agrupamiento (clustering) y minería de bitextos. El modelo ofrece dimensiones vectoriales flexibles (de 32 a 2560) y capacidades sensibles a instrucciones para un mejor rendimiento en tareas y escenarios específicos, proporcionando un equilibrio óptimo entre eficiencia y eficacia....

Input:

$

0.02

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Qwen

Embedding

Qwen3-Embedding-0.6B

Qwen3-Embedding-0.6B es el último modelo propietario de la serie Qwen3 Embedding, diseñado específicamente para tareas de Embedding y clasificación de Text. Desarrollado a partir de los modelos fundacionales densos de la serie Qwen3, este modelo de 0.6B parámetros admite longitudes de contexto de hasta 32K y puede generar embeddings con dimensiones de hasta 1024. El modelo hereda unas capacidades multilingües excepcionales que admiten más de 100 idiomas, junto con habilidades de comprensión y razonamiento de Text largo. Logra un sólido rendimiento en la clasificación multilingüe MTEB (puntuación de 64.33) y demuestra resultados excelentes en diversas tareas, incluida la recuperación de Text, la recuperación de código, la clasificación de Text, la agrupación y la minería de bitextos. El modelo ofrece dimensiones vectoriales flexibles (de 32 a 1024) y capacidades sensibles a instrucciones para un rendimiento mejorado en tareas y escenarios específicos, lo que lo convierte en una opción ideal para aplicaciones que priorizan tanto la eficiencia como la eficacia...

Input:

$

0.01

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Qwen

Reranker

Qwen3-Reranker-0.6B

Qwen3-Reranker-0.6B es un modelo de reordenación de Text de la serie Qwen3. Está diseñado específicamente para refinar los resultados de los sistemas de recuperación iniciales al reordenar los documentos según su relevancia para una consulta determinada. Con 0.600 millones de parámetros y una longitud de contexto de 32k, este modelo aprovecha las sólidas capacidades de razonamiento, comprensión de textos largos y multilingüismo (compatible con más de 100 idiomas) de su base Qwen3. Los resultados de la evaluación muestran que Qwen3-Reranker-0.6B logra un alto rendimiento en varios puntos de referencia de recuperación de Text, incluidos MTEB-R, CMTEB-R y MLDR...

$

0.01

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Qwen

Reranker

Qwen3-Reranker-8B

Qwen3-Reranker-8B es el modelo de reordenación de Text de 8000 millones de parámetros de la serie Qwen3. Está diseñado para perfeccionar y mejorar la calidad de los resultados de búsqueda reordenando con precisión los documentos en función de su relevancia con respecto a la consulta. Basado en los potentes modelos fundacionales Qwen3, destaca en la comprensión de Text largo con una longitud de contexto de 32k y admite más de 100 idiomas. El modelo Qwen3-Reranker-8B forma parte de una serie flexible que ofrece un rendimiento de vanguardia en diversos escenarios de recuperación de Text y código....

$

0.04

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

DeepSeek

Text Generation

DeepSeek-R1

DeepSeek-R1-0528 es un modelo mejorado que muestra mejoras significativas en la gestión de tareas de razonamiento complejo, además de ofrecer una tasa de alucinación reducida, un soporte mejorado para la llamada a funciones y una mejor experiencia para el vibe coding. Logra un rendimiento comparable al de O3 y Gemini 2.5 Pro....

Contexto total:

164K

Output máx.:

164K

Input:

$

0.5

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

2.18

/ M Tokens

Qwen

Text Generation

Qwen3-32B

Qwen3-32B es el último modelo de lenguaje a gran escala de la serie Qwen, con 32,8B de parámetros. Este modelo admite de forma única la transición fluida entre el modo de pensamiento (para razonamiento lógico complejo, matemáticas y programación) y el modo sin pensamiento (para un diálogo eficiente y de propósito general). Demuestra una capacidad de razonamiento significativamente mejorada, superando a los modelos instructivos anteriores QwQ y Qwen2.5 en matemáticas, generación de código y razonamiento lógico de sentido común. El modelo destaca en la alineación con las preferencias humanas para la escritura creativa, el juego de rol y los diálogos de múltiples turnos. Además, es compatible con más de 100 idiomas y dialectos, con una sólida capacidad de traducción y seguimiento de instrucciones multilingües....

Contexto total:

131K

Output máx.:

131K

Input:

$

0.14

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.57

/ M Tokens

Qwen

Text Generation

Qwen3-14B

Qwen3-14B es el modelo de lenguaje grande más reciente de la serie Qwen, con 14,8 mil millones de parámetros. Este modelo admite de manera única el cambio fluido entre el modo de pensamiento (para razonamiento lógico complejo, matemáticas y programación) y el modo sin pensamiento (para diálogos eficientes y de propósito general). Demuestra una capacidad de razonamiento significativamente mejorada, superando a los modelos instruct previos QwQ y Qwen2.5 en matemáticas, generación de código y razonamiento lógico de sentido común. El modelo destaca en la alineación con las preferencias humanas para la escritura creativa, los juegos de rol y los diálogos multiturno. Además, es compatible con más de 100 idiomas y dialectos, contando con excelentes capacidades de traducción y seguimiento de instrucciones multilingües....

Contexto total:

131K

Output máx.:

131K

Input:

$

0.07

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.28

/ M Tokens

Qwen

Text Generation

Qwen3-8B

Qwen3-8B es el último modelo de lenguaje grande de la serie Qwen con 8,2B de parámetros. Este modelo permite de manera única alternar sin interrupciones entre el modo de pensamiento (para un razonamiento lógico complejo, matemáticas y programación) y el modo sin pensamiento (para un diálogo eficiente y de uso general). Demuestra una capacidad de razonamiento significativamente mejorada, superando a los modelos instruct anteriores QwQ y Qwen2.5 en matemáticas, generación de código y razonamiento lógico de sentido común. El modelo destaca en la alineación con las preferencias humanas para la escritura creativa, el juego de rol y los diálogos de múltiples turnos. Además, es compatible con más de 100 idiomas y dialectos, contando con excelentes capacidades de traducción y de seguimiento de instrucciones multilíngües....

Contexto total:

131K

Output máx.:

131K

Input:

$

0.06

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.06

/ M Tokens

DeepSeek

Text Generation

DeepSeek-V3

DeepSeek-V3-0324 demuestra mejoras notables con respecto a su predecesor, DeepSeek-V3, en varios aspectos clave, incluido un gran impulso en el rendimiento de razonamiento, habilidades de desarrollo front-end más sólidas y capacidades de uso de herramientas más inteligentes....

Contexto total:

164K

Output máx.:

164K

Input:

$

0.25

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

1.0

/ M Tokens

FunAudioLLM

Text-to-Speech

FunAudioLLM/CosyVoice2-0.5B

CosyVoice 2 es un modelo de síntesis de voz en streaming basado en un gran modelo de lenguaje, que emplea un diseño de marco unificado de streaming y no streaming. El modelo mejora la utilización del libro de códigos de token de voz mediante la cuantificación escalar finita (FSQ), simplifica la arquitectura del modelo de lenguaje de Text a voz y desarrolla un modelo de emparejamiento de streaming causal con reconocimiento de fragmentos que admite diferentes escenarios de síntesis. En el modo de streaming, el modelo logra una latencia ultrabaja de 150 ms mientras mantiene una calidad de síntesis casi idéntica a la del modo no streaming. En comparación con la versión 1.0, la tasa de errores de pronunciación se ha reducido entre un 30% y un 50%, la puntuación MOS ha mejorado de 5.4 a 5.53 y se admite un control detallado de las emociones y los dialectos. El modelo es compatible con el chino (incluidos dialectos: cantonés, dialecto de Sichuan, shanghainés, dialecto de Tianjin, etc.), inglés, japonés, coreano, y admite escenarios multilingües y de idiomas mixtos....

$

7.15

/ M UTF-8 bytes

Input almacenada en caché:

$

texto

/ M UTF-8 bytes

Fish Audio

Text-to-Speech

Fish-Speech-1.5

Fish Speech V1.5 es un modelo líder de generación de Text a voz (TTS) de código abierto. El modelo emplea una arquitectura innovadora DualAR de tipo transformador autorregresivo dual. Soporta múltiples idiomas, con más de 300 000 horas de datos de entrenamiento tanto para inglés como para chino, y más de 100 000 horas para japonés. En evaluaciones independientes realizadas por TTS Arena, el modelo obtuvo un rendimiento excepcional, con una puntuación ELO de 1339. El modelo alcanzó una tasa de error de palabra (WER) del 3.5 % y una tasa de error de caracteres (CER) del 1.2 % para el inglés, y una CER del 1.3 % para los caracteres chinos....

$

15.0

/ M UTF-8 bytes

Input almacenada en caché:

$

texto

/ M UTF-8 bytes

Qwen

Text Generation

Qwen2.5-72B-Instruct

Qwen2.5-72B-Instruct es una de las series de modelos de lenguaje grandes más recientes lanzadas por Alibaba Cloud. El modelo 72B demuestra mejoras significativas en áreas como la programación y las matemáticas. El modelo también ofrece soporte multilingüe, que abarca más de 29 idiomas, incluidos el chino y el inglés. Muestra mejoras notables en el seguimiento de instrucciones, la comprensión de datos estructurados y la generación de Outputs estructurados, particularmente en formato JSON....

Contexto total:

33K

Output máx.:

4K

Input:

$

0.59

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.59

/ M Tokens

Qwen

Text Generation

Qwen2.5-7B-Instruct

Qwen2.5-7B-Instruct es una de las series de modelos de lenguaje grandes más recientes lanzadas por Alibaba Cloud. Este modelo de 7B demuestra mejoras significativas en áreas como la programación y las matemáticas. El modelo también ofrece soporte multilingüe, que cubre más de 29 idiomas, incluidos el chino, el inglés y otros. El modelo muestra mejoras notables en el seguimiento de instrucciones, la comprensión de datos estructurados y la generación de outputs estructurados, particularmente JSON....

Contexto total:

33K

Output máx.:

4K

Input:

$

0.05

/ M Tokens

Input almacenada en caché:

$

texto

/ M Tokens

Output:

$

0.05

/ M Tokens

Black Forest Labs

Text-to-Image

FLUX.1-dev

$

0.014

/ Image

Input almacenada en caché:

$

texto

/ Image

Black Forest Labs

Text-to-Image

FLUX.1-schnell

$

0.0014

/ Image

Input almacenada en caché:

$

texto

/ Image

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow