
Moonshot AI
Text Generation
Kimi-K3
Kimi K3 es el modelo más capaz de Kimi hasta la fecha, con 2,8 billones de parámetros. Basado en Kimi Delta Attention, un mecanismo de atención lineal híbrido, y Attention Residuals, es compatible de forma nativa con la comprensión visual y ofrece una ventana de contexto de 1 millón de tokens. Está diseñado para aplicaciones avanzadas de IA, como la ingeniería de software, el trabajo de conocimiento y el razonamiento profundo....
Contexto total:
1049K
Output máx.:
1049K
Input:
$
3.0
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
15.0
/ M Tokens

Moonshot AI
Text Generation
Kimi-K2.7-Code
Kimi K2.7 Code es un modelo agéntico centrado en la programación desarrollado sobre Kimi K2.6. Con mejoras sustanciales en tareas de programación complejas y de largo recorrido en el mundo real, potencia la resolución de tareas de extremo a extremo en flujos de trabajo de ingeniería de software complejos, al tiempo que mejora la eficiencia de tokens, reduciendo el uso de tokens de pensamiento en aproximadamente un 30% en comparación con Kimi K2.6....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.85916
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
3.8
/ M Tokens
Text Generation
gemma-4-12B-it
Gemma 4 26B es el último modelo MoE de código abierto de Google DeepMind, desarrollado sobre una arquitectura de mezcla de expertos de 26B de parámetros que activa solo 3.8B de parámetros durante la inferencia para ofrecer un rendimiento de tokens excepcionalmente rápido. Diseñado específicamente para el razonamiento avanzado y los flujos de trabajo de agentes, se sitúa en el puesto número 6 entre todos los modelos abiertos en la clasificación de Arena AI (superando a modelos de hasta 20 veces su tamaño) con llamada a funciones nativas, contexto de 256K y licencia completa Apache 2.0....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.1
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.3
/ M Tokens

Nex AGI
Text Generation
Nex-N2-Pro
Nex-N2 es una familia de modelos de pensamiento con Pensamiento Agéntico. Deciden de manera adaptativa cuándo y con qué profundidad razonar, unificando la cognición del agente en la codificación, la búsqueda y el uso de herramientas en un único paradigma coherente. Afirmaciones Clave - SOTA entre los modelos abiertos en SWE-Verified, SWE-Pro, Terminal Bench 2.0, Tau3, WildClawBench, BFCL V4 - Nivel superior en codificación agéntica (bucles de desarrollo de extremo a extremo), búsqueda profunda (BrowserComp, Wild Search, FinSearch) y productividad en el mundo real (GDP Val) - Pensamiento Adaptativo: ajusta automáticamente la profundidad del razonamiento por paso, entre un 30 y un 50 % menos de tokens de pensamiento frente a la activación constante, con un rendimiento igual o mejor - Plug-and-play con Claude Code, Cursor, OpenClaw y entornos agénticos...
Contexto total:
262K
Output máx.:
256K
Input:
$
0.5
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
2.5
/ M Tokens

MiniMaxAI
Text Generation
MiniMax-M3
MiniMax-M3 es el modelo de codificación Multimodal y agéntico de vanguardia de MiniMax, creado sobre la arquitectura de atención dispersa de MiniMax (MSA). Soporta una ventana de contexto de hasta 1M de tokens y acepta Inputs de Video e Image. El modelo está diseñado para la generación de código, flujos de trabajo agénticos, uso de herramientas, comprensión de contexto largo y razonamiento multipaso, mostrando un fuerte rendimiento en pruebas de rendimiento como SWE-Bench Pro, Terminal-Bench 2.1 y MCP Atlas....
Contexto total:
1049K
Output máx.:
131K
Input:
$
0.3
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
1.2
/ M Tokens

Qwen
Text Generation
Qwen3.6-27B
Qwen3.6-27B es el primer modelo denso de tamaño pequeño a mediano y de pesos abiertos de la serie Qwen3.6, con mejoras específicas para la generación de código, flujos de trabajo de agentes y tareas de desarrollo del mundo real. En comparación con Qwen3.5-27B, ofrece mejoras claras en el desarrollo frontend, el razonamiento a nivel de repositorio, el uso de herramientas y la resolución de problemas complejos, al tiempo que añade soporte para preservar el contexto de razonamiento entre turnos para reducir el razonamiento redundante en flujos de trabajo iterativos. También es compatible con la comprensión de Vision con una longitud de contexto nativa de 262.144 tokens...
Contexto total:
262K
Output máx.:
262K
Input:
$
0.3
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
3.2
/ M Tokens

Qwen
Text Generation
Qwen3.6-35B-A3B
Qwen3.6-35B-A3B es un modelo de lenguaje grande de la serie Qwen3.6 de Alibaba, que cuenta con una arquitectura de Mezcla de Expertos (MoE) con 35.000 millones de parámetros en total y aproximadamente 3.000 millones de parámetros activos por inferencia, lo que ofrece un sólido rendimiento con un uso eficiente de la computación. El modelo es compatible tanto con el modo de pensamiento como con el de no pensamiento, ofreciendo una transición flexible entre una respuesta rápida y un razonamiento profundo....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
1.6
/ M Tokens

Qwen
Text Generation
Qwen3.5-9B
Qwen3.5-9B es un modelo de lenguaje grande Multimodal nativo del equipo Qwen con 9B de parámetros. Como modelo denso y ligero de la serie Qwen3.5, cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Gated Attention, admitiendo de forma nativa una longitud de contexto de 262K ampliable hasta ~1M de tokens. El modelo logra capacidades unificadas de lenguaje-visión mediante el entrenamiento de fusión temprana, admitiendo la comprensión de Text, Image y Video. Se activa por defecto en modo de pensamiento, admite llamadas a herramientas y cubre 201 idiomas y dialectos e idiomas y dialectos...
Contexto total:
262K
Output máx.:
262K
Input:
$
0.1
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.15
/ M Tokens

Qwen
Text Generation
Qwen3.5-122B-A10B
Qwen3.5-122B-A10B es un modelo de lenguaje grande Multimodal nativo del equipo Qwen, con 122B de parámetros totales y solo 10B activos. Cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Mixture-of-Experts (MoE) disperso, admitiendo de forma nativa una longitud de contexto de 256K ampliable hasta ~1M tokens. A través de un entrenamiento de fusión temprana, logra capacidades unificadas de lenguaje visual que admiten la comprensión de Text, Image y Video, con un sólido rendimiento en conocimiento, razonamiento, codificación, agentes, comprensión visual y evaluaciones comparativas multilingües, superando a GPT-5-mini y Qwen3-235B-A22B en múltiples métricas. Se activa de manera predeterminada en modo de pensamiento, admite llamadas a herramientas y cubre 201 idiomas y dialectos....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.26
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
2.08
/ M Tokens

Qwen
Text Generation
Qwen3.5-27B
Qwen3.5-27B es un modelo de lenguaje grande Multimodal nativo del equipo Qwen con 27B de parámetros. Cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Gated Attention, admitiendo de forma nativa una longitud de contexto de 256K ampliable hasta ~1M de tokens. El modelo logra capacidades unificadas de Vision-lenguaje a través de un entrenamiento de fusión temprana, admitiendo la comprensión de Text, Image y Video con un sólido rendimiento en evaluaciones de razonamiento, programación, agentes y comprensión visual, superando a Qwen3-235B-A22B y GPT-5-mini en múltiples métricas. Se activa por defecto en modo de pensamiento, admite la llamada a herramientas y cubre 201 idiomas y dialectos....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.25
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
2.0
/ M Tokens

Qwen
Text Generation
Qwen3.5-397B-A17B
Qwen3.5-397B-A17B es el último modelo de lenguaje-Vision de la serie Qwen, con una arquitectura Mixture-of-Experts (MoE) con 397B de parámetros totales y 17B de parámetros activados. Soporta de forma nativa una longitud de contexto de 256K, ampliable a aproximadamente 1M de tokens, con soporte para 201 idiomas, comprensión unificada de Vision-Text, llamada a herramientas y modo de razonamiento (pensamiento)...
Contexto total:
262K
Output máx.:
262K
Input:
$
0.39
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
2.34
/ M Tokens

Qwen
Text Generation
Qwen3.5-35B-A3B
Qwen3.5-35B-A3B es un modelo de lenguaje grande Multimodal nativo del equipo de Qwen, con 35B de parámetros totales y solo 3B activados. Cuenta con una arquitectura híbrida eficiente que combina Gated Delta Networks con Mixture-of-Experts (MoE) disperso, admitiendo de forma nativa una longitud de contexto de 262K ampliable hasta ~1M tokens. El modelo logra capacidades unificadas de lenguaje y Vision a través de un entrenamiento de fusión temprana, admitiendo la comprensión de Text, Image y Video con un sólido rendimiento en pruebas de rendimiento de razonamiento, codificación, agentes y comprensión visual. Se activa por defecto en modo de pensamiento, admite llamadas a herramientas y cubre 201 idiomas y dialectos...
Contexto total:
262K
Output máx.:
262K
Input:
$
0.24
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
1.8
/ M Tokens

Moonshot AI
Text Generation
Kimi-K2.6
Kimi K2.6 es un modelo de agentes Multimodal nativo y de código abierto creado por Moonshot AI, que alcanza el estado del arte en código abierto en evaluaciones de rendimiento como HLE con herramientas, SWE-Bench Pro y BrowseComp. Desarrollado sobre una arquitectura MoE con un total de 1T de parámetros y 32B activados, el modelo soporta una ventana de contexto de 256K token e Input multimodales (Image y Video) a través de su codificador de Vision MoonViT. K2.6 está optimizado para cargas de trabajo de agentes: soporta más de 4.000 llamadas a herramientas durante más de 12 horas de ejecución continua, escala a 300 subagentes paralelos × 4.000 pasos por ejecución para producir más de 100 archivos a partir de un único prompt, y es compatible tanto con los modos de inferencia de pensamiento (Thinking) como instantáneo (Instant) con llamada a funciones y persistencia de pensamiento (Preserve Thinking) en múltiples turnos...
Contexto total:
262K
Output máx.:
262K
Input:
$
0.77
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
3.4
/ M Tokens
Text Generation
gemma-4-26B-A4B-it
Gemma 4 26B es el último modelo MoE de código abierto de Google DeepMind, desarrollado sobre una arquitectura de mezcla de expertos de 26B de parámetros que activa solo 3.8B de parámetros durante la inferencia para ofrecer un rendimiento de tokens excepcionalmente rápido. Diseñado específicamente para el razonamiento avanzado y los flujos de trabajo de agentes, se sitúa en el puesto número 6 entre todos los modelos abiertos en la clasificación de Arena AI (superando a modelos de hasta 20 veces su tamaño) con llamada a funciones nativas, contexto de 256K y licencia completa Apache 2.0....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.12
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.4
/ M Tokens
Text Generation
gemma-4-31B-it
Gemma 4 31B es el último modelo de código abierto de Google DeepMind, construido sobre una arquitectura densa de 31B a partir de la misma base de investigación que Gemini 3. Diseñado específicamente para el razonamiento avanzado y los flujos de trabajo de agentes, ocupa el puesto número 3 entre todos los modelos abiertos en la clasificación de Arena AI, superando a modelos de hasta 20 veces su tamaño, con llamada a funciones nativa, contexto de 256K y licencia completa Apache 2.0....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.13
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.4
/ M Tokens

Z.ai
Text Generation
GLM-5V-Turbo
GLM-5V-Turbo es el último modelo fundacional multimodal insignia de Zhipu, optimizado para codificación multimodal y capacidades de agentes. Admite un contexto de hasta 200K tokens de Image, Video y Text, y, cuando se integra con frameworks como Claude Code y OpenClaw, puede manejar tareas complejas de programación a largo plazo y de asistente....
Contexto total:
205K
Output máx.:
131K
Input:
$
1.2
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
4.0
/ M Tokens

Moonshot AI
Text Generation
Kimi-K2.5
Kimi K2.5 es un modelo agentivo Multimodal nativo y de código abierto creado mediante el preentrenamiento continuo de aproximadamente 15 billones de tokens mixtos de texto y Vision sobre Kimi-K2-Base. Con una arquitectura MoE de 1T de parámetros (32B activos) y una longitud de contexto de 256K, integra a la perfección la comprensión de Vision y lenguaje con capacidades agentivas avanzadas, admitiendo tanto el modo instantáneo como el de pensamiento, así como los paradigmas conversacional y agentivo....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.45
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
2.25
/ M Tokens

Qwen
Text Generation
Qwen3-VL-32B-Thinking
Qwen3-VL-Thinking es una versión de la serie Qwen3-VL especialmente optimizada para tareas complejas de razonamiento visual. Incorpora un "Thinking Mode" (Modo de pensamiento), lo que le permite generar pasos detallados de razonamiento intermedio (Chain-of-Thought) antes de proporcionar una respuesta final. Este diseño mejora significativamente el rendimiento del modelo en la resolución de preguntas visuales (VQA) y otras tareas de Vision-language que requieren lógica de múltiples pasos, planificación y análisis profundo....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
1.5
/ M Tokens

Qwen
Text Generation
Qwen3-VL-32B-Instruct
Qwen3-VL es el modelo de lenguaje de visión de la serie Qwen3, que logra un rendimiento de última generación (SOTA) en varias pruebas de referencia de lenguaje de visión (VL). El modelo admite entradas de Image de alta resolución de hasta el nivel de megapíxeles y posee sólidas capacidades en comprensión visual general, OCR multilingüe, localización de objetos visuales a nivel de detalle (grounding) y diálogo visual. Como parte de la serie Qwen3, hereda una base de lenguaje potente, lo que le permite comprender y ejecutar instrucciones complejas....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.6
/ M Tokens

Qwen
Text Generation
Qwen3-VL-8B-Instruct
Qwen3-VL-8B-Instruct es el modelo de Vision-lenguaje de la serie Qwen3, que demuestra sólidas capacidades en comprensión visual general, diálogo centrado en lo visual y reconocimiento de Text en Image multilingüe....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.18
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.68
/ M Tokens

Qwen
Text Generation
Qwen3-VL-30B-A3B-Thinking
La serie Qwen3-VL ofrece una comprensión y generación de Text superior, una percepción visual y razonamiento más profundos, una longitud de contexto ampliada, una comprensión mejorada de la dinámica espacial y de Video, y capacidades de interacción de agentes más sólidas. Disponible en arquitecturas Dense y MoE que se escalan desde el extremo (edge) hasta la nube, con ediciones de instrucción (Instruct) y de pensamiento mejorado por razonamiento (Thinking)....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
1.0
/ M Tokens

Qwen
Text Generation
Qwen3-VL-30B-A3B-Instruct
La serie Qwen3-VL ofrece una comprensión y generación de Text superior, una percepción visual y razonamiento más profundos, una longitud de contexto ampliada, una comprensión mejorada de la dinámica espacial y de Video, y capacidades de interacción de agentes más sólidas. Disponible en arquitecturas Dense y MoE que se escalan desde el extremo (edge) hasta la nube, con ediciones de instrucción (Instruct) y de pensamiento mejorado por razonamiento (Thinking)....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
1.0
/ M Tokens

