gemma-4-12B-it
Acerca de gemma-4-12B-it
Gemma 4 26B es el último modelo MoE de código abierto de Google DeepMind, desarrollado sobre una arquitectura de mezcla de expertos de 26B de parámetros que activa solo 3.8B de parámetros durante la inferencia para ofrecer un rendimiento de tokens excepcionalmente rápido. Diseñado específicamente para el razonamiento avanzado y los flujos de trabajo de agentes, se sitúa en el puesto número 6 entre todos los modelos abiertos en la clasificación de Arena AI (superando a modelos de hasta 20 veces su tamaño) con llamada a funciones nativas, contexto de 256K y licencia completa Apache 2.0.
Serverless disponible
Ejecute consultas de forma inmediata y pague solo por el uso
Precio de Input
$
0.1
/ M Tokens
Precio de Output
$
0.3
/ M Tokens
Metadatos
Especificación
Estado
Available
Arquitectura
Calibrado
No
Mezcla de expertos
No
Parámetros totales
31B
Parámetros activados
Razonamiento
No
Precisión
FP8
Longitud del contexto
262K
Tokens máximos
262K
Funcionalidades admitidas
Serverless
Compatible
Serverless LoRA
No compatible
Ajuste fino
No compatible
Embeddings
No compatible
Rerankers
No compatible
Soporte para Input de Image
Compatible
JSON Mode
Compatible
Outputs estructuradas
No compatible
Herramientas
Compatible
Finalización de Fim
No compatible
Completado de prefijo de Chat
No compatible
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.
chat
gemma-4-12B-it
Contexto total:
262K
Output máx.:
262K
Input:
$
0.1
/ M Tokens
Output:
$
0.3
/ M Tokens
chat
gemma-4-26B-A4B-it
Contexto total:
262K
Output máx.:
262K
Input:
$
0.12
/ M Tokens
Output:
$
0.4
/ M Tokens
chat
gemma-4-31B-it
Contexto total:
262K
Output máx.:
262K
Input:
$
0.13
/ M Tokens
Output:
$
0.4
/ M Tokens
