DeepSeek-R1-Distill-Llama-8B
Acerca de DeepSeek-R1-Distill-Llama-8B
DeepSeek-R1-Distill-Llama-8B es un modelo destilado basado en Llama-3.1-8B. El modelo se ajustó con precisión utilizando muestras generadas por DeepSeek-R1 y demuestra sólidas capacidades de razonamiento. Logró resultados notables en varios puntos de referencia, incluyendo una precisión del 89.1% en MATH-500, una tasa de aprobación del 50.4% en AIME 2024 y una puntuación de 1205 en CodeForces, mostrando impresionantes habilidades matemáticas y de programación para un modelo de escala 8B.
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Calibrado
No
Mezcla de expertos
No
Parámetros totales
8B
Parámetros activados
Razonamiento
No
Precisión
FP8
Longitud del contexto
33K
Tokens máximos
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.
DeepSeek
chat
DeepSeek-V3.2
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.42
/ M Tokens
DeepSeek
chat
DeepSeek-V3.2-Exp
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.41
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1-Terminus
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3
Contexto total:
164K
Output máx.:
164K
Input:
$
0.25
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-R1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.5
/ M Tokens
Output:
$
2.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-32B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.18
/ M Tokens
Output:
$
0.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-14B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.1
/ M Tokens
Output:
$
0.1
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-7B
Contexto total:
33K
Output máx.:
16K
Input:
$
0.05
/ M Tokens
Output:
$
0.05
/ M Tokens
