DeepSeek-R1-Distill-Qwen-1.5B
Acerca de DeepSeek-R1-Distill-Qwen-1.5B
DeepSeek-R1-Distill-Qwen-1.5B es un modelo destilado basado en Qwen2.5-Math-1.5B. El modelo fue ajustado mediante fine-tuning utilizando 800.000 muestras seleccionadas generadas por DeepSeek-R1 y muestra un rendimiento decente en diversos puntos de referencia (benchmarks). Al ser un modelo ligero, logró una precisión del 83,9 % en MATH-500, una tasa de aprobación del 28,9 % en AIME 2024 y una puntuación de 954 en CodeForces, demostrando capacidades de razonamiento más allá de su escala de parámetros.
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Calibrado
No
Mezcla de expertos
No
Parámetros totales
2B
Parámetros activados
Razonamiento
No
Precisión
FP8
Longitud del contexto
33K
Tokens máximos
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.
DeepSeek
chat
DeepSeek-V3.2
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.42
/ M Tokens
DeepSeek
chat
DeepSeek-V3.2-Exp
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.41
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1-Terminus
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3
Contexto total:
164K
Output máx.:
164K
Input:
$
0.25
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-R1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.5
/ M Tokens
Output:
$
2.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-32B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.18
/ M Tokens
Output:
$
0.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-14B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.1
/ M Tokens
Output:
$
0.1
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-7B
Contexto total:
33K
Output máx.:
16K
Input:
$
0.05
/ M Tokens
Output:
$
0.05
/ M Tokens
