DeepSeek-R1-Distill-Llama-70B
Acerca de DeepSeek-R1-Distill-Llama-70B
DeepSeek-R1-Distill-Llama-70B es un modelo destilado basado en Llama-3.3-70B-Instruct. Como parte de la serie DeepSeek-R1, se perfeccionó utilizando muestras generadas por DeepSeek-R1 y demuestra un rendimiento excelente en tareas de matemáticas, programación y razonamiento. El modelo obtuvo resultados impresionantes en varios puntos de referencia, incluidos AIME 2024, MATH-500 y GPQA Diamond, lo que demuestra sus sólidas capacidades de razonamiento.
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Calibrado
No
Mezcla de expertos
No
Parámetros totales
70B
Parámetros activados
Razonamiento
No
Precisión
FP8
Longitud del contexto
33K
Tokens máximos
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.
DeepSeek
chat
DeepSeek-V3.2
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.42
/ M Tokens
DeepSeek
chat
DeepSeek-V3.2-Exp
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.41
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1-Terminus
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3
Contexto total:
164K
Output máx.:
164K
Input:
$
0.25
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-R1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.5
/ M Tokens
Output:
$
2.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-32B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.18
/ M Tokens
Output:
$
0.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-14B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.1
/ M Tokens
Output:
$
0.1
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-7B
Contexto total:
33K
Output máx.:
16K
Input:
$
0.05
/ M Tokens
Output:
$
0.05
/ M Tokens
