DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B

Acerca de DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B es un modelo destilado basado en Llama-3.1-8B. El modelo se ajustó con precisión utilizando muestras generadas por DeepSeek-R1 y demuestra sólidas capacidades de razonamiento. Logró resultados notables en varios puntos de referencia, incluyendo una precisión del 89.1% en MATH-500, una tasa de aprobación del 50.4% en AIME 2024 y una puntuación de 1205 en CodeForces, mostrando impresionantes habilidades matemáticas y de programación para un modelo de escala 8B.

Metadatos

Creado el

Licencia

MIT

Proveedor

DeepSeek

Especificación

Estado

Deprecated

Arquitectura

Calibrado

No

Mezcla de expertos

No

Parámetros totales

8B

Parámetros activados

Razonamiento

No

Precisión

FP8

Longitud del contexto

33K

Tokens máximos

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow