DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B

关于DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B 是基于 Llama-3.1-8B 的蒸馏模型。该模型经过 DeepSeek-R1 生成的样本进行了微调,展示了强大的推理能力。它在各项基准中取得了显著的成果,包括在 MATH-500 上达成了 89.1% 的准确率,在 AIME 2024 上达成了 50.4% 的通过率,并在 CodeForces 上取得了 1205 的评分,这表明它在 8B 级别的模型中具有令人印象深刻的数学和编程能力。

元数据

创建

许可证

MIT

提供者

DeepSeek

规格

Deprecated

建筑

校准的

专家混合

总参数

8B

激活的参数

推理

精度

FP8

上下文长度

33K

最大输出长度

准备好 加速您的人工智能开发吗?

准备好 加速您的人工智能开发吗?

准备好 加速您的人工智能开发吗?