DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B

關於DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B是一個基於Llama-3.1-8B的蒸餾模型。該模型使用DeepSeek-R1生成的樣本進行微調,展示出強大的推理能力。它在各種基準測試中取得了顯著的成績,包括在MATH-500上達到了89.1%的準確率、在AIME 2024上達到了50.4%的通過率,以及在CodeForces上取得了1205的評分,顯示出一個8B規模模型的令人印象深刻的數學和編程能力。

元數據

創建於

許可證

MIT

供應商

DeepSeek

規格

狀態

Deprecated

架構

經過校準的

專家並行

總參數

8B

啟用的參數

推理

精度

FP8

上下文長度

33K

最大輸出長度

準備好 加速您的人工智能開發了嗎?

準備好 加速您的人工智能開發了嗎?

準備好 加速您的人工智能開發了嗎?