DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B

約DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8BはLlama-3.1-8Bをベースにした蒸留されたModelです。このModelはDeepSeek-R1によって生成されたサンプルを使用して微調整され、強力な推論能力を示しています。MATH-500で89.1%の精度、AIME 2024で50.4%の合格率、CodeForcesで1205の評価を達成し、8BスケールのModelとして印象的な数学的およびプログラミング能力を示しています。

メタデータ

作成する

ライセンス

MIT

プロバイダー

DeepSeek

ハギングフェイス

仕様

Deprecated

建築

キャリブレートされた

いいえ

専門家の混合

いいえ

合計パラメータ

8B

アクティブ化されたパラメータ

推論

いいえ

Precision

FP8

コンテキスト長

33K

Max Tokens

AI開発を 加速する準備はできていますか?

AI開発を 加速する準備はできていますか?

AI開発を 加速する準備はできていますか?