DeepSeek-R1-Distill-Llama-8B
Tentang DeepSeek-R1-Distill-Llama-8B
DeepSeek-R1-Distill-Llama-8B adalah Model hasil distilasi berdasarkan Llama-3.1-8B. Model ini disesuaikan lebih lanjut menggunakan sampel yang dihasilkan oleh DeepSeek-R1 dan menunjukkan kemampuan penalaran yang kuat. Ini mencapai hasil signifikan pada berbagai tolok ukur, termasuk akurasi 89.1% pada MATH-500, tingkat kelulusan 50.4% pada AIME 2024, dan penilaian 1205 di CodeForces, menunjukkan kemampuan matematika dan pemrograman yang mengesankan untuk Model skala 8B
Metadata
Spesifikasi
Negara
Deprecated
Arsitektur
Terkalibrasi
Tidak
Campuran Ahli
Tidak
Total Parameter
8B
Parameter yang Diaktifkan
Penalaran
Tidak
Precision
FP8
Text panjang konteks
33K
Max Tokens
Bandingkan dengan Model Lain
Lihat bagaimana model ini dibandingkan dengan yang lain.
DeepSeek
chat
DeepSeek-V3.2
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.42
/ M Tokens
DeepSeek
chat
DeepSeek-V3.2-Exp
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.41
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1-Terminus
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3
Total Context:
164K
Max output:
164K
Input:
$
0.25
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-R1
Total Context:
164K
Max output:
164K
Input:
$
0.5
/ M Tokens
Output:
$
2.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-32B
Total Context:
131K
Max output:
131K
Input:
$
0.18
/ M Tokens
Output:
$
0.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-14B
Total Context:
131K
Max output:
131K
Input:
$
0.1
/ M Tokens
Output:
$
0.1
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-7B
Total Context:
33K
Max output:
16K
Input:
$
0.05
/ M Tokens
Output:
$
0.05
/ M Tokens
