DeepSeek-R1-Distill-Qwen-1.5B
Tentang DeepSeek-R1-Distill-Qwen-1.5B
DeepSeek-R1-Distill-Qwen-1.5B adalah model distilled yang didasarkan pada Qwen2.5-Math-1.5B. Model ini di-tuning dengan baik menggunakan 800k sampel dikurasi yang dihasilkan oleh DeepSeek-R1 dan menunjukkan kinerja yang cukup baik di berbagai tolok ukur. Sebagai model ringan, model ini mencapai akurasi 83.9% pada MATH-500, tingkat kelulusan 28.9% pada AIME 2024, dan peringkat 954 di CodeForces, menunjukkan kemampuan penalaran yang melampaui skala parameternya
Metadata
Spesifikasi
Negara
Deprecated
Arsitektur
Terkalibrasi
Tidak
Campuran Ahli
Tidak
Total Parameter
2B
Parameter yang Diaktifkan
Penalaran
Tidak
Precision
FP8
Text panjang konteks
33K
Max Tokens
Bandingkan dengan Model Lain
Lihat bagaimana model ini dibandingkan dengan yang lain.
DeepSeek
chat
DeepSeek-V3.2
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.42
/ M Tokens
DeepSeek
chat
DeepSeek-V3.2-Exp
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.41
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1-Terminus
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1
Total Context:
164K
Max output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3
Total Context:
164K
Max output:
164K
Input:
$
0.25
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-R1
Total Context:
164K
Max output:
164K
Input:
$
0.5
/ M Tokens
Output:
$
2.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-32B
Total Context:
131K
Max output:
131K
Input:
$
0.18
/ M Tokens
Output:
$
0.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-14B
Total Context:
131K
Max output:
131K
Input:
$
0.1
/ M Tokens
Output:
$
0.1
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-7B
Total Context:
33K
Max output:
16K
Input:
$
0.05
/ M Tokens
Output:
$
0.05
/ M Tokens
