DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B

Tentang DeepSeek-R1-Distill-Llama-8B

DeepSeek-R1-Distill-Llama-8B adalah Model hasil distilasi berdasarkan Llama-3.1-8B. Model ini disesuaikan lebih lanjut menggunakan sampel yang dihasilkan oleh DeepSeek-R1 dan menunjukkan kemampuan penalaran yang kuat. Ini mencapai hasil signifikan pada berbagai tolok ukur, termasuk akurasi 89.1% pada MATH-500, tingkat kelulusan 50.4% pada AIME 2024, dan penilaian 1205 di CodeForces, menunjukkan kemampuan matematika dan pemrograman yang mengesankan untuk Model skala 8B

Metadata

Buat di

Lisensi

MIT

Penyedia

DeepSeek

Spesifikasi

Negara

Deprecated

Arsitektur

Terkalibrasi

Tidak

Campuran Ahli

Tidak

Total Parameter

8B

Parameter yang Diaktifkan

Penalaran

Tidak

Precision

FP8

Text panjang konteks

33K

Max Tokens

Siap untuk mempercepat pengembangan AI Anda?

Siap untuk mempercepat pengembangan AI Anda?

Siap untuk mempercepat pengembangan AI Anda?