DeepSeek-R1-Distill-Llama-8B
О DeepSeek-R1-Distill-Llama-8B
DeepSeek-R1-Distill-Llama-8B — это дистиллированная модель, основанная на Llama-3.1-8B. Модель была дообучена с использованием образцов, сгенерированных DeepSeek-R1, и демонстрирует сильные способности к рассуждению. Она достигла заметных результатов на различных тестах, включая 89,1% точности на MATH-500, 50,4% прохождения на AIME 2024 и рейтинг 1205 на CodeForces, демонстрируя впечатляющие математические и программные способности для модели масштаба 8B.
Метаданные
Спецификация
Государство
Deprecated
Архитектура
Калибровка
Нет
Смешение экспертов
Нет
Общее количество параметров
8B
Активированные параметры
Мышление
Нет
Точность
ФП8
Контекст length
33K
Максимум Tokens
Сравнить с другими Model
Посмотрите, как эта Model сравнивается с другими.
DeepSeek
chat
DeepSeek-V3.2
Общий Контекст:
164K
Максимальный Output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.42
/ M Tokens
DeepSeek
chat
DeepSeek-V3.2-Exp
Общий Контекст:
164K
Максимальный Output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.41
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1-Terminus
Общий Контекст:
164K
Максимальный Output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1
Общий Контекст:
164K
Максимальный Output:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3
Общий Контекст:
164K
Максимальный Output:
164K
Input:
$
0.25
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-R1
Общий Контекст:
164K
Максимальный Output:
164K
Input:
$
0.5
/ M Tokens
Output:
$
2.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-32B
Общий Контекст:
131K
Максимальный Output:
131K
Input:
$
0.18
/ M Tokens
Output:
$
0.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-14B
Общий Контекст:
131K
Максимальный Output:
131K
Input:
$
0.1
/ M Tokens
Output:
$
0.1
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-7B
Общий Контекст:
33K
Максимальный Output:
16K
Input:
$
0.05
/ M Tokens
Output:
$
0.05
/ M Tokens
