deepseek-vl2
Acerca de deepseek-vl2
DeepSeek-VL2 es un modelo de lenguaje y Vision mixto de expertos (MoE) desarrollado sobre la base de DeepSeekMoE-27B, que emplea una arquitectura MoE de activación dispersa para lograr un rendimiento superior con solo 4,5B de parámetros activos. El modelo destaca en diversas tareas, como la respuesta visual a preguntas, el reconocimiento óptico de caracteres, la comprensión de documentos/tablas/gráficos y la localización visual. En comparación con los modelos densos de código abierto existentes y los modelos basados en MoE, demuestra un rendimiento competitivo o de última generación utilizando la misma cantidad o menos de parámetros activos.
Explore cómo las capacidades avanzadas de lenguaje y visión de DeepSeek-VL2 resuelven problemas complejos del mundo real en diversos sectores.
Procesamiento inteligente de documentos
Automatice la extracción y el análisis de datos de diversos documentos como facturas, contratos e informes, aprovechando el OCR y la comprensión visual.
Ejemplo de caso de uso:
"Extrae automáticamente cifras clave de estados financieros escaneados y rellena una base de datos, reduciendo la introducción manual de datos en un 80 % para una firma de contabilidad."
Análisis de contenido visual
Identifique y categorice objetos, escenas o contenido inapropiado dentro de imágenes y videos para moderación, búsqueda o análisis.
Ejemplo de caso de uso:
"Marca artículos prohibidos o contenido sensible en imágenes de productos cargadas por los usuarios en comercios electrónicos, garantizando el cumplimiento de las directrices de la plataforma y la seguridad de la marca."
Generación automática de subtítulos de imágenes
Genere descripciones detalladas y contextuales para imágenes, mejorando la accesibilidad para usuarios con discapacidad visual y optimizando el SEO del contenido.
Ejemplo de caso de uso:
"Proporciona una descripción textual detallada de una resonancia magnética médica compleja, explicando los hallazgos a un médico o paciente, o generando texto alternativo para imágenes web."
Enriquecimiento de productos de comercio electrónico
Etiquete automáticamente imágenes de productos con atributos, marcas y categorías para mejorar las búsquedas, las recomendaciones y la gestión de inventario.
Ejemplo de caso de uso:
"Analiza la imagen de una prenda de vestir para identificar su estilo, color, material y marca a partir de un logotipo, completando los metadatos del producto para un sistema de catálogo en línea."
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Sparse MoE VLM
Calibrado
No
Mezcla de expertos
Sí
Parámetros totales
27B
Parámetros activados
4.5B
Razonamiento
No
Precisión
FP8
Longitud del contexto
4K
Tokens máximos
4K
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.
DeepSeek
chat
DeepSeek-V3.2
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.42
/ M Tokens
DeepSeek
chat
DeepSeek-V3.2-Exp
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
0.41
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1-Terminus
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3.1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.27
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-V3
Contexto total:
164K
Output máx.:
164K
Input:
$
0.25
/ M Tokens
Output:
$
1.0
/ M Tokens
DeepSeek
chat
DeepSeek-R1
Contexto total:
164K
Output máx.:
164K
Input:
$
0.5
/ M Tokens
Output:
$
2.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-32B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.18
/ M Tokens
Output:
$
0.18
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-14B
Contexto total:
131K
Output máx.:
131K
Input:
$
0.1
/ M Tokens
Output:
$
0.1
/ M Tokens
DeepSeek
chat
DeepSeek-R1-Distill-Qwen-7B
Contexto total:
33K
Output máx.:
16K
Input:
$
0.05
/ M Tokens
Output:
$
0.05
/ M Tokens
