Qwen2.5-VL-32B-Instruct
Acerca de Qwen2.5-VL-32B-Instruct
Qwen2.5-VL-32B-Instruct es un modelo de lenguaje grande Multimodal lanzado por el equipo de Qwen, parte de la serie Qwen2.5-VL. Este modelo no solo es competente en el reconocimiento de objetos comunes, sino que es altamente capaz de analizar Textos, gráficos, iconos, esquemas y diseños dentro de las Images. Actúa como un agente visual que puede razonar y dirigir herramientas de forma dinámica, capaz de usar ordenadores y teléfonos. Además, el modelo puede localizar con precisión objetos en Images y generar Outputs estructurados para datos como facturas y tablas. En comparación con su predecesor Qwen2-VL, esta versión cuenta con capacidades matemáticas y de resolución de problemas mejoradas mediante el aprendizaje por refuerzo, con estilos de respuesta ajustados para alinearse mejor con las preferencias humanas.
Explore cómo la inteligencia multimodal y las capacidades agénticas de Qwen2.5-VL-32B-Instruct resuelven desafíos visuales y analíticos complejos.
Extracción de datos de documentos
Automatice la extracción de datos de facturas, formularios e informes, estructurando la información para un procesamiento eficiente.
Ejemplo de caso de uso:
"Extracción de proveedor, artículos e importes totales de miles de facturas escaneadas, completando una base de datos y reduciendo el tiempo de entrada manual en un 80%."
Automatización visual de la interfaz de usuario
Automatice interacciones complejas en aplicaciones web o móviles mediante la comprensión visual de los diseños y la dirección de acciones.
Ejemplo de caso de uso:
"Un agente de IA navegó por un sitio de comercio electrónico, añadió artículos y completó el proceso de pago, adaptándose a los cambios de la interfaz de usuario para una automatización sólida."
Detección de eventos en vídeo
Analice secuencias de vídeo largas para detectar eventos, objetos o actividades específicos con marcas de tiempo y resúmenes precisos.
Ejemplo de caso de uso:
"Monitoreo de imágenes de seguridad, localizando instancias de acceso no autorizado y generando alertas con videoclips relevantes."
Aprendizaje interactivo de STEM
Proporcione soluciones paso a paso para problemas en libros de texto, diagramas o notas manuscritas, mejorando la educación STEM.
Ejemplo de caso de uso:
"Resolución de un problema de física desafiante mediante el análisis de un diagrama y ecuaciones, proporcionando una derivación detallada paso a paso."
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Multimodal Transformer
Calibrado
Sí
Mezcla de expertos
No
Parámetros totales
32B
Parámetros activados
32B
Razonamiento
No
Precisión
FP8
Longitud del contexto
131K
Tokens máximos
131K
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.

Qwen
chat
Qwen3-VL-32B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Output:
$
0.6
/ M Tokens

Qwen
chat
Qwen3-VL-32B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Output:
$
1.5
/ M Tokens

Qwen
chat
Qwen3-VL-8B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.18
/ M Tokens
Output:
$
0.68
/ M Tokens

Qwen
chat
Qwen3-VL-8B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.18
/ M Tokens
Output:
$
2.0
/ M Tokens

Qwen
chat
Qwen3-VL-235B-A22B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.3
/ M Tokens
Output:
$
1.5
/ M Tokens

Qwen
chat
Qwen3-VL-235B-A22B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.45
/ M Tokens
Output:
$
3.5
/ M Tokens

Qwen
chat
Qwen3-VL-30B-A3B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Output:
$
1.0
/ M Tokens

Qwen
chat
Qwen3-VL-30B-A3B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Output:
$
1.0
/ M Tokens

Qwen
image-to-video
Wan2.2-I2V-A14B
$
0.29
/ Video
