Qwen2.5-VL-72B-Instruct
Acerca de Qwen2.5-VL-72B-Instruct
Qwen2.5-VL es un modelo de lenguage-vision de la serie Qwen2.5 que muestra mejoras significativas en varios aspectos: tiene fuertes capacidades de comprensión visual, reconociendo objetos comunes mientras analiza texts, gráficos y diseños en images; funciona como un agente visual capaz de razonar y dirigir herramientas dinámicamente; puede comprender videos de más de 1 hora de duración y capturar eventos clave; localiza con precisión objetos en images generando cajas delimitadoras o puntos; y admite outputs estructurados para datos escaneados como facturas y formularios. El modelo demuestra un rendimiento excelente en varios puntos de referencia, incluidas tareas de image, video y agente y, agent,, y o video, video y de agente y de agente
Explore cómo las capacidades avanzadas de vision-lenguaje de Qwen2.5-VL-72B-Instruct resuelven problemas complejos del mundo real.
Extracción inteligente de datos de documentos
Automatice la extracción de datos de diversos documentos visuales como facturas, formularios y gráficos, convirtiendo datos visuales no estructurados en información estructurada y utilizable.
Ejemplo de caso de uso:
"Se procesaron miles de formularios de admisión médica escaneados, extrayendo con precisión los datos demográficos y el historial médico de los pacientes, lo que redujo la introducción manual de datos en un 80%."
Análisis de contenido de Video de larga duración
Comprenda y analice contenido de video extendido (de más de 1 hora), identificando eventos clave, objetos y acciones, y localizando segmentos relevantes para una revisión rápida.
Ejemplo de caso de uso:
"Se supervisaron 8 horas de grabación de una línea de fabricación, detectando automáticamente anomalías como productos mal alineados o infracciones de seguridad con marcas de tiempo precisas para su revisión."
Automatización visual de la interfaz de usuario
Actúe como un agente visual para interactuar con interfaces digitales (web, móvil), realizando tareas complejas y automatizando flujos de trabajo basados en señales visuales.
Ejemplo de caso de uso:
"Se automatizaron las tareas de atención al cliente en un portal web navegando visualmente por la interfaz de usuario para procesar devoluciones y actualizar los estados de los pedidos, eliminando las llamadas manuales a la API."
Localización de objetos en tiempo real
Detecte y localice con precisión objetos dentro de imágenes y transmisiones de video, generando cuadros delimitadores o puntos para un seguimiento preciso y la gestión de inventarios.
Ejemplo de caso de uso:
"Se implementó un sistema de almacén minorista para supervisar el stock de las estanterías, identificando los artículos con poco stock y su ubicación exacta, mejorando la precisión del inventario."
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Vision-Language Transformer
Calibrado
No
Mezcla de expertos
No
Parámetros totales
72B
Parámetros activados
72B
Razonamiento
No
Precisión
FP8
Longitud del contexto
131K
Tokens máximos
4K
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.

Qwen
chat
Qwen3-VL-32B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Output:
$
0.6
/ M Tokens

Qwen
chat
Qwen3-VL-32B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Output:
$
1.5
/ M Tokens

Qwen
chat
Qwen3-VL-8B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.18
/ M Tokens
Output:
$
0.68
/ M Tokens

Qwen
chat
Qwen3-VL-8B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.18
/ M Tokens
Output:
$
2.0
/ M Tokens

Qwen
chat
Qwen3-VL-235B-A22B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.3
/ M Tokens
Output:
$
1.5
/ M Tokens

Qwen
chat
Qwen3-VL-235B-A22B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.45
/ M Tokens
Output:
$
3.5
/ M Tokens

Qwen
chat
Qwen3-VL-30B-A3B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Output:
$
1.0
/ M Tokens

Qwen
chat
Qwen3-VL-30B-A3B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Output:
$
1.0
/ M Tokens

Qwen
image-to-video
Wan2.2-I2V-A14B
$
0.29
/ Video
