Qwen2.5-VL-72B-Instruct

Qwen2.5-VL-72B-Instruct

Acerca de Qwen2.5-VL-72B-Instruct

Qwen2.5-VL es un modelo de lenguage-vision de la serie Qwen2.5 que muestra mejoras significativas en varios aspectos: tiene fuertes capacidades de comprensión visual, reconociendo objetos comunes mientras analiza texts, gráficos y diseños en images; funciona como un agente visual capaz de razonar y dirigir herramientas dinámicamente; puede comprender videos de más de 1 hora de duración y capturar eventos clave; localiza con precisión objetos en images generando cajas delimitadoras o puntos; y admite outputs estructurados para datos escaneados como facturas y formularios. El modelo demuestra un rendimiento excelente en varios puntos de referencia, incluidas tareas de image, video y agente y, agent,, y o video, video y de agente y de agente

Explore cómo las capacidades avanzadas de vision-lenguaje de Qwen2.5-VL-72B-Instruct resuelven problemas complejos del mundo real.

Extracción inteligente de datos de documentos

Automatice la extracción de datos de diversos documentos visuales como facturas, formularios y gráficos, convirtiendo datos visuales no estructurados en información estructurada y utilizable.

Ejemplo de caso de uso:

"Se procesaron miles de formularios de admisión médica escaneados, extrayendo con precisión los datos demográficos y el historial médico de los pacientes, lo que redujo la introducción manual de datos en un 80%."

Análisis de contenido de Video de larga duración

Comprenda y analice contenido de video extendido (de más de 1 hora), identificando eventos clave, objetos y acciones, y localizando segmentos relevantes para una revisión rápida.

Ejemplo de caso de uso:

"Se supervisaron 8 horas de grabación de una línea de fabricación, detectando automáticamente anomalías como productos mal alineados o infracciones de seguridad con marcas de tiempo precisas para su revisión."

Automatización visual de la interfaz de usuario

Actúe como un agente visual para interactuar con interfaces digitales (web, móvil), realizando tareas complejas y automatizando flujos de trabajo basados en señales visuales.

Ejemplo de caso de uso:

"Se automatizaron las tareas de atención al cliente en un portal web navegando visualmente por la interfaz de usuario para procesar devoluciones y actualizar los estados de los pedidos, eliminando las llamadas manuales a la API."

Localización de objetos en tiempo real

Detecte y localice con precisión objetos dentro de imágenes y transmisiones de video, generando cuadros delimitadores o puntos para un seguimiento preciso y la gestión de inventarios.

Ejemplo de caso de uso:

"Se implementó un sistema de almacén minorista para supervisar el stock de las estanterías, identificando los artículos con poco stock y su ubicación exacta, mejorando la precisión del inventario."

Metadatos

Creado el

Licencia

-

Proveedor

Qwen

Especificación

Estado

Deprecated

Arquitectura

Vision-Language Transformer

Calibrado

No

Mezcla de expertos

No

Parámetros totales

72B

Parámetros activados

72B

Razonamiento

No

Precisión

FP8

Longitud del contexto

131K

Tokens máximos

4K

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow