Qwen3-VL-235B-A22B-Instruct
Acerca de Qwen3-VL-235B-A22B-Instruct
Qwen3-VL-235B-A22B-Instruct es un modelo de lenguaje y visión (MoE) de mezcla de expertos de 235B de parámetros, con 22B de parámetros activados. Es una versión ajustada por instrucciones de Qwen3-VL-235B-A22B y está optimizada para aplicaciones de Chat.
Explore cómo las capacidades avanzadas de visión-lenguaje y el razonamiento Multimodal de Qwen3-VL-235B-A22B-Instruct pueden resolver problemas complejos del mundo real.
Automatización de IU con IA
Automatice tareas complejas de interfaz de usuario en aplicaciones web y móviles mediante la comprensión visual de las interfaces y la ejecución de acciones.
Ejemplo de caso de uso:
"Navega automáticamente por un nuevo sitio web de comercio electrónico, añade artículos al carrito y completa el proceso de pago interpretando indicaciones visuales e interactuando con elementos de la interfaz de usuario, sin necesidad de llamadas explícitas a la API."
Generación de código visual
Transforme diseños visuales (bocetos, maquetas o demostraciones en Video) directamente en componentes web funcionales o diagramas.
Ejemplo de caso de uso:
"Convierte un boceto hecho a mano de una página web en código HTML/CSS/JS adaptativo, incluyendo elementos interactivos, acelerando significativamente los flujos de trabajo de desarrollo front-end."
Análisis de Video avanzado
Analice metrajes de Video de larga duración para detectar eventos, objetos o acciones específicos, generando resúmenes detallados e información valiosa con indexación a nivel de segundo.
Ejemplo de caso de uso:
"Procesa una grabación de cámara de seguridad de 8 horas, identificando todos los casos de acceso no autorizado, rastreando a personas específicas y generando un informe con marca de tiempo y pruebas visuales."
IA de documentos Multimodal
Extraiga, analice y razone sobre la información de documentos complejos y visualmente ricos, incluyendo diagramas de ingeniería, informes e Image(s) escaneadas.
Ejemplo de caso de uso:
"Analiza un plano de ingeniería de varias páginas, extrayendo listas de componentes, identificando relaciones espaciales entre las piezas y señalando posibles incoherencias de diseño basándose en datos visuales y de Text."
Razonamiento espacial para robótica
Permita que los sistemas de IA comprendan e interactúen con entornos físicos percibiendo con precisión las posiciones, orientaciones y relaciones espaciales de los objetos.
Ejemplo de caso de uso:
"Guía a un brazo robótico para recoger y colocar con precisión objetos de formas irregulares de un contenedor desordenado, adaptándose en tiempo real a diferentes puntos de vista y oclusiones parciales."
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Mixture of Experts
Calibrado
Sí
Mezcla de expertos
Sí
Parámetros totales
235B
Parámetros activados
22B
Razonamiento
No
Precisión
FP8
Longitud del contexto
262K
Tokens máximos
262K
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.

Qwen
chat
Qwen3-VL-32B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Output:
$
0.6
/ M Tokens

Qwen
chat
Qwen3-VL-32B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.2
/ M Tokens
Output:
$
1.5
/ M Tokens

Qwen
chat
Qwen3-VL-8B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.18
/ M Tokens
Output:
$
0.68
/ M Tokens

Qwen
chat
Qwen3-VL-8B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.18
/ M Tokens
Output:
$
2.0
/ M Tokens

Qwen
chat
Qwen3-VL-235B-A22B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.3
/ M Tokens
Output:
$
1.5
/ M Tokens

Qwen
chat
Qwen3-VL-235B-A22B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.45
/ M Tokens
Output:
$
3.5
/ M Tokens

Qwen
chat
Qwen3-VL-30B-A3B-Instruct
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Output:
$
1.0
/ M Tokens

Qwen
chat
Qwen3-VL-30B-A3B-Thinking
Contexto total:
262K
Output máx.:
262K
Input:
$
0.29
/ M Tokens
Output:
$
1.0
/ M Tokens

Qwen
image-to-video
Wan2.2-I2V-A14B
$
0.29
/ Video
