GLM-4.6V
Acerca de GLM-4.6V
GLM-4.6V logra una precisión SOTA (State-of-the-Art) en comprensión visual entre modelos de la misma escala de parámetros. Por primera vez, integra de forma nativa capacidades de Function Call en lo que es la arquitectura del modelo visual, reduciendo la brecha entre la "percepción visual" y la "acción ejecutable". Esto proporciona una base técnica unificada para agentes del tipo Multimodal en escenarios de negocio del mundo real. Además, la ventana de contexto visual se ha ampliado a 128k, lo que permite el procesamiento de flujos de Video largos y el análisis de alta resolución de múltiples Images.
Explore cómo las capacidades avanzadas de comprensión visual y llamada a funciones de GLM-4.6V pueden resolver problemas complejos del mundo real.
Análisis visual de datos científicos
Interprete complejos diagramas, gráficos y transmisiones de Video científicos para extraer información, validar experimentos y generar resúmenes visuales.
Ejemplo de caso de uso:
"Se analizó un Video de microscopía de división celular, identificando anomalías y generando un gráfico de series temporales, acelerando la investigación en dinámica celular."
Generación y edición de código UI/UX
Genere HTML/CSS con precisión de píxel a partir de maquetas de diseño o capturas de Image, y luego perfeccione y edite la interfaz de usuario mediante comandos de lenguaje natural.
Ejemplo de caso de uso:
"Se replicó la interfaz de usuario de un panel de control complejo a partir de una captura de pantalla de Figma en componentes limpios de React, y luego se ajustaron los estilos de los botones mediante comandos de Text, ahorrando horas de desarrollo frontend."
Inteligencia financiera Multimodal
Procese diversos documentos financieros (informes escaneados, gráficos de mercado, resúmenes en Video) para identificar tendencias, evaluar riesgos y ejecutar acciones de recuperación de datos.
Ejemplo de caso de uso:
"Se interpretó el informe anual de una empresa (PDF con gráficos), se contrastó con gráficos de acciones en tiempo real mediante una llamada de función y se resumieron las oportunidades de inversión."
Auditorías del sistema visual mediante agentes
Audite sistemas complejos inspeccionando visualmente interfaces, registros y esquemas, identificando vulnerabilidades y activando acciones automáticas de solución mediante llamadas a funciones.
Ejemplo de caso de uso:
"Se auditó la seguridad de una aplicación web mediante la inspección visual de gráficos de tráfico de red y elementos de la interfaz de usuario, y luego se utilizó una llamada a una función para marcar una vulnerabilidad potencial de XSS en el WAF."
Metadatos
Especificación
Estado
Deprecated
Arquitectura
Multimodal MoE
Calibrado
Sí
Mezcla de expertos
Sí
Parámetros totales
106B
Parámetros activados
106B
Razonamiento
No
Precisión
FP8
Longitud del contexto
131K
Tokens máximos
131K
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.

Z.ai
GLM-4.7
Contexto total:
205K
Output máx.:
205K
Input:
$
0.42
/ M Tokens
Output:
$
2.2
/ M Tokens

Z.ai
chat
GLM-4.6V
Contexto total:
131K
Output máx.:
131K
Input:
$
0.3
/ M Tokens
Output:
$
0.9
/ M Tokens

Z.ai
chat
GLM-4.6
Contexto total:
205K
Output máx.:
205K
Input:
$
0.39
/ M Tokens
Output:
$
1.9
/ M Tokens

Z.ai
chat
GLM-4.5-Air
Contexto total:
131K
Output máx.:
131K
Input:
$
0.14
/ M Tokens
Output:
$
0.86
/ M Tokens

Z.ai
chat
GLM-4.5V
Contexto total:
66K
Output máx.:
66K
Input:
$
0.14
/ M Tokens
Output:
$
0.86
/ M Tokens

Z.ai
chat
GLM-4.1V-9B-Thinking
Contexto total:
66K
Output máx.:
66K
Input:
$
0.035
/ M Tokens
Output:
$
0.14
/ M Tokens

Z.ai
chat
GLM-Z1-32B-0414
Contexto total:
131K
Output máx.:
131K
Input:
$
0.14
/ M Tokens
Output:
$
0.57
/ M Tokens

Z.ai
chat
GLM-4-32B-0414
Contexto total:
33K
Output máx.:
33K
Input:
$
0.27
/ M Tokens
Output:
$
0.27
/ M Tokens

Z.ai
chat
GLM-Z1-9B-0414
Contexto total:
131K
Output máx.:
131K
Input:
$
0.086
/ M Tokens
Output:
$
0.086
/ M Tokens
