Acerca de GLM-4.6V

GLM-4.6V logra una precisión SOTA (State-of-the-Art) en comprensión visual entre modelos de la misma escala de parámetros. Por primera vez, integra de forma nativa capacidades de Function Call en lo que es la arquitectura del modelo visual, reduciendo la brecha entre la "percepción visual" y la "acción ejecutable". Esto proporciona una base técnica unificada para agentes del tipo Multimodal en escenarios de negocio del mundo real. Además, la ventana de contexto visual se ha ampliado a 128k, lo que permite el procesamiento de flujos de Video largos y el análisis de alta resolución de múltiples Images.

Explore cómo las capacidades avanzadas de comprensión visual y llamada a funciones de GLM-4.6V pueden resolver problemas complejos del mundo real.

Análisis visual de datos científicos

Interprete complejos diagramas, gráficos y transmisiones de Video científicos para extraer información, validar experimentos y generar resúmenes visuales.

Ejemplo de caso de uso:

"Se analizó un Video de microscopía de división celular, identificando anomalías y generando un gráfico de series temporales, acelerando la investigación en dinámica celular."

Generación y edición de código UI/UX

Genere HTML/CSS con precisión de píxel a partir de maquetas de diseño o capturas de Image, y luego perfeccione y edite la interfaz de usuario mediante comandos de lenguaje natural.

Ejemplo de caso de uso:

"Se replicó la interfaz de usuario de un panel de control complejo a partir de una captura de pantalla de Figma en componentes limpios de React, y luego se ajustaron los estilos de los botones mediante comandos de Text, ahorrando horas de desarrollo frontend."

Inteligencia financiera Multimodal

Procese diversos documentos financieros (informes escaneados, gráficos de mercado, resúmenes en Video) para identificar tendencias, evaluar riesgos y ejecutar acciones de recuperación de datos.

Ejemplo de caso de uso:

"Se interpretó el informe anual de una empresa (PDF con gráficos), se contrastó con gráficos de acciones en tiempo real mediante una llamada de función y se resumieron las oportunidades de inversión."

Auditorías del sistema visual mediante agentes

Audite sistemas complejos inspeccionando visualmente interfaces, registros y esquemas, identificando vulnerabilidades y activando acciones automáticas de solución mediante llamadas a funciones.

Ejemplo de caso de uso:

"Se auditó la seguridad de una aplicación web mediante la inspección visual de gráficos de tráfico de red y elementos de la interfaz de usuario, y luego se utilizó una llamada a una función para marcar una vulnerabilidad potencial de XSS en el WAF."

Metadatos

Creado el

Licencia

MIT

Proveedor

Z.ai

HuggingFace

Especificación

Estado

Deprecated

Arquitectura

Multimodal MoE

Calibrado

Mezcla de expertos

Parámetros totales

106B

Parámetros activados

106B

Razonamiento

No

Precisión

FP8

Longitud del contexto

131K

Tokens máximos

131K

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow