Índice de contenidos

TL;DR
GLM-5.3 ya está totalmente disponible en SiliconFlow.
Como último modelo insignia de Z.ai para ingeniería de software compleja y tareas de agentes de largo horizonte, GLM-5.3 se basa en el mismo modelo base que GLM-5.2, al tiempo que ofrece una codificación, uso de herramientas, interacción con el entorno y ejecución de tareas de múltiples pasos más sólidos a través de un post-entrenamiento escalado.
Los desarrolladores ahora pueden usar SiliconFlow para:
Acceder al modelo con el ID de modelo
zai-org/GLM-5.3Trabajar con una ventana de contexto de hasta 1 M de tokens y una salida máxima de 128 K de tokens, como se especifica en la documentación oficial de GLM-5.3
Seleccionar un esfuerzo de razonamiento
low,highomaxa través del despliegue de GLM-5.3 disponible en SiliconFlowUtilizar llamadas a herramientas, transmisión (streaming), argumentos de llamada a herramientas transmitidos, salidas estructuradas y almacenamiento en caché de contexto
Acceder a inferencia en línea a 0,26 $ por millón de tokens de entrada almacenados en caché, 1,40 $ por millón de tokens de entrada y 4,40 $ por millón de tokens de salida, según la Biblioteca de Modelos de SiliconFlow actual
Integrar GLM-5.3 en aplicaciones existentes y flujos de trabajo de agentes a través de la API compatible con OpenAI de SiliconFlow
Este artículo también presenta SHATTERLINE, un juego de navegador que creamos con GLM-5.3 para demostrar cómo el modelo puede transformar una especificación detallada de producto en una experiencia jugable con un entorno 3D, sistemas de interacción, lógica de colisiones, bucles de recursos y retroalimentación visual.
Desbloqueando más capacidad a través de un post-entrenamiento escalado
Según el lanzamiento oficial de GLM-5.3 de Z.ai, GLM-5.3 utiliza el mismo modelo base que GLM-5.2. Sus mejoras de capacidad son impulsadas por un post-entrenamiento a mayor escala, en una variedad más amplia de tareas y con más cómputo.
En lugar de centrarse únicamente en ejercicios de generación de código aislados, este proceso de entrenamiento coloca al modelo en entornos que se asemejan más al trabajo de ingeniería real. Estos entornos pueden incluir bases de código, clústeres de cómputo, sistemas de almacenamiento, documentación interna y resultados de experimentos.
Dentro de estos entornos, el modelo puede necesitar diagnosticar un cuello de botella, implementar una optimización, ejecutar experimentos, evaluar el resultado y ofrecer una mejora medible mientras preserva la corrección. La documentación oficial de GLM-5.3 describe estos entornos ejecutables y verificables como una parte central del proceso de post-entrenamiento del modelo.
Esto hace que GLM-5.3 sea especialmente relevante para:
Ingeniería de software entre archivos y módulos
Agentes de codificación que deben planificar y ejecutar durante períodos prolongados
Tareas automatizadas que involucran terminales, herramientas y entornos externos
Comprensión, depuración, refactorización y optimización de bases de código
Desarrollo de aplicaciones complejas que requieren un contexto largo y salidas extensas
El repositorio oficial del modelo GLM-5.3 ya está disponible públicamente, ofreciendo a los desarrolladores opciones de despliegue adicionales. A través de SiliconFlow, los equipos pueden utilizar el modelo mediante una API Serverless lista para usar sin tener que construir y mantener por sí mismos una infraestructura de inferencia a gran escala.
GLM-5.3 de un vistazo
Especificación | Configuración en SiliconFlow |
ID de modelo de la API |
|
Arquitectura | 744B MoE |
Ventana de contexto | 1M tokens |
Salida máxima | 128K tokens |
Modalidad de entrada | Text |
Modalidad de salida | Text |
Modo de razonamiento | Razonamiento siempre activo |
Esfuerzo de razonamiento |
|
Capacidades del agente | Llamada a herramientas y argumentos de llamada a herramientas transmitidos |
Capacidades de la API | Transmisión, almacenamiento en caché de contexto y salidas estructuradas |
Integración | API de SiliconFlow compatible con OpenAI |
El ID de modelo específico del despliegue, la etiqueta de arquitectura, los precios y la disponibilidad se basan en la Biblioteca de Modelos de SiliconFlow actual. La ventana de contexto, la salida máxima, el comportamiento de razonamiento, la llamada a funciones, la transmisión, el almacenamiento en caché y las capacidades de salida estructurada también se documentan en la guía oficial del modelo GLM-5.3 de Z.ai.
Diseñado para la ingeniería de software del mundo real
GLM-5.3 está diseñado para hacer más que generar fragmentos de código individuales. Su enfoque se centra en completar tareas de largo horizonte que implican comprensión, planificación, uso de herramientas, implementación y verificación.
Mayor rendimiento de codificación y de agentes
Los resultados publicados en la evaluación oficial de GLM-5.3 de Z.ai muestran mejoras sustanciales con respecto a GLM-5.2 en pruebas de rendimiento de ingeniería de software, terminal, uso de herramientas y agentes:
Prueba de rendimiento (Benchmark) | GLM-5.2 | GLM-5.3 |
Terminal-Bench 2.1 | 81.0 | 88.2 |
Terminal-Bench 3.0 | 4.6 | 28.3 |
DeepSWE v1.1 | 46.2 | 66.9 |
NL2Repo | 48.9 | 58.0 |
Toolathlon Verified | 59.9 | 73.0 |
AutomationBench v1.0.6 | 26.2 | 48.2 |
Agents’ Last Exam CLI | 23.8 | 28.5 |
HLE con herramientas | 54.7 | 62.5 |
En la prueba privada Z.ai Code Bench de Z.ai, GLM-5.3 Max alcanza el 34,5%, en comparación con el 23,4% de GLM-5.2, una mejora de aproximadamente el 50%. La misma evaluación oficial informa que GLM-5.3 Max utilizó aproximadamente 75 K tokens de salida por tarea, en comparación con los aproximadamente 96 K de GLM-5.2.
Estas evaluaciones van más allá de la generación de código. Requieren que el modelo comprenda una tarea, opere herramientas, ejecute pasos en un entorno, inspeccione los resultados y revise su enfoque basándose en la retroalimentación.
Ventana de contexto de 1M de tokens y hasta 128K tokens de salida
La documentación oficial del modelo GLM-5.3 especifica una ventana de contexto de hasta 1M de tokens y una salida máxima de 128K tokens.
La gran ventana de contexto permite al modelo procesar más código, archivos de configuración, documentación, registros e historial de tareas en una sola solicitud. Esto es especialmente útil para:
Analizar grandes repositorios de código
Comprender dependencias entre múltiples módulos
Mantener el contexto de desarrollo a lo largo de conversaciones largas
Procesar trayectorias extensas de agentes
Generar implementaciones completas de múltiples archivos
Ejecutar tareas de ingeniería de software de larga duración
Esfuerzo de razonamiento controlable
GLM-5.3 utiliza un razonamiento siempre activo. El modelo no permite desactivar el razonamiento, pero los desarrolladores pueden seleccionar uno de tres niveles de esfuerzo de razonamiento.
La guía oficial de GLM-5.3 de SiliconFlow confirma que los tres niveles están disponibles:
lowpara tareas rutinarias donde la prioridad es la capacidad de respuestahighpara un equilibrio entre la profundidad del razonamiento y la eficienciamaxpara codificación compleja, diseño de arquitectura y tareas de agentes de largo horizonte
max es la configuración predeterminada y la opción recomendada para cargas de trabajo de codificación complejas. Estos valores predeterminados y admitidos también se documentan en la guía oficial de parámetros de GLM-5.3 de Z.ai.
Esto proporciona a los equipos una forma directa de adaptar los recursos de razonamiento a la complejidad de la tarea. Las transformaciones de código rutinarias y las solicitudes sencillas pueden utilizar una configuración más ligera, mientras que la depuración entre módulos, el diseño de sistemas y los flujos de trabajo de agentes de larga duración pueden utilizar un nivel superior.
Demostración: Creación de un juego de navegador 3D ejecutable con GLM-5.3
Para explorar cómo se comporta GLM-5.3 en una tarea completa de desarrollo de aplicaciones, diseñamos un experimento de creación de juegos: crear un juego de navegador inspirado en la jugabilidad arcade en primera persona de romper cristales.
El resultado es SHATTERLINE.
Un pasillo interminable de cristal. Una sola vía hacia adelante. No te detengas.
De una especificación detallada a un sistema jugable
Proporcionamos a GLM-5.3 una instrucción completa de desarrollo del juego que solicitaba una primera versión totalmente ejecutable. Luego continuamos iterando sobre la sensación de juego, la presentación visual y los detalles de interacción.
La versión final incluye:
Un pasillo infinito 3D en primera persona
Controles táctiles, de ratón y teclado
Un sistema de lanzamiento de canicas y proyectiles
Obstáculos de cristal destructibles
Detección de colisiones y lógica de fin de partida
Cristales brillantes que reponen las canicas del jugador
Un bucle de recursos de supervivencia y munición
Una pantalla de inicio, instrucciones de juego y retroalimentación de estado
Efectos de rotura de cristales, iluminación y atmósfera ambiental
Efectos de sonido diseñados en torno al ritmo del juego
Los jugadores deben destruir los obstáculos que se aproximan mientras se mueven continuamente por el pasillo. Los cristales brillantes proporcionan canicas adicionales, mientras que chocar contra un cristal intacto o un obstáculo sólido pone fin a la partida.
¿Qué demuestra esta presentación?
SHATTERLINE es un experimento de producto diseñado para parecerse a un flujo de trabajo real de desarrollo de aplicaciones.
Completar este tipo de tareas requiere que el modelo trabaje en varios sistemas interconectados:
Reglas del juego y gestión del estado
Escenas 3D y renderizado
Lógica de proyectiles, colisión y destrucción
Entrada de ratón, teclado y táctil
Interfaz de usuario, retroalimentación visual y audio
Consistencia del contexto a lo largo de múltiples iteraciones
Esto refleja un desafío común para los agentes de codificación de largo horizonte: la tarea no se limita a una sola función o a un fragmento de código aislado. En su lugar, abarca múltiples sistemas cuyo comportamiento debe mantenerse coordinado.
El experimento demuestra cómo GLM-5.3 puede traducir una especificación de producto en lenguaje natural en un sistema interactivo y continuar refinando la implementación a través de iteraciones de desarrollo posteriores.
Utilice GLM-5.3 en SiliconFlow
GLM-5.3 está completamente desplegado y configurado en SiliconFlow. Los desarrolladores pueden probarlo en el Playground y conectarlo a herramientas, agentes y flujos de trabajo de evaluación existentes a través de la API compatible con OpenAI descrita en la guía oficial de GLM-5.3 de SiliconFlow.
Precios
Al momento de la publicación, la Biblioteca de Modelos de SiliconFlow muestra los siguientes precios de inferencia en línea para zai-org/GLM-5.3:
Tipo de uso | Precio por millón de tokens |
Entrada almacenada en caché | 0,26 $ |
Entrada | 1,40 $ |
Salida | 4,40 $ |
El almacenamiento en caché de contexto puede reducir el costo de las entradas repetidas. En el análisis de bases de código y flujos de trabajo de agentes de largo horizonte, las instrucciones del sistema, el contexto del proyecto, la documentación y partes de la base de código pueden reutilizarse en múltiples solicitudes. Los precios de entrada almacenada en caché ayudan a las empresas a ejecutar estas cargas de trabajo persistentes de manera más eficiente.
Ejemplo de API
Primero, cree una clave de API en la consola de SiliconFlow. A continuación, puede llamar a la API de Chat Completions compatible con OpenAI:
La URL base de la API de SiliconFlow es:
El punto de conexión completo, el formato de autenticación, los parámetros de solicitud y la estructura de respuesta están disponibles en la documentación de la API de Chat Completions de SiliconFlow. El esquema de respuesta de SiliconFlow también incluye reasoning_content para las salidas de modelos de razonamiento.
Para tareas rutinarias, establezca reasoning_effort en low o high. Para desarrollo entre archivos, diseño de sistemas, depuración compleja y tareas de agentes de largo horizonte, utilice max.
De las capacidades del modelo a las aplicaciones de producción
GLM-5.3 reúne una amplia ventana de contexto, salida extensa, llamadas a herramientas y esfuerzo de razonamiento controlable, lo que permite al modelo asumir tareas de ingeniería de software más completas.
A través de SiliconFlow, los desarrolladores pueden acceder a:
Una API de GLM-5.3 completamente desplegada y configurada
Una experiencia de integración compatible con OpenAI
Controles flexibles del esfuerzo de razonamiento
Llamadas a herramientas, transmisión y salidas estructuradas
Precios de entrada almacenada en caché para cargas de trabajo con contexto repetido
Una experiencia de API constante desde el prototipado hasta la producción
Ya sea que esté creando un agente de codificación, automatizando flujos de trabajo de desarrollo, analizando grandes bases de código o convirtiendo la especificación de un producto en una aplicación interactiva completa, GLM-5.3 proporciona una base sólida para flujos de trabajo de ingeniería de software más autónomos y de largo horizonte.
