GLM-5.3 ya está disponible en SiliconFlow

Índice de contenidos

TL;DR

GLM-5.3 ya está totalmente disponible en SiliconFlow.

Como último modelo insignia de Z.ai para ingeniería de software compleja y tareas de agentes de largo horizonte, GLM-5.3 se basa en el mismo modelo base que GLM-5.2, al tiempo que ofrece una codificación, uso de herramientas, interacción con el entorno y ejecución de tareas de múltiples pasos más sólidos a través de un post-entrenamiento escalado.

Los desarrolladores ahora pueden usar SiliconFlow para:

  • Acceder al modelo con el ID de modelo zai-org/GLM-5.3

  • Trabajar con una ventana de contexto de hasta 1 M de tokens y una salida máxima de 128 K de tokens, como se especifica en la documentación oficial de GLM-5.3

  • Seleccionar un esfuerzo de razonamiento lowhigh o max a través del despliegue de GLM-5.3 disponible en SiliconFlow

  • Utilizar llamadas a herramientas, transmisión (streaming), argumentos de llamada a herramientas transmitidos, salidas estructuradas y almacenamiento en caché de contexto

  • Acceder a inferencia en línea a 0,26 $ por millón de tokens de entrada almacenados en caché, 1,40 $ por millón de tokens de entrada y 4,40 $ por millón de tokens de salida, según la Biblioteca de Modelos de SiliconFlow actual

  • Integrar GLM-5.3 en aplicaciones existentes y flujos de trabajo de agentes a través de la API compatible con OpenAI de SiliconFlow

Este artículo también presenta SHATTERLINE, un juego de navegador que creamos con GLM-5.3 para demostrar cómo el modelo puede transformar una especificación detallada de producto en una experiencia jugable con un entorno 3D, sistemas de interacción, lógica de colisiones, bucles de recursos y retroalimentación visual.


Desbloqueando más capacidad a través de un post-entrenamiento escalado

Según el lanzamiento oficial de GLM-5.3 de Z.ai, GLM-5.3 utiliza el mismo modelo base que GLM-5.2. Sus mejoras de capacidad son impulsadas por un post-entrenamiento a mayor escala, en una variedad más amplia de tareas y con más cómputo.

En lugar de centrarse únicamente en ejercicios de generación de código aislados, este proceso de entrenamiento coloca al modelo en entornos que se asemejan más al trabajo de ingeniería real. Estos entornos pueden incluir bases de código, clústeres de cómputo, sistemas de almacenamiento, documentación interna y resultados de experimentos.

Dentro de estos entornos, el modelo puede necesitar diagnosticar un cuello de botella, implementar una optimización, ejecutar experimentos, evaluar el resultado y ofrecer una mejora medible mientras preserva la corrección. La documentación oficial de GLM-5.3 describe estos entornos ejecutables y verificables como una parte central del proceso de post-entrenamiento del modelo.

Esto hace que GLM-5.3 sea especialmente relevante para:

  • Ingeniería de software entre archivos y módulos

  • Agentes de codificación que deben planificar y ejecutar durante períodos prolongados

  • Tareas automatizadas que involucran terminales, herramientas y entornos externos

  • Comprensión, depuración, refactorización y optimización de bases de código

  • Desarrollo de aplicaciones complejas que requieren un contexto largo y salidas extensas

El repositorio oficial del modelo GLM-5.3 ya está disponible públicamente, ofreciendo a los desarrolladores opciones de despliegue adicionales. A través de SiliconFlow, los equipos pueden utilizar el modelo mediante una API Serverless lista para usar sin tener que construir y mantener por sí mismos una infraestructura de inferencia a gran escala.


GLM-5.3 de un vistazo

Especificación

Configuración en SiliconFlow

ID de modelo de la API

zai-org/GLM-5.3

Arquitectura

744B MoE

Ventana de contexto

1M tokens

Salida máxima

128K tokens

Modalidad de entrada

Text

Modalidad de salida

Text

Modo de razonamiento

Razonamiento siempre activo

Esfuerzo de razonamiento

lowhighmax

Capacidades del agente

Llamada a herramientas y argumentos de llamada a herramientas transmitidos

Capacidades de la API

Transmisión, almacenamiento en caché de contexto y salidas estructuradas

Integración

API de SiliconFlow compatible con OpenAI

El ID de modelo específico del despliegue, la etiqueta de arquitectura, los precios y la disponibilidad se basan en la Biblioteca de Modelos de SiliconFlow actual. La ventana de contexto, la salida máxima, el comportamiento de razonamiento, la llamada a funciones, la transmisión, el almacenamiento en caché y las capacidades de salida estructurada también se documentan en la guía oficial del modelo GLM-5.3 de Z.ai.


Diseñado para la ingeniería de software del mundo real

GLM-5.3 está diseñado para hacer más que generar fragmentos de código individuales. Su enfoque se centra en completar tareas de largo horizonte que implican comprensión, planificación, uso de herramientas, implementación y verificación.

Mayor rendimiento de codificación y de agentes

Los resultados publicados en la evaluación oficial de GLM-5.3 de Z.ai muestran mejoras sustanciales con respecto a GLM-5.2 en pruebas de rendimiento de ingeniería de software, terminal, uso de herramientas y agentes:

Prueba de rendimiento (Benchmark)

GLM-5.2

GLM-5.3

Terminal-Bench 2.1

81.0

88.2

Terminal-Bench 3.0

4.6

28.3

DeepSWE v1.1

46.2

66.9

NL2Repo

48.9

58.0

Toolathlon Verified

59.9

73.0

AutomationBench v1.0.6

26.2

48.2

Agents’ Last Exam CLI

23.8

28.5

HLE con herramientas

54.7

62.5

En la prueba privada Z.ai Code Bench de Z.ai, GLM-5.3 Max alcanza el 34,5%, en comparación con el 23,4% de GLM-5.2, una mejora de aproximadamente el 50%. La misma evaluación oficial informa que GLM-5.3 Max utilizó aproximadamente 75 K tokens de salida por tarea, en comparación con los aproximadamente 96 K de GLM-5.2.

Estas evaluaciones van más allá de la generación de código. Requieren que el modelo comprenda una tarea, opere herramientas, ejecute pasos en un entorno, inspeccione los resultados y revise su enfoque basándose en la retroalimentación.

Ventana de contexto de 1M de tokens y hasta 128K tokens de salida

La documentación oficial del modelo GLM-5.3 especifica una ventana de contexto de hasta 1M de tokens y una salida máxima de 128K tokens.

La gran ventana de contexto permite al modelo procesar más código, archivos de configuración, documentación, registros e historial de tareas en una sola solicitud. Esto es especialmente útil para:

  • Analizar grandes repositorios de código

  • Comprender dependencias entre múltiples módulos

  • Mantener el contexto de desarrollo a lo largo de conversaciones largas

  • Procesar trayectorias extensas de agentes

  • Generar implementaciones completas de múltiples archivos

  • Ejecutar tareas de ingeniería de software de larga duración

Esfuerzo de razonamiento controlable

GLM-5.3 utiliza un razonamiento siempre activo. El modelo no permite desactivar el razonamiento, pero los desarrolladores pueden seleccionar uno de tres niveles de esfuerzo de razonamiento.

La guía oficial de GLM-5.3 de SiliconFlow confirma que los tres niveles están disponibles:

  • low para tareas rutinarias donde la prioridad es la capacidad de respuesta

  • high para un equilibrio entre la profundidad del razonamiento y la eficiencia

  • max para codificación compleja, diseño de arquitectura y tareas de agentes de largo horizonte

max es la configuración predeterminada y la opción recomendada para cargas de trabajo de codificación complejas. Estos valores predeterminados y admitidos también se documentan en la guía oficial de parámetros de GLM-5.3 de Z.ai.

Esto proporciona a los equipos una forma directa de adaptar los recursos de razonamiento a la complejidad de la tarea. Las transformaciones de código rutinarias y las solicitudes sencillas pueden utilizar una configuración más ligera, mientras que la depuración entre módulos, el diseño de sistemas y los flujos de trabajo de agentes de larga duración pueden utilizar un nivel superior.


Demostración: Creación de un juego de navegador 3D ejecutable con GLM-5.3

Para explorar cómo se comporta GLM-5.3 en una tarea completa de desarrollo de aplicaciones, diseñamos un experimento de creación de juegos: crear un juego de navegador inspirado en la jugabilidad arcade en primera persona de romper cristales.

El resultado es SHATTERLINE.

Un pasillo interminable de cristal. Una sola vía hacia adelante. No te detengas.

De una especificación detallada a un sistema jugable

Proporcionamos a GLM-5.3 una instrucción completa de desarrollo del juego que solicitaba una primera versión totalmente ejecutable. Luego continuamos iterando sobre la sensación de juego, la presentación visual y los detalles de interacción.

La versión final incluye:

  • Un pasillo infinito 3D en primera persona

  • Controles táctiles, de ratón y teclado

  • Un sistema de lanzamiento de canicas y proyectiles

  • Obstáculos de cristal destructibles

  • Detección de colisiones y lógica de fin de partida

  • Cristales brillantes que reponen las canicas del jugador

  • Un bucle de recursos de supervivencia y munición

  • Una pantalla de inicio, instrucciones de juego y retroalimentación de estado

  • Efectos de rotura de cristales, iluminación y atmósfera ambiental

  • Efectos de sonido diseñados en torno al ritmo del juego

Los jugadores deben destruir los obstáculos que se aproximan mientras se mueven continuamente por el pasillo. Los cristales brillantes proporcionan canicas adicionales, mientras que chocar contra un cristal intacto o un obstáculo sólido pone fin a la partida.

¿Qué demuestra esta presentación?

SHATTERLINE es un experimento de producto diseñado para parecerse a un flujo de trabajo real de desarrollo de aplicaciones.

Completar este tipo de tareas requiere que el modelo trabaje en varios sistemas interconectados:

  • Reglas del juego y gestión del estado

  • Escenas 3D y renderizado

  • Lógica de proyectiles, colisión y destrucción

  • Entrada de ratón, teclado y táctil

  • Interfaz de usuario, retroalimentación visual y audio

  • Consistencia del contexto a lo largo de múltiples iteraciones

Esto refleja un desafío común para los agentes de codificación de largo horizonte: la tarea no se limita a una sola función o a un fragmento de código aislado. En su lugar, abarca múltiples sistemas cuyo comportamiento debe mantenerse coordinado.

El experimento demuestra cómo GLM-5.3 puede traducir una especificación de producto en lenguaje natural en un sistema interactivo y continuar refinando la implementación a través de iteraciones de desarrollo posteriores.


Utilice GLM-5.3 en SiliconFlow

GLM-5.3 está completamente desplegado y configurado en SiliconFlow. Los desarrolladores pueden probarlo en el Playground y conectarlo a herramientas, agentes y flujos de trabajo de evaluación existentes a través de la API compatible con OpenAI descrita en la guía oficial de GLM-5.3 de SiliconFlow.

Precios

Al momento de la publicación, la Biblioteca de Modelos de SiliconFlow muestra los siguientes precios de inferencia en línea para zai-org/GLM-5.3:

Tipo de uso

Precio por millón de tokens

Entrada almacenada en caché

0,26 $

Entrada

1,40 $

Salida

4,40 $

El almacenamiento en caché de contexto puede reducir el costo de las entradas repetidas. En el análisis de bases de código y flujos de trabajo de agentes de largo horizonte, las instrucciones del sistema, el contexto del proyecto, la documentación y partes de la base de código pueden reutilizarse en múltiples solicitudes. Los precios de entrada almacenada en caché ayudan a las empresas a ejecutar estas cargas de trabajo persistentes de manera más eficiente.

Ejemplo de API

Primero, cree una clave de API en la consola de SiliconFlow. A continuación, puede llamar a la API de Chat Completions compatible con OpenAI:

import os
import requests

response = requests.post(
    "https://api.siliconflow.com/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {os.environ['SILICONFLOW_API_KEY']}",
        "Content-Type": "application/json",
    },
    json={
        "model": "zai-org/GLM-5.3",
        "messages": [
            {
                "role": "system",
                "content": (
                    "You are a senior software engineer. "
                    "Analyze the task, implement the solution, "
                    "and verify the result."
                ),
            },
            {
                "role": "user",
                "content": (
                    "Design the architecture for a browser-based 3D game. "
                    "Include the gameplay loop, collision system, "
                    "resource management, and project structure."
                ),
            },
        ],
        "reasoning_effort": "max",
        "max_tokens": 4096,
        "stream": False,
    },
    timeout=120,
)

response.raise_for_status()
result = response.json()

print(result["choices"][0]["message"]["content"])
import os
import requests

response = requests.post(
    "https://api.siliconflow.com/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {os.environ['SILICONFLOW_API_KEY']}",
        "Content-Type": "application/json",
    },
    json={
        "model": "zai-org/GLM-5.3",
        "messages": [
            {
                "role": "system",
                "content": (
                    "You are a senior software engineer. "
                    "Analyze the task, implement the solution, "
                    "and verify the result."
                ),
            },
            {
                "role": "user",
                "content": (
                    "Design the architecture for a browser-based 3D game. "
                    "Include the gameplay loop, collision system, "
                    "resource management, and project structure."
                ),
            },
        ],
        "reasoning_effort": "max",
        "max_tokens": 4096,
        "stream": False,
    },
    timeout=120,
)

response.raise_for_status()
result = response.json()

print(result["choices"][0]["message"]["content"])
import os
import requests

response = requests.post(
    "https://api.siliconflow.com/v1/chat/completions",
    headers={
        "Authorization": f"Bearer {os.environ['SILICONFLOW_API_KEY']}",
        "Content-Type": "application/json",
    },
    json={
        "model": "zai-org/GLM-5.3",
        "messages": [
            {
                "role": "system",
                "content": (
                    "You are a senior software engineer. "
                    "Analyze the task, implement the solution, "
                    "and verify the result."
                ),
            },
            {
                "role": "user",
                "content": (
                    "Design the architecture for a browser-based 3D game. "
                    "Include the gameplay loop, collision system, "
                    "resource management, and project structure."
                ),
            },
        ],
        "reasoning_effort": "max",
        "max_tokens": 4096,
        "stream": False,
    },
    timeout=120,
)

response.raise_for_status()
result = response.json()

print(result["choices"][0]["message"]["content"])

La URL base de la API de SiliconFlow es:

https://api.siliconflow.com/v1
https://api.siliconflow.com/v1
https://api.siliconflow.com/v1

El punto de conexión completo, el formato de autenticación, los parámetros de solicitud y la estructura de respuesta están disponibles en la documentación de la API de Chat Completions de SiliconFlow. El esquema de respuesta de SiliconFlow también incluye reasoning_content para las salidas de modelos de razonamiento.

Para tareas rutinarias, establezca reasoning_effort en low o high. Para desarrollo entre archivos, diseño de sistemas, depuración compleja y tareas de agentes de largo horizonte, utilice max.


De las capacidades del modelo a las aplicaciones de producción

GLM-5.3 reúne una amplia ventana de contexto, salida extensa, llamadas a herramientas y esfuerzo de razonamiento controlable, lo que permite al modelo asumir tareas de ingeniería de software más completas.

A través de SiliconFlow, los desarrolladores pueden acceder a:

  • Una API de GLM-5.3 completamente desplegada y configurada

  • Una experiencia de integración compatible con OpenAI

  • Controles flexibles del esfuerzo de razonamiento

  • Llamadas a herramientas, transmisión y salidas estructuradas

  • Precios de entrada almacenada en caché para cargas de trabajo con contexto repetido

  • Una experiencia de API constante desde el prototipado hasta la producción

Ya sea que esté creando un agente de codificación, automatizando flujos de trabajo de desarrollo, analizando grandes bases de código o convirtiendo la especificación de un producto en una aplicación interactiva completa, GLM-5.3 proporciona una base sólida para flujos de trabajo de ingeniería de software más autónomos y de largo horizonte.


¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow