Secciones de la base de conocimientos ▾

Tecnología

GLM-5.3 Flash: modelo de razonamiento Z.ai en la red Gonka

En septiembre de 2026, apareció en la red Gonka un nuevo modelo operativo: GLM-5.3 Flash del laboratorio chino Z.ai. La propuesta de gobernanza #101 para su integración fue aprobada, los hosts cargaron los pesos y el modelo quedó disponible a través de nuestra pasarela junto a MiniMax M2.7 y DeepSeek V4 Flash. Simultáneamente, Kimi K2.6 salió de la red, y el modelo insignia GLM-5.2, que estuvo mucho tiempo en el registro a la espera de implementación, nunca llegó a entrar en funcionamiento: la red eligió un modelo más ligero de la misma línea.

GLM-5.3 Flash se diferencia de sus vecinos en la red por una propiedad fundamental: es un modelo de razonamiento. Antes de responder, razona, y este razonamiento consume tokens, tiempo y requiere ajustes correctos en la solicitud. Quien establezca max_tokens: 200 para una «respuesta corta», obtendrá una respuesta vacía. Analizaremos qué es este modelo, cuáles son sus características específicamente en la red Gonka, cómo funciona el presupuesto de razonamiento, cuál es la situación con las herramientas y JSON, cuánto cuesta y cuándo elegirlo en lugar de los otros dos modelos de la red.

Qué es GLM-5.3 Flash y quién está detrás

Z.ai es una marca internacional del laboratorio Zhipu AI de Pekín, surgido de la Universidad de Tsinghua. La familia GLM ha evolucionado desde 2023 (ChatGLM), y desde el lanzamiento de GLM-4.5 en el verano de 2025, la compañía publica los pesos de sus modelos insignia bajo licencia MIT, lo que ha convertido a esta serie en una de las más destacadas en el mundo de los pesos abiertos. Los productos propios de Z.ai, el entorno de desarrollo ZCode y la suscripción GLM Coding Plan, están construidos en torno a estos mismos modelos.

GLM-5.3 Flash es un modelo ligero de la línea 5.3. «Ligero» aquí es relativo: se trata de un modelo MoE de 320 mil millones de parámetros, de los cuales se activan unos 18 mil millones por token. Los pesos se distribuyen en formato FP8 con licencia MIT. Una característica arquitectónica es la atención híbrida: una parte de las capas utiliza atención dispersa (sparse) y otra atención lineal, lo que reduce considerablemente el coste de memoria y tiempo en contextos largos en comparación con la atención completa clásica.

La segunda propiedad que define el comportamiento del modelo es el razonamiento integrado. GLM-5.3 Flash ha sido entrenado para pensar antes de responder: el proceso de razonamiento se separa de la respuesta y se entrega al cliente en un campo independiente. El razonamiento se activa y desactiva mediante el parámetro reasoning_effort, y está completo por defecto. Esto hace que el modelo sea potente en tareas que requieren descifrar una lógica compleja, aunque también exige ajustes precisos en la solicitud, como veremos a continuación.

La diferencia entre «Flash» y el modelo superior GLM-5.3 es evidente en los precios del proveedor: en OpenRouter, en el momento de la publicación, Flash cuesta 0,09 $ por millón de tokens de entrada y 0,30 $ por millón de salida, mientras que el modelo superior cuesta 1,40 $ y 4,40 $. En la red Gonka esta escala no existe: todos los modelos de la red se ofrecen bajo una tarifa única.

Características de GLM-5.3 Flash en la red Gonka

Como ocurre con otros modelos de la red, es importante distinguir entre las características del modelo «listo para usar» y los parámetros operativos de un despliegue específico: estos son definidos por la configuración de inferencia vLLM en los nodos GPU de la red. Valores reales a través de nuestro Gateway:

  • Ventana de contexto: 390 000 tokens. Este es el mínimo demostrado por solicitudes, no un número de la tarjeta del modelo: se aceptó y procesó una entrada de 390 013 tokens, y ejecutamos un prefill grande directamente hacia los nodos de la red. La configuración técnica de los nodos permite 400 000, pero publicamos lo que ha sido verificado.
  • Salida máxima: 8 192 tokens por respuesta. Importante: este límite incluye tanto los tokens de razonamiento como la respuesta en sí. Un modelo que pensó 3000 tokens con un límite de 4096, dejará alrededor de mil para la respuesta.
  • Reasoning y tool calling: el modelo está desplegado con un parser de razonamiento y un parser de invocación de herramientas; el razonamiento llega en el campo reasoning_content, y las invocaciones de herramientas en el campo estándar tool_calls, como en cualquier modelo compatible con OpenAI.
  • Velocidad: en nuestras mediciones a través del gateway, el primer token llega aproximadamente en 0,75 segundos, y la generación ocurre a una velocidad de 25–44 tokens por segundo dependiendo de la carga. Para un modelo de reasoning esto es rápido, pero recuerde que los primeros cientos de tokens se dedicarán al razonamiento y la respuesta visible comenzará más tarde.
  • Requisito de VRAM del host: alrededor de 560 GB por réplica según los parámetros on-chain del modelo; más que el MiniMax M2.7 (320 GB) y DeepSeek V4 Flash (280 GB). Cuanto mayor sea el umbral de hardware, menos nodos son capaces de desplegar el modelo, y esto afecta directamente su capacidad en la red; sobre esto en la sección de escenarios y limitaciones.

El precio de la inferencia en la red Gonka no depende de la elección del modelo: GLM-5.3 Flash está disponible a la misma tarifa que MiniMax M2.7 y DeepSeek V4 Flash; a través de JoinGonka Gateway esto es $0.0069 por millón de tokens de entrada y $0.021 por millón de tokens de salida. Los tokens de razonamiento se facturan como tokens de salida. La economía de la red es un tema aparte: el precio se determina mediante el cálculo del trabajo computacional, no por el precio del proveedor.

Razonamiento y presupuesto de tokens: cómo evitar una respuesta vacía

El error más frecuente al familiarizarse con GLM-5.3 Flash es el siguiente: el desarrollador envía una pregunta corta con el parámetro habitual max_tokens: 256, recibe finish_reason: "length" y un campo content vacío. Nada está roto: el modelo consumió todo el límite en el razonamiento y no llegó a la respuesta. Según nuestras mediciones, incluso para una pregunta trivial, el razonamiento ocupa entre 250 y 450 tokens, y miles en tareas complejas.

Tres reglas prácticas:

AjusteRecomendaciónPor qué
max_tokensNo menos de 600 incluso para respuestas cortas; para tareas reales, a partir de 2000El límite es compartido entre razonamiento y respuesta; el razonamiento consume los primeros cientos de tokens
streamtrue siempre que sea posibleEl razonamiento y la respuesta llegan a medida que se generan: se ve el progreso, se evita esperar una «pantalla vacía» y las respuestas largas no alcanzan los tiempos de espera del proxy
reasoning_effortlow cuando no se necesita razonar; no indicar nada cuando síEl interruptor es binario: low desactiva el razonamiento, cualquier otro valor lo deja completo. La pasarela traduce none y minimal a low, mientras que medium, high, xhigh y max se eliminan por ser redundantes. Los campos enable_thinking, chat_template_kwargs, reasoning.enabled y thinking.type son ignorados por la red

Ejemplo de solicitud para una tarea corta con razonamiento limitado y límite suficiente:

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-tu-clave" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "reasoning_effort": "low",
    "max_tokens": 800,
    "messages": [{"role": "user", "content": "Nombra la capital de Australia con una sola palabra"}]
  }'

En la respuesta, el razonamiento reside en message.reasoning_content y la respuesta en message.content; en el stream llegan como deltas independientes. La mayoría de los clientes compatibles con OpenAI ignoran silenciosamente el campo desconocido, por lo que el razonamiento no se «filtra» en el texto de la respuesta, pero sí cuenta dentro de completion_tokens y se cobra como tokens de salida. Si no se necesita razonamiento en absoluto, GLM-5.3 Flash no es la mejor opción: para réplicas cortas y rápidas, MiniMax M2.7 es más económico.

Advertencia importante para escenarios de agentes: herramientas como Cline o Cursor suelen establecer un límite de salida bajo para solicitudes de servicio (compresión de contexto, generación de títulos de diálogo). Si una solicitud así se envía a GLM-5.3 Flash con un límite de un par de cientos de tokens, volverá vacía. Compruebe la configuración de límite en la herramienta o envíe las solicitudes de servicio a otro modelo de la red.

Herramientas, JSON y comparación con otros modelos de la red

Los modelos de razonamiento a veces no se llevan bien con los frameworks de agentes: el razonamiento se interpone entre las llamadas a las herramientas y rompe el formato. Con GLM-5.3 Flash, ejecutamos un ciclo de agente completo —descripción de herramientas, llamada, retorno de resultado, segunda ronda de llamada— y, a través de la ruta compatible con OpenAI, funciona normalmente: las llamadas llegan estructuradas en tool_calls, los argumentos son válidos y la segunda ronda no confunde el historial. El modo JSON (response_format: {"type": "json_object"}) también funciona: el modelo entrega un objeto válido y el razonamiento permanece fuera de la respuesta. Para los agentes se aplica la misma regla de presupuesto: un límite de salida con margen, de lo contrario, la llamada a la herramienta podría interrumpirse a mitad.

Cómo se compara GLM-5.3 Flash con los otros dos modelos de la red:

ParámetroGLM-5.3 FlashMiniMax M2.7DeepSeek V4 Flash
Contexto en la red390 000200 000380 000
Salida por respuesta8 1928 19232 768
ArquitecturaMoE 320B (~18B activos), atención híbridaMoE + atención linealMoE 284B (~13B activos)
VRAM por réplica560 GB320 GB280 GB
Punto fuerteLógica compleja, análisis de código, tareas de "pensamiento"; el contexto más largo de la redTareas cotidianas, respuestas cortas rápidas, modelo por defectoSegundo contexto más largo de la red, la salida más larga, codificación de agentes
Precio vía Gatewayigual — $0.0069 entrada / $0.021 salida por 1M

La consecuencia práctica del precio único es la misma que antes: el modelo se elige según la tarea, no según el presupuesto. ¿Necesitas pensar en una lógica compleja? GLM-5.3 Flash; ¿necesitas leer un repositorio completo? DeepSeek V4 Flash; ¿necesitas una respuesta rápida y uniforme? MiniMax M2.7.

Cómo usar GLM-5.3 Flash a través de JoinGonka Gateway

El modelo está disponible a través de JoinGonka Gateway mediante una API compatible con OpenAI y Anthropic. Identificador del modelo: zai-org/GLM-5.3-Flash. Una clave del tipo jg-… se genera en el panel de control inmediatamente después del registro; a las cuentas nuevas se les acreditan 3M tokens gratuitos, suficientes para ejecutar el modelo en sus propias tareas y ajustar el presupuesto de razonamiento.

Llamada directa a la API (formato OpenAI, streaming activado — modo recomendado para el modelo de reasoning):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-tu-clave" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "stream": true,
    "max_tokens": 4000,
    "messages": [{"role": "user", "content": "Encuentra el error en esta función y explícalo: …"}]
  }'

En herramientas de desarrollo, el modelo se conecta igual que el resto de los modelos de la red: base URL https://gate.joingonka.ai/v1, clave jg-… e identificador del modelo. Las guías para Cursor, Claude Code, Cline, Continue y otras herramientas están recopiladas en la sección «Herramientas»; el instalador npx @joingonka/setup configurará la gateway en el archivo de configuración de la herramienta con un solo comando. Para clientes que utilizan la Anthropic Messages API, basta con definir ANTHROPIC_BASE_URL=https://gate.joingonka.ai.

Puede probarlo sin registro en el chat gratuito: seleccione GLM-5.3 Flash en la lista de modelos; el razonamiento se muestra en un bloque desplegable separado, por lo que se puede ver claramente cuánto «piensa» el modelo antes de responder.

Cuándo elegir GLM-5.3 Flash: escenarios y qué tener en cuenta

Escenarios sólidos para este modelo:

  • Tareas donde se necesita pensar. Análisis de lógica de negocio compleja, búsqueda de errores no evidentes, diseño de esquemas de datos, matemáticas y deducciones de múltiples pasos: es para lo que existen los modelos de razonamiento. Aquí, el razonamiento se compensa con la calidad de la respuesta.
  • Revisión y explicación de código. El modelo analiza código ajeno y argumenta las observaciones, y el hilo de razonamiento de reasoning_content puede mostrarse al usuario como el "por qué decidí esto".
  • Extracción estructurada con validación. El modo JSON más el razonamiento producen resultados más precisos en datos de entrada ambiguos que una respuesta directa sin reflexión.
  • Pipelínes de agentes con el rol de «planificador». En una combinación de varios modelos, es lógico situar a GLM-5.3 Flash donde se decide "qué hacer" y asignar los pasos ejecutivos rápidos a MiniMax M2.7.

Cuándo es más razonable otro modelo de la red: para respuestas cortas y rápidas, autocompletado y consultas masivas económicas — MiniMax M2.7 (el razonamiento allí solo añade latencia y consumo); para documentos y repositorios que deben caber en una sola consulta completa — DeepSeek V4 Flash con contexto de 380K.

Qué considerar antes de trasladar la carga. GLM-5.3 Flash es el modelo de red más nuevo y pesado en cuanto a hardware, y actualmente es atendido por una pequeña parte de los hosts. Esto significa menos capacidad de reserva que en MiniMax M2.7 y DeepSeek V4 Flash: en minutos pico, las solicitudes pueden esperar más tiempo por un slot libre o recibir una respuesta de sobrecarga que debe repetirse después de unos segundos. La segunda limitación es el tiempo: el proveedor que actualmente sirve el modelo de la red corta una respuesta aproximadamente en el quinto minuto de generación; a 25–44 tokens por segundo, esto equivale a unos 7,000–10,000 tokens, por lo que es mejor dividir las generaciones muy largas en pasos. La composición de la red cambia por votación, por lo que siempre debe obtener la lista actualizada de modelos y sus límites desde un GET https://gate.joingonka.ai/v1/models en vivo, y la disponibilidad y latencia actuales en la página de estado del gateway. Gracias al precio único, el experimento no cuesta nada: cambiar de modelo es solo una línea en la solicitud.

GLM-5.3 Flash es un modelo de razonamiento abierto de Z.ai (MoE de 320B parámetros, unos 18B activos, FP8, licencia MIT, atención híbrida), añadido a la red Gonka mediante la propuesta de gobernanza #101 en septiembre de 2026. Antes de responder, el modelo razona, y el razonamiento forma parte del límite de salida: configure max_tokens a partir de 600 incluso para respuestas cortas, active stream y para tareas simples desactive el razonamiento mediante reasoning_effort: low — cualquier otro valor lo deja completo (la pasarela traduce none y minimal a low). El Tool calling (incluyendo rondas repetidas) y el modo JSON funcionan; el contexto en la red es de 390 000 tokens, salida hasta 8 192. El precio es el mismo que para MiniMax M2.7 y DeepSeek V4 Flash: a través de JoinGonka Gateway — $0.0069 por millón de tokens de entrada y $0.021 por millón de tokens de salida. Identificador: zai-org/GLM-5.3-Flash; composición actual de la red: GET /v1/models.

¿Quieres saber más?

Explora otras secciones o empieza a ganar GNK ahora mismo.

Probar GLM-5.3 Flash a través de Gateway →