Secciones de la base de conocimientos ▾

Navegación

▸ Empiece aquí Por roles

Categorías

Herramientas 52
Glosario 12

Herramientas

ZCode: inferencia GLM barata en lugar de GLM Coding Plan

En junio de 2026, Z.ai lanzó ZCode 3.0, un entorno de desarrollo de agentes de escritorio que la propia empresa denomina «Official Harness for GLM-5.2». El producto rápidamente llamó la atención: núcleo de agentes propio, tareas autónomas mediante /goal, modo multi-agente y control remoto de sesiones directamente desde Telegram. Sin embargo, junto con la ola de reseñas llegó también una ola de preguntas de los primeros suscriptores del GLM Coding Plan: la cuota se cuenta como «prompts» en ventanas de cinco horas, en las horas pico el consumo se triplica, en los planes básicos hay una sola solicitud paralela, y en Hacker News se quejan de bloqueos repentinos tras un día de trabajo intenso.

La buena noticia: ZCode admite oficialmente un custom provider; se puede conectar cualquier API compatible con OpenAI o Anthropic y pagar por los tokens reales, no por cuotas de suscripción. En esta guía analizaremos qué es ZCode y cómo funciona el GLM Coding Plan, y luego configuraremos paso a paso ZCode en JoinGonka Gateway, la puerta de enlace de la red descentralizada Gonka, que aloja GLM-5.3 Flash, el modelo de razonamiento abierto de la propia Z.ai. Resultado: la misma herramienta, los mismos modelos open-weight, pero con una economía basada en tokens y mucho más barata que las API centralizadas.

Qué es ZCode: entorno de desarrollo con agentes de Z.ai

ZCode no es un «editor con chat lateral», sino un ADE: describe un objetivo, el agente planifica, edita archivos, ejecuta pruebas e itera hasta obtener el resultado. Funciona como una aplicación de escritorio en macOS y Windows (la compilación para Linux está en estado beta).

Características clave de la versión 3.0:

  • ZCode Agent: núcleo de agentes propio con integración profunda de GLM-5.2; además de este, se pueden conectar agentes de terceros (Claude Code, Codex, Gemini CLI y otros);
  • Modo Goal (/goal): tareas autónomas largas: plan → ejecución → verificación paso a paso;
  • Multi-agent: trabajo paralelo de varios agentes en el proyecto;
  • Gestión remota: inicio y control de sesiones desde Telegram, WeChat y Feishu: el agente funciona en su máquina y usted responde a las preguntas desde su teléfono.

El cliente en sí es gratuito, Z.ai otorga a los nuevos usuarios una cuota diaria de tokens de GLM-5.2 para que lo prueben. A partir de ahí, o bien una suscripción GLM Coding Plan, o su propia clave de API. Y aquí es donde vale la pena profundizar, porque el funcionamiento de la suscripción es la parte más comentada del producto.

GLM Coding Plan: precio, límites y cuotas

GLM Coding Plan es la suscripción de Z.ai que da acceso a los modelos GLM en ZCode y en una veintena de herramientas de terceros. En el momento de publicarse esto (julio de 2026) la tabla base es la siguiente, pero los precios y las promociones cambian: consulta la página en vivo z.ai/subscribe:

PlanPrecio, $/mesCuotaSolicitudes paralelas
Lite$18 (con promociones, desde ~$12.6)«Prompts» en ventanas de 5 horas + techo semanal1
Pro$72×4 respecto a Lite1
Max$160×16 respecto a Litehasta 30

De qué se quejan los suscriptores (hilos de Hacker News y GitHub):

  • Multiplicador en horas punta. En horas punta (14:00—18:00 UTC+8: tarde en Asia, mañana-mediodía en Europa) cada solicitud descuenta cuota con un coeficiente ×3; fuera de punta, ×2. Toca planificar el gasto según la zona horaria de Pekín.
  • La cuota es en «prompts», no en tokens. Cuántos tokens quedan exactamente es opaco; en los hilos aparecen historias del tipo «consumí ~17M tokens en GLM y me bloquearon cuatro días».
  • Una sola solicitud paralela en Lite y Pro. Para un entorno de agentes se nota: el modo multi-agente del propio ZCode y cualquier subagente en paralelo chocan con la cola.
  • GLM-5.2 consume la cuota más rápido que los modelos menores: el buque insignia quema el límite con su propio multiplicador.

La conclusión es simple: para desarrollo en solitario y sin prisa, la suscripción funciona de verdad. Pero cuanto más «agéntico» sea tu modo de trabajo —tareas paralelas, sesiones autónomas largas, ejecuciones nocturnas—, más veces el modelo de cuotas se convierte en una lotería. La alternativa es pagar por los tokens reales: sin ventanas, multiplicadores ni colas; lo que gaste el agente, eso se descuenta. Ese es justo el modelo que ofrece el mecanismo de custom provider integrado en ZCode, y se configura en cinco minutos.

BYOK en ZCode: su propia clave API y custom provider

ZCode incorpora oficialmente soporte para BYOK: la documentación permite explícitamente añadir «cualquier servicio compatible con los protocolos de OpenAI o Anthropic» — APIs públicas, canales corporativos e incluso instalaciones self-hosted. Se configura de tres formas:

  • el botón Connect en la pantalla de bienvenida → «Set Your API Key»;
  • Manage Models en el selector de modelo;
  • el engranaje → Settings → Model Settings → Add Provider.

Al proveedor se le indican OpenAI Base URL y/o Anthropic Base URL más la API Key — ZCode cargará solo la lista de modelos disponibles.

Tres escollos en los que se tropieza con más frecuencia:

  • Los endpoint's de Z.ai son distintos. La suscripción Coding Plan solo funciona a través del coding-endpoint https://api.z.ai/api/coding/paas/v4; el general /api/paas/v4 con una clave de suscripción devolverá un error — la causa clásica de «me da 401/429 aunque el plan está pagado».
  • «Funciona en Claude Code ≠ funciona en ZCode». Variables de entorno como ANTHROPIC_BASE_URL, con las que se configura Claude Code, ZCode no las lee: tiene su propio almacén de ajustes de proveedores. Configura precisamente desde Settings.
  • «El modelo aparece en el selector ≠ la clave tiene cuota». La lista de modelos se carga desde la API del proveedor, pero la disponibilidad depende del saldo y los límites de cada clave.

Ahora la práctica: conectamos a ZCode el gateway JoinGonka y obtenemos el stack GLM por tokens.

Configuración del JoinGonka Gateway en ZCode: GLM por tokens

JoinGonka Gateway — gateway a la red descentralizada Gonka con dos protocolos nativos: /v1/chat/completions compatible con OpenAI y /v1/messages de Anthropic. La economía es pay-per-token: nada de ventanas de 5 horas, multiplicadores de pico de ×3 ni límite de una solicitud paralela; el consumo se visualiza en tiempo real en el dashboard, y el gateway no almacena el contenido de los prompts.

Paso a paso (interfaz actual de Custom Provider):

PasoAcción
1. ClaveRegístrese en gate.joingonka.ai/register (las cuentas nuevas reciben 3M de tokens gratuitos), cree una API-key en la sección Keys. Más detalles en API Quick Start.
2. ProveedorZCode → Settings → Model Settings → Add Provider. Nombre: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keysu clave con formato jg-…
5. API formatChat completions (/chat/completions)
6. ModeloAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. De igual forma se añaden MiniMaxAI/MiniMax-M2.7 y zai-org/GLM-5.3-Flash — el modelo de razonamiento de Z.ai; la lista actualizada y los límites se encuentran en GET /v1/models.

En versiones antiguas de ZCode, en lugar de esto hay dos campos separados: OpenAI Base URL (https://gate.joingonka.ai/v1) y Anthropic Base URL (https://gate.joingonka.ai — el cliente añadirá la ruta automáticamente).

Verificación: seleccione el modelo creado y haga cualquier pregunta al agente. Si llega la respuesta, todo funciona; error 401 — verifique la clave; 402 — saldo de la cuenta. Si en DeepSeek V4 Flash aparece «Model request failed» con Thought Level Max — cambie el Thought Level a High y repita la solicitud.

Sugerencia. El comando npx @joingonka/setup --tool zcode imprimirá los valores listos para estos campos — base URL, clave, ID del modelo y sus límites reales: ventana de contexto y límite de respuesta — y verificará mediante una solicitud real que el gateway los acepte. ZCode solo se configura a través de la UI; no existe un archivo que se pueda editar de forma segura, por lo que los valores deben insertarse manualmente.

Comparativa de precios: Coding Plan, Z.ai API, OpenRouter y Gonka

Cuánto cuesta la inferencia GLM en diferentes canales (precios por 1M de tokens; los de la competencia se registraron en septiembre de 2026, el precio de JoinGonka se inserta en la página en vivo desde la API del gateway):

CanalEntrada, $/1MSalida, $/1MModelo de pago
Z.ai API (GLM-5.2)$1.40 (entrada cacheada — $0.26)$4.40por tokens
GLM Coding Plan$18—160/messuscripción: cuotas por «prompts», multiplicador ×3 en hora pico, límites de concurrencia
OpenRouter (z-ai/glm-5.2)$1.40$4.40por tokens
OpenRouter (z-ai/glm-5.3-flash)$0.09$0.30por tokens
JoinGonka Gateway$0.0069$0.021por tokens, red Gonka

La diferencia de dos o tres órdenes de magnitud no es un redondeo de marketing, sino una economía distinta: los cálculos los realizan participantes de la red descentralizada, que ganan por el trabajo realizado y no por el margen de un centro de datos. Análisis detallado de cómo funciona y sus límites de aplicabilidad en el artículo sobre el API de IA más barato.

La línea JoinGonka representa el precio de GLM-5.3 Flash en la red Gonka: todos los modelos de la red tienen una tarifa única. Las cifras de esta página se actualizan automáticamente, no es necesario recalcular nada manualmente.

GLM en la red Gonka: GLM-5.3 Flash y preguntas frecuentes

La red Gonka sirve el modelo Z.ai: zai-org/GLM-5.3-Flash, aceptado por la propuesta de gobernanza #101 y proporcionado a través de la pasarela junto a MiniMax M2.7 y DeepSeek V4 Flash. El emblemático GLM-5.2, mencionado en las primeras versiones de esta guía, no entró en la composición operativa; la red eligió un modelo más ligero y rápido de la misma línea. La Base URL y la clave son las mismas: en ZCode es suficiente añadir el modelo en custom provider.

Sobre el modelo en sí: pesos abiertos bajo licencia MIT, arquitectura MoE con 320B de parámetros (18B activos por token), atención híbrida dispersa y lineal. La característica principal es que es un modelo de reasoning: antes de responder, razona, y el razonamiento ocupa varios cientos de tokens incluso ante una pregunta sencilla. Para ZCode esto significa dos cosas: no subestime el límite de longitud de respuesta del modelo (desde 600 tokens incluso para réplicas cortas) y para ediciones rápidas reduzca el Thought Level — a nivel de API esto es reasoning_effort: low. Análisis detallado del modelo y sus límites en el artículo GLM-5.3 Flash en la red Gonka.

Preguntas frecuentes:

  • ¿Por qué hay 429 o cola en el nuevo modelo? — El modelo es servido por una pequeña parte de los hosts de la red; en minutos pico, las solicitudes pueden esperar un slot libre. Reintente la solicitud después de unos segundos; el balanceador encontrará un nodo activo. El estado actual se encuentra en la página de estado de la pasarela.
  • ¿Qué más está disponible? — Además de GLM-5.3 Flash, están MiniMax M2.7 y DeepSeek V4 Flash: los tres modelos funcionan en ZCode a través del mismo custom provider, la configuración de esta guía es totalmente funcional.
  • ¿Qué pasa con la privacidad? — La pasarela no almacena el contenido de los prompts y respuestas; en las estadísticas, solo agregados de consumo.
  • ¿Cuándo es más rentable el Coding Plan? — Si trabaja solo, cumple con la cuota Lite y no ejecuta agentes en paralelo, una suscripción con una tarifa fija es cómoda y predecible. Calcule según su perfil: con trabajo activo de agentes, el pago por tokens a través de la red sale órdenes de magnitud más barato; con ediciones ligeras de código un par de veces al día, la diferencia puede no sentirse.
  • ¿Es adecuado para otras herramientas? — Sí: el mismo endpoint funciona en Claude Code, Cursor, Cline y cualquier cliente compatible con OpenAI/Anthropic.
ZCode 3.0 es una IDE de agentes notable, pero su suscripción nativa GLM Coding Plan funciona por cuotas: «prompts» en ventanas de 5 horas, multiplicador ×3 en horas pico y una solicitud paralela en los niveles básicos. Cuanto más agente es la carga, más cara e impredecible resulta. El BYOK oficial resuelve el problema: conecte JoinGonka Gateway como custom provider y pague por los tokens reales a los precios de la red descentralizada Gonka, cientos de veces más bajos que los API centralizados. GLM-5.3 Flash, el modelo de reasoning abierto de la propia Z.ai, ya es servido por la red, junto a MiniMax M2.7 y DeepSeek V4 Flash. Comience con tokens iniciales gratuitos.

¿Quieres saber más?

Explora otras secciones o empieza a ganar GNK ahora mismo.

Obtener tokens gratuitos →