Sezioni dell'archivio conoscenza ▾

Navigazione

▸ Inizia qui Per ruolo

Categorie

Strumenti 36
Glossario 12

Strumenti

ZCode: inferenza GLM economica al posto del GLM Coding Plan

A giugno 2026 Z.ai ha rilasciato ZCode 3.0 — un ambiente di sviluppo agentico desktop, che l'azienda stessa definisce «Official Harness for GLM-5.2». Il prodotto ha rapidamente attirato l'attenzione: core agentico proprietario, attività autonome tramite /goal, modalità multi-agent e gestione remota delle sessioni direttamente da Telegram. Ma insieme all'ondata di recensioni è arrivata un'ondata di domande dai primi abbonati al GLM Coding Plan: la quota viene conteggiata come «prompts» in finestre di cinque ore, nelle ore di punta il consumo viene moltiplicato per tre, nei piani base c'è una sola richiesta parallela, e su Hacker News ci si lamenta di blocchi improvvisi dopo una giornata intensa di lavoro.

La buona notizia: ZCode supporta ufficialmente il custom provider — è possibile collegare qualsiasi API compatibile con OpenAI o Anthropic e pagare per i token effettivi, non per le quote di abbonamento. In questa guida vedremo cos'è ZCode e come funziona il GLM Coding Plan, per poi configurare passo dopo passo ZCode sul JoinGonka Gateway — il gateway della rete decentralizzata Gonka, nel cui registro è già stata aggiunta GLM-5.2. Risultato: lo stesso strumento, gli stessi modelli open-weight, ma un'economia basata sui token, centinaia di volte più economica delle API centralizzate.

Cos'è ZCode: ambiente di sviluppo agentico di Z.ai

ZCode non è un «editor con barra laterale per chat», ma un ADE: descrivi un obiettivo, l'agente crea un piano, modifica i file, esegue controlli e itera fino al risultato. Funziona come applicazione desktop su macOS e Windows (build per Linux in stato beta).

Caratteristiche chiave della versione 3.0:

  • ZCode Agent — core agentico proprietario con profonda integrazione di GLM-5.2; oltre a questo è possibile collegare agenti di terze parti (Claude Code, Codex, Gemini CLI e altri);
  • Modalità Goal (/goal) — attività autonome lunghe: piano → esecuzione → verifica passo dopo passo;
  • Multi-agent — lavoro parallelo di diversi agenti su un progetto;
  • Gestione remota — avvio e controllo delle sessioni da Telegram, WeChat e Feishu: l'agente lavora sulla tua macchina e tu rispondi alle domande dal telefono.

Il client è gratuito, ai nuovi utenti Z.ai assegna una quota giornaliera di token GLM-5.2 per testare il prodotto. Dopodiché, o si sottoscrive il GLM Coding Plan, o si usa la propria API-key. Ed è qui che bisogna entrare nei dettagli, perché il sistema di abbonamento è la parte più discussa del prodotto.

GLM Coding Plan: prezzo, limiti e quote

Il GLM Coding Plan è l'abbonamento Z.ai che dà accesso ai modelli GLM in ZCode e in due dozzine di strumenti terzi. Al momento della pubblicazione (luglio 2026) la struttura base è la seguente — ma prezzi e promozioni cambiano, verificate la pagina live z.ai/subscribe:

PianoPrezzo $/meseQuotaRichieste parallele
Lite$18 (in promozione da ~$12.6)«Prompts» in finestre da 5 ore + tetto settimanale1
Pro$72×4 rispetto a Lite1
Max$160×16 rispetto a Litefino a 30

Di cosa si lamentano gli abbonati (thread su Hacker News e GitHub):

  • Moltiplicatore di punta. Nelle ore di punta (14:00—18:00 UTC+8 — sera in Asia, mattina-pomeriggio in Europa) ogni richiesta scala la quota con un coefficiente ×3, fuori ora di punta — ×2. Bisogna pianificare il consumo secondo il fuso orario di Pechino.
  • Quota a «prompts», non a token. Quanti token rimangono è poco chiaro; nei thread si trovano storie del tipo «ho consumato ~17M di token su GLM — e ho ricevuto un blocco di quattro giorni».
  • Una sola richiesta parallela su Lite e Pro. Per un ambiente agentico questo è significativo: la modalità multi-agent di ZCode e qualsiasi sotto-agente parallelo finiscono in coda.
  • GLM-5.2 consuma la quota più velocemente dei modelli minori — il flagship erode il limite con il proprio moltiplicatore.

Conclusione semplice: per uno sviluppo in solitaria tranquillo, l'abbonamento funziona onestamente. Ma più la tua modalità è «agentica» — attività parallele, sessioni autonome lunghe, esecuzioni notturne — più il modello a quote si trasforma in una lotteria. L'alternativa è il pagamento per i token effettivi: senza finestre, moltiplicatori o code — quanto l'agente ha consumato, tanto è stato addebitato. È esattamente il modello offerto dal meccanismo custom provider integrato in ZCode, e si configura in cinque minuti.

BYOK in ZCode: la tua API-key e il custom provider

ZCode include ufficialmente il supporto nativo per BYOK: la documentazione consente esplicitamente di aggiungere "qualsiasi servizio compatibile con i protocolli OpenAI o Anthropic", inclusi API pubbliche, canali aziendali e persino installazioni self-hosted. Si configura in tre modi:

  • pulsante Connect nella welcome-screen → «Set Your API Key»;
  • Manage Models nel selettore del modello;
  • icona ingranaggio → Settings → Model Settings → Add Provider.

Al provider si assegnano OpenAI Base URL e/o Anthropic Base URL più la API Key; ZCode caricherà automaticamente l'elenco dei modelli disponibili.

I tre errori più comuni:

  • Gli endpoint di Z.ai differiscono. L'abbonamento Coding Plan funziona solo tramite il coding-endpoint https://api.z.ai/api/coding/paas/v4; il generico /api/paas/v4 con una chiave in abbonamento restituirà un errore: è la classica causa del "ricevo 401/429, anche se il piano è pagato".
  • "Funziona in Claude Code ≠ funziona in ZCode". Le variabili d'ambiente come ANTHROPIC_BASE_URL, utilizzate per configurare Claude Code, non vengono lette da ZCode: ha un proprio sistema di archiviazione delle impostazioni dei provider. Configurate direttamente nelle Settings.
  • "Il modello è visibile nel selettore ≠ la chiave ha credito". L'elenco dei modelli viene estratto dall'API del provider, ma la disponibilità dipende dal saldo e dai limiti della specifica chiave.

Ora passiamo alla pratica: colleghiamo ZCode al gateway JoinGonka e otteniamo lo stack GLM pagando per token.

Configurazione JoinGonka Gateway in ZCode: GLM pagando per token

JoinGonka Gateway è un gateway verso la rete decentralizzata Gonka con due protocolli nativi: /v1/chat/completions compatibile con OpenAI e /v1/messages per Anthropic. Il modello economico è pay-per-token: niente finestre di 5 ore, moltiplicatori di picco ×3 o limiti di una richiesta parallela; il consumo è visibile nella dashboard in tempo reale e il gateway non memorizza il contenuto dei prompt.

Procedura passo dopo passo (interfaccia Custom Provider attuale):

PassaggioAzione
1. ChiaveRegistrati — gate.joingonka.ai/register (per i nuovi account 10M token gratuiti), crea una API-key nella sezione Keys. Dettagli in API Quick Start.
2. ProviderZCode → Settings → Model Settings → Add Provider. Nome: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keyla tua chiave del tipo jg-…
5. API formatChat completions (/chat/completions)
6. ModelloAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Si possono aggiungere anche moonshotai/Kimi-K2.6 e MiniMaxAI/MiniMax-M2.7; la lista aggiornata è disponibile tramite GET /v1/models.

Nelle versioni precedenti di ZCode ci sono invece due campi separati: OpenAI Base URL (https://gate.joingonka.ai/v1) e Anthropic Base URL (https://gate.joingonka.ai — il percorso verrà aggiunto dal client stesso).

Verifica: seleziona il modello creato e poni all'agente una domanda qualsiasi. Se ricevi una risposta, tutto funziona; errore 401 — controlla la chiave, 402 — controlla il saldo del conto. Se su DeepSeek V4 Flash appare «Model request failed» con Thought Level impostato su Max, sposta il Thought Level su High e ripeti la richiesta.

Suggerimento: Il comando npx @joingonka/setup --tool zcode stamperà i valori pronti per i campi sottostanti (base URL, chiave, id modello con limiti aggiornati) e verificherà tramite richiesta che il gateway li accetti. ZCode si configura solo tramite UI — non esiste un file modificabile in sicurezza, quindi i valori vanno inseriti manualmente.

Confronto prezzi: Coding Plan, Z.ai API, OpenRouter e Gonka

Quanto costa l'inferenza GLM su diversi canali (prezzi per 1M di token; per i competitor fissati a luglio 2026, il prezzo di JoinGonka viene caricato live sulla pagina dal gateway API):

CanaleInput, $/1MOutput, $/1MModello di pagamento
Z.ai API (GLM-5.2)$1.40 (input in cache — $0.26)$4.40per token
GLM Coding Plan$18—160/meseabbonamento: quote tramite "prompt", moltiplicatore ×3 nelle ore di punta, limiti di parallelismo
OpenRouter (z-ai/glm-5.2)$0.93$3.00per token; non esiste una versione gratuita di GLM-5.2
JoinGonka Gateway$0.0032$0.0097per token, rete Gonka

La differenza di due o tre ordini di grandezza non è un arrotondamento di marketing, ma un'economia diversa: i calcoli vengono eseguiti dai partecipanti di una rete decentralizzata che guadagnano dal lavoro stesso, non dal margine di un data center. Un'analisi dettagliata di come funziona e quali sono i limiti di applicabilità è disponibile nell'articolo sulla AI API più economica.

Nota onesta su GLM-5.2: il prezzo esatto del modello viene impostato dalla rete al momento dell'attivazione (nella tabella sopra è indicato il prezzo live attuale dei modelli di rete). I numeri su questa pagina vengono aggiornati automaticamente, non dovrai ricalcolare nulla manualmente.

GLM-5.2 nella rete Gonka: status e domande frequenti

Il modello zai-org/GLM-5.2-FP8 è già stato aggiunto al registro on-chain della rete Gonka: la configurazione imposta una finestra di contesto fino a 400K token, e il modello stesso è pesante (per ogni replica è necessario più di un terabyte di VRAM). Attualmente è in fase di roll-out: i nodi della rete stanno riscaldando i pesi. Non appena i controlli diventeranno verdi, il modello apparirà automaticamente nell'elenco dei modelli del gateway — il base URL e la chiave non cambiano, in ZCode basterà selezionarlo nel selettore.

Riguardo al modello: pesi aperti sotto licenza MIT, architettura MoE con ~750B di parametri (circa 40B attivi per token), finestra nativa fino a 1M di token. Secondo i dati di Z.ai, su SWE-bench Pro il modello mostra 62.1 — superiore a GPT-5.5, mentre su FrontierSWE è dietro a Claude Opus 4.8 di circa l'uno percento. Per un modello open-weight, questa è la prima posizione nel coding.

Domande frequenti:

  • Perché subito dopo l'attivazione di un nuovo modello ci sono errori 429? — È la fase di roll-out: alcuni nodi stanno ancora caricando i pesi. Ripeti la richiesta dopo alcuni secondi — il bilanciatore di carico troverà un nodo attivo.
  • Cosa è disponibile già oggi? — Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash: tutti e tre i modelli funzionano in ZCode tramite lo stesso custom provider, la configurazione di questa guida è pienamente operativa già da ora.
  • Cosa succede con la privacy? — Il gateway non memorizza il contenuto dei prompt e delle risposte; nelle statistiche appaiono solo gli aggregati di consumo.
  • Quando il Coding Plan è più vantaggioso? — Se lavori in solitaria, rientri nella quota Lite e non esegui agenti in parallelo, l'abbonamento con un costo fisso è comodo e prevedibile. Fai i conti in base al tuo profilo: con un lavoro attivo degli agenti, pagare per i token tramite la rete risulta ordini di grandezza più economico; con una leggera correzione di codice un paio di volte al giorno, la differenza potrebbe non essere percepibile.
  • È adatto per altri strumenti? — Sì: lo stesso endpoint funziona in Claude Code, Cursor, Cline e qualsiasi client compatibile con OpenAI/Anthropic.
ZCode 3.0 è un notevole IDE agent-based, ma il suo abbonamento nativo GLM Coding Plan è basato su quote: "prompt" in finestre di 5 ore, un moltiplicatore ×3 nelle ore di punta e una sola richiesta parallela nei piani base. Più il carico di lavoro è basato su agenti, più diventa costoso e imprevedibile. Il BYOK ufficiale risolve il problema: collega JoinGonka Gateway come custom provider e paga i token effettivi ai prezzi della rete decentralizzata Gonka, centinaia di volte inferiori rispetto alle API centralizzate. GLM-5.2 è già nel registro di rete e apparirà automaticamente nel tuo selettore di modelli, mentre Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash funzionano già da oggi. Inizia con 10M di token gratuiti.

Vuoi saperne di più?

Esplora altre sezioni o inizia a guadagnare GNK subito.

Ottieni 10M di token gratuiti →