Sezioni dell'archivio conoscenza ▾

Navigazione

▸ Inizia qui Per ruolo

Categorie

Strumenti 52
Glossario 12

Strumenti

ZCode: inferenza GLM economica al posto del GLM Coding Plan

Nel giugno 2026 Z.ai ha rilasciato ZCode 3.0, un ambiente di sviluppo desktop basato su agenti che l'azienda stessa definisce "Official Harness for GLM-5.2". Il prodotto ha rapidamente attirato l'attenzione: core agente proprietario, compiti autonomi tramite /goal, modalità multi-agent e gestione remota delle sessioni direttamente da Telegram. Tuttavia, insieme all'ondata di recensioni è arrivata un'ondata di domande da parte dei primi abbonati al GLM Coding Plan: la quota viene contata come "prompt" in finestre di cinque ore, nelle ore di punta il consumo viene moltiplicato per tre, nei piani base c'è una sola richiesta parallela e su Hacker News ci si lamenta di blocchi improvvisi dopo una giornata di lavoro intenso.

La buona notizia: ZCode supporta ufficialmente un custom provider: è possibile collegare qualsiasi API compatibile con OpenAI o Anthropic e pagare per i token effettivi, non per le quote di abbonamento. In questa guida analizzeremo cos'è ZCode e come funziona il GLM Coding Plan, e poi configureremo passo dopo passo ZCode sul JoinGonka Gateway, il gateway della rete decentralizzata Gonka che serve GLM-5.3 Flash, il modello di reasoning open-weight di Z.ai. Risultato: lo stesso strumento, gli stessi modelli open-weight, ma un'economia basata sui token e decisamente più economica rispetto alle API centralizzate.

Cos'è ZCode: ambiente di sviluppo agentico di Z.ai

ZCode non è un «editor con barra laterale per chat», ma un ADE: descrivi un obiettivo, l'agente crea un piano, modifica i file, esegue controlli e itera fino al risultato. Funziona come applicazione desktop su macOS e Windows (build per Linux in stato beta).

Caratteristiche chiave della versione 3.0:

  • ZCode Agent — core agentico proprietario con profonda integrazione di GLM-5.2; oltre a questo è possibile collegare agenti di terze parti (Claude Code, Codex, Gemini CLI e altri);
  • Modalità Goal (/goal) — attività autonome lunghe: piano → esecuzione → verifica passo dopo passo;
  • Multi-agent — lavoro parallelo di diversi agenti su un progetto;
  • Gestione remota — avvio e controllo delle sessioni da Telegram, WeChat e Feishu: l'agente lavora sulla tua macchina e tu rispondi alle domande dal telefono.

Il client è gratuito, ai nuovi utenti Z.ai assegna una quota giornaliera di token GLM-5.2 per testare il prodotto. Dopodiché, o si sottoscrive il GLM Coding Plan, o si usa la propria API-key. Ed è qui che bisogna entrare nei dettagli, perché il sistema di abbonamento è la parte più discussa del prodotto.

GLM Coding Plan: prezzo, limiti e quote

GLM Coding Plan è l'abbonamento di Z.ai che dà accesso ai modelli GLM in ZCode e in una ventina di strumenti di terze parti. Al momento della pubblicazione (luglio 2026) il listino base è questo — ma prezzi e promozioni cambiano, controlla la pagina aggiornata su z.ai/subscribe:

PianoPrezzo, $/meseQuotaRichieste parallele
Lite$18 (con le promo — da ~$12.6)Prompt in finestre di 5 ore + tetto settimanale1
Pro$72×4 rispetto a Lite1
Max$160×16 rispetto a Litefino a 30

Le lamentele degli abbonati (thread su Hacker News e GitHub):

  • Moltiplicatore nelle ore di punta. Nelle ore di picco (14:00—18:00 UTC+8 — sera in Asia, mattina-primo pomeriggio in Europa) ogni richiesta consuma quota con coefficiente ×3, fuori picco ×2. Bisogna pianificare le spese in base al fuso orario di Pechino.
  • Quota in prompt, non in token. Quanti token restino di preciso è opaco; nei thread si leggono storie tipo ho consumato ~17M token su GLM — e mi sono beccato un blocco di quattro giorni.
  • Una sola richiesta parallela su Lite e Pro. Per un ambiente agentico si sente: la modalità multi-agent di ZCode stesso e qualsiasi sub-agente parallelo finiscono in coda.
  • GLM-5.2 consuma la quota più in fretta dei modelli minori — il flagship brucia il limite con un suo moltiplicatore.

La conclusione è semplice: per lo sviluppo solitario e tranquillo l'abbonamento funziona onestamente. Ma più il tuo modo di lavorare è agentico — attività parallele, sessioni autonome lunghe, esecuzioni notturne — più il modello a quota si trasforma in una lotteria. L'alternativa è — pagare per i token effettivi: senza finestre, moltiplicatori e code — quanto l'agente ha consumato, tanto viene addebitato. Ed è esattamente il modello offerto dal meccanismo custom provider integrato in ZCode, che si configura in cinque minuti.

BYOK in ZCode: la tua API-key e il custom provider

ZCode integra ufficialmente il supporto BYOK: la documentazione consente esplicitamente di aggiungere «qualsiasi servizio compatibile con i protocolli OpenAI o Anthropic» — API pubbliche, canali aziendali e persino installazioni self-hosted. Si configura in tre modi:

  • pulsante Connect nella welcome screen → «Set Your API Key»;
  • Manage Models nel selettore del modello;
  • ingranaggio → Settings → Model Settings → Add Provider.

Al provider si assegnano OpenAI Base URL e/o Anthropic Base URL più la API Key — ZCode recupererà da solo l'elenco dei modelli disponibili.

Tre inciampi su cui si sbatte più spesso:

  • Gli endpoint di Z.ai sono diversi. L'abbonamento Coding Plan funziona solo tramite il coding-endpoint https://api.z.ai/api/coding/paas/v4; il generico /api/paas/v4 con una chiave di abbonamento restituirà un errore — la classica causa del «mi dà 401/429 anche se il piano è pagato».
  • «Funziona in Claude Code ≠ funziona in ZCode». Le variabili d'ambiente come ANTHROPIC_BASE_URL, con cui si configura Claude Code, ZCode non le legge: ha un proprio archivio delle impostazioni dei provider. Configurate proprio tramite Settings.
  • «Il modello è visibile nel selettore ≠ la chiave ha quota». L'elenco dei modelli viene recuperato dall'API del provider, ma la disponibilità dipende dal saldo e dai limiti della singola chiave.

Ora la pratica: colleghiamo a ZCode il gateway JoinGonka e otteniamo lo stack GLM a pagamento in token.

Configurazione JoinGonka Gateway in ZCode: GLM pagando per token

JoinGonka Gateway — un gateway verso la rete decentralizzata Gonka con due protocolli nativi: /v1/chat/completions compatibile con OpenAI e /v1/messages di Anthropic. L'economia è pay-per-token: nessuna finestra di 5 ore, moltiplicatori di picco ×3 o limite di una sola richiesta parallela; il consumo è visibile in tempo reale nella dashboard e il gateway non memorizza il contenuto dei prompt.

Passo dopo passo (interfaccia Custom Provider attuale):

PassaggioAzione
1. ChiaveRegistrati — gate.joingonka.ai/register (i nuovi account ricevono 3M di token gratuiti), crea una API-key nella sezione Keys. Maggiori dettagli in API Quick Start.
2. ProviderZCode → Settings → Model Settings → Add Provider. Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keyla tua chiave nel formato jg-…
5. Formato APIChat completions (/chat/completions)
6. ModelloAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Allo stesso modo si possono aggiungere MiniMaxAI/MiniMax-M2.7 e zai-org/GLM-5.3-Flash — il modello di reasoning di Z.ai; elenco attuale e limiti — GET /v1/models.

Nelle versioni precedenti di ZCode ci sono invece due campi separati: OpenAI Base URL (https://gate.joingonka.ai/v1) e Anthropic Base URL (https://gate.joingonka.ai — il percorso verrà aggiunto dal client).

Verifica: seleziona il modello creato e fai una domanda all'agente. Se arriva la risposta, tutto funziona; errore 401 — controlla la chiave, 402 — saldo dell'account. Se su DeepSeek V4 Flash appare «Model request failed» con Thought Level impostato su Max — passa a High e riprova.

Suggerimento. Il comando npx @joingonka/setup --tool zcode stamperà i valori pronti per questi campi — base URL, chiave, ID del modello e i suoi limiti reali: finestra di contesto e limite di risposta — e verificherà con una richiesta reale che il gateway li accetti. ZCode si configura solo tramite UI — non esiste un file che si possa modificare in sicurezza, quindi i valori vanno inseriti manualmente.

Confronto prezzi: Coding Plan, Z.ai API, OpenRouter e Gonka

Quanto costa GLM-inference su diversi canali (prezzi per 1M di token; quelli della concorrenza sono fissi a settembre 2026, il prezzo JoinGonka viene inserito nella pagina in tempo reale dalle API del gateway):

CanaleInput, $/1MOutput, $/1MModello di pagamento
Z.ai API (GLM-5.2)$1.40 (input in cache — $0.26)$4.40per token
GLM Coding Plan$18—160/meseabbonamento: quote "prompt", moltiplicatore ×3 di picco, limiti di parallelismo
OpenRouter (z-ai/glm-5.2)$1.40$4.40per token
OpenRouter (z-ai/glm-5.3-flash)$0.09$0.30per token
JoinGonka Gateway$0.0069$0.021per token, rete Gonka

La differenza di due o tre ordini di grandezza non è arrotondamento di marketing, ma un'economia diversa: i calcoli vengono eseguiti dai partecipanti alla rete decentralizzata che guadagnano dal lavoro stesso e non dal margine di un data center. Un'analisi dettagliata di come funziona e quali sono i limiti di applicabilità è disponibile nell'articolo sull'API AI più economica.

La riga JoinGonka rappresenta il prezzo di GLM-5.3 Flash nella rete Gonka: tutti i modelli della rete hanno una tariffa unificata. Le cifre in questa pagina si aggiornano automaticamente, non c'è nulla da ricalcolare a mano.

GLM nella rete Gonka: GLM-5.3 Flash e domande frequenti

La rete Gonka supporta il modello Z.ai: zai-org/GLM-5.3-Flash è stato adottato tramite la governance-proposal #101 ed è disponibile tramite il gateway insieme a MiniMax M2.7 e DeepSeek V4 Flash. Il modello di punta GLM-5.2, menzionato nelle prime versioni di questa guida, non è entrato in produzione poiché la rete ha scelto un modello più leggero e veloce della stessa linea. Il Base URL e la chiave rimangono gli stessi: in ZCode basta aggiungere il modello come custom provider.

Sul modello: pesi aperti sotto licenza MIT, architettura MoE da 320B di parametri (18B attivi per token), attenzione ibrida sparsa e lineare. La caratteristica principale è il reasoning-model: prima di rispondere, il modello riflette, e la riflessione occupa diverse centinaia di token anche per una domanda semplice. Per ZCode significa due cose: non abbassare il limite di lunghezza della risposta (almeno 600 token anche per repliche brevi) e, per correzioni rapide, ridurre il Thought Level — a livello API è reasoning_effort: low. Un'analisi dettagliata del modello e dei suoi limiti è disponibile nell'articolo GLM-5.3 Flash nella rete Gonka.

Domande frequenti:

  • Perché sul nuovo modello ci sono 429 o code? — Il modello è attualmente servito da una piccola parte degli host della rete; durante i picchi di traffico, le richieste potrebbero dover attendere uno slot libero. Ripeti la richiesta dopo pochi secondi: il bilanciatore di carico troverà un nodo attivo. Lo stato attuale è visibile sulla pagina di stato del gateway.
  • Cos'altro è disponibile? — Oltre a GLM-5.3 Flash, ci sono MiniMax M2.7 e DeepSeek V4 Flash: tutti e tre i modelli funzionano in ZCode tramite lo stesso custom provider, la configurazione di questa guida è perfettamente operativa.
  • Com'è gestita la privacy? — Il gateway non memorizza il contenuto dei prompt o delle risposte; nelle statistiche vengono riportati solo aggregati di consumo.
  • Quando conviene il Coding Plan? — Se lavori da solo, rientri nella quota Lite e non esegui agenti paralleli, l'abbonamento a costo fisso è comodo e prevedibile. Fai i tuoi calcoli: con un uso intensivo di agenti, il pagamento a consumo per token tramite la rete è nettamente più economico; con leggere correzioni di codice un paio di volte al giorno, la differenza potrebbe essere impercettibile.
  • È adatto ad altri strumenti? — Sì: lo stesso endpoint funziona in Claude Code, Cursor, Cline e qualsiasi client compatibile con OpenAI/Anthropic.
ZCode 3.0 è un'IDE per agenti notevole, ma il suo abbonamento nativo GLM Coding Plan è basato su quote: "prompt" in finestre di 5 ore, moltiplicatore ×3 nelle ore di punta e una sola richiesta parallela nei piani base. Più il carico di lavoro è basato su agenti, più diventa costoso e imprevedibile. Il BYOK ufficiale risolve il problema: collega il JoinGonka Gateway come custom provider e paga per i token effettivi ai prezzi della rete decentralizzata Gonka, centinaia di volte inferiori alle API centralizzate. GLM-5.3 Flash — reasoning-model open di Z.ai — è già supportato dalla rete, insieme a MiniMax M2.7 e DeepSeek V4 Flash. Inizia con i token iniziali gratuiti.

Vuoi saperne di più?

Esplora altre sezioni o inizia a guadagnare GNK subito.

Ottieni token gratuiti →