Sezioni dell'archivio conoscenza ▾
Navigazione
▸ Inizia qui Per ruoloCategorie
- Architettura di rete Gonka: Sprint, Transfer Agents, DiLoCo
- Sviluppatori: Come guadagnare GNK
- Auto-hosting: Guida passo passo
- Scelta della GPU per Gonka: raccomandazioni hardware
- Qwen3-235B: il modello precedentemente supportato da Gonka
- Kimi K2.6: il modello precedentemente servito da Gonka
- MiniMax M2.7: modello della rete Gonka
- DeepSeek V4 Flash: modello della rete Gonka con contesto 380K
- GLM-5.3 Flash: modello di ragionamento Z.ai sulla rete Gonka
Tecnologia
GLM-5.3 Flash: modello di ragionamento Z.ai sulla rete Gonka
Nel settembre 2026, nella rete Gonka è apparso un nuovo modello operativo: GLM-5.3 Flash del laboratorio cinese Z.ai. La proposta di governance #101 per la sua aggiunta è stata votata, gli host hanno caricato i pesi e il modello è diventato disponibile tramite il nostro gateway insieme a MiniMax M2.7 e DeepSeek V4 Flash. Contemporaneamente, Kimi K2.6 ha lasciato la rete e il flagship GLM-5.2, che era rimasto a lungo nel registro in attesa di implementazione, non è mai entrato in servizio attivo: la rete ha scelto un modello più leggero della stessa linea.
GLM-5.3 Flash si distingue dai suoi simili sulla rete per una caratteristica fondamentale: è un reasoning-modello. Prima di rispondere, ragiona — e questi ragionamenti costano token, tempo e richiedono impostazioni di richiesta corrette. Chi imposta max_tokens: 200 per una "risposta breve", riceverà una risposta vuota. Analizzeremo cos'è questo modello, quali sono le sue caratteristiche specifiche nella rete Gonka, come è strutturato il budget di ragionamento, come stanno le cose con strumenti e JSON, quanto costa e quando conviene sceglierlo rispetto agli altri due modelli della rete.
Cos'è GLM-5.3 Flash e chi c'è dietro
Z.ai è il marchio internazionale del laboratorio di Pechino Zhipu AI, nato dall'Università Tsinghua. La famiglia GLM si sta evolvendo dal 2023 (ChatGLM) e, a partire da GLM-4.5 nell'estate del 2025, l'azienda ha rilasciato i pesi dei modelli flagship sotto licenza MIT, rendendo questa serie una delle più importanti al mondo tra i modelli a pesi aperti. I prodotti proprietari di Z.ai, come l'ambiente di sviluppo ZCode e l'abbonamento GLM Coding Plan, sono costruiti attorno a questi stessi modelli.
GLM-5.3 Flash è un modello leggero della linea 5.3. "Leggero" è relativo: si tratta di un modello MoE da 320 miliardi di parametri, di cui circa 18 miliardi vengono attivati per ogni token. I pesi sono distribuiti in formato FP8, con licenza MIT. Una caratteristica architettonica è l'attenzione ibrida: parte degli strati utilizza un'attenzione sparsa (sparse attention), parte un'attenzione lineare; ciò rende il contesto lungo significativamente più economico in termini di memoria e tempo rispetto alla classica attenzione completa.
La seconda proprietà che determina il comportamento del modello è il ragionamento integrato. GLM-5.3 Flash è addestrato a pensare prima di rispondere: il processo di ragionamento è separato dalla risposta e fornito al client in un campo distinto. Il ragionamento si attiva e disattiva con il parametro reasoning_effort e, per impostazione predefinita, è completo. Questo rende il modello potente in compiti che richiedono logica complessa, ma anche esigente in termini di impostazioni delle query, come vedremo di seguito.
La differenza tra "Flash" e il GLM-5.3 superiore è ben visibile nei prezzi del vendor: su OpenRouter, al momento della pubblicazione, Flash costa $0.09 per milione di token in entrata e $0.30 per milione di token in uscita, mentre il modello superiore costa $1.40 e $4.40. Nella rete Gonka questa gerarchia non esiste: tutti i modelli della rete sono offerti a una tariffa unica.
Caratteristiche di GLM-5.3 Flash nella rete Gonka
Come per altri modelli della rete, è importante distinguere tra le caratteristiche del modello "out-of-the-box" e i parametri operativi di una specifica distribuzione: questi sono determinati dalla configurazione vLLM-inference sugli host GPU della rete. I valori effettivi tramite il nostro Gateway sono:
- Finestra di contesto: 390.000 token. Questo è il minimo provato dalle richieste e non un numero preso dalla scheda del modello: un input di 390.013 token è stato accettato ed elaborato; abbiamo testato un prefill elevato direttamente sugli host della rete. L'impostazione tecnica degli host consente 400.000, ma pubblichiamo solo ciò che è verificato.
- Output massimo: 8.192 token per risposta. Importante: questo limite include sia i token di ragionamento che la risposta stessa. Un modello che ha ragionato per 3.000 token su un limite di 4.096 lascerà circa mille token per la risposta.
- Reasoning e tool calling: il modello è distribuito con un parser per il ragionamento e uno per le chiamate agli strumenti; i ragionamenti arrivano nel campo
reasoning_content, mentre le chiamate agli strumenti nel campo standardtool_calls, come in qualsiasi modello OpenAI-compatible. - Velocità: nelle nostre misurazioni tramite gateway, il primo token arriva in circa 0,75 secondi e la generazione procede a una velocità di 25–44 token al secondo, a seconda del carico. Per un modello di ragionamento è veloce, ma ricorda che le prime centinaia di token saranno dedicate al ragionamento e la risposta visibile inizierà più tardi.
- Requisito VRAM dell'host: circa 560 GB per replica in base ai parametri on-chain del modello, più di MiniMax M2.7 (320 GB) e DeepSeek V4 Flash (280 GB). Più alta è la soglia hardware, meno host sono in grado di distribuire il modello, il che influisce direttamente sulla sua capacità nella rete: di questo parleremo nella sezione su scenari e limitazioni.
Il prezzo dell'inferenza nella rete Gonka non dipende dalla scelta del modello: GLM-5.3 Flash è disponibile alla stessa tariffa di MiniMax M2.7 e DeepSeek V4 Flash. Tramite il JoinGonka Gateway, il costo è di $0.0069 per milione di token di input e $0.021 per milione di token di output. I token di ragionamento sono tariffati come token di output. L'economia della rete è un argomento a parte: il prezzo è determinato dal calcolo del lavoro computazionale, non dal listino del fornitore.
Ragionamento e budget di token: come evitare una risposta vuota
L'errore più comune quando si prova GLM-5.3 Flash per la prima volta è: lo sviluppatore invia una domanda breve con il solito max_tokens: 256, riceve finish_reason: "length" e un campo content vuoto. Non c'è nulla di rotto: il modello ha esaurito il limite per il ragionamento e non è arrivato alla risposta. Secondo le nostre misurazioni, anche per una domanda banale il ragionamento occupa 250–450 token, e per compiti complessi migliaia.
Tre regole pratiche:
| Impostazione | Raccomandazione | Perché |
|---|---|---|
max_tokens | Non meno di 600 anche per risposte brevi; per compiti reali, da 2000 | Il limite è condiviso tra ragionamento e risposta; il ragionamento consuma le prime centinaia di token |
stream | true ovunque possibile | Il ragionamento e la risposta arrivano man mano che vengono generati: si vede il progresso, non c'è attesa di "schermo vuoto" e le risposte lunghe non raggiungono i timeout dei proxy |
reasoning_effort | low quando il ragionamento non serve; non specificare quando serve | L'interruttore è binario: low disattiva il ragionamento, qualsiasi altro valore lo mantiene completo. Il gateway converte none e minimal in low, mentre medium, high, xhigh e max vengono scartati come superflui. Il gateway ignora i campi enable_thinking, chat_template_kwargs, reasoning.enabled e thinking.type |
Esempio di query per un compito breve, con ragionamento limitato e limite sufficiente:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-la-tua-chiave" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"reasoning_effort": "low",
"max_tokens": 800,
"messages": [{"role": "user", "content": "Nomina la capitale dell'Australia in una parola"}]
}'Nella risposta il ragionamento si trova in message.reasoning_content, mentre la risposta stessa è in message.content; nello stream arrivano come delta separati. La maggior parte dei client compatibili con OpenAI ignora silenziosamente il campo sconosciuto, quindi il ragionamento non "trapela" nel testo della risposta, ma viene conteggiato nei completion_tokens e pagato come token in uscita. Se il ragionamento non è necessario affatto, GLM-5.3 Flash non è la scelta migliore: per risposte brevi e veloci, MiniMax M2.7 è più economico.
Un'avvertenza per gli scenari di agenti: strumenti come Cline o Cursor spesso impostano autonomamente un limite di output ridotto per query di servizio (compressione del contesto, generazione del titolo della chat). Se una query di questo tipo finisce su GLM-5.3 Flash con un limite di poche centinaia di token, tornerà vuota. Controlla l'impostazione del limite nello strumento o invia le query di servizio a un altro modello della rete.
Strumenti, JSON e confronto con altri modelli della rete
I modelli di reasoning a volte non si integrano bene con i framework agentici: il processo di ragionamento si inserisce tra le chiamate agli strumenti e ne rompe il formato. Con GLM-5.3 Flash abbiamo eseguito l'intero ciclo dell'agente — descrizione degli strumenti, chiamata, restituzione del risultato, secondo round di chiamata — e sul percorso compatibile con OpenAI funziona regolarmente: le chiamate arrivano strutturate in tool_calls, gli argomenti sono validi e il secondo round non confonde la cronologia. Funziona anche la modalità JSON (response_format: {"type": "json_object"}) — il modello restituisce un oggetto valido, mentre i ragionamenti rimangono fuori dalla risposta. Per gli agenti vale la stessa regola di budget: il limite di output deve essere ampio, altrimenti la chiamata allo strumento potrebbe interrompersi a metà.
Come si relaziona GLM-5.3 Flash con gli altri due modelli della rete:
| Parametro | GLM-5.3 Flash | MiniMax M2.7 | DeepSeek V4 Flash |
|---|---|---|---|
| Contesto nella rete | 390 000 | 200 000 | 380 000 |
| Output per risposta | 8 192 | 8 192 | 32 768 |
| Architettura | MoE 320B (~18B attivi), attenzione ibrida | MoE + attenzione lineare | MoE 284B (~13B attivi) |
| VRAM per replica | 560 GB | 320 GB | 280 GB |
| Punti di forza | Logica complessa, analisi del codice, compiti di "riflessione"; il contesto più lungo della rete | Attività quotidiane, risposte brevi e rapide, modello predefinito | Secondo contesto di rete più lungo, output più lungo, agent coding |
| Prezzo via Gateway | uguale — $0.0069 input / $0.021 output per 1M | ||
La conseguenza pratica del prezzo unico è la stessa di prima: il modello viene scelto in base al compito, non al budget. Serve riflettere su una logica complessa? — GLM-5.3 Flash; bisogna leggere un intero repository? — DeepSeek V4 Flash; serve una risposta rapida e precisa? — MiniMax M2.7.
Come utilizzare GLM-5.3 Flash tramite JoinGonka Gateway
Il modello è disponibile tramite JoinGonka Gateway tramite un'API compatibile con OpenAI e Anthropic. L'ID del modello è zai-org/GLM-5.3-Flash. Una chiave del tipo jg-… viene creata nell'area personale subito dopo la registrazione; ai nuovi account vengono accreditati 3M di token gratuiti — sufficienti per testare il modello sui propri task e calibrare il budget di ragionamento.
Chiamata API diretta (formato OpenAI, streaming incluso — modalità raccomandata per i modelli di reasoning):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-la-tua-chiave" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"stream": true,
"max_tokens": 4000,
"messages": [{"role": "user", "content": "Trova l'errore in questa funzione e spiegalo: …"}]
}'Negli strumenti di sviluppo, il modello si connette esattamente come gli altri modelli della rete: base URL https://gate.joingonka.ai/v1, chiave jg-… e ID del modello. Le guide per Cursor, Claude Code, Cline, Continue e altri strumenti sono raccolte nella sezione «Strumenti»; l'installer npx @joingonka/setup configurerà il gateway nel tool con un singolo comando. Per i client che utilizzano l'Anthropic Messages API, è sufficiente impostare ANTHROPIC_BASE_URL=https://gate.joingonka.ai.
È possibile provare il modello senza registrazione nella chat gratuita: seleziona GLM-5.3 Flash nell'elenco dei modelli — i ragionamenti vengono mostrati in un blocco compresso separato, così da poter vedere chiaramente quanto il modello "pensa" prima di rispondere.
Quando scegliere GLM-5.3 Flash — scenari e cosa considerare
Scenari ideali per questo modello:
- Compiti in cui bisogna pensare. Analisi di logiche di business complesse, ricerca di bug non ovvi, progettazione di schemi di dati, matematica e inferenze multi-step: è per questo che esistono i modelli di ragionamento. Qui il ragionamento viene ripagato dalla qualità della risposta.
- Revisione e spiegazione del codice. Il modello scompone il codice altrui e motiva le osservazioni, mentre il processo di ragionamento dal
reasoning_contentpuò essere mostrato all'utente come "il motivo della mia decisione". - Estrazione strutturata con verifica. La modalità JSON più il ragionamento offrono risultati più accurati su dati di input ambigui rispetto a una risposta diretta senza riflessione.
- Pipeline agentiche con ruolo di "pianificatore". In una combinazione di più modelli, è logico inserire GLM-5.3 Flash dove si decide "cosa fare", delegando i passaggi esecutivi rapidi a MiniMax M2.7.
Quando è più sensato usare un altro modello della rete: per risposte brevi e veloci, completamento automatico e richieste massive economiche — MiniMax M2.7 (il ragionamento aggiungerebbe solo latenza e costi); per documenti e repository che devono entrare interamente in una singola richiesta — DeepSeek V4 Flash con contesto 380K.
Cosa considerare prima di trasferire il carico. GLM-5.3 Flash è il modello più nuovo e pesante per l'hardware della rete, ed è attualmente gestito da un numero limitato di host. Ciò significa una capacità inferiore rispetto a MiniMax M2.7 e DeepSeek V4 Flash: nei momenti di picco le richieste potrebbero attendere più a lungo uno slot libero o ricevere un messaggio di sovraccarico, che vale la pena ripetere dopo alcuni secondi. Il secondo limite è il tempo: il provider che attualmente eroga il modello di rete interrompe la risposta circa al quinto minuto di generazione; a 25–44 token al secondo, si tratta di circa 7–10 mila token, quindi è meglio suddividere le generazioni molto lunghe in più passaggi. La composizione della rete cambia tramite votazione, quindi consultate sempre l'elenco aggiornato dei modelli e i loro limiti tramite GET https://gate.joingonka.ai/v1/models, mentre la disponibilità attuale e le latenze sono visibili sulla pagina dello stato del gateway. Grazie al prezzo unico, l'esperimento non costa nulla: cambiare modello richiede solo una riga nella richiesta.
Vuoi saperne di più?
Esplora altre sezioni o inizia a guadagnare GNK subito.
Prova GLM-5.3 Flash tramite Gateway →