Sezioni dell'archivio conoscenza ▾
Navigazione
▸ Inizia qui Per ruoloCategorie
- Architettura di rete Gonka: Sprint, Transfer Agents, DiLoCo
- Sviluppatori: Come guadagnare GNK
- Auto-hosting: Guida passo passo
- Scelta della GPU per Gonka: raccomandazioni hardware
- Qwen3-235B: il modello precedentemente supportato da Gonka
- Kimi K2.6: il secondo modello della rete Gonka
- MiniMax M2.7: modello della rete Gonka
Tecnologia
Qwen3-235B: il modello precedentemente supportato da Gonka
Cos'è Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 è un modello linguistico di grandi dimensioni (LLM) della famiglia Qwen3, sviluppato dal team Qwen di Alibaba Cloud. Il nome completo si espande così: Qwen3 — terza generazione della serie, 235B — 235 miliardi di parametri totali, A22B — 22 miliardi di parametri attivi per ogni richiesta, Instruct — versione addestrata a seguire le istruzioni, 2507 — rilascio di luglio 2025, FP8 — quantizzazione a 8 bit per l'ottimizzazione della memoria.
La caratteristica architetturale chiave è MoE (Mixture of Experts). A differenza dei modelli “densi” (GPT-5.5, Claude Sonnet 4.6), dove ogni token passa attraverso tutti i parametri, un modello MoE attiva per ogni richiesta solo un sottoinsieme di “esperti” — blocchi specializzati della rete neurale. Nel caso di Qwen3-235B, su 235 miliardi di parametri, solo 22 miliardi vengono attivati per ogni token — meno del 10%. Questo offre una qualità pari a quella dei modelli con più di 200B parametri, con costi computazionali di un modello da 22B.
Praticamente, questo significa: il modello è più intelligente di quanto ci si aspetterebbe dalla sua velocità. Elabora le richieste significativamente più velocemente dei modelli densi di qualità comparabile, richiedendo al contempo molta meno VRAM per l'inferenza. Questo è il motivo per cui MoE è diventata l'architettura dominante per i modelli più grandi del 2025-2026.
La finestra di contesto di Qwen3-235B è di 131.072 token (~100.000 parole), sufficiente per analizzare interi libri, basi di codice o lunghi documenti legali in una singola richiesta. Il modello supporta 119 lingue, inclusi russo, inglese, cinese, arabo, hindi e decine di altre — rendendolo uno dei modelli più multilingue sul mercato.
Caratteristiche e benchmark
Qwen3-235B compete con i più grandi modelli chiusi e aperti. Ecco un confronto delle caratteristiche chiave:
| Modello | Parametri | Contesto | MoE | Open Source | Prezzo (per 1M di token) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B attivi) | 131K | Sì | Sì (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (stima) | 128K | Sì (presunto) | No | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Non divulgato | 200K | No (presunto) | No | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B attivi) | 1M | Sì | Sì (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B attivi) | 128K | Sì | Sì (MIT) | $0.55 |
Qwen3-235B dimostra un livello di qualità paragonabile a GPT-5.5 e Claude Sonnet 4.6 nella maggior parte dei benchmark, e come modello MoE open-weights costa molto meno delle alternative proprietarie: l'architettura MoE attiva solo una parte dei parametri per richiesta, riducendo drasticamente i costi computazionali. La rete Gonka applica oggi lo stesso principio di inferenza decentralizzata low-cost ai propri modelli attivi — Kimi K2.6 e MiniMax M2.7, accessibili tramite JoinGonka Gateway a $0.003 per 1M di token (migliaia di volte più economico di GPT-5.5 e Claude).
Nei benchmark MMLU-Pro, HumanEval, MATH-500 e GSM8K, il modello rientra tra i migliori tre open-source, cedendo il passo solo a DeepSeek-R1 nelle attività di ragionamento matematico. Nelle attività di generazione di codice, traduzione e seguito di istruzioni, Qwen3-235B supera costantemente Llama 4 Maverick ed è paragonabile a Claude Sonnet 4.6.
Come Gonka ha utilizzato Qwen3-235B
Quando Qwen3-235B era il modello principale della rete, operava sulla rete Gonka in modo distribuito tramite il protocollo DiLoCo, adattato per l'inference. Il modello completo in formato FP8 richiede circa 640 GB di VRAM (VRAM), impossibile da contenere su una singola GPU: nemmeno una H100 80GB o una H200 141GB sono sufficienti. Pertanto, il modello veniva suddiviso per livelli (tensor parallelism + pipeline parallelism) tra più ML-node.
In pratica, Qwen3-235B operava su un cluster di 8-16 GPU-node, ciascuno con almeno 40 GB di VRAM. I Transfer Agents instradavano la richiesta al cluster appropriato, il vLLM su ogni nodo elaborava la sua porzione di modello e i risultati venivano aggregati e restituiti all'utente. L'intero processo richiedeva centinaia di millisecondi; l'utente non percepiva che la richiesta veniva elaborata da una dozzina di GPU sparse per il mondo. Lo stesso principio di inference distribuita viene applicato dalla rete anche oggi, con i modelli correnti.
Dettaglio tecnico importante: Gonka utilizza vLLM come motore di serving. vLLM è un progetto open source che garantisce una generazione di testo ad alte prestazioni tramite PagedAttention, un algoritmo che ottimizza l'uso della memoria video durante l'elaborazione parallela di molteplici richieste. Ciò consente alla rete di servire migliaia di utenti simultanei senza degradazione della qualità.
Il modello supporta il native tool calling — la chiamata di funzioni e strumenti direttamente dalla risposta del modello. Questa funzionalità è stata aggiunta a Gonka tramite la PR #767 con una soglia di 0,958 per il riconoscimento delle chiamate agli strumenti. Su Qwen3-235B, questo consentiva agli sviluppatori di costruire AI-agent che interagiscono con API esterne, database e strumenti, il tutto in un'unica richiesta. Il supporto al tool calling è rimasto invariato anche nei modelli attuali della rete.
La rete Gonka conta oltre 4 000 GPU (H100, H200, A100, RTX 4090 e altre), raggruppate in 120+ ML-node. È una delle più grandi reti GPU distribuite per AI inference al mondo; se in precedenza questa potenza era dedicata a Qwen3-235B, oggi serve i modelli correnti della rete, Kimi K2.6 e MiniMax M2.7.
È possibile provare Qwen3-235B adesso
Risposta diretta: tramite la rete Gonka — non più. Qwen3-235B è stato rimosso dalla rete, quindi non può più essere richiamato tramite l'identificativo qwen3-235b-a22b attraverso il nostro Gateway. Poiché il modello è aperto (Apache 2.0), è comunque possibile eseguirlo autonomamente o accedervi tramite provider di hosting di modelli open-weights di terze parti — ad esempio tramite OpenRouter (circa $0.071/$0.100 per 1M di token).
Se invece cercate l'inferenza decentralizzata low-cost per cui ci si rivolge a Gonka — è ancora disponibile, semplicemente funziona ora sui modelli attivi della rete. Tramite JoinGonka API Gateway sono disponibili Kimi K2.6 e MiniMax M2.7 tramite API compatibile con OpenAI: qualsiasi codice scritto per OpenAI funziona senza modifiche — basta sostituire URL, API-key e nome del modello.
Esempio di richiesta verso un modello attivo:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Spiega l'architettura MoE"}]
}'Costo: $0.003 per 1 milione di token — è 1.700 volte più economico di GPT-5.5 ($5.00/1M) e 1.000 volte più economico di Claude Sonnet 4.6 ($3.00/1M). All'iscrizione si ricevono 10 milioni di token gratuiti per i test.
Il Gateway è compatibile con i più diffusi strumenti di sviluppo: la Quick Start descrive la connessione tramite Python, Node.js e curl. Sono supportate anche integrazioni IDE — Cursor, Continue, Cline, Aider e Claude Code — e framework per AI agent: LangChain, n8n, LibreChat, Open WebUI.
Per una partenza rapida:
- Registrati su gate.joingonka.ai (collega il wallet o creane uno nuovo)
- Ottieni l'API-key nella Dashboard
- Sostituisci
api.openai.comcongate.joingonka.ai/apinel tuo codice - Specifica il modello di rete corrente —
moonshotai/Kimi-K2.6oMiniMaxAI/MiniMax-M2.7(elenco completo nell'endpointGET /v1/models)
L'inferenza decentralizzata enterprise a prezzo hobby è ancora qui — Qwen3-235B ha solo lasciato il posto a modelli di rete più recenti. Lo stesso rapporto qualità-prezzo si applica ora a Kimi K2.6 e MiniMax M2.7.
Vuoi saperne di più?
Esplora altre sezioni o inizia a guadagnare GNK subito.
Prova i modelli correnti di Gonka →