Sezioni dell'archivio conoscenza ▾

Tecnologia

Qwen3-235B: il modello precedentemente supportato da Gonka

La rete Gonka non si limita al noleggio di GPU, ma gestisce modelli AI per l'inference. Per molto tempo, il modello principale e unico della rete è stato Qwen3-235B-A22B-Instruct, sviluppato da Alibaba Cloud. Con il tempo, la rete è passata a un'architettura multimodello e Qwen3-235B è stato rimosso: oggi Gonka gestisce Kimi K2.6 di Moonshot AI, MiniMax M2.7 e DeepSeek V4 Flash. Analizziamo cosa fosse Qwen3-235B, il ruolo che ha svolto nella rete Gonka e con cosa è stato sostituito: come noto modello open-source MoE, rimane un utile punto di riferimento.

Cos'è Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 è un modello linguistico di grandi dimensioni (LLM) della famiglia Qwen3, sviluppato dal team Qwen di Alibaba Cloud. Il nome completo si espande così: Qwen3 — terza generazione della serie, 235B — 235 miliardi di parametri totali, A22B — 22 miliardi di parametri attivi per ogni richiesta, Instruct — versione addestrata a seguire le istruzioni, 2507 — rilascio di luglio 2025, FP8 — quantizzazione a 8 bit per l'ottimizzazione della memoria.

La caratteristica architetturale chiave è MoE (Mixture of Experts). A differenza dei modelli “densi” (GPT-5.5, Claude Sonnet 4.6), dove ogni token passa attraverso tutti i parametri, un modello MoE attiva per ogni richiesta solo un sottoinsieme di “esperti” — blocchi specializzati della rete neurale. Nel caso di Qwen3-235B, su 235 miliardi di parametri, solo 22 miliardi vengono attivati per ogni token — meno del 10%. Questo offre una qualità pari a quella dei modelli con più di 200B parametri, con costi computazionali di un modello da 22B.

Praticamente, questo significa: il modello è più intelligente di quanto ci si aspetterebbe dalla sua velocità. Elabora le richieste significativamente più velocemente dei modelli densi di qualità comparabile, richiedendo al contempo molta meno VRAM per l'inferenza. Questo è il motivo per cui MoE è diventata l'architettura dominante per i modelli più grandi del 2025-2026.

La finestra di contesto di Qwen3-235B è di 131.072 token (~100.000 parole), sufficiente per analizzare interi libri, basi di codice o lunghi documenti legali in una singola richiesta. Il modello supporta 119 lingue, inclusi russo, inglese, cinese, arabo, hindi e decine di altre — rendendolo uno dei modelli più multilingue sul mercato.

Caratteristiche e benchmark

Qwen3-235B compete con i più grandi modelli chiusi e aperti. Ecco un confronto delle caratteristiche principali:

ModelloParametriContestoMoEOpen SourcePrezzo (per 1M token)
Qwen3-235B (Alibaba)235B (22B attivi)131KSì (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (stima)128KSì (presunto)No$5.00
Claude Sonnet 4.6 (Anthropic)Non divulgato200KNo (presunto)No$3.00
Llama 4 Maverick (Meta)400B (17B attivi)1MSì (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B attivi)128KSì (MIT)$0.55

Qwen3-235B dimostra un livello di qualità paragonabile a GPT-5.5 e Claude Sonnet 4.6 nella maggior parte dei benchmark, e come modello open-weights MoE costa molto meno delle alternative proprietarie: l'architettura MoE attiva solo una parte dei parametri per richiesta, riducendo drasticamente i costi computazionali. Lo stesso principio di inference decentralizzata ed economica viene applicato dalla rete Gonka ai suoi modelli attuali: Kimi K2.6 e MiniMax M2.7, disponibili tramite il JoinGonka Gateway a $0.0047 per 1M token (centinaia o migliaia di volte più economico di GPT-5.5 e Claude).

Nei benchmark MMLU-Pro, HumanEval, MATH-500 e GSM8K, il modello è tra i primi tre modelli open-source, superato solo da DeepSeek-R1 nei compiti di ragionamento matematico. Nei compiti di generazione di codice, traduzione e esecuzione di istruzioni, Qwen3-235B supera costantemente Llama 4 Maverick ed è paragonabile a Claude Sonnet 4.6.

Come Gonka ha utilizzato Qwen3-235B

Quando Qwen3-235B era il modello principale, operava nella rete Gonka in modo distribuito — attraverso il protocollo DiLoCo, adattato per l'inference. Il modello completo in formato FP8 richiede circa 640 GB di VRAM (VRAM), impossibile da far stare su una singola GPU — anche H100 80GB o H200 141GB non bastano. Pertanto, il modello veniva suddiviso per livelli (tensor parallelism + pipeline parallelism) tra diversi ML-nodes.

In pratica, Qwen3-235B girava su un cluster di 8—16 GPU-nodes, ognuno con almeno 40 GB di VRAM. I Transfer Agents indirizzavano la richiesta al cluster corretto, vLLM su ogni nodo elaborava il proprio frammento di modello, i risultati venivano aggregati e restituiti all'utente. L'intero processo richiedeva centinaia di millisecondi — l'utente non percepiva che la sua richiesta fosse elaborata da una dozzina di GPU in diversi punti del pianeta. Lo stesso principio di inference distribuita viene applicato dalla rete anche oggi — ai modelli attuali.

Dettaglio tecnico importante: Gonka utilizza vLLM come motore di serving. vLLM è un progetto open-source che garantisce una generazione di testo ad alte prestazioni tramite PagedAttention — un algoritmo che ottimizza l'uso della VRAM durante l'elaborazione parallela di molteplici richieste. Ciò consente alla rete di servire migliaia di utenti simultanei senza degrado della qualità.

Il modello supporta il native tool calling — la chiamata di funzioni e strumenti direttamente dalla risposta del modello. Questa capacità è stata aggiunta a Gonka tramite la PR #767 con una soglia di 0.958 per il rilevamento delle chiamate agli strumenti. Su Qwen3-235B, ciò permetteva agli sviluppatori di creare AI-agents che interagiscono con API esterne, database e strumenti — il tutto tramite una singola richiesta. Il supporto al tool calling è rimasto anche nei modelli attuali della rete.

La rete Gonka conta oltre 4 000 GPU (H100, H200, A100, RTX 4090 e altre), riunite in 120+ ML-nodes. È una delle più grandi reti GPU distribuite per l'AI inference al mondo — e se prima questa potenza era orientata su Qwen3-235B, oggi serve i modelli attuali della rete — Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash.

È possibile provare Qwen3-235B adesso

Risposta diretta: tramite la rete Gonka non più. Qwen3-235B è stato rimosso dalla rete, quindi non è più possibile richiamarlo tramite l'identificativo qwen3-235b-a22b attraverso il nostro Gateway. Poiché il modello è open source (Apache 2.0), è ancora possibile eseguirlo autonomamente o accedervi tramite provider terzi di modelli open-weights — ad esempio, tramite OpenRouter (circa $0.071/$0.100 per 1M di token).

Se cercate l'inferenza decentralizzata a basso costo, che è il motivo per cui gli utenti scelgono Gonka, questa è ancora disponibile e funziona sui modelli attualmente attivi nella rete. Tramite il JoinGonka API Gateway sono disponibili Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash tramite un'API compatibile con OpenAI: qualsiasi codice scritto per OpenAI funziona senza modifiche, basta sostituire URL, API-key e nome del modello.

Esempio di richiesta a un modello attivo:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Spiega l'architettura MoE"}]
  }'

Costo: $0.0047 per 1 milione di token — circa 800 volte più economico di GPT-5.5 ($5.00/1M) e circa 500 volte più economico di Claude Sonnet 4.6 ($3.00/1M). Alla registrazione riceverete gratuitamente 1.5M di token per i test.

Il Gateway è compatibile con i più diffusi strumenti di sviluppo: la Quick Start descrive la connessione tramite Python, Node.js e curl. Sono supportate anche integrazioni IDE — Cursor, Continue, Cline, Aider e Claude Code — e framework per agenti AI: LangChain, n8n, LibreChat, Open WebUI.

Per un avvio rapido:

  1. Registratevi su gate.joingonka.ai (collegate il vostro wallet o createne uno nuovo)
  2. Ottenete una API-key nella Dashboard
  3. Sostituite api.openai.com con gate.joingonka.ai/api nel vostro codice
  4. Specificate il modello di rete corrente — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 o deepseek-ai/DeepSeek-V4-Flash-0731 (lista completa disponibile nell'endpoint GET /v1/models)

L'inferenza decentralizzata di livello enterprise al prezzo di un progetto hobbistico è ancora qui; Qwen3-235B ha solo ceduto il posto a modelli di rete più recenti. Lo stesso rapporto prezzo-qualità funziona ora su Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash.

Qwen3-235B-A22B — un modello MoE con 235 miliardi di parametri (22 miliardi attivi) sviluppato da Alibaba Cloud, che inizialmente era il modello principale della rete Gonka per l'AI inference decentralizzata. Grazie all'architettura MoE, offre una qualità paragonabile ai migliori modelli proprietari con un costo computazionale notevolmente inferiore. Attualmente, Qwen3-235B è stato rimosso dalla rete: i modelli attuali di Gonka sono Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash, accessibili tramite il JoinGonka Gateway via API compatibile con OpenAI a $0.0047/1M token. Qwen3-235B rimane open (Apache 2.0) ed è disponibile presso host di terze parti di modelli open-weights.

Vuoi saperne di più?

Esplora altre sezioni o inizia a guadagnare GNK subito.

Prova i modelli correnti di Gonka →