Sezioni dell'archivio conoscenza ▾
Navigazione
▸ Inizia qui Per ruoloCategorie
- Architettura di rete Gonka: Sprint, Transfer Agents, DiLoCo
- Sviluppatori: Come guadagnare GNK
- Auto-hosting: Guida passo passo
- Scelta della GPU per Gonka: raccomandazioni hardware
- Qwen3-235B: il modello precedentemente supportato da Gonka
- Kimi K2.6: il secondo modello della rete Gonka
- MiniMax M2.7: modello della rete Gonka
- DeepSeek V4 Flash: modello della rete Gonka con contesto 380K
Tecnologia
MiniMax M2.7: modello della rete Gonka
Nella primavera del 2026, la rete Gonka è passata da single-model a multi-model. Inizialmente, al modello di punta Qwen3-235B è stato aggiunto Kimi K2.6, e alla fine di maggio 2026 il MiniMax M2.7 del laboratorio cinese MiniMax. Successivamente, Qwen3-235B è stato rimosso e oggi Gonka supporta tre modelli simultaneamente: Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash.
Vediamo che cos'è MiniMax M2.7, chi c'è dietro il suo sviluppo, quali sono le sue caratteristiche specifiche all'interno della rete Gonka, in cosa differisce dall'altro modello operativo della rete (Kimi K2.6) e come interfacciarsi ad esso tramite il nostro API Gateway seguendo il protocollo compatibile con OpenAI.
Cos'è MiniMax M2.7 e chi sta dietro al modello
MiniMax M2.7 è un grande modello linguistico (LLM) della società MiniMax, con sede a Shanghai. MiniMax è stata fondata nel 2021 da un team di ricercatori guidato da Yan Junjie (precedentemente in SenseTime) ed è rapidamente entrata a far parte dei principali laboratori di intelligenza artificiale cinesi. L'azienda ha attratto finanziamenti da Alibaba, Tencent e HongShan — lo stesso circolo di investitori strategici che sta dietro ad altre “tigri dell'IA cinesi”, tra cui Moonshot AI, lo sviluppatore di Kimi K2.6.
Al di là dei puri modelli linguistici, MiniMax è nota per i prodotti di consumo: gli assistenti di chat Talkie e Hailuo, oltre a uno dei generatori video più notevoli del settore. Ma per la rete Gonka è importante la linea di modelli testuali della serie M, eredi dei modelli abab precedenti.
La caratteristica architettonica principale della serie M è l'attenzione al meccanismo di attenzione efficiente. Se i primi grandi modelli utilizzavano l'attenzione quadratica classica (il costo computazionale cresce proporzionalmente al quadrato della lunghezza del contesto), MiniMax è stata una delle prime a rendere disponibile pubblicamente un'attenzione lineare ibrida. Ciò consente di elaborare sequenze molto lunghe senza un'esplosione dei costi computazionali — un marchio di fabbrica storico della linea. Come Qwen3-235B e Kimi K2.6, il modello è costruito sull'architettura MoE (Mixture of Experts): centinaia di miliardi di parametri “sulla carta”, ma per ogni query viene attivata solo una piccola parte di essi, il che riduce radicalmente il costo dell'inferenza.
Nella rete Gonka il modello è identificato come MiniMaxAI/MiniMax-M2.7 — è questa stringa che deve essere passata nel campo model della richiesta API. La versione M2.7 è l'ultima iterazione della serie M al momento della pubblicazione dell'articolo.
Caratteristiche di MiniMax M2.7 nella rete Gonka
È importante distinguere tra le caratteristiche del modello "out-of-the-box" e quelle con cui viene distribuito in una rete specifica. Quando il modello opera nella rete decentralizzata Gonka, i suoi parametri di lavoro sono definiti dalla configurazione dell'inferenza vLLM lato GPU-host, non solo dall'architettura del modello. Ecco i valori effettivi forniti dal nostro Gateway:
- Finestra di contesto: 200.000 token (circa 150.000 parole). Questa è la configurazione della subnet nella rete Gonka. L'architettura MiniMax stessa supporta un contesto significativamente più lungo, ma il limite pratico in ogni momento è dettato dalla configurazione dell'inferenza sugli host.
- Output massimo: 8.192 token per singola risposta. Questa cifra è stata misurata empiricamente tramite una richiesta di generazione forzata prolungata che ha raggiunto il limite (finish_reason: length). Attualmente, questo tetto è lo stesso per tutti i modelli della rete: fino a 8.192 token. Non si tratta di un limite del modello stesso, ma della configurazione della vLLM-subnet.
- Requisiti VRAM host: circa 320 GB di VRAM per nodo. Questo è un requisito tipico per un grande modello MoE in quantizzazione FP8 — gli stessi 320 GB sono necessari anche per Kimi K2.6. In pratica, ciò significa utilizzare diverse GPU di classe H100/H200 raggruppate in un unico nodo.
Il costo dell'inference nella rete Gonka non dipende dalla scelta del modello, ma è determinato dai parametri di rete: tramite il JoinGonka Gateway, MiniMax M2.7 è disponibile alla stessa tariffa di Kimi K2.6. Questo prezzo unificato è una conseguenza del fatto che la rete si basa su un calcolo unitario del costo della potenza di calcolo, anziché sul listino prezzi di un singolo fornitore.
MiniMax M2.7 e Kimi K2.6: confronto tra i modelli Gonka
Gli utenti della rete Gonka hanno a disposizione due modelli di punta, entrambi accessibili tramite l'interfaccia unificata compatibile con OpenAI JoinGonka Gateway. Il confronto seguente aiuta a capire non "quale sia migliore", ma per quale profilo di attività ciascuno sia ottimizzato.
| Caratteristica | MiniMax M2.7 | Kimi K2.6 |
|---|---|---|
| Produttore | MiniMax (Shanghai) | Moonshot AI (Pechino) |
| Architettura | MoE + linear attention | MoE |
| Contesto in Gonka | 200.000 token | 200.000 token |
| Output max | 8.192 token | 8.192 token |
| Punti di forza storici | Contesto lungo, efficient attention | Reasoning, contesto lungo |
| ID API | MiniMaxAI/MiniMax-M2.7 | moonshotai/Kimi-K2.6 |
| Stato nella rete | Lanciato con upgrade v0.2.13 (maggio 2026) | Lanciato tramite DevShards (maggio 2026) |
Una nota importante sui benchmark nel 2026: il divario tra i principali modelli open-weights nei test pubblici si è ridotto a pochi punti percentuali, e questa differenza rientra spesso nel margine di errore statistico dei benchmark stessi. Per un utilizzo pratico, ciò che conta non è la posizione assoluta nel ranking MMLU, ma la natura del compito: lunghezza del contesto, complessità delle catene logiche, lingua richiesta, presenza di tool calling.
Indicazione pratica: per attività che coinvolgono documenti molto lunghi ed elaborazione in streaming di grandi volumi di testo, ha senso testare MiniMax M2.7, poiché l'efficient attention della sua serie è storicamente ottimizzato per tali scenari. Per attività di reasoning con logica complessa e contesto lungo, vale la pena confrontare le risposte con Kimi K2.6. La strategia migliore in produzione è mantenere entrambi i modelli nel codice e passare dall'uno all'altro tramite il parametro model, senza dover modificare l'architettura dell'applicazione.
Come Gonka ha lanciato MiniMax M2.7: l'upgrade v0.2.13
L'aggiunta di MiniMax M2.7 non è un semplice "upload di file su server", ma il risultato di un aggiornamento di rete approvato tramite voto on-chain. Il supporto per il modello è stato incluso nella release del protocollo v0.2.13, approvata con la proposta #54: è stata accettata il 21 maggio 2026 (con circa il 63% dei voti favorevoli) e attivata all'altezza di blocco specificata. Questo è lo stesso meccanismo di governance attraverso il quale la rete accetta qualsiasi cambiamento significativo — dalle tariffe ai nuovi modelli.
La multimodalità per una rete decentralizzata è un passo fondamentale. Una rete vincolata a un unico modello è intrinsecamente fragile: il rilascio di una nuova versione di un modello si trasforma in una crisi di migrazione e qualsiasi malfunzionamento dell'unico modello farebbe crollare l'intero servizio. Una rete in grado di ospitare più modelli contemporaneamente evolve in modo fluido: i nuovi modelli vengono aggiunti come "corsie" aggiuntive, quelli vecchi continuano a funzionare e gli host GPU possono scegliere cosa gestire. Tecnicamente, ogni modello risiede nel proprio shard di rete — lo stesso meccanismo (DevShards) utilizzato in precedenza per avviare Kimi K2.6.
Un dettaglio delle fasi iniziali: tra il momento in cui "il modello appare nella lista della rete" e quello in cui "il modello è aperto a tutti i clienti" può esserci un ritardo. Inizialmente, l'inferenced di MiniMax M2.7 in modalità broker era disponibile solo per chiavi privilegiate e restituiva un errore per le normali richieste — una normale fase di rodaggio. Verso la fine di maggio 2026, l'accesso pubblico è stato aperto e il modello è diventato disponibile per tutti i clienti Gateway. Maggiori dettagli su come funziona la rete e sul perché i modelli vengono avviati in questo modo si trovano nell'articolo sull'architettura di rete Gonka.
La stessa MiniMax M2.7 tramite OpenRouter costa $0.279/$1.20 per 1M, contro $0.0047/$0.014 su JoinGonka.
Come usare MiniMax M2.7 tramite JoinGonka Gateway
La via più diretta è tramite il JoinGonka API Gateway. Poiché il Gateway fornisce un'API compatibile con OpenAI, lo stesso codice che funziona con GPT, Claude o Kimi inizierà a funzionare con MiniMax dopo aver cambiato il valore del campo model.
Esempio minimo tramite curl:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMaxAI/MiniMax-M2.7",
"messages": [
{"role": "user", "content": "Spiega brevemente cos'è la linear attention"}
]
}'La stessa richiesta in Python tramite la libreria openai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://gate.joingonka.ai/v1",
)
response = client.chat.completions.create(
model="MiniMaxAI/MiniMax-M2.7",
messages=[{"role": "user", "content": "Ciao, MiniMax"}],
)
print(response.choices[0].message.content)Streaming (Server-Sent Events) — per interfacce interattive, dove la risposta viene mostrata man mano che viene generata:
stream = client.chat.completions.create(
model="MiniMaxAI/MiniMax-M2.7",
messages=[{"role": "user", "content": "Scrivi un breve saggio sul contesto lungo"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)Al momento della registrazione su JoinGonka Gateway, ricevi 1.5M di token gratuiti per testare qualsiasi modello della rete: basteranno per confrontare tutti e tre i modelli della rete sulle tue attività specifiche.
Compatibilità con gli strumenti di sviluppo: tutto ciò che funziona con l'API OpenAI funziona anche con MiniMax tramite il Gateway. Basta cambiare il parametro model:
- Cursor: nelle impostazioni Custom Model indica
MiniMaxAI/MiniMax-M2.7 - Claude Code, Cline, Continue.dev: nome del modello nel file di configurazione
- LangChain, n8n: parametro
modeldurante l'inizializzazione del client
L'elenco aggiornato dei modelli è sempre disponibile all'endpoint GET /v1/models — da lì è comodo estrarlo dinamicamente in modo che l'UI della tua applicazione mostri automaticamente il set aggiornato. Se ricevi una risposta 429 too many concurrent requests, è una fase normale per un modello nuovo in una fase di crescita precoce della rete: ripeti la richiesta dopo pochi secondi.
Quando scegliere MiniMax M2.7 — Scenari pratici
Avere tre modelli in una sola rete è prezioso perché puoi scegliere lo strumento giusto per compiti diversi, senza cambiare né provider né il codice di integrazione. Ecco scenari in cui ha senso iniziare i test proprio con MiniMax M2.7.
Analisi di documenti lunghi. Se il compito è riassumere contratti, analizzare documentazione tecnica, elaborare grandi testi legali o finanziari, l'efficace attention della serie M è storicamente ottimizzata per mantenere un lungo contesto senza un forte aumento dei costi. Invia il documento intero in un'unica richiesta e chiedi al modello di elaborare l'intero volume in una volta sola, anziché a pezzi.
RAG e lavoro con basi di conoscenza. Negli scenari retrieval-augmented, dove vengono miscelati decine di frammenti da un database vettoriale nel contesto, la capacità del modello di mantenere molti pezzi eterogenei di testo influisce direttamente sulla qualità della risposta. Questa è una nicchia naturale per i modelli con contesto lungo.
Elaborazione di trascrizioni e log. Trascrizioni di chiamate, lunghe chat di supporto, log in streaming — compiti dove il volume di input è elevato ma la risposta solitamente breve. Qui il limite di output di 8 192 token non disturba: in entrata c'è molto, in uscita c'è un riassunto o fatti estratti.
Quando vale la pena scegliere un altro modello. Attualmente tutti i modelli della rete forniscono fino a 8 192 token in una singola risposta, quindi se l'applicazione ha bisogno di una risposta molto lunga in una sola richiesta (un documento generato ampio, un grosso blocco di codice) — tieni conto di questo limite generale nell'architettura e suddividi la generazione. Per compiti con ragionamenti complessi a più passaggi, vale la pena confrontare le risposte con Kimi K2.6. Consiglio universale: esegui lo stesso set di tue richieste reali su entrambi i modelli e confronta i risultati — i 1.5M di token gratuiti al momento della registrazione basteranno per il primo confronto.
Tecnicamente, il passaggio tra i modelli è la modifica di una sola riga nel campo model. Pertanto, un'architettura dell'applicazione ben progettata sulla rete Gonka non "sceglie un modello per sempre", ma consente di instradare le richieste tra Kimi K2.6 e MiniMax M2.7 in base al tipo di compito — l'inference a basso costo rende questo routing economicamente vantaggioso.
Vuoi saperne di più?
Esplora altre sezioni o inizia a guadagnare GNK subito.
Prova MiniMax M2.7 tramite Gateway →