Sections de la base de connaissances ▾
Navigation
▸ Commencez ici Par rôlesCatégories
- Architecture du réseau Gonka : Sprint, Transfer Agents, DiLoCo
- Développeurs : Comment gagner du GNK
- Auto-hébergement : Guide étape par étape
- Choix du GPU pour Gonka : recommandations matérielles
- Qwen3-235B : le modèle précédemment desservi par Gonka
- Kimi K2.6 : Le deuxième modèle du réseau Gonka
- MiniMax M2.7 : modèle du réseau Gonka
- DeepSeek V4 Flash : modèle du réseau Gonka avec un contexte de 380K
Technologie
Qwen3-235B : le modèle précédemment desservi par Gonka
Qu'est-ce que Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 est un grand modèle linguistique (LLM) de la famille Qwen3, développé par l'équipe Qwen d'Alibaba Cloud. Le nom complet se décompose comme suit : Qwen3 — troisième génération de la série, 235B — 235 milliards de paramètres au total, A22B — 22 milliards de paramètres actifs par requête, Instruct — version entraînée pour suivre des instructions, 2507 — sortie de juillet 2025, FP8 — quantification 8 bits pour l'optimisation de la mémoire.
La principale caractéristique architecturale est MoE (Mixture of Experts). Contrairement aux modèles « denses » (GPT-5.5, Claude Sonnet 4.6), où chaque token passe par tous les paramètres, un modèle MoE n'active pour chaque requête qu'un sous-ensemble d'« experts » — des blocs spécialisés du réseau neuronal. Dans le cas de Qwen3-235B, sur 235 milliards de paramètres, seulement 22 milliards sont activés par token — moins de 10 %. Cela offre une qualité au niveau des modèles de plus de 200 milliards de paramètres avec les coûts de calcul d'un modèle de 22 milliards.
En pratique, cela signifie que le modèle est plus intelligent qu'on ne pourrait s'y attendre compte tenu de sa vitesse. Il traite les requêtes nettement plus vite que les modèles denses de qualité comparable, tout en nécessitant beaucoup moins de VRAM pour l'inférence. C'est pourquoi MoE est devenue l'architecture dominante pour les plus grands modèles de 2025-2026.
La fenêtre contextuelle de Qwen3-235B est de 131 072 tokens (~100 000 mots) — cela suffit pour analyser des livres entiers, des bases de code ou de longs documents juridiques en une seule requête. Le modèle prend en charge 119 langues, dont le russe, l'anglais, le chinois, l'arabe, l'hindi et des dizaines d'autres — ce qui en fait l'un des modèles les plus multilingues du marché.
Caractéristiques et benchmarks
Qwen3-235B est en concurrence avec les plus grands modèles fermés et ouverts. Voici une comparaison des caractéristiques clés :
| Modèle | Paramètres | Contexte | MoE | Open Source | Prix (par 1M de jetons) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B actifs) | 131K | Oui | Oui (Apache 2.0) | $0.07+ (hébergement) |
| GPT-5.5 (OpenAI) | ~1.8T (estimation) | 128K | Oui (supposé) | Non | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Non divulgué | 200K | Non (supposé) | Non | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B actifs) | 1M | Oui | Oui (Llama License) | $0.20+ (hébergement) |
| DeepSeek-R1 (DeepSeek) | 671B (37B actifs) | 128K | Oui | Oui (MIT) | $0.55 |
Qwen3-235B démontre un niveau de qualité comparable à GPT-5.5 et Claude Sonnet 4.6 sur la plupart des benchmarks, tout en étant un modèle MoE open-weights bien moins coûteux que ses alternatives propriétaires : l'architecture MoE n'active qu'une partie des paramètres par requête, réduisant drastiquement les coûts de calcul. Ce même principe d'inference décentralisé et économique est appliqué par le réseau Gonka à ses modèles actuels — Kimi K2.6 et MiniMax M2.7, disponibles via JoinGonka Gateway à $0.0047 pour 1M de jetons (des centaines à des milliers de fois moins cher que GPT-5.5 et Claude).
Sur les benchmarks MMLU-Pro, HumanEval, MATH-500 et GSM8K, le modèle se classe parmi les trois meilleurs modèles open-source, ne cédant que devant DeepSeek-R1 pour les tâches de raisonnement mathématique. Pour la génération de code, la traduction et le suivi d'instructions, Qwen3-235B surpasse constamment Llama 4 Maverick et est comparable à Claude Sonnet 4.6.
Comment Gonka utilisait Qwen3-235B
Lorsque Qwen3-235B était le modèle principal du réseau, il fonctionnait sur le réseau Gonka de manière distribuée — via le protocole DiLoCo, adapté pour l'inférence. Le modèle complet au format FP8 nécessite environ 640 Go de mémoire vidéo (VRAM), ce qui est impossible à loger sur un seul GPU — même un H100 80GB ou un H200 141GB ne suffisent pas. Par conséquent, le modèle était divisé en couches (parallélisme de tenseurs + parallélisme de pipeline) entre plusieurs ML-nodes.
En pratique, Qwen3-235B fonctionnait sur un cluster de 8 à 16 GPU-nodes, chacun avec un minimum de 40 Go de VRAM. Les Transfer Agents acheminaient la requête vers le cluster approprié, vLLM sur chaque nœud traitait son fragment de modèle, les résultats étaient agrégés et renvoyés à l'utilisateur. Tout le processus prenait des centaines de millisecondes — l'utilisateur ne ressentait pas que sa requête était traitée par une douzaine de GPU aux quatre coins de la planète. Le réseau applique aujourd'hui le même principe d'inférence distribuée aux modèles en activité.
Détail technique important : Gonka utilise vLLM comme moteur de serving. vLLM est un projet open-source qui assure une génération de texte haute performance via PagedAttention — un algorithme optimisant l'utilisation de la mémoire vidéo lors du traitement parallèle de multiples requêtes. Cela permet au réseau de servir des milliers d'utilisateurs simultanés sans dégradation de la qualité.
Le modèle prend en charge le tool calling natif — l'appel de fonctions et d'outils directement à partir de la réponse du modèle. Cette fonctionnalité a été ajoutée à Gonka via la PR #767 avec un seuil de 0,958 pour définir les appels d'outils. Sur Qwen3-235B, cela permettait aux développeurs de construire des agents IA interagissant avec des API externes, des bases de données et des outils — le tout via une seule requête. La prise en charge du tool calling a été conservée dans les modèles actuels du réseau.
Le réseau Gonka compte plus de 4 000 GPU (H100, H200, A100, RTX 4090 et autres), regroupés en 120+ ML-nodes. C'est l'un des plus grands réseaux GPU distribués pour l'inférence IA au monde — et si cette puissance était autrefois dédiée à Qwen3-235B, elle dessert aujourd'hui les modèles actuels du réseau — Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash.
Est-il possible d'essayer Qwen3-235B maintenant ?
Réponse directe : via le réseau Gonka — non. Qwen3-235B a été retiré du réseau, il n'est donc plus possible de l'appeler via l'identifiant qwen3-235b-a22b par notre Gateway. Comme le modèle est open-source (Apache 2.0), vous pouvez toujours l'exécuter vous-même ou y accéder via des hébergeurs tiers de modèles open-weights — par exemple, via OpenRouter (environ $0.071/$0.100 pour 1M de tokens).
Si vous cherchez l'inférence décentralisée à bas coût qui fait la renommée de Gonka, elle est toujours disponible, fonctionnant désormais sur les modèles actifs du réseau. Via le JoinGonka API Gateway, vous avez accès à Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash via une API compatible OpenAI : tout code écrit pour OpenAI fonctionne sans modification — il suffit de remplacer l'URL, la clé API et le nom du modèle.
Exemple de requête vers un modèle actif :
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Explique l'architecture MoE"}]
}'Coût : $0.0047 pour 1 million de tokens — c'est environ 800 fois moins cher que GPT-5.5 ($5.00/1M) et environ 500 fois moins cher que Claude Sonnet 4.6 ($3.00/1M). Lors de votre inscription, vous recevez 1.5M de tokens gratuits pour vos tests.
La Gateway est compatible avec les outils de développement populaires : le Quick Start décrit la connexion via Python, Node.js et curl. Les intégrations IDE sont également prises en charge — Cursor, Continue, Cline, Aider et Claude Code — ainsi que les frameworks d'agents IA : LangChain, n8n, LibreChat, Open WebUI.
Pour un démarrage rapide :
- Inscrivez-vous sur gate.joingonka.ai (connectez un portefeuille ou créez-en un nouveau)
- Obtenez votre clé API dans le Dashboard
- Remplacez
api.openai.compargate.joingonka.ai/apidans votre code - Indiquez un modèle actuel du réseau —
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7oudeepseek-ai/DeepSeek-V4-Flash-0731(liste complète disponible via l'endpointGET /v1/models)
L'inférence décentralisée de niveau entreprise au prix d'un projet de loisir est toujours là — Qwen3-235B a simplement laissé place aux nouveaux modèles du réseau. Le même rapport qualité-prix est désormais disponible sur Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash.
Vous voulez en savoir plus ?
Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.
Essayer les modèles actuels de Gonka →