Sections de la base de connaissances ▾

Technologie

Qwen3-235B : le modèle précédemment desservi par Gonka

Le réseau Gonka ne fait pas que louer des GPU — il gère des modèles d'IA pour l'inférence. Pendant longtemps, le modèle principal et unique du réseau était Qwen3-235B-A22B-Instruct, développé par Alibaba Cloud. Avec le temps, le réseau est passé à une architecture multi-modèle et Qwen3-235B a été retiré du réseau : aujourd'hui, Gonka dessert Kimi K2.6 de Moonshot AI, MiniMax M2.7 et DeepSeek V4 Flash. Analysons ce qu'est Qwen3-235B, quel rôle il a joué dans le réseau Gonka et par quoi il a été remplacé — en tant que modèle MoE open-source notable, il reste une référence utile.

Qu'est-ce que Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 est un grand modèle linguistique (LLM) de la famille Qwen3, développé par l'équipe Qwen d'Alibaba Cloud. Le nom complet se décompose comme suit : Qwen3 — troisième génération de la série, 235B — 235 milliards de paramètres au total, A22B — 22 milliards de paramètres actifs par requête, Instruct — version entraînée pour suivre des instructions, 2507 — sortie de juillet 2025, FP8 — quantification 8 bits pour l'optimisation de la mémoire.

La principale caractéristique architecturale est MoE (Mixture of Experts). Contrairement aux modèles « denses » (GPT-5.5, Claude Sonnet 4.6), où chaque token passe par tous les paramètres, un modèle MoE n'active pour chaque requête qu'un sous-ensemble d'« experts » — des blocs spécialisés du réseau neuronal. Dans le cas de Qwen3-235B, sur 235 milliards de paramètres, seulement 22 milliards sont activés par token — moins de 10 %. Cela offre une qualité au niveau des modèles de plus de 200 milliards de paramètres avec les coûts de calcul d'un modèle de 22 milliards.

En pratique, cela signifie que le modèle est plus intelligent qu'on ne pourrait s'y attendre compte tenu de sa vitesse. Il traite les requêtes nettement plus vite que les modèles denses de qualité comparable, tout en nécessitant beaucoup moins de VRAM pour l'inférence. C'est pourquoi MoE est devenue l'architecture dominante pour les plus grands modèles de 2025-2026.

La fenêtre contextuelle de Qwen3-235B est de 131 072 tokens (~100 000 mots) — cela suffit pour analyser des livres entiers, des bases de code ou de longs documents juridiques en une seule requête. Le modèle prend en charge 119 langues, dont le russe, l'anglais, le chinois, l'arabe, l'hindi et des dizaines d'autres — ce qui en fait l'un des modèles les plus multilingues du marché.

Caractéristiques et benchmarks

Qwen3-235B est en concurrence avec les plus grands modèles fermés et ouverts. Voici une comparaison des caractéristiques clés :

ModèleParamètresContexteMoEOpen SourcePrix (par 1M de jetons)
Qwen3-235B (Alibaba)235B (22B actifs)131KOuiOui (Apache 2.0)$0.07+ (hébergement)
GPT-5.5 (OpenAI)~1.8T (estimation)128KOui (supposé)Non$5.00
Claude Sonnet 4.6 (Anthropic)Non divulgué200KNon (supposé)Non$3.00
Llama 4 Maverick (Meta)400B (17B actifs)1MOuiOui (Llama License)$0.20+ (hébergement)
DeepSeek-R1 (DeepSeek)671B (37B actifs)128KOuiOui (MIT)$0.55

Qwen3-235B démontre un niveau de qualité comparable à GPT-5.5 et Claude Sonnet 4.6 sur la plupart des benchmarks, tout en étant un modèle MoE open-weights bien moins coûteux que ses alternatives propriétaires : l'architecture MoE n'active qu'une partie des paramètres par requête, réduisant drastiquement les coûts de calcul. Ce même principe d'inference décentralisé et économique est appliqué par le réseau Gonka à ses modèles actuels — Kimi K2.6 et MiniMax M2.7, disponibles via JoinGonka Gateway à $0.0047 pour 1M de jetons (des centaines à des milliers de fois moins cher que GPT-5.5 et Claude).

Sur les benchmarks MMLU-Pro, HumanEval, MATH-500 et GSM8K, le modèle se classe parmi les trois meilleurs modèles open-source, ne cédant que devant DeepSeek-R1 pour les tâches de raisonnement mathématique. Pour la génération de code, la traduction et le suivi d'instructions, Qwen3-235B surpasse constamment Llama 4 Maverick et est comparable à Claude Sonnet 4.6.

Comment Gonka utilisait Qwen3-235B

Lorsque Qwen3-235B était le modèle principal du réseau, il fonctionnait sur le réseau Gonka de manière distribuée — via le protocole DiLoCo, adapté pour l'inférence. Le modèle complet au format FP8 nécessite environ 640 Go de mémoire vidéo (VRAM), ce qui est impossible à loger sur un seul GPU — même un H100 80GB ou un H200 141GB ne suffisent pas. Par conséquent, le modèle était divisé en couches (parallélisme de tenseurs + parallélisme de pipeline) entre plusieurs ML-nodes.

En pratique, Qwen3-235B fonctionnait sur un cluster de 8 à 16 GPU-nodes, chacun avec un minimum de 40 Go de VRAM. Les Transfer Agents acheminaient la requête vers le cluster approprié, vLLM sur chaque nœud traitait son fragment de modèle, les résultats étaient agrégés et renvoyés à l'utilisateur. Tout le processus prenait des centaines de millisecondes — l'utilisateur ne ressentait pas que sa requête était traitée par une douzaine de GPU aux quatre coins de la planète. Le réseau applique aujourd'hui le même principe d'inférence distribuée aux modèles en activité.

Détail technique important : Gonka utilise vLLM comme moteur de serving. vLLM est un projet open-source qui assure une génération de texte haute performance via PagedAttention — un algorithme optimisant l'utilisation de la mémoire vidéo lors du traitement parallèle de multiples requêtes. Cela permet au réseau de servir des milliers d'utilisateurs simultanés sans dégradation de la qualité.

Le modèle prend en charge le tool calling natif — l'appel de fonctions et d'outils directement à partir de la réponse du modèle. Cette fonctionnalité a été ajoutée à Gonka via la PR #767 avec un seuil de 0,958 pour définir les appels d'outils. Sur Qwen3-235B, cela permettait aux développeurs de construire des agents IA interagissant avec des API externes, des bases de données et des outils — le tout via une seule requête. La prise en charge du tool calling a été conservée dans les modèles actuels du réseau.

Le réseau Gonka compte plus de 4 000 GPU (H100, H200, A100, RTX 4090 et autres), regroupés en 120+ ML-nodes. C'est l'un des plus grands réseaux GPU distribués pour l'inférence IA au monde — et si cette puissance était autrefois dédiée à Qwen3-235B, elle dessert aujourd'hui les modèles actuels du réseau — Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash.

Est-il possible d'essayer Qwen3-235B maintenant ?

Réponse directe : via le réseau Gonka — non. Qwen3-235B a été retiré du réseau, il n'est donc plus possible de l'appeler via l'identifiant qwen3-235b-a22b par notre Gateway. Comme le modèle est open-source (Apache 2.0), vous pouvez toujours l'exécuter vous-même ou y accéder via des hébergeurs tiers de modèles open-weights — par exemple, via OpenRouter (environ $0.071/$0.100 pour 1M de tokens).

Si vous cherchez l'inférence décentralisée à bas coût qui fait la renommée de Gonka, elle est toujours disponible, fonctionnant désormais sur les modèles actifs du réseau. Via le JoinGonka API Gateway, vous avez accès à Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash via une API compatible OpenAI : tout code écrit pour OpenAI fonctionne sans modification — il suffit de remplacer l'URL, la clé API et le nom du modèle.

Exemple de requête vers un modèle actif :

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Explique l'architecture MoE"}]
  }'

Coût : $0.0047 pour 1 million de tokens — c'est environ 800 fois moins cher que GPT-5.5 ($5.00/1M) et environ 500 fois moins cher que Claude Sonnet 4.6 ($3.00/1M). Lors de votre inscription, vous recevez 1.5M de tokens gratuits pour vos tests.

La Gateway est compatible avec les outils de développement populaires : le Quick Start décrit la connexion via Python, Node.js et curl. Les intégrations IDE sont également prises en charge — Cursor, Continue, Cline, Aider et Claude Code — ainsi que les frameworks d'agents IA : LangChain, n8n, LibreChat, Open WebUI.

Pour un démarrage rapide :

  1. Inscrivez-vous sur gate.joingonka.ai (connectez un portefeuille ou créez-en un nouveau)
  2. Obtenez votre clé API dans le Dashboard
  3. Remplacez api.openai.com par gate.joingonka.ai/api dans votre code
  4. Indiquez un modèle actuel du réseau — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 ou deepseek-ai/DeepSeek-V4-Flash-0731 (liste complète disponible via l'endpoint GET /v1/models)

L'inférence décentralisée de niveau entreprise au prix d'un projet de loisir est toujours là — Qwen3-235B a simplement laissé place aux nouveaux modèles du réseau. Le même rapport qualité-prix est désormais disponible sur Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash.

Qwen3-235B-A22B est un modèle MoE avec 235 milliards de paramètres (22 milliards actifs) d'Alibaba Cloud, qui était à un stade précoce le modèle principal du réseau Gonka pour l'inférence IA décentralisée. Grâce à son architecture MoE, il offre une qualité au niveau des meilleurs modèles propriétaires pour un coût de calcul nettement inférieur. Actuellement, Qwen3-235B a été retiré du réseau : les modèles actuels de Gonka sont Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash, accessibles via le JoinGonka Gateway via une API compatible OpenAI pour $0.0047/1M jetons. Qwen3-235B lui-même reste open-source (Apache 2.0) et est disponible sur des hébergeurs tiers de modèles open-weights.

Vous voulez en savoir plus ?

Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.

Essayer les modèles actuels de Gonka →