Sections de la base de connaissances ▾

Technologie

Qwen3-235B : le modèle précédemment desservi par Gonka

Le réseau Gonka ne se contente pas de louer des GPU — il dessert des modèles IA pour l'inférence. Pendant longtemps, le modèle principal et unique du réseau était Qwen3-235B-A22B-Instruct, développé par Alibaba Cloud. Avec le temps, le réseau est passé à une architecture multi-modèle, et Qwen3-235B a été retiré du réseau : aujourd'hui, Gonka dessert Kimi K2.6 de Moonshot AI et MiniMax M2.7. Voyons ce qu'est Qwen3-235B, quel rôle il a joué dans le réseau Gonka et par quoi il a été remplacé — en tant que modèle MoE open-source notable, il reste une référence utile.

Qu'est-ce que Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 est un grand modèle linguistique (LLM) de la famille Qwen3, développé par l'équipe Qwen d'Alibaba Cloud. Le nom complet se décompose comme suit : Qwen3 — troisième génération de la série, 235B — 235 milliards de paramètres au total, A22B — 22 milliards de paramètres actifs par requête, Instruct — version entraînée pour suivre des instructions, 2507 — sortie de juillet 2025, FP8 — quantification 8 bits pour l'optimisation de la mémoire.

La principale caractéristique architecturale est MoE (Mixture of Experts). Contrairement aux modèles « denses » (GPT-5.5, Claude Sonnet 4.6), où chaque token passe par tous les paramètres, un modèle MoE n'active pour chaque requête qu'un sous-ensemble d'« experts » — des blocs spécialisés du réseau neuronal. Dans le cas de Qwen3-235B, sur 235 milliards de paramètres, seulement 22 milliards sont activés par token — moins de 10 %. Cela offre une qualité au niveau des modèles de plus de 200 milliards de paramètres avec les coûts de calcul d'un modèle de 22 milliards.

En pratique, cela signifie que le modèle est plus intelligent qu'on ne pourrait s'y attendre compte tenu de sa vitesse. Il traite les requêtes nettement plus vite que les modèles denses de qualité comparable, tout en nécessitant beaucoup moins de VRAM pour l'inférence. C'est pourquoi MoE est devenue l'architecture dominante pour les plus grands modèles de 2025-2026.

La fenêtre contextuelle de Qwen3-235B est de 131 072 tokens (~100 000 mots) — cela suffit pour analyser des livres entiers, des bases de code ou de longs documents juridiques en une seule requête. Le modèle prend en charge 119 langues, dont le russe, l'anglais, le chinois, l'arabe, l'hindi et des dizaines d'autres — ce qui en fait l'un des modèles les plus multilingues du marché.

Caractéristiques et benchmarks

Qwen3-235B est en concurrence avec les plus grands modèles fermés et ouverts. Voici une comparaison des caractéristiques clés :

ModèleParamètresContexteMoEOpen SourcePrix (pour 1M de tokens)
Qwen3-235B (Alibaba)235B (22B actifs)131KOuiOui (Apache 2.0)$0.07+ (hébergement)
GPT-5.5 (OpenAI)~1.8T (estimation)128KOui (supposé)Non$5.00
Claude Sonnet 4.6 (Anthropic)Non divulgué200KNon (supposé)Non$3.00
Llama 4 Maverick (Meta)400B (17B actifs)1MOuiOui (Llama License)$0.20+ (hébergement)
DeepSeek-R1 (DeepSeek)671B (37B actifs)128KOuiOui (MIT)$0.55

Qwen3-235B démontre un niveau de qualité comparable à GPT-5.5 et Claude Sonnet 4.6 sur la plupart des benchmarks, tout en étant un modèle MoE open-weights bien moins coûteux que ses alternatives propriétaires : l'architecture MoE n'active qu'une partie des paramètres par requête, réduisant drastiquement les coûts de calcul. Le réseau Gonka applique aujourd'hui ce même principe d'inference décentralisé et économique à ses modèles actuels — Kimi K2.6 et MiniMax M2.7, accessibles via JoinGonka Gateway à $0.003 pour 1M de tokens (des milliers de fois moins cher que GPT-5.5 et Claude).

Sur les benchmarks MMLU-Pro, HumanEval, MATH-500 et GSM8K, le modèle se classe parmi les trois meilleurs modèles open-source, ne cédant que devant DeepSeek-R1 pour les tâches de raisonnement mathématique (reasoning). Dans les tâches de génération de code, traduction et suivi d'instructions, Qwen3-235B surpasse régulièrement Llama 4 Maverick et est comparable à Claude Sonnet 4.6.

Comment Gonka utilisait Qwen3-235B

Lorsque Qwen3-235B était le modèle principal du réseau, il fonctionnait sur le réseau Gonka de manière distribuée — via le protocole DiLoCo, adapté pour l'inference. Le modèle complet au format FP8 nécessite environ 640 Go de mémoire vidéo (VRAM), ce qui est impossible à loger sur un seul GPU — même un H100 80GB ou H200 141GB ne suffit pas. Le modèle était donc réparti par couches (tensor parallelism + pipeline parallelism) entre plusieurs ML-nodes.

En pratique, Qwen3-235B fonctionnait sur un cluster de 8 à 16 GPU-nodes, chacun avec au moins 40 Go de VRAM. Les Transfer Agents acheminaient la requête vers le cluster approprié, vLLM traitait son segment du modèle sur chaque nœud, et les résultats étaient agrégés et renvoyés à l'utilisateur. L'ensemble du processus prenait des centaines de millisecondes — l'utilisateur ne ressentait jamais que sa requête était traitée par une dizaine de GPU situés aux quatre coins du globe. Le réseau applique aujourd'hui le même principe d'inference distribué aux modèles actifs.

Détail technique important : Gonka utilise vLLM comme moteur de serving. vLLM est un projet open source qui assure une génération de texte haute performance via PagedAttention — un algorithme optimisant l'utilisation de la VRAM lors du traitement parallèle de nombreuses requêtes. Cela permet au réseau de servir des milliers d'utilisateurs simultanés sans dégradation de la qualité.

Le modèle supporte le natively tool calling — l'appel de fonctions et d'outils directement depuis la réponse du modèle. Cette fonctionnalité a été ajoutée à Gonka via la PR #767 avec un seuil de 0.958 pour détecter les appels d'outils. Sur Qwen3-235B, cela permettait aux développeurs de créer des agents IA interagissant avec des API externes, des bases de données et des outils — le tout via une seule requête. Le support du tool calling est conservé dans les modèles actuels du réseau.

Le réseau Gonka compte plus de 4 000 GPU (H100, H200, A100, RTX 4090 et autres), regroupés en 120+ ML-nodes. Il s'agit de l'un des plus grands réseaux GPU distribués pour l'AI inference au monde — et si cette puissance était autrefois dédiée à Qwen3-235B, elle dessert aujourd'hui les modèles actifs du réseau, Kimi K2.6 et MiniMax M2.7.

Est-il possible d'essayer Qwen3-235B maintenant ?

Réponse directe : via le réseau Gonka — non. Qwen3-235B a été retiré du réseau, il est donc impossible de l'appeler via l'identifiant qwen3-235b-a22b par notre Gateway. Puisque le modèle est ouvert (Apache 2.0), vous pouvez toujours le lancer vous-même ou y accéder via des hébergeurs tiers de modèles open-weights — par exemple, via OpenRouter (environ $0.071/$0.100 pour 1M de tokens).

Si vous recherchez cet inference décentralisé et économique pour lequel les utilisateurs viennent chez Gonka, — il existe toujours, mais fonctionne désormais sur les modèles actifs du réseau. Via le JoinGonka API Gateway, Kimi K2.6 et MiniMax M2.7 sont disponibles via une API compatible OpenAI : tout code écrit pour OpenAI fonctionne sans modification — il suffit de remplacer l'URL, la clé API et le nom du modèle.

Exemple de requête vers un modèle actif :

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Explique l'architecture MoE"}]
  }'

Coût : $0.003 pour 1 million de tokens — c'est 1 700 fois moins cher que GPT-5.5 ($5.00/1M) et 1 000 fois moins cher que Claude Sonnet 4.6 ($3.00/1M). Lors de l'inscription, vous obtenez 10 millions de tokens gratuits pour tester.

La Gateway est compatible avec les outils de développement populaires : le Quick Start décrit la connexion via Python, Node.js et curl. Les intégrations IDE sont également supportées — Cursor, Continue, Cline, Aider et Claude Code — ainsi que les frameworks pour agents IA : LangChain, n8n, LibreChat, Open WebUI.

Pour un démarrage rapide :

  1. Inscrivez-vous sur gate.joingonka.ai (connectez votre portefeuille ou créez-en un nouveau)
  2. Obtenez une clé API dans le Dashboard
  3. Remplacez api.openai.com par gate.joingonka.ai/api dans votre code
  4. Indiquez le modèle réseau actuel — moonshotai/Kimi-K2.6 ou MiniMaxAI/MiniMax-M2.7 (liste complète dans l'endpoint GET /v1/models)

L'inference décentralisé de niveau entreprise au prix d'un projet de loisir n'a pas disparu — Qwen3-235B a simplement laissé la place à des modèles plus récents. La même association de prix et de qualité fonctionne désormais sur Kimi K2.6 et MiniMax M2.7.

Qwen3-235B-A22B est un modèle MoE avec 235 milliards de paramètres (22 milliards actifs) d'Alibaba Cloud qui, à ses débuts, était le modèle principal du réseau Gonka pour l'inferenced AI décentralisé. Grâce à son architecture MoE, elle offre une qualité au niveau des meilleurs modèles propriétaires pour un coût de calcul nettement inférieur. Actuellement, Qwen3-235B a été retiré du réseau : les modèles actuels de Gonka sont Kimi K2.6 et MiniMax M2.7, accessibles via JoinGonka Gateway via une API compatible OpenAI pour 0,003 $/1M de tokens. Le Qwen3-235B lui-même reste open-source (Apache 2.0) et est disponible sur des hébergeurs tiers de modèles open-weights.

Vous voulez en savoir plus ?

Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.

Essayer les modèles actuels de Gonka →