Sections de la base de connaissances ▾
Navigation
▸ Commencez ici Par rôlesCatégories
- Architecture du réseau Gonka : Sprint, Transfer Agents, DiLoCo
- Développeurs : Comment gagner du GNK
- Auto-hébergement : Guide étape par étape
- Choix du GPU pour Gonka : recommandations matérielles
- Qwen3-235B : le modèle précédemment desservi par Gonka
- Kimi K2.6 : modèle anciennement pris en charge par Gonka
- MiniMax M2.7 : modèle du réseau Gonka
- DeepSeek V4 Flash : modèle du réseau Gonka avec un contexte de 380K
- GLM-5.3 Flash : modèle de raisonnement Z.ai sur le réseau Gonka
Technologie
Kimi K2.6 : modèle anciennement pris en charge par Gonka
Pendant longtemps, le réseau Gonka a fonctionné avec un seul modèle — Qwen3-235B d'Alibaba Cloud. En mai 2026, cela a changé : le support multi-modèles via le mécanisme DevShards a été lancé, et Kimi K2.6 de la société chinoise Moonshot AI a été le premier à être intégré. Plus tard, MiniMax M2.7 et DeepSeek V4 Flash s'y sont ajoutés, tandis que Qwen3-235B a été retiré du réseau. En septembre 2026, ce fut au tour de Kimi K2.6 : les hôtes ont cessé de le prendre en charge, et la proposition de gouvernance #101 a officialisé son départ — GLM-5.3 Flash a pris sa place dans le réseau. Aujourd'hui, Gonka prend en charge trois modèles : MiniMax M2.7, DeepSeek V4 Flash et GLM-5.3 Flash. Analysons ce qu'est Kimi K2.6, en quoi il différait de MiniMax M2.7, comment Gonka a techniquement implémenté la multi-modélisation, pourquoi le modèle a quitté le réseau et ce qu'il faut choisir à la place aujourd'hui.
Qu'est-ce que Kimi K2.6 de Moonshot AI
Kimi K2.6 est un grand modèle de langage (LLM) de la série Kimi, développé par la société pékinoise Moonshot AI. Moonshot AI est l'un des laboratoires d'IA leaders en Chine, fondé en 2023 par une équipe de chercheurs dirigée par Yang Zhilin. L'entreprise a levé des fonds auprès d'Alibaba, Tencent et d'autres grands investisseurs, et figure parmi les « tigres de l'IA chinois » — ces entreprises qui donnent le rythme du développement de l'IA en Asie.
La série Kimi est connue depuis 2024. Les premières versions (K1, K1.5) ont immédiatement attiré l'attention par leur fenêtre de contexte exceptionnellement longue — jusqu'à 200 000 tokens par requête, un record à l'époque pour les modèles accessibles au public. Un contexte long signifie concrètement la possibilité d'analyser en une seule requête un livre entier, une base de code de taille moyenne ou un ensemble de documents juridiques. À la sortie de Kimi, cette caractéristique constituait un solide avantage concurrentiel.
La version K2 est apparue en 2025 et a apporté un saut architectural décisif — le passage à MoE (Mixture of Experts). Cette même architecture est à la base de Qwen3-235B et de DeepSeek-R1 — elle est devenue le standard de fait des plus grands modèles de 2025—2026. Le MoE permet de disposer de centaines de milliards de paramètres « au total », mais de n'en activer qu'un sous-ensemble à chaque requête (généralement 5—10 %), ce qui réduit radicalement le coût de calcul de l'inférence à qualité comparable.
K2.6 est la dernière itération de la série K2 au moment de la rédaction de cet article. D'après les déclarations publiques de Moonshot AI, cette version améliore les capacités du modèle en reasoning (raisonnement logique), en génération de code et en appel natif d'outils (tool calling). Tant que le modèle était servi par le réseau Gonka, il était disponible sous l'identifiant moonshotai/Kimi-K2.6 ; aujourd'hui la passerelle n'accepte plus cet identifiant — la liste à jour des modèles est toujours fournie par GET /v1/models.
Comparaison entre Kimi K2.6 et MiniMax M2.7
Les deux modèles représentent des développements phares des plus grands laboratoires d'IA chinois ; tant qu'ils étaient tous deux pris en charge par le réseau, ils étaient accessibles via une interface unique compatible OpenAI, la JoinGonka Gateway — aujourd'hui, de ce duo, seul MiniMax M2.7 est accessible via la passerelle. Cependant, ils ont des points forts et un héritage différents, ce qui fait que le choix entre eux n'est pas une question de « quel est le meilleur », mais de « lequel correspond à la tâche ».
| Caractéristique | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|
| Fabricant | Moonshot AI (Pékin) | MiniMax (Shanghai) |
| Année de fondation de l'entreprise | 2023 | 2021 |
| Architecture | MoE | MoE + attention linéaire |
| Fenêtre de contexte | 200 000 jetons | 200 000 jetons |
| Point fort | Reasoning, contexte long, code generation | Contexte long, attention (linéaire) efficace |
| Prix via JoinGonka | — (modèle retiré du réseau) | $0.0069 par 1M jetons |
| Identifiant API | moonshotai/Kimi-K2.6 | MiniMaxAI/MiniMax-M2.7 |
| Statut dans le réseau Gonka | Pris en charge de mai à septembre 2026, retiré (proposal #101) | Modèle actif (depuis mai 2026, mise à jour v0.2.13) |
Sur les benchmarks de reasoning (MATH-500, GSM8K, AIME), la série Kimi K2 affiche historiquement des résultats dans le groupe supérieur des modèles open-weights, en concurrence avec les modèles DeepSeek-R1 et de type o1. Sur les tâches de génération de code (HumanEval, MBPP), les deux modèles se maintiennent à des niveaux proches. Le point fort de MiniMax M2.7 est l'attention efficace (linéaire) pour des séquences très longues, alors que Kimi est reconnue pour son reasoning puissant et le contexte long de la série Kimi.
Une mise en garde importante concernant les benchmarks en 2026 : l'écart entre les modèles de pointe dans les tests publics s'est réduit à quelques pourcents, et cette différence se situe souvent dans la marge d'erreur statistique des benchmarks eux-mêmes. Pour le travail pratique, ce qui compte n'est pas « qui est 2 % plus élevé dans MMLU », mais la nature des tâches : quel contexte transmettez-vous au modèle, quelle est la complexité des chaînes logiques, avez-vous besoin d'un long historique de dialogue, quelles langues sont utilisées. Par conséquent, le tableau ci-dessus ne classe pas les modèles — il aide à comprendre rapidement pour quel profil de tâches chacun d'eux est optimisé.
Pour le choix pratique aujourd'hui : le créneau de Kimi K2.6 — contexte long (analyse de gros documents, lecture de bases de code volumineuses, longs dialogues avec conservation de l'historique) et tâches de reasoning complexes — est couvert dans la composition actuelle du réseau par deux modèles. Pour le raisonnement, GLM-5.3 Flash est responsable : il réfléchit avant de répondre, et c'est celui-ci qu'il faut choisir pour une logique complexe ; il possède également le contexte le plus long du réseau (390K). Pour les grands prompts sans raisonnement et les sessions d'agents longues — DeepSeek V4 Flash (380K, deuxième contexte le plus long). Si la priorité est le traitement de séquences d'entrée très longues et de données en streaming avec une réponse rapide — MiniMax M2.7 avec son attention efficace. Une bonne stratégie en production n'a pas changé — garder plusieurs modèles du réseau dans son code : un changement rapide via le paramètre model permet de basculer entre eux en fonction de la tâche sans modifier l'architecture de l'application.
DevShards : comment Gonka a lancé le second modèle
Jusqu'au printemps 2026, l'ensemble du réseau Gonka ne servait qu'un seul modèle : Qwen3-235B. D'un point de vue architectural, c'était un choix réfléchi : l'inférence distribuée via DiLoCo impose que tous les participants du réseau conservent le même modèle en mémoire vidéo, faute de quoi il est impossible de garantir que n'importe quel nœud puisse traiter n'importe quelle requête. Le modèle Qwen3-235B complet en format FP8 occupe environ 640 Go de VRAM, ce qui représente déjà en soi un engagement considérable pour chaque ML-node.
Pour passer à un réseau multi-modèles, il fallait un mécanisme permettant d'héberger plusieurs modèles simultanément sans exiger de chaque hôte qu'il les fasse tous tourner. Ce mécanisme, ce sont les DevShards — des shards distincts du réseau, chacun spécialisé dans un modèle. Les nœuds d'un même shard travaillent sur le même modèle, et le routeur du réseau dirige la requête vers le shard disposant du modèle voulu.
L'idée ne sort pas de nulle part : elle a été formalisée dans la Gonka Improvement Proposal #800 « Multi-Model PoC », soumise au vote de la communauté au printemps 2026. La proposition a reçu le soutien des participants et des validateurs du réseau et a été mise en œuvre en avril-mai 2026. Kimi K2.6 est devenu le premier modèle lancé sur un DevShard dédié — autrement dit, une implémentation pilote de la nouvelle approche. L'expérience s'est révélée concluante : MiniMax M2.7, DeepSeek V4 Flash et GLM-5.3 Flash sont ensuite apparus sur leurs propres shards, chacun avec son ensemble d'hôtes et son économie propre. Le même mécanisme fonctionne aussi dans l'autre sens : un modèle que les hôtes cessent de prendre en charge est retiré du réseau par un vote — c'est ainsi que Kimi K2.6 lui-même a quitté le réseau en septembre 2026.
Ce que cela signifie pour les utilisateurs et les développeurs :
- Une seule API, plusieurs modèles. Via JoinGonka Gateway, pas besoin de changer d'endpoint ni de clés : il suffit d'indiquer un autre
modeldans le corps de la requête. Le format compatible OpenAI est intégralement préservé. - Le prix reste le même. Tant que Kimi K2.6 était servi, il était facturé au même tarif que MiniMax M2.7 ; le tarif unique du réseau s'applique aussi aux modèles actuels — $0.0069 pour 1M de tokens via le Gateway. Cette tarification unique est un choix délibéré pour simplifier la migration des utilisateurs entre les modèles.
- La stabilité dépend de la charge du shard. Au stade initial, le shard d'un nouveau modèle compte moins d'hôtes ; en cas de concentration des requêtes, le modèle peut donc temporairement renvoyer
429 too many concurrent requests. C'est une phase normale pour un nouveau modèle : à mesure que l'intérêt grandit, des hôtes rejoignent son shard et les limites augmentent. L'inverse est vrai aussi — si des hôtes quittent le shard, le modèle perd de la capacité ; c'est exactement ainsi que s'est terminée l'histoire de Kimi K2.6 sur le réseau. - Le tool calling est propre à chaque modèle. Pour Kimi K2.6 sur le réseau Gonka, de petits problèmes de sélection automatique des outils (
tool_choice: "auto") ont été constatés au lancement, corrigés plus tard par une mise à jour des nœuds. La leçon reste valable pour tout modèle du réseau : le format d'appel des outils est une propriété du modèle sur un nœud donné, donc pour les scénarios critiques en production, testez au préalable le comportement du modèle choisi sur vos propres requêtes.
Par quoi est-ce remplacé et que choisir maintenant
Réponse directe : Kimi K2.6 n'est plus disponible via le réseau Gonka. Les hôtes ont cessé de la servir début septembre 2026, et la proposition de gouvernance #101 a définitivement retiré le modèle de la liste des modèles du réseau — une requête avec model: "moonshotai/Kimi-K2.6" sera rejetée par la passerelle. Comme les poids du modèle sont ouverts, il reste possible de l'obtenir auprès d'hébergeurs tiers de modèles open-weights (par exemple via OpenRouter) ou de le déployer soi-même.
Si en revanche vous cherchez cet inference décentralisé et bon marché qui attire les utilisateurs vers Gonka, il n'a pas disparu — il tourne simplement sur les modèles actifs du réseau. Via la JoinGonka API Gateway, avec une API compatible OpenAI et Anthropic, trois modèles sont disponibles, et chacun couvre une partie de ce qui faisait apprécier Kimi :
- GLM-5.3 Flash (
zai-org/GLM-5.3-Flash) — le modèle de reasoning de Z.ai : il raisonne avant de répondre, ce qui en fait le choix à privilégier pour la logique complexe, l'analyse de code et les tâches de « réflexion » ; il offre aussi le plus long contexte du réseau (390K). Les raisonnements sont comptés dans la limite de réponse — prévoyez unmax_tokensconfortable et activez le stream. - DeepSeek V4 Flash (
deepseek-ai/DeepSeek-V4-Flash-0731) — l'un des plus longs contextes du réseau (380K), la sortie la plus longue et un codage agentique solide : gros dépôts, longues chaînes d'appels d'outils. - MiniMax M2.7 (
MiniMaxAI/MiniMax-M2.7) — le modèle par défaut de la passerelle : réponses rapides et régulières sur les tâches du quotidien, longs documents et traitement en flux.
Migrer depuis Kimi K2.6, c'est remplacer une seule ligne. Tout code écrit pour OpenAI fonctionne sans modification : il suffit de changer l'URL, la clé API et le nom du modèle.
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMaxAI/MiniMax-M2.7",
"messages": [{"role": "user", "content": "Explain the difference between MoE and dense models"}]
}'Dans les outils de développement, la règle est la même : partout où la configuration contenait moonshotai/Kimi-K2.6, remplacez par l'identifiant de l'un des modèles actifs. Dans Cursor, c'est le champ Custom Model ; dans Claude Code, la variable d'environnement ANTHROPIC_MODEL ou le flag --model ; dans OpenClaw, Cline et Continue.dev, le nom du modèle dans la config du provider ; dans LangChain et n8n, le paramètre model à l'initialisation du client. L'installateur npx @joingonka/setup inscrit la passerelle et le modèle à jour dans la config de l'outil en une seule commande. La liste des modèles disponibles est toujours à jour sur l'endpoint GET /v1/models — pratique pour la récupérer dynamiquement dans l'UI de votre application, afin qu'un départ ou une arrivée de modèle sur le réseau ne casse pas votre produit.
Pour essayer sans inscription, un chat gratuit est disponible sur la page /try — les modèles actifs du réseau y sont accessibles. En vous inscrivant sur JoinGonka Gateway, vous recevez 3M tokens gratuits pour tester tous les modèles du réseau — de quoi faire tourner vos tâches sur chacun des trois et choisir votre remplacement en connaissance de cause.
Ce que l'histoire de Kimi K2.6 a montré pour le réseau Gonka : le mécanisme DevShards a fonctionné dans les deux sens. Il a permis d'ajouter des modèles sans interrompre le réseau — après Kimi sont venus MiniMax M2.7, DeepSeek V4 Flash et GLM-5.3 Flash — et il a permis de retirer sans douleur un modèle que les hôtes ne supportaient plus. Un réseau lié à un seul modèle est fondamentalement fragile ; un réseau capable de faire évoluer sa composition par vote évolue en douceur et en continu. Pour le développeur, la règle est simple : ne pas « choisir un modèle pour toujours », mais garder le nom du modèle dans la configuration et vérifier la liste en direct.
Vous voulez en savoir plus ?
Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.
Essayer les modèles actuels de Gonka →