Sections de la base de connaissances ▾

Navigation

▸ Commencez ici Par rôles

Catégories

Outils 36
Glossaire 12

Outils

ZCode : inférence GLM abordable au lieu du GLM Coding Plan

En juin 2026, Z.ai a lancé ZCode 3.0 — un environnement de développement agentique de bureau, que l'entreprise elle-même qualifie d'« Official Harness for GLM-5.2 ». Le produit a rapidement attiré l'attention : moteur agentique propriétaire, tâches autonomes via /goal, mode multi-agent et gestion de session à distance directement depuis Telegram. Mais avec la vague d'avis est arrivée une vague de questions de la part des premiers abonnés au GLM Coding Plan : le quota est compté en « prompts » sur des fenêtres de cinq heures, aux heures de pointe la consommation est multipliée par trois, sur les petits forfaits il n'y a qu'une seule requête parallèle, et sur Hacker News, les utilisateurs se plaignent de blocages soudains après une journée intense de travail.

La bonne nouvelle : ZCode prend officiellement en charge un custom provider — vous pouvez y connecter n'importe quel API compatible OpenAI ou Anthropic et payer pour les jetons réels, et non pour des quotas d'abonnement. Dans ce guide, nous découvrirons ce qu'est ZCode et comment fonctionne le GLM Coding Plan, puis nous configurerons étape par étape ZCode sur JoinGonka Gateway — la passerelle du réseau décentralisé Gonka, dont le registre inclut déjà GLM-5.2. Résultat : le même outil, les mêmes modèles open-weight, mais économiquement basé sur les jetons et des centaines de fois moins cher que les API centralisées.

Qu'est-ce que ZCode : environnement de développement agentique par Z.ai

ZCode n'est pas un « éditeur avec une barre latérale de chat », mais un ADE : vous décrivez un objectif, l'agent construit un plan, modifie les fichiers, lance des tests et itère jusqu'au résultat. Fonctionne comme une application de bureau sur macOS et Windows (build pour Linux — en statut bêta).

Fonctionnalités clés de la version 3.0 :

  • ZCode Agent — moteur agentique propriétaire avec une intégration profonde de GLM-5.2 ; en plus de celui-ci, vous pouvez connecter des agents tiers (Claude Code, Codex, Gemini CLI et autres) ;
  • Mode Goal (/goal) — tâches autonomes longues : plan → exécution → vérification par étapes ;
  • Multi-agent — travail parallèle de plusieurs agents sur le projet ;
  • Gestion à distance — lancement et contrôle de sessions depuis Telegram, WeChat et Feishu : l'agent travaille sur votre machine et vous répondez aux questions depuis votre téléphone.

Le client lui-même est gratuit, Z.ai offre aux nouveaux utilisateurs un quota quotidien de jetons GLM-5.2 pour découvrir l'outil. Ensuite, soit l'abonnement GLM Coding Plan, soit votre propre clé API. Et c'est ici qu'il faut entrer dans les détails, car le modèle d'abonnement est la partie la plus discutée du produit.

GLM Coding Plan : prix, limites et quotas

GLM Coding Plan est un abonnement Z.ai donnant accès aux modèles GLM dans ZCode et dans deux douzaines d'outils tiers. Au moment de la publication (juillet 2026), la grille de base ressemble à ceci — mais les prix et les promotions changent, vérifiez la page en direct z.ai/subscribe :

ForfaitPrix, $/moisQuotaRequêtes parallèles
Lite$18 (en promo — à partir de ~$12.6)« Prompts » par fenêtres de 5h + plafond hebdomadaire1
Pro$72×4 par rapport au Lite1
Max$160×16 par rapport au Litejusqu'à 30

De quoi se plaignent les abonnés (fils de discussion sur Hacker News et GitHub) :

  • Multiplicateur de pointe. Aux heures de pointe (14:00—18:00 UTC+8 — soirée en Asie, matin/journée en Europe), chaque requête déduit le quota avec un coefficient ×3, hors pointe — ×2. Vous devez planifier votre consommation selon le fuseau horaire de Pékin.
  • Quota en « prompts », pas en jetons. Le nombre exact de jetons restants est opaque ; dans les fils de discussion, on trouve des témoignages comme : « j'ai consommé ~17M de jetons sur GLM — et j'ai été bloqué pendant quatre jours ».
  • Une seule requête parallèle sur Lite et Pro. Pour un environnement agentique, c'est significatif : le mode multi-agent de ZCode lui-même et tout sous-agent parallèle se heurtent à une file d'attente.
  • GLM-5.2 consomme le quota plus rapidement que les modèles plus petits — le fleuron brûle la limite avec son propre multiplicateur.

La conclusion est simple : pour un développement en solo calme, l'abonnement fonctionne honnêtement. Mais plus votre mode est « agentique » — tâches parallèles, longues sessions autonomes, exécutions nocturnes — plus le modèle de quota se transforme en loterie. L'alternative est le paiement à l'usage des jetons réels : sans fenêtres, sans multiplicateurs et sans files d'attente — ce que l'agent a consommé, c'est ce qui est débité. C'est précisément ce modèle que fournit le mécanisme de custom provider intégré dans ZCode, et il se configure en cinq minutes.

BYOK dans ZCode : votre clé API et custom provider

ZCode intègre officiellement le support BYOK : la documentation autorise explicitement l'ajout de « tout service compatible avec les protocoles OpenAI ou Anthropic » — API publiques, canaux d'entreprise et même installations self-hosted. La configuration se fait de trois manières :

  • bouton Connect sur l'écran d'accueil → « Set Your API Key » ;
  • Manage Models dans le sélecteur de modèle ;
  • engrenage → Settings → Model Settings → Add Provider.

Pour le fournisseur, vous devez définir le OpenAI Base URL et/ou le Anthropic Base URL ainsi que la API Key — ZCode récupérera automatiquement la liste des modèles disponibles.

Les trois pièges les plus fréquents :

  • Les endpoints Z.ai diffèrent. Le Coding Plan ne fonctionne qu'à travers le coding-endpoint https://api.z.ai/api/coding/paas/v4 ; le /api/paas/v4 général avec une clé d'abonnement renverra une erreur — la cause classique du « j'ai une erreur 401/429 bien que mon plan soit payé ».
  • « Ça fonctionne dans Claude Code ≠ ça fonctionne dans ZCode ». Les variables d'environnement comme ANTHROPIC_BASE_URL, utilisées pour configurer Claude Code, ne sont pas lues par ZCode : il possède son propre stockage de paramètres pour les fournisseurs. Configurez-les via Settings.
  • « Le modèle est visible dans le sélecteur ≠ la clé a un quota ». La liste des modèles est récupérée depuis l'API du fournisseur, mais la disponibilité dépend du solde et des limites de la clé spécifique.

Passons à la pratique : connectez la passerelle JoinGonka à ZCode et obtenez la stack GLM contre des jetons.

Configuration de JoinGonka Gateway dans ZCode : GLM contre des jetons

JoinGonka Gateway — une passerelle vers le réseau décentralisé Gonka avec deux protocoles natifs : /v1/chat/completions compatible OpenAI et /v1/messages Anthropic. Économie pay-per-token : pas de fenêtres de 5 heures, pas de multiplicateurs de pointe ×3 et pas de limite à une seule requête parallèle ; la consommation est visible dans le tableau de bord en temps réel, la passerelle ne stocke pas le contenu des prompts.

Étape par étape (interface Custom Provider actuelle) :

ÉtapeAction
1. CléInscrivez-vous sur gate.joingonka.ai/register (10M de jetons gratuits pour les nouveaux comptes), créez une clé API dans la section Keys. Plus de détails dans le API Quick Start.
2. ProviderZCode → Settings → Model Settings → Add Provider. Name : JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keyvotre clé du type jg-…
5. API formatChat completions (/chat/completions)
6. ModèleAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. On peut également ajouter moonshotai/Kimi-K2.6 et MiniMaxAI/MiniMax-M2.7 ; la liste actuelle est disponible via GET /v1/models.

Dans les anciennes versions de ZCode, il y a deux champs séparés : OpenAI Base URL (https://gate.joingonka.ai/v1) et Anthropic Base URL (https://gate.joingonka.ai — le chemin est ajouté automatiquement par le client).

Vérification : sélectionnez le modèle créé et posez n'importe quelle question à l'agent. Si la réponse arrive, tout fonctionne ; en cas d'erreur 401, vérifiez la clé, 402, vérifiez le solde du compte. Si une « Model request failed » apparaît sur DeepSeek V4 Flash avec Thought Level Max, passez le Thought Level sur High et relancez la requête.

Astuce : La commande npx @joingonka/setup --tool zcode affichera les valeurs prêtes pour les champs ci-dessous (base URL, clé, ID du modèle avec les limites actuelles) et vérifiera par une requête en direct que la passerelle les accepte. ZCode lui-même ne se configure que via l'interface utilisateur — il n'existe pas de fichier pouvant être modifié en toute sécurité, vous devez donc saisir les valeurs manuellement.

Comparaison des prix : Coding Plan, Z.ai API, OpenRouter et Gonka

Coût de l'inférence GLM sur différents canaux (prix pour 1M de jetons ; les prix des concurrents sont fixés en juillet 2026, le prix de JoinGonka est mis à jour en temps réel sur la page depuis la passerelle API) :

CanalEntrée, $/1MSortie, $/1MModèle de paiement
Z.ai API (GLM-5.2)$1.40 (entrée en cache — $0.26)$4.40par jeton
GLM Coding Plan$18—160/moisabonnement : quotas par « prompts », multiplicateur ×3 en période de pointe, limites de parallélisme
OpenRouter (z-ai/glm-5.2)$0.93$3.00par jeton ; pas d'option gratuite pour GLM-5.2
JoinGonka Gateway$0.0032$0.0097par jeton, réseau Gonka

La différence de deux ou trois ordres de grandeur n'est pas un arrondi marketing, mais une économie différente : les calculs sont effectués par des participants d'un réseau décentralisé qui gagnent de l'argent grâce au travail lui-même et non grâce à la marge d'un centre de données. Une analyse détaillée du fonctionnement et des limites d'applicabilité se trouve dans l'article sur l'API IA la moins chère.

Clause de non-responsabilité honnête concernant GLM-5.2 : le réseau définira le prix exact du modèle au moment de son activation (le tableau ci-dessus indique le prix actuel en direct des modèles du réseau). Les chiffres sur cette page sont mis à jour automatiquement, aucun calcul manuel n'est nécessaire.

GLM-5.2 sur le réseau Gonka : statut et FAQ

Le modèle zai-org/GLM-5.2-FP8 a déjà été ajouté au registre on-chain du réseau Gonka : la configuration définit une fenêtre contextuelle allant jusqu'à 400K jetons, et le modèle lui-même fait partie des modèles lourds (chaque réplique nécessite plus d'un téraoctet de VRAM). Le déploiement est en cours : les nœuds du réseau réchauffent les poids. Dès que les vérifications seront au vert, le modèle apparaîtra automatiquement dans la liste des modèles de la passerelle — l'URL de base et la clé ne changent pas, il suffira de le sélectionner dans ZCode.

À propos du modèle lui-même : poids ouverts sous licence MIT, architecture MoE d'environ 750B paramètres (environ 40B actifs par jeton), fenêtre native allant jusqu'à 1M de jetons. Selon Z.ai, sur SWE-bench Pro, le modèle affiche 62.1 — supérieur à GPT-5.5, et sur FrontierSWE, il accuse un retard d'environ un pour cent par rapport à Claude Opus 4.8. Pour un modèle à poids ouverts, c'est la première ligne dans le codage.

Questions fréquentes :

  • Pourquoi y a-t-il des erreurs 429 juste après l'activation d'un nouveau modèle ? — C'est la phase de déploiement : certains nœuds chargent encore les poids. Répétez la requête quelques secondes plus tard — l'équilibreur de charge trouvera un nœud opérationnel.
  • Qu'est-ce qui est disponible dès aujourd'hui ? — Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash : les trois modèles fonctionnent dans ZCode via le même fournisseur personnalisé, la configuration de ce guide est entièrement fonctionnelle dès maintenant.
  • Qu'en est-il de la confidentialité ? — La passerelle ne stocke pas le contenu des invites et des réponses ; les statistiques ne contiennent que des agrégats de consommation.
  • Quand le plan de codage est-il plus avantageux ? — Si vous travaillez seul, que vous respectez le quota Lite et que vous ne lancez pas d'agents en parallèle, un abonnement avec un tarif fixe est pratique et prévisible. Calculez selon votre profil : pour un travail d'agent actif, le paiement à la consommation via le réseau revient beaucoup moins cher, alors que pour une simple correction de code occasionnelle, la différence peut ne pas être perceptible.
  • Cela fonctionnera-t-il avec d'autres outils ? — Oui : le même point de terminaison fonctionne avec Claude Code, Cursor, Cline et tout client compatible OpenAI/Anthropic.
ZCode 3.0 est un IDE agentique remarquable, mais son abonnement natif GLM Coding Plan est basé sur des quotas : des « prompts » dans des fenêtres de 5 heures, un multiplicateur ×3 pendant les heures de pointe et une seule requête simultanée sur les forfaits d'entrée de gamme. Plus la charge de travail est agentique, plus elle devient coûteuse et imprévisible. Le BYOK officiel résout ce problème : connectez JoinGonka Gateway en tant que custom provider et payez pour les jetons réels aux prix du réseau décentralisé Gonka, des centaines de fois inférieurs à ceux des API centralisées. GLM-5.2 est déjà dans le registre du réseau et apparaîtra automatiquement dans votre sélecteur de modèles, tandis que Kimi K2.6, MiniMax M2.7 et DeepSeek V4 Flash fonctionnent dès aujourd'hui. Commencez avec 10M de jetons gratuits.

Vous voulez en savoir plus ?

Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.

Obtenir 10M de tokens gratuits →