Sections de la base de connaissances ▾
Navigation
▸ Commencez ici Par rôlesCatégories
- Cursor + Gonka AI — LLM pas cher pour le codage
- Claude Code + Gonka AI — LLM pour le terminal
- OpenClaw + Gonka AI — Agents IA accessibles
- OpenCode : votre propre modèle dans le terminal
- Continue.dev + Gonka AI — IA pour VS Code/JetBrains
- Cline + Gonka AI — Agent IA dans VS Code
- Aider + Gonka AI — programmation en binôme avec l'IA
- LangChain + Gonka AI — Applications IA pour des centimes
- n8n + Gonka AI — Automatisation avec IA pas chère
- Open WebUI + Gonka AI — Votre propre ChatGPT
- LibreChat + Gonka AI — ChatGPT open-source
- Hermes Agent + DeepSeek sur le réseau Gonka : un agent autonome à petit prix
- Kilo Code + Gonka AI — Agent IA dans VS Code
- Roo Code + Gonka AI — Agent IA autonome dans VS Code
- LlamaIndex + Gonka AI — Applications RAG pour une bouchée de pain
- PydanticAI + Gonka — Agents IA typés pour une bouchée de pain
- Vercel AI SDK + Gonka AI — Applications IA en TypeScript pour une bouchée de pain
- TanStack AI + Gonka — Applications IA en TypeScript pour une bouchée de pain
- API démarrage rapide — curl, Python, TypeScript
- JoinGonka Gateway — présentation complète
- Management Keys — SaaS sur Gonka
- L'API AI la moins chère : comparaison des fournisseurs 2026
- Comment acheter des tokens AI et une clé API : 3 méthodes en 2026
- Limite de requêtes Cursor Pro atteinte — analyse et alternative économique
- Claude Code moins cher — analyse de facture et changement
- Cline brûle votre argent — pourquoi l'agent consomme autant
- OpenClaw coûte cher — pourquoi l'agent consomme des tokens et comment économiser
- OpenRouter : une alternative bon marché — comparaison avec JoinGonka Gateway
- Meilleur modèle AI pour le codage en 2026 : comparaison et tarifs
- Alternative bon marché à GitHub Copilot sans limites
- Alternative bon marché à Windsurf sans crédits ni limites
- L'API la moins chère pour les agents AI en 2026
- ZCode : inférence GLM abordable au lieu du GLM Coding Plan
- JetBrains IDE + JoinGonka Gateway — votre endpoint au lieu des crédits
- GitHub Copilot BYOK — vos modèles plutôt que vos quotas
- Zed + JoinGonka Gateway — inférence bon marché dans l'éditeur
- Pi + JoinGonka Gateway — agent de terminal sur inférence à bas prix
- Codex CLI : utilisez votre propre clé plutôt qu'un abonnement
- DeepSeek Harness : votre propre fournisseur via JoinGonka Gateway
- MiniMax Code : agent MiniMax avec votre clé via Gonka
- Warp + JoinGonka Gateway — agent de terminal sur votre propre endpoint
- Trae + JoinGonka Gateway — modèles du réseau Gonka dans AI-IDE
- Cherry Studio + JoinGonka Gateway — client AI de bureau
- omp (Oh My Pi) + JoinGonka Gateway : agent avec rôles de modèles
- OpenHands + JoinGonka Gateway : agent sur votre propre endpoint
- Qwen Code après la fermeture de qwen-oauth : fonctionnement via JoinGonka Gateway
- Goose + JoinGonka Gateway : votre propre fournisseur et clé dans le trousseau
- Crush + JoinGonka Gateway : agent Charm sur les modèles du réseau Gonka
- Zoo Code + JoinGonka Gateway : migrer de Roo Code vers les modèles Gonka
- Kimi Code CLI : agent Moonshot AI sur votre clé via Gonka
- Factory Droid + JoinGonka Gateway : BYOK sur les modèles du réseau Gonka
- MiMo Code + JoinGonka Gateway : agent Xiaomi sur les modèles du réseau Gonka
Outils
ZCode : inférence GLM abordable au lieu du GLM Coding Plan
En juin 2026, Z.ai a publié ZCode 3.0 — un environnement de développement agentique de bureau, que l'entreprise elle-même qualifie de « Official Harness for GLM-5.2 ». Le produit a rapidement suscité l'attention : moteur agentique propriétaire, tâches autonomes via /goal, mode multi-agent et gestion de session à distance directement depuis Telegram. Mais avec la vague d'avis est arrivée une vague de questions des premiers abonnés au GLM Coding Plan : le quota est calculé en « prompts » sur des fenêtres de cinq heures, aux heures de pointe la consommation est multipliée par trois, sur les plans inférieurs — une seule requête parallèle, et sur Hacker News, les utilisateurs se plaignent de blocages soudains après une grosse journée de travail.
La bonne nouvelle : ZCode supporte officiellement le custom provider — il est possible d'y connecter n'importe quelle API compatible OpenAI ou Anthropic et de payer pour les jetons réels, au lieu de payer des quotas d'abonnement. Dans ce guide, nous examinerons ce qu'est ZCode et comment fonctionne le GLM Coding Plan, puis nous configurerons étape par étape ZCode sur JoinGonka Gateway — la passerelle du réseau décentralisé Gonka, qui dessert GLM-5.3 Flash — le modèle de raisonnement open-weight de Z.ai lui-même. Résultat : le même outil, les mêmes modèles open-weight, mais une économie basée sur les jetons et nettement moins chère que les API centralisées.
Qu'est-ce que ZCode : environnement de développement agentique par Z.ai
ZCode n'est pas un « éditeur avec une barre latérale de chat », mais un ADE : vous décrivez un objectif, l'agent construit un plan, modifie les fichiers, lance des tests et itère jusqu'au résultat. Fonctionne comme une application de bureau sur macOS et Windows (build pour Linux — en statut bêta).
Fonctionnalités clés de la version 3.0 :
- ZCode Agent — moteur agentique propriétaire avec une intégration profonde de GLM-5.2 ; en plus de celui-ci, vous pouvez connecter des agents tiers (Claude Code, Codex, Gemini CLI et autres) ;
- Mode Goal (
/goal) — tâches autonomes longues : plan → exécution → vérification par étapes ; - Multi-agent — travail parallèle de plusieurs agents sur le projet ;
- Gestion à distance — lancement et contrôle de sessions depuis Telegram, WeChat et Feishu : l'agent travaille sur votre machine et vous répondez aux questions depuis votre téléphone.
Le client lui-même est gratuit, Z.ai offre aux nouveaux utilisateurs un quota quotidien de jetons GLM-5.2 pour découvrir l'outil. Ensuite, soit l'abonnement GLM Coding Plan, soit votre propre clé API. Et c'est ici qu'il faut entrer dans les détails, car le modèle d'abonnement est la partie la plus discutée du produit.
GLM Coding Plan : prix, limites et quotas
GLM Coding Plan est l'abonnement de Z.ai donnant accès aux modèles GLM dans ZCode et une vingtaine d'outils tiers. À la date de publication (juillet 2026), la grille de base ressemble à ceci — mais les prix et les promos évoluent, vérifiez sur la page live z.ai/subscribe :
| Formule | Prix, $/mois | Quota | Requêtes parallèles |
|---|---|---|---|
| Lite | $18 (en promo — à partir d'environ $12.6) | « Prompts » par fenêtres de 5 heures + plafond hebdomadaire | 1 |
| Pro | $72 | ×4 par rapport à Lite | 1 |
| Max | $160 | ×16 par rapport à Lite | jusqu'à 30 |
Ce dont se plaignent les abonnés (fils Hacker News et GitHub) :
- Multiplicateur en heures de pointe. Aux heures de pointe (14:00—18:00 UTC+8 — le soir en Asie, le matin et la journée en Europe), chaque requête décompte le quota avec un coefficient ×3, hors pointe ×2. Il faut donc planifier sa consommation selon le fuseau de Pékin.
- Un quota en « prompts », pas en tokens. Combien de tokens il reste exactement, c'est opaque ; on lit dans les fils des histoires du type « j'ai consommé ~17M tokens sur GLM — et j'ai été bloqué quatre jours ».
- Une seule requête parallèle sur Lite et Pro. Pour un environnement agentique, c'est sensible : le mode multi-agent de ZCode lui-même et tout sous-agent parallèle finissent en file d'attente.
- GLM-5.2 consomme le quota plus vite que les modèles plus modestes — le flagship brûle la limite avec son propre multiplicateur.
La conclusion est simple : pour un développement solo tranquille, l'abonnement fonctionne honnêtement. Mais plus votre usage est « agentique » — tâches parallèles, longues sessions autonomes, exécutions nocturnes — plus le modèle à quota ressemble à une loterie. L'alternative : payer les tokens réellement consommés, sans fenêtres, multiplicateurs ni files d'attente — ce que l'agent dépense est ce qui est débité. C'est exactement le modèle qu'offre le mécanisme custom provider intégré à ZCode, et il se configure en cinq minutes.
BYOK dans ZCode : votre clé API et custom provider
ZCode intègre officiellement la prise en charge du BYOK : la documentation autorise explicitement l'ajout de « tout service compatible avec les protocoles OpenAI ou Anthropic » — API publiques, canaux d'entreprise et même installations self-hosted. La configuration se fait par trois voies :
- le bouton Connect sur l'écran d'accueil → « Set Your API Key » ;
- Manage Models dans le sélecteur de modèle ;
- la roue crantée → Settings → Model Settings → Add Provider.
On renseigne pour le fournisseur l'OpenAI Base URL et/ou l'Anthropic Base URL, plus la API Key — ZCode récupérera lui-même la liste des modèles disponibles.
Trois pièges sur lesquels on trébuche le plus souvent :
- Les endpoints Z.ai sont différents. L'abonnement Coding Plan ne fonctionne que via le coding-endpoint
https://api.z.ai/api/coding/paas/v4; le endpoint général/api/paas/v4avec une clé d'abonnement renverra une erreur — la cause classique du « j'ai un 401/429 alors que mon plan est payé ». - « Ça marche dans Claude Code ≠ ça marche dans ZCode ». Les variables d'environnement comme
ANTHROPIC_BASE_URL, utilisées pour configurer Claude Code, ne sont pas lues par ZCode : il possède son propre stockage de configuration des fournisseurs. Configurez donc via Settings. - « Le modèle apparaît dans le sélecteur ≠ la clé a un quota ». La liste des modèles est récupérée depuis l'API du fournisseur, mais la disponibilité dépend du solde et des limites de la clé concernée.
Passons à la pratique : connectons la passerelle JoinGonka à ZCode et obtenons la stack GLM contre des tokens.
Configuration de JoinGonka Gateway dans ZCode : GLM contre des jetons
JoinGonka Gateway — une passerelle vers le réseau décentralisé Gonka avec deux protocoles natifs : /v1/chat/completions compatible OpenAI et /v1/messages Anthropic. Économie basée sur le pay-per-token : pas de fenêtres de 5 heures, pas de multiplicateurs de pointe ×3, ni de limite à une seule requête parallèle ; la consommation est visible en temps réel sur le tableau de bord, et la passerelle ne stocke pas le contenu des invites.
Étape par étape (interface Custom Provider actuelle) :
| Étape | Action |
|---|---|
| 1. Clé | Inscrivez-vous — gate.joingonka.ai/register (1.5M de jetons gratuits pour les nouveaux comptes avec 3M), créez une clé API dans la section Keys. Plus de détails dans API Quick Start. |
| 2. Fournisseur | ZCode → Settings → Model Settings → Add Provider. Nom : JoinGonka |
| 3. Base URL | https://gate.joingonka.ai/v1 |
| 4. Clé API | votre clé du type jg-… |
| 5. Format API | Chat completions (/chat/completions) |
| 6. Modèle | Add Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, fenêtre contextuelle 380000. On ajoute de la même manière MiniMaxAI/MiniMax-M2.7 et zai-org/GLM-5.3-Flash — le modèle de raisonnement de Z.ai ; la liste actuelle et les limites se trouvent via GET /v1/models. |
Dans les anciennes versions de ZCode, il y a deux champs séparés : OpenAI Base URL (https://gate.joingonka.ai/v1) et Anthropic Base URL (https://gate.joingonka.ai — le chemin sera ajouté automatiquement par le client).
Vérification : sélectionnez le modèle créé et posez n'importe quelle question à l'agent. Si la réponse arrive, tout fonctionne ; en cas d'erreur 401, vérifiez la clé, et pour 402, le solde du compte. Si une erreur « Model request failed » apparaît sur DeepSeek V4 Flash avec un Thought Level sur Max, passez le Thought Level sur High et relancez la requête.
Astuce. La commande npx @joingonka/setup --tool zcode affichera les valeurs prêtes à l'emploi pour ces champs — base URL, clé, ID du modèle et ses limites réelles (fenêtre de contexte et plafond de réponse) — et vérifiera via une requête en direct que la passerelle les accepte. ZCode ne peut être configuré que via l'interface utilisateur — il n'existe pas de fichier pouvant être modifié en toute sécurité, les valeurs doivent donc être insérées manuellement.
Comparaison des prix : Coding Plan, Z.ai API, OpenRouter et Gonka
Combien coûte l'inférence GLM sur différents canaux (prix pour 1M de tokens ; prix des concurrents fixés en septembre 2026, le prix JoinGonka est récupéré en direct depuis l'API de la passerelle) :
| Canal | Entrée, $/1M | Sortie, $/1M | Modèle de paiement |
|---|---|---|---|
| Z.ai API (GLM-5.2) | 1.40 $ (entrée mise en cache — 0.26 $) | 4.40 $ | au token |
| GLM Coding Plan | 18—160 $/mois | abonnement : quotas par « prompts », multiplicateur ×3 en pic, limites de parallélisme | |
| OpenRouter (z-ai/glm-5.2) | 1.40 $ | 4.40 $ | au token |
| OpenRouter (z-ai/glm-5.3-flash) | 0.09 $ | 0.30 $ | au token |
| JoinGonka Gateway | $0.0069 | $0.021 | au token, réseau Gonka |
La différence de deux ou trois ordres de grandeur n'est pas un arrondi marketing, mais une économie différente : les calculs sont effectués par les participants du réseau décentralisé, qui gagnent de l'argent sur le travail lui-même et non sur la marge d'un centre de données. Une analyse détaillée du fonctionnement et des limites d'application est disponible dans l'article sur l'API AI la moins chère.
La ligne JoinGonka indique le prix de GLM-5.3 Flash sur le réseau Gonka : tous les modèles du réseau ont un tarif unique. Les chiffres sur cette page sont mis à jour automatiquement, aucun calcul manuel n'est nécessaire.
GLM sur le réseau Gonka : GLM-5.3 Flash et FAQ
Le réseau Gonka dessert le modèle Z.ai : zai-org/GLM-5.3-Flash adopté par la proposition de gouvernance #101 et délivré par la passerelle au même titre que MiniMax M2.7 et DeepSeek V4 Flash. Le fleuron GLM-5.2, mentionné dans les premières versions de ce guide, n'a finalement pas été intégré à la production — le réseau a opté pour un modèle plus léger et plus rapide de la même gamme. L'URL de base et la clé restent identiques : dans ZCode, il suffit d'ajouter le modèle en tant que custom provider.
À propos du modèle : poids ouverts sous licence MIT, architecture MoE à 320B de paramètres (18B actifs par jeton), attention hybride parcimonieuse et linéaire. Sa particularité principale est d'être un modèle de raisonnement : avant de répondre, il réfléchit, et ce raisonnement occupe plusieurs centaines de jetons même pour une question simple. Pour ZCode, cela signifie deux choses : ne sous-estimez pas la limite de longueur de réponse du modèle (à partir de 600 jetons même pour des répliques courtes) et pour des modifications rapides, réduisez le Thought Level — au niveau de l'API, c'est reasoning_effort: low. Analyse détaillée du modèle et de ses limites dans l'article GLM-5.3 Flash sur le réseau Gonka.
Questions fréquentes :
- Pourquoi y a-t-il parfois des erreurs 429 ou des files d'attente sur le nouveau modèle ? — Le modèle est actuellement desservi par une petite partie des hôtes du réseau ; aux heures de pointe, les requêtes peuvent attendre un slot libre. Réessayez dans quelques secondes — l'équilibreur de charge trouvera un nœud disponible. État actuel sur la page de statut de la passerelle.
- Qu'est-ce qui est disponible d'autre ? — Outre GLM-5.3 Flash, MiniMax M2.7 et DeepSeek V4 Flash sont disponibles : les trois modèles fonctionnent dans ZCode via le même custom provider, la configuration de ce guide est parfaitement opérationnelle.
- Qu'en est-il de la confidentialité ? — La passerelle ne stocke pas le contenu des prompts et des réponses ; seules les statistiques de consommation agrégées sont conservées.
- Quand le Coding Plan est-il plus avantageux ? — Si vous travaillez seul, que vous respectez le quota Lite et que vous ne lancez pas d'agents parallèles, un abonnement à prix fixe est pratique et prévisible. Calculez selon votre profil : avec une activité d'agent intense, le paiement au jeton via le réseau est nettement moins cher ; pour de légères modifications de code une fois par jour, la différence peut ne pas être ressentie.
- Est-ce compatible avec d'autres outils ? — Oui : le même endpoint fonctionne dans Claude Code, Cursor, Cline et tout client compatible OpenAI/Anthropic.
Vous voulez en savoir plus ?
Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.
Obtenir des jetons gratuits →