Sections de la base de connaissances ▾
Navigation
▸ Commencez ici Par rôlesCatégories
- Architecture du réseau Gonka : Sprint, Transfer Agents, DiLoCo
- Développeurs : Comment gagner du GNK
- Auto-hébergement : Guide étape par étape
- Choix du GPU pour Gonka : recommandations matérielles
- Qwen3-235B : le modèle précédemment desservi par Gonka
- Kimi K2.6 : modèle anciennement pris en charge par Gonka
- MiniMax M2.7 : modèle du réseau Gonka
- DeepSeek V4 Flash : modèle du réseau Gonka avec un contexte de 380K
- GLM-5.3 Flash : modèle de raisonnement Z.ai sur le réseau Gonka
Technologie
GLM-5.3 Flash : modèle de raisonnement Z.ai sur le réseau Gonka
En septembre 2026, un nouveau modèle opérationnel est apparu sur le réseau Gonka : GLM-5.3 Flash du laboratoire chinois Z.ai. La proposition de gouvernance #101 concernant son ajout a été votée, les hôtes ont mis à jour les poids et le modèle est devenu disponible via notre passerelle aux côtés de MiniMax M2.7 et DeepSeek V4 Flash. Parallèlement, Kimi K2.6 a quitté le réseau, et le modèle phare GLM-5.2, qui figurait depuis longtemps dans le registre en attente de déploiement, n'a jamais été intégré au service actif — le réseau a opté pour un modèle plus léger de la même gamme.
Le GLM-5.3 Flash se distingue de ses pairs par une caractéristique fondamentale : c'est un modèle de raisonnement. Avant de répondre, il réfléchit — et ces réflexions consomment des jetons, du temps et nécessitent des paramètres de requête corrects. Quiconque lui impose max_tokens: 200 pour « une réponse courte » recevra une réponse vide. Voyons ce qu'est ce modèle, quelles sont ses caractéristiques sur le réseau Gonka, comment fonctionne le budget de réflexion, ce qu'il en est des outils et du JSON, combien cela coûte et quand il est préférable de le choisir par rapport aux deux autres modèles du réseau.
Qu'est-ce que le GLM-5.3 Flash et qui est derrière lui
Z.ai est la marque internationale du laboratoire pékinois Zhipu AI, issu de l'Université Tsinghua. La famille GLM se développe depuis 2023 (ChatGLM), et depuis le GLM-4.5 à l'été 2025, l'entreprise publie les poids de ses modèles phares sous licence MIT, faisant de cette série l'une des plus remarquables au monde en matière de poids ouverts. Les produits propres à Z.ai — l'environnement de développement ZCode et l'abonnement GLM Coding Plan — sont construits autour de ces mêmes modèles.
GLM-5.3 Flash est un modèle léger de la gamme 5.3. « Léger » ici est relatif : il s'agit d'un modèle MoE de 320 milliards de paramètres, dont environ 18 milliards sont activés par jeton. Les poids sont distribués au format FP8, licence MIT. Une particularité architecturale est l'attention hybride : une partie des couches utilise une attention creuse (sparse), l'autre une attention linéaire, ce qui réduit considérablement le coût de la mémoire et du temps pour le contexte long par rapport à l'attention totale classique.
La deuxième propriété définissant le comportement du modèle est le raisonnement intégré. GLM-5.3 Flash est entraîné à réfléchir d'abord, puis à répondre : le processus de raisonnement est séparé de la réponse et transmis au client dans un champ distinct. Le raisonnement s'active et se désactive via le paramètre reasoning_effort, et est complet par défaut. Cela rend le modèle puissant pour les tâches nécessitant une logique complexe — et exigeant en termes de paramètres de requête, comme détaillé ci-dessous.
La différence entre « Flash » et le modèle GLM-5.3 supérieur est clairement visible sur les prix chez le fournisseur : sur OpenRouter, au moment de la publication, Flash coûte 0,09 $ par million de jetons d'entrée et 0,30 $ par million de jetons de sortie, tandis que le modèle supérieur coûte 1,40 $ et 4,40 $. Dans le réseau Gonka, cet échelonnement n'existe pas : tous les modèles du réseau sont fournis à un tarif unique.
Caractéristiques du GLM-5.3 Flash sur le réseau Gonka
Comme pour les autres modèles du réseau, il est important de distinguer les caractéristiques du modèle « sorti de la boîte » des paramètres opérationnels d'un déploiement spécifique : ceux-ci sont définis par la configuration de l'inférence vLLM sur les nœuds GPU du réseau. Les valeurs réelles via notre passerelle :
- Fenêtre contextuelle : 390 000 jetons. C'est un minimum prouvé par les requêtes, et non un chiffre issu de la fiche technique du modèle : une entrée de 390 013 jetons a été acceptée et traitée, nous avons testé un préremplissage important directement vers les nœuds du réseau. La configuration technique des nœuds permet 400 000, mais nous publions ce qui a été vérifié.
- Sortie maximale : 8 192 jetons par réponse. Important : cette limite inclut à la fois les jetons de raisonnement et la réponse elle-même. Un modèle qui a réfléchi pendant 3 000 jetons avec une limite de 4 096 ne laissera qu'environ mille jetons pour la réponse.
- Raisonnement et appel d'outils (tool calling) : le modèle est déployé avec un analyseur de raisonnement et un analyseur d'appels d'outils — le raisonnement arrive dans le champ
reasoning_content, et les appels d'outils dans le champ standardtool_calls, comme pour tout modèle compatible OpenAI. - Vitesse : dans nos mesures via la passerelle, le premier jeton arrive en environ 0,75 seconde, la génération se fait à une vitesse de 25–44 jetons par seconde selon la charge. Pour un modèle de raisonnement, c'est rapide — mais n'oubliez pas que les premières centaines de jetons seront consacrées au raisonnement, et la réponse visible commencera plus tard.
- Exigence en VRAM de l'hôte : environ 560 Go par réplique selon les paramètres on-chain du modèle — plus que pour MiniMax M2.7 (320 Go) et DeepSeek V4 Flash (280 Go). Plus le seuil matériel est élevé, moins il y a de nœuds capables de déployer le modèle, ce qui affecte directement sa capacité sur le réseau — voir la section sur les scénarios et les limitations.
Le prix de l'inférence sur le réseau Gonka ne dépend pas du choix du modèle : GLM-5.3 Flash est disponible au même tarif que MiniMax M2.7 et DeepSeek V4 Flash — via le JoinGonka Gateway, cela coûte $0.0069 par million de jetons d'entrée et $0.021 par million de jetons de sortie. Les jetons de raisonnement sont facturés comme des jetons de sortie. L'économie du réseau est un sujet distinct : le prix est déterminé par le calcul du travail informatique, et non par le tarif d'un fournisseur.
Raisonnement et budget de jetons : comment éviter une réponse vide
L'erreur la plus fréquente lors de la première utilisation de GLM-5.3 Flash est la suivante : le développeur envoie une question courte avec le max_tokens: 256 habituel, reçoit finish_reason: "length" et un champ content vide. Rien n'est cassé — le modèle a épuisé toute la limite pour le raisonnement et n'a simplement pas atteint la réponse. Selon nos mesures, même pour une question triviale, le raisonnement prend 250–450 jetons, et des milliers pour une tâche complexe.
Trois règles pratiques :
| Paramètre | Recommandation | Pourquoi |
|---|---|---|
max_tokens | Pas moins de 600 même pour des réponses courtes ; à partir de 2000 pour des tâches réelles | La limite est partagée entre le raisonnement et la réponse ; le raisonnement consomme les premières centaines de jetons |
stream | true partout où c'est possible | Le raisonnement et la réponse arrivent au fur et à mesure de la génération : le progrès est visible, pas d'attente d'« écran vide », et les réponses longues ne dépassent pas les délais d'attente du proxy |
reasoning_effort | low lorsque le raisonnement n'est pas nécessaire ; ne pas spécifier lorsqu'il est nécessaire | L'interrupteur est binaire : low désactive le raisonnement, toute autre valeur le laisse complet. La passerelle convertit none et minimal en low, et supprime medium, high, xhigh et max comme superflus. La passerelle ignore les champs enable_thinking, chat_template_kwargs, reasoning.enabled et thinking.type |
Exemple de requête pour une tâche courte — avec un raisonnement limité et une limite suffisante :
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-votre-clé" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"reasoning_effort": "low",
"max_tokens": 800,
"messages": [{"role": "user", "content": "Nommez la capitale de l'Australie en un mot"}]
}'Dans la réponse, le raisonnement se trouve dans message.reasoning_content, et la réponse elle-même dans message.content ; en flux (stream), ils arrivent via des deltas séparés. La plupart des clients compatibles OpenAI ignorent silencieusement le champ inconnu, donc le raisonnement ne « fuit » pas dans le texte de réponse — mais ils sont inclus dans completion_tokens et facturés comme jetons de sortie. Si le raisonnement n'est pas nécessaire du tout, GLM-5.3 Flash n'est pas le meilleur choix : pour des répliques rapides et courtes, MiniMax M2.7 est plus économique.
Une mise en garde pour les scénarios d'agents : des outils comme Cline ou Cursor fixent souvent eux-mêmes une petite limite de sortie pour les requêtes système — compression de contexte, génération de titre de dialogue. Si une telle requête est envoyée à GLM-5.3 Flash avec une limite de quelques centaines de jetons, elle reviendra vide. Vérifiez le paramètre de limite dans l'outil ou envoyez les requêtes système à un autre modèle du réseau.
Outils, JSON et comparaison avec d'autres modèles du réseau
Les modèles de raisonnement s'entendent parfois mal avec les frameworks d'agents : le raisonnement s'intercale entre les appels d'outils et brise le format. Avec GLM-5.3 Flash, nous avons exécuté le cycle d'agent complet — description des outils, appel, retour de résultat, deuxième tour d'appel — et via le chemin compatible OpenAI, cela fonctionne normalement : les appels arrivent de manière structurée dans tool_calls, les arguments sont valides, et le deuxième tour ne confond pas l'historique. Le mode JSON fonctionne également (response_format: {"type": "json_object"}) — le modèle renvoie un objet valide et le raisonnement reste en dehors de la réponse. La règle de budget s'applique aussi aux agents : limite de sortie avec une marge, sinon l'appel d'outil pourrait être interrompu au milieu.
Comment GLM-5.3 Flash se compare aux deux autres modèles du réseau :
| Paramètre | GLM-5.3 Flash | MiniMax M2.7 | DeepSeek V4 Flash |
|---|---|---|---|
| Contexte réseau | 390 000 | 200 000 | 380 000 |
| Sortie par réponse | 8 192 | 8 192 | 32 768 |
| Architecture | MoE 320B (~18B actifs), attention hybride | MoE + attention linéaire | MoE 284B (~13B actifs) |
| VRAM par réplique | 560 Go | 320 Go | 280 Go |
| Point fort | Logique complexe, analyse de code, tâches de « réflexion » ; le plus long contexte réseau | Tâches quotidiennes, réponses courtes rapides, modèle par défaut | Deuxième contexte réseau le plus long, sortie la plus longue, codage agentique |
| Prix via Gateway | identique — $0.0069 entrée / $0.021 sortie par 1M | ||
La conséquence pratique du prix unique est la même qu'auparavant : le modèle est choisi pour la tâche, et non pour le budget. Besoin de réfléchir à une logique complexe — GLM-5.3 Flash ; besoin de lire tout un dépôt — DeepSeek V4 Flash ; besoin d'une réponse rapide et stable — MiniMax M2.7.
Comment utiliser GLM-5.3 Flash via JoinGonka Gateway
Le modèle est disponible via le JoinGonka Gateway via une API compatible OpenAI et Anthropic. Identifiant du modèle : zai-org/GLM-5.3-Flash. Une clé de type jg-… est générée dans l'espace personnel immédiatement après l'inscription ; les nouveaux comptes reçoivent 3M de jetons gratuits — assez pour tester le modèle sur vos tâches et ajuster votre budget de raisonnement.
Appel API direct (format OpenAI, flux activé — mode recommandé pour les modèles de raisonnement) :
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-votre-clé" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"stream": true,
"max_tokens": 4000,
"messages": [{"role": "user", "content": "Trouve l'erreur dans cette fonction et explique-la : …"}]
}'Dans les outils de développement, le modèle se connecte comme les autres modèles du réseau : base URL https://gate.joingonka.ai/v1, clé jg-… et identifiant du modèle. Les guides pour Cursor, Claude Code, Cline, Continue et d'autres outils sont regroupés dans la section « Outils » ; l'installateur npx @joingonka/setup configurera la passerelle dans le fichier de configuration de l'outil avec une seule commande. Pour les clients utilisant l'API Anthropic Messages, il suffit de définir ANTHROPIC_BASE_URL=https://gate.joingonka.ai.
Vous pouvez essayer sans inscription dans le chat gratuit : sélectionnez GLM-5.3 Flash dans la liste des modèles — les réflexions y sont affichées dans un bloc repliable séparé, ce qui permet de bien voir combien de temps le modèle « réfléchit » avant de répondre.
Quand choisir GLM-5.3 Flash — scénarios et points à considérer
Scénarios forts pour ce modèle :
- Tâches nécessitant de la réflexion. Analyse d'une logique métier complexe, recherche de bugs non évidents, conception de schémas de données, mathématiques et déductions en plusieurs étapes — c'est pour cela que les modèles de raisonnement existent. Ici, le raisonnement est rentabilisé par la qualité de la réponse.
- Revue et explication de code. Le modèle décortique le code tiers et justifie ses remarques, et le processus de raisonnement depuis
reasoning_contentpeut être montré à l'utilisateur comme « pourquoi j'ai pris cette décision ». - Extraction structurée avec vérification. Le mode JSON combiné au raisonnement donne des résultats plus précis sur des données d'entrée ambiguës qu'une réponse directe sans réflexion.
- Pipelines d'agents avec rôle de « planificateur ». Dans une chaîne de plusieurs modèles, il est logique de placer GLM-5.3 Flash là où l'on décide « quoi faire », et de laisser les étapes d'exécution rapide à MiniMax M2.7.
Quand un autre modèle du réseau est plus judicieux : pour les réponses courtes et rapides, l'auto-complétion et les requêtes de masse bon marché — MiniMax M2.7 (le raisonnement n'y ajoute que de la latence et des coûts) ; pour les documents et dépôts devant tenir en une seule requête, — DeepSeek V4 Flash avec un contexte de 380K.
À prendre en compte avant de transférer la charge. GLM-5.3 Flash est le modèle le plus récent et le plus exigeant en matériel du réseau, et il est actuellement servi par une petite partie des hôtes. Cela signifie une marge de capacité plus faible que pour MiniMax M2.7 et DeepSeek V4 Flash : pendant les heures de pointe, les requêtes peuvent attendre plus longtemps un emplacement libre ou recevoir une réponse de surcharge, qu'il faudra relancer quelques secondes plus tard. Deuxième limite — le temps : le fournisseur qui délivre actuellement le modèle réseau interrompt une réponse à environ cinq minutes de génération ; à 25–44 jetons par seconde, cela représente environ 7–10 mille jetons, donc il est préférable de diviser les très longues générations en étapes. La composition du réseau change par vote, donc obtenez toujours la liste actuelle des modèles et leurs limites via une requête GET https://gate.joingonka.ai/v1/models en direct, et vérifiez la disponibilité et les latences actuelles sur la page d'état de la passerelle. Grâce au prix unique, l'expérience ne coûte rien : changer de modèle ne prend qu'une ligne dans la requête.
Vous voulez en savoir plus ?
Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.
Essayer GLM-5.3 Flash via Gateway →