Sections de la base de connaissances ▾

Technologie

GLM-5.3 Flash : modèle de raisonnement Z.ai sur le réseau Gonka

En septembre 2026, un nouveau modèle opérationnel est apparu sur le réseau Gonka : GLM-5.3 Flash du laboratoire chinois Z.ai. La proposition de gouvernance #101 concernant son ajout a été votée, les hôtes ont mis à jour les poids et le modèle est devenu disponible via notre passerelle aux côtés de MiniMax M2.7 et DeepSeek V4 Flash. Parallèlement, Kimi K2.6 a quitté le réseau, et le modèle phare GLM-5.2, qui figurait depuis longtemps dans le registre en attente de déploiement, n'a jamais été intégré au service actif — le réseau a opté pour un modèle plus léger de la même gamme.

Le GLM-5.3 Flash se distingue de ses pairs par une caractéristique fondamentale : c'est un modèle de raisonnement. Avant de répondre, il réfléchit — et ces réflexions consomment des jetons, du temps et nécessitent des paramètres de requête corrects. Quiconque lui impose max_tokens: 200 pour « une réponse courte » recevra une réponse vide. Voyons ce qu'est ce modèle, quelles sont ses caractéristiques sur le réseau Gonka, comment fonctionne le budget de réflexion, ce qu'il en est des outils et du JSON, combien cela coûte et quand il est préférable de le choisir par rapport aux deux autres modèles du réseau.

Qu'est-ce que le GLM-5.3 Flash et qui est derrière lui

Z.ai est la marque internationale du laboratoire pékinois Zhipu AI, issu de l'Université Tsinghua. La famille GLM se développe depuis 2023 (ChatGLM), et depuis le GLM-4.5 à l'été 2025, l'entreprise publie les poids de ses modèles phares sous licence MIT, faisant de cette série l'une des plus remarquables au monde en matière de poids ouverts. Les produits propres à Z.ai — l'environnement de développement ZCode et l'abonnement GLM Coding Plan — sont construits autour de ces mêmes modèles.

GLM-5.3 Flash est un modèle léger de la gamme 5.3. « Léger » ici est relatif : il s'agit d'un modèle MoE de 320 milliards de paramètres, dont environ 18 milliards sont activés par jeton. Les poids sont distribués au format FP8, licence MIT. Une particularité architecturale est l'attention hybride : une partie des couches utilise une attention creuse (sparse), l'autre une attention linéaire, ce qui réduit considérablement le coût de la mémoire et du temps pour le contexte long par rapport à l'attention totale classique.

La deuxième propriété définissant le comportement du modèle est le raisonnement intégré. GLM-5.3 Flash est entraîné à réfléchir d'abord, puis à répondre : le processus de raisonnement est séparé de la réponse et transmis au client dans un champ distinct. Le raisonnement s'active et se désactive via le paramètre reasoning_effort, et est complet par défaut. Cela rend le modèle puissant pour les tâches nécessitant une logique complexe — et exigeant en termes de paramètres de requête, comme détaillé ci-dessous.

La différence entre « Flash » et le modèle GLM-5.3 supérieur est clairement visible sur les prix chez le fournisseur : sur OpenRouter, au moment de la publication, Flash coûte 0,09 $ par million de jetons d'entrée et 0,30 $ par million de jetons de sortie, tandis que le modèle supérieur coûte 1,40 $ et 4,40 $. Dans le réseau Gonka, cet échelonnement n'existe pas : tous les modèles du réseau sont fournis à un tarif unique.

Caractéristiques du GLM-5.3 Flash sur le réseau Gonka

Comme pour les autres modèles du réseau, il est important de distinguer les caractéristiques du modèle « sorti de la boîte » des paramètres opérationnels d'un déploiement spécifique : ceux-ci sont définis par la configuration de l'inférence vLLM sur les nœuds GPU du réseau. Les valeurs réelles via notre passerelle :

  • Fenêtre contextuelle : 390 000 jetons. C'est un minimum prouvé par les requêtes, et non un chiffre issu de la fiche technique du modèle : une entrée de 390 013 jetons a été acceptée et traitée, nous avons testé un préremplissage important directement vers les nœuds du réseau. La configuration technique des nœuds permet 400 000, mais nous publions ce qui a été vérifié.
  • Sortie maximale : 8 192 jetons par réponse. Important : cette limite inclut à la fois les jetons de raisonnement et la réponse elle-même. Un modèle qui a réfléchi pendant 3 000 jetons avec une limite de 4 096 ne laissera qu'environ mille jetons pour la réponse.
  • Raisonnement et appel d'outils (tool calling) : le modèle est déployé avec un analyseur de raisonnement et un analyseur d'appels d'outils — le raisonnement arrive dans le champ reasoning_content, et les appels d'outils dans le champ standard tool_calls, comme pour tout modèle compatible OpenAI.
  • Vitesse : dans nos mesures via la passerelle, le premier jeton arrive en environ 0,75 seconde, la génération se fait à une vitesse de 25–44 jetons par seconde selon la charge. Pour un modèle de raisonnement, c'est rapide — mais n'oubliez pas que les premières centaines de jetons seront consacrées au raisonnement, et la réponse visible commencera plus tard.
  • Exigence en VRAM de l'hôte : environ 560 Go par réplique selon les paramètres on-chain du modèle — plus que pour MiniMax M2.7 (320 Go) et DeepSeek V4 Flash (280 Go). Plus le seuil matériel est élevé, moins il y a de nœuds capables de déployer le modèle, ce qui affecte directement sa capacité sur le réseau — voir la section sur les scénarios et les limitations.

Le prix de l'inférence sur le réseau Gonka ne dépend pas du choix du modèle : GLM-5.3 Flash est disponible au même tarif que MiniMax M2.7 et DeepSeek V4 Flash — via le JoinGonka Gateway, cela coûte $0.0069 par million de jetons d'entrée et $0.021 par million de jetons de sortie. Les jetons de raisonnement sont facturés comme des jetons de sortie. L'économie du réseau est un sujet distinct : le prix est déterminé par le calcul du travail informatique, et non par le tarif d'un fournisseur.

Raisonnement et budget de jetons : comment éviter une réponse vide

L'erreur la plus fréquente lors de la première utilisation de GLM-5.3 Flash est la suivante : le développeur envoie une question courte avec le max_tokens: 256 habituel, reçoit finish_reason: "length" et un champ content vide. Rien n'est cassé — le modèle a épuisé toute la limite pour le raisonnement et n'a simplement pas atteint la réponse. Selon nos mesures, même pour une question triviale, le raisonnement prend 250–450 jetons, et des milliers pour une tâche complexe.

Trois règles pratiques :

ParamètreRecommandationPourquoi
max_tokensPas moins de 600 même pour des réponses courtes ; à partir de 2000 pour des tâches réellesLa limite est partagée entre le raisonnement et la réponse ; le raisonnement consomme les premières centaines de jetons
streamtrue partout où c'est possibleLe raisonnement et la réponse arrivent au fur et à mesure de la génération : le progrès est visible, pas d'attente d'« écran vide », et les réponses longues ne dépassent pas les délais d'attente du proxy
reasoning_effortlow lorsque le raisonnement n'est pas nécessaire ; ne pas spécifier lorsqu'il est nécessaireL'interrupteur est binaire : low désactive le raisonnement, toute autre valeur le laisse complet. La passerelle convertit none et minimal en low, et supprime medium, high, xhigh et max comme superflus. La passerelle ignore les champs enable_thinking, chat_template_kwargs, reasoning.enabled et thinking.type

Exemple de requête pour une tâche courte — avec un raisonnement limité et une limite suffisante :

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-votre-clé" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "reasoning_effort": "low",
    "max_tokens": 800,
    "messages": [{"role": "user", "content": "Nommez la capitale de l'Australie en un mot"}]
  }'

Dans la réponse, le raisonnement se trouve dans message.reasoning_content, et la réponse elle-même dans message.content ; en flux (stream), ils arrivent via des deltas séparés. La plupart des clients compatibles OpenAI ignorent silencieusement le champ inconnu, donc le raisonnement ne « fuit » pas dans le texte de réponse — mais ils sont inclus dans completion_tokens et facturés comme jetons de sortie. Si le raisonnement n'est pas nécessaire du tout, GLM-5.3 Flash n'est pas le meilleur choix : pour des répliques rapides et courtes, MiniMax M2.7 est plus économique.

Une mise en garde pour les scénarios d'agents : des outils comme Cline ou Cursor fixent souvent eux-mêmes une petite limite de sortie pour les requêtes système — compression de contexte, génération de titre de dialogue. Si une telle requête est envoyée à GLM-5.3 Flash avec une limite de quelques centaines de jetons, elle reviendra vide. Vérifiez le paramètre de limite dans l'outil ou envoyez les requêtes système à un autre modèle du réseau.

Outils, JSON et comparaison avec d'autres modèles du réseau

Les modèles de raisonnement s'entendent parfois mal avec les frameworks d'agents : le raisonnement s'intercale entre les appels d'outils et brise le format. Avec GLM-5.3 Flash, nous avons exécuté le cycle d'agent complet — description des outils, appel, retour de résultat, deuxième tour d'appel — et via le chemin compatible OpenAI, cela fonctionne normalement : les appels arrivent de manière structurée dans tool_calls, les arguments sont valides, et le deuxième tour ne confond pas l'historique. Le mode JSON fonctionne également (response_format: {"type": "json_object"}) — le modèle renvoie un objet valide et le raisonnement reste en dehors de la réponse. La règle de budget s'applique aussi aux agents : limite de sortie avec une marge, sinon l'appel d'outil pourrait être interrompu au milieu.

Comment GLM-5.3 Flash se compare aux deux autres modèles du réseau :

ParamètreGLM-5.3 FlashMiniMax M2.7DeepSeek V4 Flash
Contexte réseau390 000200 000380 000
Sortie par réponse8 1928 19232 768
ArchitectureMoE 320B (~18B actifs), attention hybrideMoE + attention linéaireMoE 284B (~13B actifs)
VRAM par réplique560 Go320 Go280 Go
Point fortLogique complexe, analyse de code, tâches de « réflexion » ; le plus long contexte réseauTâches quotidiennes, réponses courtes rapides, modèle par défautDeuxième contexte réseau le plus long, sortie la plus longue, codage agentique
Prix via Gatewayidentique — $0.0069 entrée / $0.021 sortie par 1M

La conséquence pratique du prix unique est la même qu'auparavant : le modèle est choisi pour la tâche, et non pour le budget. Besoin de réfléchir à une logique complexe — GLM-5.3 Flash ; besoin de lire tout un dépôt — DeepSeek V4 Flash ; besoin d'une réponse rapide et stable — MiniMax M2.7.

Comment utiliser GLM-5.3 Flash via JoinGonka Gateway

Le modèle est disponible via le JoinGonka Gateway via une API compatible OpenAI et Anthropic. Identifiant du modèle : zai-org/GLM-5.3-Flash. Une clé de type jg-… est générée dans l'espace personnel immédiatement après l'inscription ; les nouveaux comptes reçoivent 3M de jetons gratuits — assez pour tester le modèle sur vos tâches et ajuster votre budget de raisonnement.

Appel API direct (format OpenAI, flux activé — mode recommandé pour les modèles de raisonnement) :

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-votre-clé" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "stream": true,
    "max_tokens": 4000,
    "messages": [{"role": "user", "content": "Trouve l'erreur dans cette fonction et explique-la : …"}]
  }'

Dans les outils de développement, le modèle se connecte comme les autres modèles du réseau : base URL https://gate.joingonka.ai/v1, clé jg-… et identifiant du modèle. Les guides pour Cursor, Claude Code, Cline, Continue et d'autres outils sont regroupés dans la section « Outils » ; l'installateur npx @joingonka/setup configurera la passerelle dans le fichier de configuration de l'outil avec une seule commande. Pour les clients utilisant l'API Anthropic Messages, il suffit de définir ANTHROPIC_BASE_URL=https://gate.joingonka.ai.

Vous pouvez essayer sans inscription dans le chat gratuit : sélectionnez GLM-5.3 Flash dans la liste des modèles — les réflexions y sont affichées dans un bloc repliable séparé, ce qui permet de bien voir combien de temps le modèle « réfléchit » avant de répondre.

Quand choisir GLM-5.3 Flash — scénarios et points à considérer

Scénarios forts pour ce modèle :

  • Tâches nécessitant de la réflexion. Analyse d'une logique métier complexe, recherche de bugs non évidents, conception de schémas de données, mathématiques et déductions en plusieurs étapes — c'est pour cela que les modèles de raisonnement existent. Ici, le raisonnement est rentabilisé par la qualité de la réponse.
  • Revue et explication de code. Le modèle décortique le code tiers et justifie ses remarques, et le processus de raisonnement depuis reasoning_content peut être montré à l'utilisateur comme « pourquoi j'ai pris cette décision ».
  • Extraction structurée avec vérification. Le mode JSON combiné au raisonnement donne des résultats plus précis sur des données d'entrée ambiguës qu'une réponse directe sans réflexion.
  • Pipelines d'agents avec rôle de « planificateur ». Dans une chaîne de plusieurs modèles, il est logique de placer GLM-5.3 Flash là où l'on décide « quoi faire », et de laisser les étapes d'exécution rapide à MiniMax M2.7.

Quand un autre modèle du réseau est plus judicieux : pour les réponses courtes et rapides, l'auto-complétion et les requêtes de masse bon marché — MiniMax M2.7 (le raisonnement n'y ajoute que de la latence et des coûts) ; pour les documents et dépôts devant tenir en une seule requête, — DeepSeek V4 Flash avec un contexte de 380K.

À prendre en compte avant de transférer la charge. GLM-5.3 Flash est le modèle le plus récent et le plus exigeant en matériel du réseau, et il est actuellement servi par une petite partie des hôtes. Cela signifie une marge de capacité plus faible que pour MiniMax M2.7 et DeepSeek V4 Flash : pendant les heures de pointe, les requêtes peuvent attendre plus longtemps un emplacement libre ou recevoir une réponse de surcharge, qu'il faudra relancer quelques secondes plus tard. Deuxième limite — le temps : le fournisseur qui délivre actuellement le modèle réseau interrompt une réponse à environ cinq minutes de génération ; à 25–44 jetons par seconde, cela représente environ 7–10 mille jetons, donc il est préférable de diviser les très longues générations en étapes. La composition du réseau change par vote, donc obtenez toujours la liste actuelle des modèles et leurs limites via une requête GET https://gate.joingonka.ai/v1/models en direct, et vérifiez la disponibilité et les latences actuelles sur la page d'état de la passerelle. Grâce au prix unique, l'expérience ne coûte rien : changer de modèle ne prend qu'une ligne dans la requête.

GLM-5.3 Flash est un modèle de raisonnement ouvert de Z.ai (MoE sur 320B paramètres, environ 18B actifs, FP8, licence MIT, attention hybride), ajouté au réseau Gonka par la proposition de gouvernance #101 en septembre 2026. Avant de répondre, le modèle raisonne, et le raisonnement est inclus dans la limite de sortie : définissez max_tokens à partir de 600 même pour des réponses courtes, activez stream et pour les tâches simples désactivez le raisonnement via reasoning_effort: low — toute autre valeur le laisse complet (la passerelle convertit none et minimal en low). Le Tool calling (y compris les tours répétés) et le mode JSON fonctionnent ; le contexte dans le réseau est de 390 000 jetons, sortie jusqu'à 8 192. Le prix est le même que pour MiniMax M2.7 et DeepSeek V4 Flash : via JoinGonka Gateway — $0.0069 par million de jetons d'entrée et $0.021 par million de jetons de sortie. Identifiant : zai-org/GLM-5.3-Flash ; composition actuelle du réseau — GET /v1/models.

Vous voulez en savoir plus ?

Explorez d'autres sections ou commencez à gagner des GNK dès maintenant.

Essayer GLM-5.3 Flash via Gateway →