Seções da Base de Conhecimento ▾

Tecnologia

GLM-5.3 Flash: modelo de raciocínio Z.ai na rede Gonka

Em setembro de 2026, um novo modelo operacional apareceu na rede Gonka: o GLM-5.3 Flash do laboratório chinês Z.ai. A proposta de governança #101 para sua adição foi aprovada, os hosts elevaram os pesos e o modelo ficou disponível através do nosso gateway junto com o MiniMax M2.7 e o DeepSeek V4 Flash. Simultaneamente, o Kimi K2.6 saiu da rede, e o carro-chefe GLM-5.2, que figurou por muito tempo no registro aguardando implantação, nunca entrou em operação real — a rede optou por um modelo mais leve da mesma linha.

O GLM-5.3 Flash difere de seus vizinhos na rede por uma propriedade fundamental: é um modelo de raciocínio. Antes de responder, ele raciocina — e esses raciocínios consomem tokens, tempo e exigem configurações de solicitação corretas. Quem definir max_tokens: 200 para uma «resposta curta» receberá uma resposta vazia. Vamos analisar o que é este modelo, quais são suas características especificamente na rede Gonka, como funciona o orçamento de raciocínio, como está a situação com ferramentas e JSON, quanto custa e quando escolher este em vez dos outros dois modelos da rede.

O que é o GLM-5.3 Flash e quem está por trás dele

Z.ai é uma marca internacional do laboratório Zhipu AI de Pequim, que surgiu da Universidade de Tsinghua. A família GLM tem evoluído desde 2023 (ChatGLM), e a partir do GLM-4.5 no verão de 2025, a empresa disponibiliza os pesos dos seus modelos emblemáticos sob licença MIT, tornando esta série uma das mais notáveis no mundo dos pesos abertos. Os produtos próprios da Z.ai, o ambiente de desenvolvimento ZCode e a subscrição GLM Coding Plan, são construídos em torno destes mesmos modelos.

GLM-5.3 Flash é um modelo leve da linha 5.3. «Leve» aqui é relativo: trata-se de um modelo MoE de 320 mil milhões de parâmetros, dos quais cerca de 18 mil milhões são ativados por token. Os pesos são distribuídos em formato FP8 com licença MIT. Uma característica arquitetónica é a atenção híbrida: parte das camadas utiliza atenção dispersa (sparse) e parte atenção linear, o que reduz consideravelmente o custo de memória e tempo em contextos longos em comparação com a atenção completa clássica.

A segunda propriedade que define o comportamento do modelo é o raciocínio integrado. O GLM-5.3 Flash foi treinado para pensar antes de responder: o processo de raciocínio é separado da resposta e entregue ao cliente num campo independente. O raciocínio é ativado e desativado através do parâmetro reasoning_effort, e está completo por defeito. Isto torna o modelo forte em tarefas que exigem decifrar uma lógica complexa, embora também exija ajustes precisos no pedido, como veremos abaixo.

A diferença entre «Flash» e o modelo superior GLM-5.3 é bem visível nos preços do fornecedor: no OpenRouter, no momento da publicação, o Flash custa $0,09 por milhão de tokens de entrada e $0,30 por milhão de saída, enquanto o modelo superior custa $1,40 e $4,40. Na rede Gonka esta escala não existe: todos os modelos da rede são oferecidos sob uma tarifa única.

Características do GLM-5.3 Flash na rede Gonka

Como acontece com outros modelos da rede, é importante distinguir entre as características do modelo «pronto para uso» e os parâmetros operacionais de uma implantação específica: estes são definidos pela configuração de inferência vLLM nos nós GPU da rede. Valores reais através do nosso Gateway:

  • Janela de contexto: 390 000 tokens. Este é o mínimo demonstrado por solicitações, não um número do cartão do modelo: uma entrada de 390 013 tokens foi aceita e processada, e executamos um prefill grande diretamente para os nós da rede. A configuração técnica dos nós permite 400 000, mas publicamos o que foi verificado.
  • Saída máxima: 8 192 tokens por resposta. Importante: este limite inclui tanto os tokens de raciocínio quanto a própria resposta. Um modelo que pensou 3000 tokens com um limite de 4096 deixará cerca de mil para a resposta.
  • Reasoning e tool calling: o modelo está implantado com um parser de raciocínio e um parser de chamada de ferramentas; o raciocínio chega no campo reasoning_content, e as chamadas de ferramentas no campo padrão tool_calls, como em qualquer modelo compatível com OpenAI.
  • Velocidade: em nossas medições através do gateway, o primeiro token chega em aproximadamente 0,75 segundos, e a geração ocorre a uma velocidade de 25–44 tokens por segundo, dependendo da carga. Para um modelo de reasoning, isso é rápido, mas lembre-se de que as primeiras centenas de tokens serão dedicadas ao raciocínio e a resposta visível começará mais tarde.
  • Requisito de VRAM do host: cerca de 560 GB por réplica de acordo com os parâmetros on-chain do modelo; mais do que o MiniMax M2.7 (320 GB) e o DeepSeek V4 Flash (280 GB). Quanto maior o limite de hardware, menos nós são capazes de implantar o modelo, e isso afeta diretamente sua capacidade na rede; sobre isso na seção de cenários e limitações.

O preço da inferência na rede Gonka não depende da escolha do modelo: o GLM-5.3 Flash está disponível na mesma tarifa que o MiniMax M2.7 e o DeepSeek V4 Flash; através do JoinGonka Gateway, isso custa $0.0069 por milhão de tokens de entrada e $0.021 por milhão de tokens de saída. Os tokens de raciocínio são tarifados como tokens de saída. A economia da rede é um assunto à parte: o preço é determinado pelo cálculo do trabalho computacional, não pelo preço do fornecedor.

Raciocínio e orçamento de tokens: como não receber uma resposta vazia

O erro mais frequente ao familiarizar-se com o GLM-5.3 Flash é o seguinte: o programador envia uma pergunta curta com o parâmetro habitual max_tokens: 256, recebe finish_reason: "length" e um campo content vazio. Nada está avariado: o modelo consumiu todo o limite no raciocínio e não chegou à resposta. Segundo as nossas medições, mesmo para uma pergunta trivial, o raciocínio ocupa entre 250 e 450 tokens, e milhares em tarefas complexas.

Três regras práticas:

ConfiguraçãoRecomendaçãoPorquê
max_tokensNão menos de 600 mesmo para respostas curtas; para tarefas reais, a partir de 2000O limite é partilhado entre raciocínio e resposta; o raciocínio consome as primeiras centenas de tokens
streamtrue sempre que possívelO raciocínio e a resposta chegam à medida que são gerados: vê-se o progresso, evita-se a espera por um «ecrã vazio» e as respostas longas não atingem os tempos limite do proxy
reasoning_effortlow quando o raciocínio não é necessário; não indicar nada quando éO interruptor é binário: low desativa o raciocínio, qualquer outro valor deixa-o completo. O gateway traduz none e minimal para low, enquanto medium, high, xhigh e max são removidos por serem redundantes. Os campos enable_thinking, chat_template_kwargs, reasoning.enabled e thinking.type são ignorados pela rede

Exemplo de pedido para uma tarefa curta com raciocínio limitado e limite suficiente:

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-sua-chave" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "reasoning_effort": "low",
    "max_tokens": 800,
    "messages": [{"role": "user", "content": "Nomeie a capital da Austrália com uma única palavra"}]
  }'

Na resposta, o raciocínio reside em message.reasoning_content e a resposta em message.content; no stream chegam como deltas independentes. A maioria dos clientes compatíveis com OpenAI ignora silenciosamente o campo desconhecido, pelo que o raciocínio não se «fuga» para o texto da resposta, mas conta dentro de completion_tokens e é cobrado como tokens de saída. Se o raciocínio não for necessário, o GLM-5.3 Flash não é a melhor opção: para réplicas curtas e rápidas, o MiniMax M2.7 é mais económico.

Advertência importante para cenários de agentes: ferramentas como o Cline ou Cursor costumam definir um limite de saída baixo para pedidos de serviço (compressão de contexto, geração de títulos de diálogo). Se tal pedido for enviado ao GLM-5.3 Flash com um limite de poucas centenas de tokens, voltará vazio. Verifique a configuração de limite na ferramenta ou envie os pedidos de serviço para outro modelo da rede.

Ferramentas, JSON e comparação com outros modelos da rede

Modelos de raciocínio às vezes não se dão bem com frameworks de agentes: o raciocínio se intromete entre as chamadas de ferramentas e quebra o formato. Com o GLM-5.3 Flash, executamos um ciclo de agente completo —descrição de ferramentas, chamada, retorno de resultado, segunda rodada de chamada— e, através do caminho compatível com OpenAI, ele funciona normalmente: as chamadas chegam estruturadas em tool_calls, os argumentos são válidos e a segunda rodada não confunde o histórico. O modo JSON (response_format: {"type": "json_object"}) também funciona — o modelo entrega um objeto válido e o raciocínio permanece fora da resposta. Para agentes, aplica-se a mesma regra de orçamento: limite de saída com margem, caso contrário, a chamada da ferramenta pode ser interrompida no meio.

Como o GLM-5.3 Flash se compara com os outros dois modelos da rede:

ParâmetroGLM-5.3 FlashMiniMax M2.7DeepSeek V4 Flash
Contexto na rede390 000200 000380 000
Saída por resposta8 1928 19232 768
ArquiteturaMoE 320B (~18B ativos), atenção híbridaMoE + atenção linearMoE 284B (~13B ativos)
VRAM por réplica560 GB320 GB280 GB
Ponto forteLógica complexa, análise de código, tarefas de "pensar"; o maior contexto da redeTarefas cotidianas, respostas curtas rápidas, modelo padrãoSegundo maior contexto da rede, maior saída, codificação de agentes
Preço via Gatewayigual — $0.0069 entrada / $0.021 saída por 1M

A consequência prática do preço único é a mesma de antes: o modelo é escolhido pela tarefa, não pelo orçamento. Precisa pensar em lógica complexa — GLM-5.3 Flash; precisa ler um repositório inteiro — DeepSeek V4 Flash; precisa de uma resposta rápida e uniforme — MiniMax M2.7.

Como usar o GLM-5.3 Flash via JoinGonka Gateway

O modelo está disponível através do JoinGonka Gateway via API compatível com OpenAI e Anthropic. Identificador do modelo: zai-org/GLM-5.3-Flash. Uma chave do tipo jg-… é criada no painel de controle logo após o registro; novas contas recebem 3M tokens gratuitos — o suficiente para testar o modelo em suas tarefas e ajustar o orçamento de raciocínio.

Chamada direta da API (formato OpenAI, streaming ativado — modo recomendado para o modelo de reasoning):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-sua-chave" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "stream": true,
    "max_tokens": 4000,
    "messages": [{"role": "user", "content": "Encontre o erro nesta função e explique-o: …"}]
  }'

Em ferramentas de desenvolvimento, o modelo conecta-se da mesma forma que os outros modelos da rede: base URL https://gate.joingonka.ai/v1, chave jg-… e identificador do modelo. Guias para Cursor, Claude Code, Cline, Continue e outras ferramentas estão reunidos na seção «Ferramentas»; o instalador npx @joingonka/setup configurará o gateway no arquivo de configuração da ferramenta com um único comando. Para clientes da Anthropic Messages API, basta definir ANTHROPIC_BASE_URL=https://gate.joingonka.ai.

Você pode testar sem registro no chat gratuito: selecione GLM-5.3 Flash na lista de modelos — o raciocínio é exibido em um bloco recolhível separado, permitindo ver claramente o quanto o modelo «pensa» antes de responder.

Quando escolher o GLM-5.3 Flash — cenários e o que considerar

Cenários sólidos para este modelo:

  • Tarefas onde é necessário pensar. Análise de lógica de negócios complexa, busca de bugs não óbvios, design de esquemas de dados, matemática e deduções de múltiplas etapas — é para isso que os modelos de raciocínio existem. Aqui, o raciocínio compensa pela qualidade da resposta.
  • Revisão e explicação de código. O modelo decompõe código de terceiros e argumenta as observações, e o fluxo de raciocínio de reasoning_content pode ser mostrado ao usuário como o "por que eu decidi isso".
  • Extração estruturada com validação. O modo JSON mais o raciocínio produzem resultados mais precisos em dados de entrada ambíguos do que uma resposta direta sem reflexão.
  • Pipelines de agentes com papel de «planejador». Em uma combinação de vários modelos, é lógico colocar o GLM-5.3 Flash onde se decide "o que fazer" e delegar os passos executivos rápidos para o MiniMax M2.7.

Quando outro modelo de rede é mais razoável: para respostas curtas e rápidas, autocompletar e consultas massivas baratas — MiniMax M2.7 (o raciocínio ali apenas adiciona latência e consumo); para documentos e repositórios que devem caber em uma única consulta completa — DeepSeek V4 Flash com contexto de 380K.

O que considerar antes de transferir a carga. O GLM-5.3 Flash é o modelo de rede mais novo e pesado em termos de hardware, e é atendido atualmente por uma pequena parte dos hosts. Isso significa menos capacidade de reserva do que no MiniMax M2.7 e DeepSeek V4 Flash: em minutos de pico, as solicitações podem esperar mais por um slot livre ou receber uma resposta de sobrecarga que deve ser repetida após alguns segundos. A segunda limitação é o tempo: o provedor que atualmente serve o modelo da rede corta uma resposta aproximadamente no quinto minuto de geração; a 25–44 tokens por segundo, isso equivale a cerca de 7.000–10.000 tokens, então é melhor dividir gerações muito longas em etapas. A composição da rede muda por votação, portanto, sempre obtenha a lista atualizada de modelos e seus limites a partir de um GET https://gate.joingonka.ai/v1/models ao vivo, e a disponibilidade e latência atuais na página de status do gateway. Graças ao preço único, o experimento não custa nada: trocar de modelo é apenas uma linha na solicitação.

GLM-5.3 Flash é um modelo de raciocínio aberto da Z.ai (MoE de 320B parâmetros, cerca de 18B ativos, FP8, licença MIT, atenção híbrida), adicionado à rede Gonka mediante a proposta de governação #101 em setembro de 2026. Antes de responder, o modelo raciocina, e o raciocínio faz parte do limite de saída: configure max_tokens a partir de 600 mesmo para respostas curtas, ative o stream e, para tarefas simples, desative o raciocínio através do reasoning_effort: low — qualquer outro valor deixa-o completo (o gateway traduz none e minimal para low). O Tool calling (incluindo rondas repetidas) e o modo JSON funcionam; o contexto na rede é de 390 000 tokens, saída até 8 192. O preço é o mesmo que para o MiniMax M2.7 e DeepSeek V4 Flash: através do JoinGonka Gateway — $0.0069 por milhão de tokens de entrada e $0.021 por milhão de tokens de saída. Identificador: zai-org/GLM-5.3-Flash; composição atual da rede: GET /v1/models.

Quer saber mais?

Explore outras seções ou comece a ganhar GNK agora mesmo.

Testar o GLM-5.3 Flash via Gateway →