Seções da Base de Conhecimento ▾
Navegação
▸ Comece aqui Por funçõesCategorias
- Arquitetura da Rede Gonka: Sprint, Agentes de Transferência, DiLoCo
- Desenvolvedores: Como Ganhar GNK
- Auto-hospedagem: Guia passo a passo
- Escolha da GPU para Gonka: recomendações de hardware
- Qwen3-235B: o modelo que a Gonka atendia anteriormente
- Kimi K2.6: modelo anteriormente mantido pela Gonka
- MiniMax M2.7: modelo da rede Gonka
- DeepSeek V4 Flash: modelo da rede Gonka com contexto de 380K
- GLM-5.3 Flash: modelo de raciocínio Z.ai na rede Gonka
Tecnologia
GLM-5.3 Flash: modelo de raciocínio Z.ai na rede Gonka
Em setembro de 2026, um novo modelo operacional apareceu na rede Gonka: o GLM-5.3 Flash do laboratório chinês Z.ai. A proposta de governança #101 para sua adição foi aprovada, os hosts elevaram os pesos e o modelo ficou disponível através do nosso gateway junto com o MiniMax M2.7 e o DeepSeek V4 Flash. Simultaneamente, o Kimi K2.6 saiu da rede, e o carro-chefe GLM-5.2, que figurou por muito tempo no registro aguardando implantação, nunca entrou em operação real — a rede optou por um modelo mais leve da mesma linha.
O GLM-5.3 Flash difere de seus vizinhos na rede por uma propriedade fundamental: é um modelo de raciocínio. Antes de responder, ele raciocina — e esses raciocínios consomem tokens, tempo e exigem configurações de solicitação corretas. Quem definir max_tokens: 200 para uma «resposta curta» receberá uma resposta vazia. Vamos analisar o que é este modelo, quais são suas características especificamente na rede Gonka, como funciona o orçamento de raciocínio, como está a situação com ferramentas e JSON, quanto custa e quando escolher este em vez dos outros dois modelos da rede.
O que é o GLM-5.3 Flash e quem está por trás dele
Z.ai é uma marca internacional do laboratório Zhipu AI de Pequim, que surgiu da Universidade de Tsinghua. A família GLM tem evoluído desde 2023 (ChatGLM), e a partir do GLM-4.5 no verão de 2025, a empresa disponibiliza os pesos dos seus modelos emblemáticos sob licença MIT, tornando esta série uma das mais notáveis no mundo dos pesos abertos. Os produtos próprios da Z.ai, o ambiente de desenvolvimento ZCode e a subscrição GLM Coding Plan, são construídos em torno destes mesmos modelos.
GLM-5.3 Flash é um modelo leve da linha 5.3. «Leve» aqui é relativo: trata-se de um modelo MoE de 320 mil milhões de parâmetros, dos quais cerca de 18 mil milhões são ativados por token. Os pesos são distribuídos em formato FP8 com licença MIT. Uma característica arquitetónica é a atenção híbrida: parte das camadas utiliza atenção dispersa (sparse) e parte atenção linear, o que reduz consideravelmente o custo de memória e tempo em contextos longos em comparação com a atenção completa clássica.
A segunda propriedade que define o comportamento do modelo é o raciocínio integrado. O GLM-5.3 Flash foi treinado para pensar antes de responder: o processo de raciocínio é separado da resposta e entregue ao cliente num campo independente. O raciocínio é ativado e desativado através do parâmetro reasoning_effort, e está completo por defeito. Isto torna o modelo forte em tarefas que exigem decifrar uma lógica complexa, embora também exija ajustes precisos no pedido, como veremos abaixo.
A diferença entre «Flash» e o modelo superior GLM-5.3 é bem visível nos preços do fornecedor: no OpenRouter, no momento da publicação, o Flash custa $0,09 por milhão de tokens de entrada e $0,30 por milhão de saída, enquanto o modelo superior custa $1,40 e $4,40. Na rede Gonka esta escala não existe: todos os modelos da rede são oferecidos sob uma tarifa única.
Características do GLM-5.3 Flash na rede Gonka
Como acontece com outros modelos da rede, é importante distinguir entre as características do modelo «pronto para uso» e os parâmetros operacionais de uma implantação específica: estes são definidos pela configuração de inferência vLLM nos nós GPU da rede. Valores reais através do nosso Gateway:
- Janela de contexto: 390 000 tokens. Este é o mínimo demonstrado por solicitações, não um número do cartão do modelo: uma entrada de 390 013 tokens foi aceita e processada, e executamos um prefill grande diretamente para os nós da rede. A configuração técnica dos nós permite 400 000, mas publicamos o que foi verificado.
- Saída máxima: 8 192 tokens por resposta. Importante: este limite inclui tanto os tokens de raciocínio quanto a própria resposta. Um modelo que pensou 3000 tokens com um limite de 4096 deixará cerca de mil para a resposta.
- Reasoning e tool calling: o modelo está implantado com um parser de raciocínio e um parser de chamada de ferramentas; o raciocínio chega no campo
reasoning_content, e as chamadas de ferramentas no campo padrãotool_calls, como em qualquer modelo compatível com OpenAI. - Velocidade: em nossas medições através do gateway, o primeiro token chega em aproximadamente 0,75 segundos, e a geração ocorre a uma velocidade de 25–44 tokens por segundo, dependendo da carga. Para um modelo de reasoning, isso é rápido, mas lembre-se de que as primeiras centenas de tokens serão dedicadas ao raciocínio e a resposta visível começará mais tarde.
- Requisito de VRAM do host: cerca de 560 GB por réplica de acordo com os parâmetros on-chain do modelo; mais do que o MiniMax M2.7 (320 GB) e o DeepSeek V4 Flash (280 GB). Quanto maior o limite de hardware, menos nós são capazes de implantar o modelo, e isso afeta diretamente sua capacidade na rede; sobre isso na seção de cenários e limitações.
O preço da inferência na rede Gonka não depende da escolha do modelo: o GLM-5.3 Flash está disponível na mesma tarifa que o MiniMax M2.7 e o DeepSeek V4 Flash; através do JoinGonka Gateway, isso custa $0.0069 por milhão de tokens de entrada e $0.021 por milhão de tokens de saída. Os tokens de raciocínio são tarifados como tokens de saída. A economia da rede é um assunto à parte: o preço é determinado pelo cálculo do trabalho computacional, não pelo preço do fornecedor.
Raciocínio e orçamento de tokens: como não receber uma resposta vazia
O erro mais frequente ao familiarizar-se com o GLM-5.3 Flash é o seguinte: o programador envia uma pergunta curta com o parâmetro habitual max_tokens: 256, recebe finish_reason: "length" e um campo content vazio. Nada está avariado: o modelo consumiu todo o limite no raciocínio e não chegou à resposta. Segundo as nossas medições, mesmo para uma pergunta trivial, o raciocínio ocupa entre 250 e 450 tokens, e milhares em tarefas complexas.
Três regras práticas:
| Configuração | Recomendação | Porquê |
|---|---|---|
max_tokens | Não menos de 600 mesmo para respostas curtas; para tarefas reais, a partir de 2000 | O limite é partilhado entre raciocínio e resposta; o raciocínio consome as primeiras centenas de tokens |
stream | true sempre que possível | O raciocínio e a resposta chegam à medida que são gerados: vê-se o progresso, evita-se a espera por um «ecrã vazio» e as respostas longas não atingem os tempos limite do proxy |
reasoning_effort | low quando o raciocínio não é necessário; não indicar nada quando é | O interruptor é binário: low desativa o raciocínio, qualquer outro valor deixa-o completo. O gateway traduz none e minimal para low, enquanto medium, high, xhigh e max são removidos por serem redundantes. Os campos enable_thinking, chat_template_kwargs, reasoning.enabled e thinking.type são ignorados pela rede |
Exemplo de pedido para uma tarefa curta com raciocínio limitado e limite suficiente:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-sua-chave" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"reasoning_effort": "low",
"max_tokens": 800,
"messages": [{"role": "user", "content": "Nomeie a capital da Austrália com uma única palavra"}]
}'Na resposta, o raciocínio reside em message.reasoning_content e a resposta em message.content; no stream chegam como deltas independentes. A maioria dos clientes compatíveis com OpenAI ignora silenciosamente o campo desconhecido, pelo que o raciocínio não se «fuga» para o texto da resposta, mas conta dentro de completion_tokens e é cobrado como tokens de saída. Se o raciocínio não for necessário, o GLM-5.3 Flash não é a melhor opção: para réplicas curtas e rápidas, o MiniMax M2.7 é mais económico.
Advertência importante para cenários de agentes: ferramentas como o Cline ou Cursor costumam definir um limite de saída baixo para pedidos de serviço (compressão de contexto, geração de títulos de diálogo). Se tal pedido for enviado ao GLM-5.3 Flash com um limite de poucas centenas de tokens, voltará vazio. Verifique a configuração de limite na ferramenta ou envie os pedidos de serviço para outro modelo da rede.
Ferramentas, JSON e comparação com outros modelos da rede
Modelos de raciocínio às vezes não se dão bem com frameworks de agentes: o raciocínio se intromete entre as chamadas de ferramentas e quebra o formato. Com o GLM-5.3 Flash, executamos um ciclo de agente completo —descrição de ferramentas, chamada, retorno de resultado, segunda rodada de chamada— e, através do caminho compatível com OpenAI, ele funciona normalmente: as chamadas chegam estruturadas em tool_calls, os argumentos são válidos e a segunda rodada não confunde o histórico. O modo JSON (response_format: {"type": "json_object"}) também funciona — o modelo entrega um objeto válido e o raciocínio permanece fora da resposta. Para agentes, aplica-se a mesma regra de orçamento: limite de saída com margem, caso contrário, a chamada da ferramenta pode ser interrompida no meio.
Como o GLM-5.3 Flash se compara com os outros dois modelos da rede:
| Parâmetro | GLM-5.3 Flash | MiniMax M2.7 | DeepSeek V4 Flash |
|---|---|---|---|
| Contexto na rede | 390 000 | 200 000 | 380 000 |
| Saída por resposta | 8 192 | 8 192 | 32 768 |
| Arquitetura | MoE 320B (~18B ativos), atenção híbrida | MoE + atenção linear | MoE 284B (~13B ativos) |
| VRAM por réplica | 560 GB | 320 GB | 280 GB |
| Ponto forte | Lógica complexa, análise de código, tarefas de "pensar"; o maior contexto da rede | Tarefas cotidianas, respostas curtas rápidas, modelo padrão | Segundo maior contexto da rede, maior saída, codificação de agentes |
| Preço via Gateway | igual — $0.0069 entrada / $0.021 saída por 1M | ||
A consequência prática do preço único é a mesma de antes: o modelo é escolhido pela tarefa, não pelo orçamento. Precisa pensar em lógica complexa — GLM-5.3 Flash; precisa ler um repositório inteiro — DeepSeek V4 Flash; precisa de uma resposta rápida e uniforme — MiniMax M2.7.
Como usar o GLM-5.3 Flash via JoinGonka Gateway
O modelo está disponível através do JoinGonka Gateway via API compatível com OpenAI e Anthropic. Identificador do modelo: zai-org/GLM-5.3-Flash. Uma chave do tipo jg-… é criada no painel de controle logo após o registro; novas contas recebem 3M tokens gratuitos — o suficiente para testar o modelo em suas tarefas e ajustar o orçamento de raciocínio.
Chamada direta da API (formato OpenAI, streaming ativado — modo recomendado para o modelo de reasoning):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-sua-chave" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"stream": true,
"max_tokens": 4000,
"messages": [{"role": "user", "content": "Encontre o erro nesta função e explique-o: …"}]
}'Em ferramentas de desenvolvimento, o modelo conecta-se da mesma forma que os outros modelos da rede: base URL https://gate.joingonka.ai/v1, chave jg-… e identificador do modelo. Guias para Cursor, Claude Code, Cline, Continue e outras ferramentas estão reunidos na seção «Ferramentas»; o instalador npx @joingonka/setup configurará o gateway no arquivo de configuração da ferramenta com um único comando. Para clientes da Anthropic Messages API, basta definir ANTHROPIC_BASE_URL=https://gate.joingonka.ai.
Você pode testar sem registro no chat gratuito: selecione GLM-5.3 Flash na lista de modelos — o raciocínio é exibido em um bloco recolhível separado, permitindo ver claramente o quanto o modelo «pensa» antes de responder.
Quando escolher o GLM-5.3 Flash — cenários e o que considerar
Cenários sólidos para este modelo:
- Tarefas onde é necessário pensar. Análise de lógica de negócios complexa, busca de bugs não óbvios, design de esquemas de dados, matemática e deduções de múltiplas etapas — é para isso que os modelos de raciocínio existem. Aqui, o raciocínio compensa pela qualidade da resposta.
- Revisão e explicação de código. O modelo decompõe código de terceiros e argumenta as observações, e o fluxo de raciocínio de
reasoning_contentpode ser mostrado ao usuário como o "por que eu decidi isso". - Extração estruturada com validação. O modo JSON mais o raciocínio produzem resultados mais precisos em dados de entrada ambíguos do que uma resposta direta sem reflexão.
- Pipelines de agentes com papel de «planejador». Em uma combinação de vários modelos, é lógico colocar o GLM-5.3 Flash onde se decide "o que fazer" e delegar os passos executivos rápidos para o MiniMax M2.7.
Quando outro modelo de rede é mais razoável: para respostas curtas e rápidas, autocompletar e consultas massivas baratas — MiniMax M2.7 (o raciocínio ali apenas adiciona latência e consumo); para documentos e repositórios que devem caber em uma única consulta completa — DeepSeek V4 Flash com contexto de 380K.
O que considerar antes de transferir a carga. O GLM-5.3 Flash é o modelo de rede mais novo e pesado em termos de hardware, e é atendido atualmente por uma pequena parte dos hosts. Isso significa menos capacidade de reserva do que no MiniMax M2.7 e DeepSeek V4 Flash: em minutos de pico, as solicitações podem esperar mais por um slot livre ou receber uma resposta de sobrecarga que deve ser repetida após alguns segundos. A segunda limitação é o tempo: o provedor que atualmente serve o modelo da rede corta uma resposta aproximadamente no quinto minuto de geração; a 25–44 tokens por segundo, isso equivale a cerca de 7.000–10.000 tokens, então é melhor dividir gerações muito longas em etapas. A composição da rede muda por votação, portanto, sempre obtenha a lista atualizada de modelos e seus limites a partir de um GET https://gate.joingonka.ai/v1/models ao vivo, e a disponibilidade e latência atuais na página de status do gateway. Graças ao preço único, o experimento não custa nada: trocar de modelo é apenas uma linha na solicitação.
Quer saber mais?
Explore outras seções ou comece a ganhar GNK agora mesmo.
Testar o GLM-5.3 Flash via Gateway →