Seções da Base de Conhecimento ▾

Navegação

▸ Comece aqui Por funções

Categorias

Ferramentas 36
Glossário 12

Ferramentas

ZCode: inferência GLM barata em vez do GLM Coding Plan

Em junho de 2026, a Z.ai lançou o ZCode 3.0, um ambiente de desenvolvimento com agentes desktop, que a própria empresa chama de «Official Harness for GLM-5.2». O produto rapidamente atraiu a atenção: núcleo de agentes próprio, tarefas autônomas via /goal, modo multi-agent e gerenciamento remoto de sessões diretamente do Telegram. Mas, junto com a onda de avaliações, surgiu uma onda de perguntas dos primeiros assinantes do GLM Coding Plan: a cota é calculada por «prompts» em janelas de cinco horas, nos horários de pico o consumo é multiplicado por três, nos planos básicos há apenas uma solicitação paralela, e no Hacker News há reclamações sobre bloqueios repentinos após dias de trabalho intenso.

A boa notícia: o ZCode oferece suporte oficial para um custom provider; você pode conectar qualquer API compatível com OpenAI ou Anthropic e pagar pelos tokens reais, em vez de cotas de assinatura. Neste guia, vamos analisar o que é o ZCode e como funciona o GLM Coding Plan, e depois configuraremos passo a passo o ZCode no JoinGonka Gateway, o gateway da rede descentralizada Gonka, em cujo registro o GLM-5.2 já foi adicionado. Resultado: a mesma ferramenta, os mesmos modelos open-weight, mas com uma economia baseada em tokens e centenas de vezes mais barata que as APIs centralizadas.

O que é o ZCode: ambiente de desenvolvimento com agentes da Z.ai

O ZCode não é um «editor com chat lateral», mas sim um ADE: você descreve um objetivo, o agente planeja, edita arquivos, executa testes e itera até o resultado. Funciona como um aplicativo desktop no macOS e Windows (a compilação para Linux está em status beta).

Recursos principais da versão 3.0:

  • ZCode Agent: núcleo de agentes próprio com integração profunda ao GLM-5.2; além dele, é possível conectar agentes de terceiros (Claude Code, Codex, Gemini CLI e outros);
  • Modo Goal (/goal): tarefas autônomas longas: plano → execução → verificação passo a passo;
  • Multi-agent: trabalho paralelo de vários agentes no projeto;
  • Gerenciamento remoto: início e controle de sessões via Telegram, WeChat e Feishu: o agente roda na sua máquina e você responde às perguntas pelo seu celular.

O cliente em si é gratuito, e a Z.ai concede aos novos usuários uma cota diária de tokens do GLM-5.2 para teste. Depois disso, ou você assina o GLM Coding Plan ou usa sua própria chave de API. E é aqui que vale a pena aprofundar, porque o funcionamento da assinatura é o aspecto mais comentado do produto.

GLM Coding Plan: preço, limites e cotas

O GLM Coding Plan é a assinatura da Z.ai que dá acesso aos modelos GLM no ZCode e em outras dezenas de ferramentas de terceiros. No momento da publicação (julho de 2026), a estrutura básica é a seguinte, mas os preços e promoções mudam; consulte a página em tempo real z.ai/subscribe:

PlanoPreço, $/mêsCotaSolicitações paralelas
Lite$18 (em promoções a partir de ~$12.6)«Prompts» em janelas de 5h + teto semanal1
Pro$72×4 em relação ao Lite1
Max$160×16 em relação ao Liteaté 30

Do que os assinantes reclamam (tópicos no Hacker News e GitHub):

  • Multiplicador de horário de pico. Nos horários de pico (14:00—18:00 UTC+8 — tarde na Ásia, manhã/tarde na Europa), cada solicitação desconta cota com um coeficiente de ×3, fora do pico, ×2. É necessário planejar o consumo pelo fuso horário de Pequim.
  • Cota por «prompts», não por tokens. A quantidade exata de tokens restantes não é transparente; nos tópicos há relatos do tipo «gastei ~17M de tokens no GLM e recebi um bloqueio de quatro dias».
  • Uma solicitação paralela no Lite e Pro. Para um ambiente de agentes, isso é sentido: o modo multi-agent do próprio ZCode e quaisquer sub-agentes paralelos ficam presos na fila.
  • O GLM-5.2 consome cota mais rápido que modelos menores; o carro-chefe esgota o limite com seu próprio multiplicador.

A conclusão é simples: para um desenvolvimento solo tranquilo, a assinatura funciona honestamente. Mas quanto mais «agente» for seu modo de trabalho (tarefas paralelas, sessões autônomas longas, execuções noturnas), mais o modelo de cotas se transforma em uma loteria. A alternativa é o pagamento pelo consumo real de tokens: sem janelas, multiplicadores ou filas; a quantidade que o agente consumiu é o que é cobrado. Esse é exatamente o modelo oferecido pelo mecanismo de custom provider integrado ao ZCode, e sua configuração leva cinco minutos.

BYOK no ZCode: sua própria chave API e custom provider

O ZCode tem suporte oficial embutido para BYOK: a documentação permite explicitamente adicionar «qualquer serviço compatível com os protocolos da OpenAI ou Anthropic» — APIs públicas, canais corporativos e até instalações self-hosted. Configura-se de três formas:

  • botão Connect na tela de boas-vindas → «Set Your API Key»;
  • Manage Models no seletor de modelos;
  • engrenagem → Settings → Model Settings → Add Provider.

Ao provedor são atribuídos um OpenAI Base URL e/ou Anthropic Base URL, além da API Key: a lista de modelos disponíveis será carregada automaticamente pelo ZCode.

Três erros comuns nos quais as pessoas tropeçam:

  • Os endpoints da Z.ai são diferentes. A assinatura Coding Plan funciona apenas através do coding-endpoint https://api.z.ai/api/coding/paas/v4; o endpoint geral /api/paas/v4 com uma chave de assinatura retornará um erro: a causa clássica de «eu tenho 401/429, embora o plano esteja pago».
  • «Funciona no Claude Code ≠ funciona no ZCode». Variáveis de ambiente como ANTHROPIC_BASE_URL, usadas para configurar o Claude Code, não são lidas pelo ZCode: ele possui seu próprio armazenamento de configurações de provedores. Configure exatamente através das Settings.
  • «O modelo é visível no seletor ≠ a chave tem cota». A lista de modelos é extraída da API do provedor, e a disponibilidade depende do saldo e dos limites da chave específica.

A seguir, a prática: conectamos o gateway JoinGonka ao ZCode e obtemos o stack GLM por tokens.

Configuração do JoinGonka Gateway no ZCode: GLM por tokens

JoinGonka Gateway — um gateway para a rede descentralizada Gonka com dois protocolos nativos: /v1/chat/completions compatível com OpenAI e /v1/messages da Anthropic. A economia é pay-per-token: sem janelas de 5 horas, sem multiplicadores de pico ×3 e sem limite de uma única solicitação paralela; o consumo é visível no dashboard em tempo real, o gateway não armazena o conteúdo dos prompts.

Passo a passo (interface atual do Custom Provider):

PassoAção
1. ChaveCadastre-se em gate.joingonka.ai/register (contas novas ganham 10M de tokens gratuitos), crie uma chave de API na seção Keys. Mais detalhes em API Quick Start.
2. ProvedorZCode → Settings → Model Settings → Add Provider. Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keysua chave do tipo jg-…
5. Formato APIChat completions (/chat/completions)
6. ModeloAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Da mesma forma, são adicionados moonshotai/Kimi-K2.6 e MiniMaxAI/MiniMax-M2.7; a lista atual está em GET /v1/models.

Em versões antigas do ZCode, existem dois campos separados: OpenAI Base URL (https://gate.joingonka.ai/v1) e Anthropic Base URL (https://gate.joingonka.ai — o cliente adicionará o caminho sozinho).

Verificação: selecione o modelo criado e faça qualquer pergunta ao agente. Se a resposta chegar, tudo está funcionando; erro 401 — verifique a chave, 402 — saldo da conta. Se aparecer "Model request failed" no DeepSeek V4 Flash com Thought Level Max, mude o Thought Level para High e repita a solicitação.

Dica. O comando npx @joingonka/setup --tool zcode imprimirá os valores prontos para os campos abaixo (base URL, chave, ID do modelo com limites atuais) e verificará com uma solicitação ao vivo que o gateway os aceita. O ZCode em si só é configurado através da UI — ele não possui um arquivo que possa ser editado com segurança, portanto, os valores devem ser inseridos manualmente.

Comparativo de preços: Coding Plan, Z.ai API, OpenRouter e Gonka

Quanto custa a inferência GLM em vários canais (preços por 1M de tokens; preços da concorrência fixados em julho de 2026, o preço da JoinGonka é atualizado ao vivo na página via gateway de API):

CanalEntrada, $/1MSaída, $/1MModelo de cobrança
Z.ai API (GLM-5.2)$1.40 (entrada em cache — $0.26)$4.40por token
GLM Coding Plan$18—160/mêsassinatura: cotas de "prompts", multiplicador ×3 em pico, limites de concorrência
OpenRouter (z-ai/glm-5.2)$0.93$3.00por token; não há versão gratuita do GLM-5.2
JoinGonka Gateway$0.0032$0.0097por token, rede Gonka

A diferença de duas a três ordens de magnitude não é um arredondamento de marketing, mas uma economia diferente: os cálculos são realizados por participantes de uma rede descentralizada que lucram com o trabalho em si, e não com a margem do data center. Uma análise detalhada de como isso funciona e os limites de aplicabilidade pode ser encontrada no artigo sobre a API de IA mais barata.

Aviso honesto sobre o GLM-5.2: a rede definirá o preço exato do modelo no momento da ativação (a tabela acima mostra os preços atuais em tempo real dos modelos da rede). Os valores nesta página são atualizados automaticamente, não há necessidade de recalcular nada manualmente.

GLM-5.2 na rede Gonka: status e dúvidas frequentes

O modelo zai-org/GLM-5.2-FP8 já foi adicionado ao registro on-chain da rede Gonka: a configuração define uma janela de contexto de até 400K tokens, e o modelo em si é dos pesados (cada réplica requer mais de um terabyte de VRAM). Atualmente, a implementação está em andamento: os nós da rede estão aquecendo os pesos. Assim que as verificações ficarem verdes, o modelo aparecerá automaticamente na lista de modelos do gateway — a URL base e a chave não mudam, no ZCode bastará selecioná-lo no seletor.

Sobre o próprio modelo: pesos abertos sob licença MIT, arquitetura MoE de ~750B de parâmetros (cerca de 40B ativos por token), janela nativa de até 1M de tokens. Segundo dados da Z.ai, no SWE-bench Pro o modelo mostra 62.1 — superando o GPT-5.5, e no FrontierSWE fica atrás do Claude Opus 4.8 por cerca de um ponto percentual. Para um modelo de pesos abertos, esta é a primeira linha em codificação.

Perguntas frequentes:

  • Por que ocorrem erros 429 logo após ativar um modelo novo? — Esta é a fase de implementação: alguns nós ainda estão carregando os pesos. Repita a solicitação após alguns segundos — o balanceador encontrará um nó ativo.
  • O que já está disponível hoje? — Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash: todos os três modelos funcionam no ZCode através do mesmo custom provider, a configuração deste guia é totalmente funcional agora mesmo.
  • E quanto à privacidade? — O gateway não armazena o conteúdo dos prompts e respostas; nas estatísticas, há apenas agregados de consumo.
  • Quando o Coding Plan é mais vantajoso? — Se você trabalha sozinho, fica dentro da cota Lite e não executa agentes paralelos, a assinatura com um preço fixo é conveniente e previsível. Calcule conforme seu perfil: com trabalho intenso de agentes, o pagamento por tokens através da rede sai ordens de grandeza mais barato; com pequenas edições de código algumas vezes por dia, a diferença pode não ser sentida.
  • Isso serve para outras ferramentas? — Sim: o mesmo endpoint funciona no Claude Code, Cursor, Cline e em qualquer cliente compatível com OpenAI/Anthropic.
ZCode 3.0 é uma IDE agentic notável, mas a sua assinatura nativa GLM Coding Plan é baseada em quotas: "prompts" em janelas de 5 horas, um multiplicador ×3 durante as horas de pico e um único pedido simultâneo nos planos de entrada. Quanto mais agentic é a carga de trabalho, mais dispendiosa e imprevisível se torna. O BYOK oficial resolve a questão: ligue o JoinGonka Gateway como um custom provider e pague pelos tokens reais aos preços da rede descentralizada Gonka, centenas de vezes mais baixos do que os das APIs centralizadas. GLM-5.2 já está no registo da rede e aparecerá automaticamente no seu seletor de modelos, enquanto Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash já funcionam hoje. Comece com 10M de tokens gratuitos.

Quer saber mais?

Explore outras seções ou comece a ganhar GNK agora mesmo.

Obter 10M de tokens gratuitos →