Seções da Base de Conhecimento ▾
Navegação
▸ Comece aqui Por funçõesCategorias
- Cursor + Gonka AI — LLM barato para codificação
- Claude Code + Gonka AI — LLM para terminal
- OpenClaw + Gonka AI — agentes AI acessíveis
- OpenCode + Gonka AI — AI grátis para código
- Continue.dev + Gonka AI — AI para VS Code/JetBrains
- Cline + Gonka AI — agente AI no VS Code
- Aider + Gonka AI — programação em par com AI
- LangChain + Gonka AI — aplicativos AI por uma fração do custo
- n8n + Gonka AI — automação com AI barata
- Open WebUI + Gonka AI — seu próprio ChatGPT
- LibreChat + Gonka AI — ChatGPT de código aberto
- Hermes Agent + Gonka AI — Agente autônomo por centavos
- Kilo Code + Gonka AI — Agente de IA no VS Code
- Roo Code + Gonka AI — Agente de IA autônomo no VS Code
- LlamaIndex + Gonka AI — Aplicações RAG por alguns centavos
- PydanticAI + Gonka — Agentes de IA tipificados por alguns centavos
- Vercel AI SDK + Gonka AI — Aplicações de IA em TypeScript por centavos
- TanStack AI + Gonka — Aplicativos de IA em TypeScript por centavos
- API início rápido — curl, Python, TypeScript
- JoinGonka Gateway — Visão geral completa
- Management Keys — SaaS na Gonka
- A API de IA mais barata: comparativo de provedores 2026
- Limite de solicitações do Cursor Pro esgotado — análise e uma alternativa barata
- Claude Code mais barato — análise de fatura e mudança de serviço
- Cline queima dinheiro — por que o agente gasta tanto
- OpenClaw custa caro — porque o agente queima tokens e como economizar
- OpenRouter: alternativa barata — comparativo com JoinGonka Gateway
- O melhor modelo de IA para codificação em 2026: comparação e preços
- Alternativa barata ao GitHub Copilot sem limites
- Alternativa barata ao Windsurf sem créditos e sem limites
- A API mais barata para agentes de IA em 2026
- ZCode: inferência GLM barata em vez do GLM Coding Plan
- JetBrains IDE + JoinGonka Gateway — seu próprio endpoint em vez de créditos
- GitHub Copilot BYOK: seus modelos em vez da cota
- Zed + JoinGonka Gateway — inferência barata no editor
- Pi + JoinGonka Gateway — agente terminal em inferência barata
Ferramentas
ZCode: inferência GLM barata em vez do GLM Coding Plan
Em junho de 2026, a Z.ai lançou o ZCode 3.0, um ambiente de desenvolvimento com agentes desktop, que a própria empresa chama de «Official Harness for GLM-5.2». O produto rapidamente atraiu a atenção: núcleo de agentes próprio, tarefas autônomas via /goal, modo multi-agent e gerenciamento remoto de sessões diretamente do Telegram. Mas, junto com a onda de avaliações, surgiu uma onda de perguntas dos primeiros assinantes do GLM Coding Plan: a cota é calculada por «prompts» em janelas de cinco horas, nos horários de pico o consumo é multiplicado por três, nos planos básicos há apenas uma solicitação paralela, e no Hacker News há reclamações sobre bloqueios repentinos após dias de trabalho intenso.
A boa notícia: o ZCode oferece suporte oficial para um custom provider; você pode conectar qualquer API compatível com OpenAI ou Anthropic e pagar pelos tokens reais, em vez de cotas de assinatura. Neste guia, vamos analisar o que é o ZCode e como funciona o GLM Coding Plan, e depois configuraremos passo a passo o ZCode no JoinGonka Gateway, o gateway da rede descentralizada Gonka, em cujo registro o GLM-5.2 já foi adicionado. Resultado: a mesma ferramenta, os mesmos modelos open-weight, mas com uma economia baseada em tokens e centenas de vezes mais barata que as APIs centralizadas.
O que é o ZCode: ambiente de desenvolvimento com agentes da Z.ai
O ZCode não é um «editor com chat lateral», mas sim um ADE: você descreve um objetivo, o agente planeja, edita arquivos, executa testes e itera até o resultado. Funciona como um aplicativo desktop no macOS e Windows (a compilação para Linux está em status beta).
Recursos principais da versão 3.0:
- ZCode Agent: núcleo de agentes próprio com integração profunda ao GLM-5.2; além dele, é possível conectar agentes de terceiros (Claude Code, Codex, Gemini CLI e outros);
- Modo Goal (
/goal): tarefas autônomas longas: plano → execução → verificação passo a passo; - Multi-agent: trabalho paralelo de vários agentes no projeto;
- Gerenciamento remoto: início e controle de sessões via Telegram, WeChat e Feishu: o agente roda na sua máquina e você responde às perguntas pelo seu celular.
O cliente em si é gratuito, e a Z.ai concede aos novos usuários uma cota diária de tokens do GLM-5.2 para teste. Depois disso, ou você assina o GLM Coding Plan ou usa sua própria chave de API. E é aqui que vale a pena aprofundar, porque o funcionamento da assinatura é o aspecto mais comentado do produto.
GLM Coding Plan: preço, limites e cotas
O GLM Coding Plan é a assinatura da Z.ai que dá acesso aos modelos GLM no ZCode e em outras dezenas de ferramentas de terceiros. No momento da publicação (julho de 2026), a estrutura básica é a seguinte, mas os preços e promoções mudam; consulte a página em tempo real z.ai/subscribe:
| Plano | Preço, $/mês | Cota | Solicitações paralelas |
|---|---|---|---|
| Lite | $18 (em promoções a partir de ~$12.6) | «Prompts» em janelas de 5h + teto semanal | 1 |
| Pro | $72 | ×4 em relação ao Lite | 1 |
| Max | $160 | ×16 em relação ao Lite | até 30 |
Do que os assinantes reclamam (tópicos no Hacker News e GitHub):
- Multiplicador de horário de pico. Nos horários de pico (14:00—18:00 UTC+8 — tarde na Ásia, manhã/tarde na Europa), cada solicitação desconta cota com um coeficiente de ×3, fora do pico, ×2. É necessário planejar o consumo pelo fuso horário de Pequim.
- Cota por «prompts», não por tokens. A quantidade exata de tokens restantes não é transparente; nos tópicos há relatos do tipo «gastei ~17M de tokens no GLM e recebi um bloqueio de quatro dias».
- Uma solicitação paralela no Lite e Pro. Para um ambiente de agentes, isso é sentido: o modo multi-agent do próprio ZCode e quaisquer sub-agentes paralelos ficam presos na fila.
- O GLM-5.2 consome cota mais rápido que modelos menores; o carro-chefe esgota o limite com seu próprio multiplicador.
A conclusão é simples: para um desenvolvimento solo tranquilo, a assinatura funciona honestamente. Mas quanto mais «agente» for seu modo de trabalho (tarefas paralelas, sessões autônomas longas, execuções noturnas), mais o modelo de cotas se transforma em uma loteria. A alternativa é o pagamento pelo consumo real de tokens: sem janelas, multiplicadores ou filas; a quantidade que o agente consumiu é o que é cobrado. Esse é exatamente o modelo oferecido pelo mecanismo de custom provider integrado ao ZCode, e sua configuração leva cinco minutos.
BYOK no ZCode: sua própria chave API e custom provider
O ZCode tem suporte oficial embutido para BYOK: a documentação permite explicitamente adicionar «qualquer serviço compatível com os protocolos da OpenAI ou Anthropic» — APIs públicas, canais corporativos e até instalações self-hosted. Configura-se de três formas:
- botão Connect na tela de boas-vindas → «Set Your API Key»;
- Manage Models no seletor de modelos;
- engrenagem → Settings → Model Settings → Add Provider.
Ao provedor são atribuídos um OpenAI Base URL e/ou Anthropic Base URL, além da API Key: a lista de modelos disponíveis será carregada automaticamente pelo ZCode.
Três erros comuns nos quais as pessoas tropeçam:
- Os endpoints da Z.ai são diferentes. A assinatura Coding Plan funciona apenas através do coding-endpoint
https://api.z.ai/api/coding/paas/v4; o endpoint geral/api/paas/v4com uma chave de assinatura retornará um erro: a causa clássica de «eu tenho 401/429, embora o plano esteja pago». - «Funciona no Claude Code ≠ funciona no ZCode». Variáveis de ambiente como
ANTHROPIC_BASE_URL, usadas para configurar o Claude Code, não são lidas pelo ZCode: ele possui seu próprio armazenamento de configurações de provedores. Configure exatamente através das Settings. - «O modelo é visível no seletor ≠ a chave tem cota». A lista de modelos é extraída da API do provedor, e a disponibilidade depende do saldo e dos limites da chave específica.
A seguir, a prática: conectamos o gateway JoinGonka ao ZCode e obtemos o stack GLM por tokens.
Configuração do JoinGonka Gateway no ZCode: GLM por tokens
JoinGonka Gateway — um gateway para a rede descentralizada Gonka com dois protocolos nativos: /v1/chat/completions compatível com OpenAI e /v1/messages da Anthropic. A economia é pay-per-token: sem janelas de 5 horas, sem multiplicadores de pico ×3 e sem limite de uma única solicitação paralela; o consumo é visível no dashboard em tempo real, o gateway não armazena o conteúdo dos prompts.
Passo a passo (interface atual do Custom Provider):
| Passo | Ação |
|---|---|
| 1. Chave | Cadastre-se em gate.joingonka.ai/register (contas novas ganham 10M de tokens gratuitos), crie uma chave de API na seção Keys. Mais detalhes em API Quick Start. |
| 2. Provedor | ZCode → Settings → Model Settings → Add Provider. Name: JoinGonka |
| 3. Base URL | https://gate.joingonka.ai/v1 |
| 4. API Key | sua chave do tipo jg-… |
| 5. Formato API | Chat completions (/chat/completions) |
| 6. Modelo | Add Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Da mesma forma, são adicionados moonshotai/Kimi-K2.6 e MiniMaxAI/MiniMax-M2.7; a lista atual está em GET /v1/models. |
Em versões antigas do ZCode, existem dois campos separados: OpenAI Base URL (https://gate.joingonka.ai/v1) e Anthropic Base URL (https://gate.joingonka.ai — o cliente adicionará o caminho sozinho).
Verificação: selecione o modelo criado e faça qualquer pergunta ao agente. Se a resposta chegar, tudo está funcionando; erro 401 — verifique a chave, 402 — saldo da conta. Se aparecer "Model request failed" no DeepSeek V4 Flash com Thought Level Max, mude o Thought Level para High e repita a solicitação.
Dica. O comando npx @joingonka/setup --tool zcode imprimirá os valores prontos para os campos abaixo (base URL, chave, ID do modelo com limites atuais) e verificará com uma solicitação ao vivo que o gateway os aceita. O ZCode em si só é configurado através da UI — ele não possui um arquivo que possa ser editado com segurança, portanto, os valores devem ser inseridos manualmente.
Comparativo de preços: Coding Plan, Z.ai API, OpenRouter e Gonka
Quanto custa a inferência GLM em vários canais (preços por 1M de tokens; preços da concorrência fixados em julho de 2026, o preço da JoinGonka é atualizado ao vivo na página via gateway de API):
| Canal | Entrada, $/1M | Saída, $/1M | Modelo de cobrança |
|---|---|---|---|
| Z.ai API (GLM-5.2) | $1.40 (entrada em cache — $0.26) | $4.40 | por token |
| GLM Coding Plan | $18—160/mês | assinatura: cotas de "prompts", multiplicador ×3 em pico, limites de concorrência | |
| OpenRouter (z-ai/glm-5.2) | $0.93 | $3.00 | por token; não há versão gratuita do GLM-5.2 |
| JoinGonka Gateway | $0.0032 | $0.0097 | por token, rede Gonka |
A diferença de duas a três ordens de magnitude não é um arredondamento de marketing, mas uma economia diferente: os cálculos são realizados por participantes de uma rede descentralizada que lucram com o trabalho em si, e não com a margem do data center. Uma análise detalhada de como isso funciona e os limites de aplicabilidade pode ser encontrada no artigo sobre a API de IA mais barata.
Aviso honesto sobre o GLM-5.2: a rede definirá o preço exato do modelo no momento da ativação (a tabela acima mostra os preços atuais em tempo real dos modelos da rede). Os valores nesta página são atualizados automaticamente, não há necessidade de recalcular nada manualmente.
GLM-5.2 na rede Gonka: status e dúvidas frequentes
O modelo zai-org/GLM-5.2-FP8 já foi adicionado ao registro on-chain da rede Gonka: a configuração define uma janela de contexto de até 400K tokens, e o modelo em si é dos pesados (cada réplica requer mais de um terabyte de VRAM). Atualmente, a implementação está em andamento: os nós da rede estão aquecendo os pesos. Assim que as verificações ficarem verdes, o modelo aparecerá automaticamente na lista de modelos do gateway — a URL base e a chave não mudam, no ZCode bastará selecioná-lo no seletor.
Sobre o próprio modelo: pesos abertos sob licença MIT, arquitetura MoE de ~750B de parâmetros (cerca de 40B ativos por token), janela nativa de até 1M de tokens. Segundo dados da Z.ai, no SWE-bench Pro o modelo mostra 62.1 — superando o GPT-5.5, e no FrontierSWE fica atrás do Claude Opus 4.8 por cerca de um ponto percentual. Para um modelo de pesos abertos, esta é a primeira linha em codificação.
Perguntas frequentes:
- Por que ocorrem erros 429 logo após ativar um modelo novo? — Esta é a fase de implementação: alguns nós ainda estão carregando os pesos. Repita a solicitação após alguns segundos — o balanceador encontrará um nó ativo.
- O que já está disponível hoje? — Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash: todos os três modelos funcionam no ZCode através do mesmo custom provider, a configuração deste guia é totalmente funcional agora mesmo.
- E quanto à privacidade? — O gateway não armazena o conteúdo dos prompts e respostas; nas estatísticas, há apenas agregados de consumo.
- Quando o Coding Plan é mais vantajoso? — Se você trabalha sozinho, fica dentro da cota Lite e não executa agentes paralelos, a assinatura com um preço fixo é conveniente e previsível. Calcule conforme seu perfil: com trabalho intenso de agentes, o pagamento por tokens através da rede sai ordens de grandeza mais barato; com pequenas edições de código algumas vezes por dia, a diferença pode não ser sentida.
- Isso serve para outras ferramentas? — Sim: o mesmo endpoint funciona no Claude Code, Cursor, Cline e em qualquer cliente compatível com OpenAI/Anthropic.
Quer saber mais?
Explore outras seções ou comece a ganhar GNK agora mesmo.
Obter 10M de tokens gratuitos →