Seções da Base de Conhecimento ▾
Navegação
▸ Comece aqui Por funçõesCategorias
- Cursor + Gonka AI — LLM barato para codificação
- Claude Code + Gonka AI — LLM para terminal
- OpenClaw + Gonka AI — agentes AI acessíveis
- OpenCode: seu próprio modelo no terminal
- Continue.dev + Gonka AI — AI para VS Code/JetBrains
- Cline + Gonka AI — agente AI no VS Code
- Aider + Gonka AI — programação em par com AI
- LangChain + Gonka AI — aplicativos AI por uma fração do custo
- n8n + Gonka AI — automação com AI barata
- Open WebUI + Gonka AI — seu próprio ChatGPT
- LibreChat + Gonka AI — ChatGPT de código aberto
- Hermes Agent + DeepSeek na rede Gonka: agente autônomo por centavos
- Kilo Code + Gonka AI — Agente de IA no VS Code
- Roo Code + Gonka AI — Agente de IA autônomo no VS Code
- LlamaIndex + Gonka AI — Aplicações RAG por alguns centavos
- PydanticAI + Gonka — Agentes de IA tipificados por alguns centavos
- Vercel AI SDK + Gonka AI — Aplicações de IA em TypeScript por centavos
- TanStack AI + Gonka — Aplicativos de IA em TypeScript por centavos
- API início rápido — curl, Python, TypeScript
- JoinGonka Gateway — Visão geral completa
- Management Keys — SaaS na Gonka
- A API de IA mais barata: comparativo de provedores 2026
- Como comprar tokens de AI e chave API: 3 formas em 2026
- Limite de solicitações do Cursor Pro esgotado — análise e uma alternativa barata
- Claude Code mais barato — análise de fatura e mudança de serviço
- Cline queima dinheiro — por que o agente gasta tanto
- OpenClaw custa caro — porque o agente queima tokens e como economizar
- OpenRouter: alternativa barata — comparativo com JoinGonka Gateway
- O melhor modelo de IA para codificação em 2026: comparação e preços
- Alternativa barata ao GitHub Copilot sem limites
- Alternativa barata ao Windsurf sem créditos e sem limites
- A API mais barata para agentes de IA em 2026
- ZCode: inferência GLM barata em vez do GLM Coding Plan
- JetBrains IDE + JoinGonka Gateway — seu próprio endpoint em vez de créditos
- GitHub Copilot BYOK: seus modelos em vez da cota
- Zed + JoinGonka Gateway — inferência barata no editor
- Pi + JoinGonka Gateway — agente terminal em inferência barata
- Codex CLI: sua própria chave em vez de assinatura
- DeepSeek Harness: seu próprio provedor via JoinGonka Gateway
- MiniMax Code: agente MiniMax com sua própria chave via Gonka
- Warp + JoinGonka Gateway — agente de terminal em seu próprio endpoint
- Trae + JoinGonka Gateway — modelos da rede Gonka no AI-IDE
- Cherry Studio + JoinGonka Gateway — cliente de IA desktop
- omp (Oh My Pi) + JoinGonka Gateway: agente com papéis de modelos
- OpenHands + JoinGonka Gateway: agente em seu próprio endpoint
- Qwen Code após o fim do qwen-oauth: trabalhando via JoinGonka Gateway
- Goose + JoinGonka Gateway: seu próprio provedor e chave no keyring
- Crush + JoinGonka Gateway: agente Charm em modelos da rede Gonka
- Zoo Code + JoinGonka Gateway: migração do Roo Code para modelos Gonka
- Kimi Code CLI: agente Moonshot AI com sua própria chave via Gonka
- Factory Droid + JoinGonka Gateway: BYOK em modelos da rede Gonka
- MiMo Code + JoinGonka Gateway: agente Xiaomi em modelos da rede Gonka
Ferramentas
ZCode: inferência GLM barata em vez do GLM Coding Plan
Em junho de 2026, a Z.ai lançou o ZCode 3.0 — um ambiente de desenvolvimento de agentes para desktop, que a própria empresa chama de "Official Harness for GLM-5.2". O produto rapidamente atraiu atenção: motor de agentes próprio, tarefas autônomas via /goal, modo multi-agente e controle remoto de sessões diretamente pelo Telegram. Mas, junto com a onda de avaliações, surgiu também uma onda de dúvidas dos primeiros assinantes do GLM Coding Plan: a cota é contada como "prompts" em janelas de cinco horas, nos horários de pico o consumo é multiplicado por três, nos planos básicos há apenas uma requisição paralela, e no Hacker News reclamam de bloqueios repentinos após um dia intenso de trabalho.
A boa notícia: o ZCode oferece suporte oficial a custom provider — é possível conectar qualquer API compatível com OpenAI ou Anthropic e pagar pelos tokens reais, não por cotas de assinatura. Neste guia, vamos entender o que é o ZCode e como funciona o GLM Coding Plan, e então configuraremos passo a passo o ZCode no JoinGonka Gateway — o gateway da rede descentralizada Gonka, que hospeda o GLM-5.3 Flash, o modelo de raciocínio aberto da própria Z.ai. Resultado: a mesma ferramenta, os mesmos modelos open-weight, mas com uma economia baseada em tokens e muito mais barata que as APIs centralizadas.
O que é o ZCode: ambiente de desenvolvimento com agentes da Z.ai
O ZCode não é um «editor com chat lateral», mas sim um ADE: você descreve um objetivo, o agente planeja, edita arquivos, executa testes e itera até o resultado. Funciona como um aplicativo desktop no macOS e Windows (a compilação para Linux está em status beta).
Recursos principais da versão 3.0:
- ZCode Agent: núcleo de agentes próprio com integração profunda ao GLM-5.2; além dele, é possível conectar agentes de terceiros (Claude Code, Codex, Gemini CLI e outros);
- Modo Goal (
/goal): tarefas autônomas longas: plano → execução → verificação passo a passo; - Multi-agent: trabalho paralelo de vários agentes no projeto;
- Gerenciamento remoto: início e controle de sessões via Telegram, WeChat e Feishu: o agente roda na sua máquina e você responde às perguntas pelo seu celular.
O cliente em si é gratuito, e a Z.ai concede aos novos usuários uma cota diária de tokens do GLM-5.2 para teste. Depois disso, ou você assina o GLM Coding Plan ou usa sua própria chave de API. E é aqui que vale a pena aprofundar, porque o funcionamento da assinatura é o aspecto mais comentado do produto.
GLM Coding Plan: preço, limites e cotas
O GLM Coding Plan é a assinatura da Z.ai que dá acesso aos modelos GLM no ZCode e em umas vinte ferramentas de terceiros. No momento da publicação (julho de 2026), a grade básica é esta — mas preços e promoções mudam, então confira na página ao vivo z.ai/subscribe:
| Plano | Preço, $/mês | Cota | Requisições paralelas |
|---|---|---|---|
| Lite | $18 (em promoções, a partir de ~$12.6) | “Prompts” em janelas de 5 horas + teto semanal | 1 |
| Pro | $72 | ×4 em relação ao Lite | 1 |
| Max | $160 | ×16 em relação ao Lite | até 30 |
Do que os assinantes reclamam (threads no Hacker News e no GitHub):
- Multiplicador em horário de pico. Nos horários de pico (14:00—18:00 UTC+8 — fim de tarde na Ásia, manhã/meio-dia na Europa) cada requisição consome cota com coeficiente ×3; fora do pico, ×2. É preciso planejar o consumo pelo fuso horário de Pequim.
- A cota é em “prompts”, não em tokens. Quantos tokens sobraram exatamente é algo opaco; nas threads aparecem histórias do tipo “gastei ~17M tokens no GLM e levei um bloqueio de quatro dias”.
- Uma única requisição paralela nos planos Lite e Pro. Para um ambiente agêntico, isso pesa: o modo multi-agente do próprio ZCode e quaisquer subagentes paralelos esbarram na fila.
- O GLM-5.2 consome a cota mais rápido que os modelos menores — o carro-chefe queima o limite com multiplicador próprio.
A conclusão é simples: para desenvolvimento solo e tranquilo, a assinatura funciona de verdade. Mas quanto mais “agêntico” for o seu modo de trabalho — tarefas paralelas, sessões autônomas longas, execuções noturnas —, mais o modelo de cotas vira loteria. A alternativa é pagar pelos tokens de fato: sem janelas, multiplicadores ou filas — o que o agente consumir é o que será cobrado. É exatamente esse o modelo que o mecanismo de custom provider integrado ao ZCode oferece, e a configuração leva cinco minutos.
BYOK no ZCode: sua própria chave API e custom provider
O ZCode traz oficialmente suporte a BYOK: a documentação permite explicitamente adicionar «qualquer serviço compatível com os protocolos da OpenAI ou da Anthropic» — APIs públicas, canais corporativos e até instalações self-hosted. A configuração é feita de três formas:
- o botão Connect na tela de boas-vindas → «Set Your API Key»;
- Manage Models no seletor de modelo;
- a engrenagem → Settings → Model Settings → Add Provider.
Para o provedor, definem-se OpenAI Base URL e/ou Anthropic Base URL mais a API Key — o ZCode busca sozinho a lista de modelos disponíveis.
Três pedras no caminho em que se tropeça com mais frequência:
- Os endpoint's da Z.ai são diferentes. A assinatura Coding Plan funciona apenas pelo coding-endpoint
https://api.z.ai/api/coding/paas/v4; o geral/api/paas/v4com uma chave de assinatura retornará erro — a causa clássica do «estou recebendo 401/429, mesmo com o plano pago». - «Funciona no Claude Code ≠ funciona no ZCode». Variáveis de ambiente como
ANTHROPIC_BASE_URL, usadas para configurar o Claude Code, o ZCode não lê: ele tem seu próprio armazenamento de configurações de provedores. Configure exatamente por Settings. - «O modelo aparece no seletor ≠ a chave tem cota». A lista de modelos é carregada da API do provedor, mas a disponibilidade depende do saldo e dos limites de cada chave.
Agora a prática: conectamos o gateway JoinGonka ao ZCode e ganhamos o stack GLM por tokens.
Configuração do JoinGonka Gateway no ZCode: GLM por tokens
JoinGonka Gateway — um gateway para a rede descentralizada Gonka com dois protocolos nativos: /v1/chat/completions compatível com OpenAI e /v1/messages da Anthropic. A economia é pay-per-token: nada de janelas de 5 horas, multiplicadores de pico de ×3 ou limites de uma solicitação paralela; o consumo é visível no dashboard em tempo real, e o gateway não armazena o conteúdo dos prompts.
Passo a passo (interface atual de Custom Provider):
| Passo | Ação |
|---|---|
| 1. Chave | Cadastre-se em gate.joingonka.ai/register (novas contas recebem 3M de tokens gratuitos), crie uma API-key na seção Keys. Mais detalhes em API Quick Start. |
| 2. Provedor | ZCode → Settings → Model Settings → Add Provider. Nome: JoinGonka |
| 3. Base URL | https://gate.joingonka.ai/v1 |
| 4. API Key | sua chave no formato jg-… |
| 5. API format | Chat completions (/chat/completions) |
| 6. Modelo | Add Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Da mesma forma, adicionam-se MiniMaxAI/MiniMax-M2.7 e zai-org/GLM-5.3-Flash — o modelo de raciocínio da Z.ai; a lista atualizada e os limites encontram-se em GET /v1/models. |
Em versões antigas do ZCode, em vez disso, existem dois campos separados: OpenAI Base URL (https://gate.joingonka.ai/v1) e Anthropic Base URL (https://gate.joingonka.ai — o cliente adicionará o caminho automaticamente).
Verificação: selecione o modelo criado e faça qualquer pergunta ao agente. Se a resposta chegar, tudo funciona; erro 401 — verifique a chave; 402 — saldo da conta. Se no DeepSeek V4 Flash aparecer «Model request failed» com Thought Level Max — altere o Thought Level para High e repita a solicitação.
Dica. O comando npx @joingonka/setup --tool zcode imprimirá os valores prontos para esses campos — base URL, chave, ID do modelo e seus limites reais: janela de contexto e limite de resposta — e verificará via solicitação real se o gateway os aceita. O ZCode é configurado apenas via UI; não existe um arquivo editável com segurança, portanto, os valores devem ser inseridos manualmente.
Comparativo de preços: Coding Plan, Z.ai API, OpenRouter e Gonka
Quanto custa a inferência GLM em diferentes canais (preços por 1M de tokens; os dos concorrentes foram registrados em setembro de 2026, o preço da JoinGonka é inserido na página ao vivo a partir da API do gateway):
| Canal | Entrada, $/1M | Saída, $/1M | Modelo de pagamento |
|---|---|---|---|
| Z.ai API (GLM-5.2) | $1.40 (entrada em cache — $0.26) | $4.40 | por tokens |
| GLM Coding Plan | $18—160/mês | assinatura: cotas por «prompts», multiplicador ×3 no pico, limites de simultaneidade | |
| OpenRouter (z-ai/glm-5.2) | $1.40 | $4.40 | por tokens |
| OpenRouter (z-ai/glm-5.3-flash) | $0.09 | $0.30 | por tokens |
| JoinGonka Gateway | $0.0069 | $0.021 | por tokens, rede Gonka |
A diferença de duas ou três ordens de magnitude não é arredondamento de marketing, mas uma economia distinta: os cálculos são realizados por participantes da rede descentralizada, que ganham pelo trabalho realizado e não pela margem de um data center. Análise detalhada de como funciona e seus limites de aplicabilidade no artigo sobre a API de IA mais barata.
A linha JoinGonka representa o preço do GLM-5.3 Flash na rede Gonka: todos os modelos da rede possuem uma tarifa única. Os números nesta página são atualizados automaticamente, não há necessidade de recalcular nada manualmente.
GLM na rede Gonka: GLM-5.3 Flash e perguntas frequentes
A rede Gonka serve o modelo Z.ai: zai-org/GLM-5.3-Flash aceito pela proposta de governança #101 e fornecido pelo gateway juntamente com o MiniMax M2.7 e o DeepSeek V4 Flash. O emblemático GLM-5.2, mencionado nas primeiras versões deste guia, não entrou na composição operacional; a rede escolheu um modelo mais leve e rápido da mesma linha. O Base URL e a chave são os mesmos: no ZCode, basta adicionar o modelo em custom provider.
Sobre o modelo em si: pesos abertos sob licença MIT, arquitetura MoE com 320B de parâmetros (18B ativos por token), atenção híbrida dispersa e linear. A principal característica é ser um modelo de reasoning: antes de responder, ele raciocina, e o raciocínio ocupa algumas centenas de tokens mesmo para uma pergunta simples. Para o ZCode, isso significa duas coisas: não subestime o limite de comprimento de resposta do modelo (a partir de 600 tokens mesmo para réplicas curtas) e, para edições rápidas, reduza o Thought Level — em nível de API, isso é reasoning_effort: low. Análise detalhada do modelo e seus limites no artigo GLM-5.3 Flash na rede Gonka.
Perguntas frequentes:
- Por que ocorrem erros 429 ou fila no novo modelo? — O modelo é atendido por uma pequena parte dos hosts da rede; em minutos de pico, as solicitações podem aguardar um slot livre. Tente novamente após alguns segundos; o balanceador encontrará um nó ativo. O estado atual está na página de status do gateway.
- O que mais está disponível? — Além do GLM-5.3 Flash, há o MiniMax M2.7 e o DeepSeek V4 Flash: todos os três modelos funcionam no ZCode através do mesmo custom provider, a configuração deste guia é totalmente funcional.
- E a privacidade? — O gateway não armazena o conteúdo dos prompts e respostas; nas estatísticas, apenas agregados de consumo.
- Quando o Coding Plan é mais vantajoso? — Se você trabalha sozinho, fica dentro da cota Lite e não executa agentes paralelos, uma assinatura com taxa fixa é cômoda e previsível. Calcule conforme seu perfil: com trabalho ativo de agentes, o pagamento por tokens via rede sai ordens de magnitude mais barato; com edições leves de código algumas vezes ao dia, a diferença pode não ser sentida.
- É adequado para outras ferramentas? — Sim: o mesmo endpoint funciona no Claude Code, Cursor, Cline e em qualquer cliente compatível com OpenAI/Anthropic.