Abschnitte der Wissensbasis ▾
Navigation
▸ Hier starten Nach RollenKategorien
- Cursor + Gonka AI – günstige LLM zum Codieren
- Claude Code + Gonka AI – LLM für das Terminal
- OpenClaw + Gonka AI – erschwingliche KI-Agenten
- OpenCode: eigenes Modell im Terminal
- Continue.dev + Gonka AI – AI für VS Code/JetBrains
- Cline + Gonka AI – KI-Agent in VS Code
- Aider + Gonka AI – Paarprogrammierung mit KI
- LangChain + Gonka AI – KI-Anwendungen für wenige Cent
- n8n + Gonka AI – Automatisierung mit günstiger KI
- Open WebUI + Gonka AI – Ihr eigenes ChatGPT
- LibreChat + Gonka AI — Open-Source ChatGPT
- Hermes Agent + DeepSeek im Gonka-Netzwerk — autonomer Agent für ein paar Cent
- Kilo Code + Gonka AI – KI-Agent in VS Code
- Roo Code + Gonka AI – Autonomer KI-Agent in VS Code
- LlamaIndex + Gonka AI – RAG-Anwendungen für kleines Geld
- PydanticAI + Gonka – typisierte KI-Agenten für kleines Geld
- Vercel AI SDK + Gonka AI – KI-Anwendungen mit TypeScript für kleines Geld
- TanStack AI + Gonka – KI-Anwendungen mit TypeScript für kleines Geld
- API Schnellstart — curl, Python, TypeScript
- JoinGonka Gateway — vollständige Übersicht
- Management Keys – SaaS auf Gonka
- Die günstigste AI API: Anbietervergleich 2026
- Wie man AI-Token und API-Schlüssel kauft: 3 Wege im Jahr 2026
- Cursor Pro Request-Limit erreicht — Analyse und eine günstige Alternative
- Claude Code ist günstiger — Rechnungsanalyse und Wechsel
- Cline verbrennt Geld — warum der Agent so viel verbraucht
- OpenClaw wird teuer — warum der Agent Tokens verbrennt und wie man spart
- OpenRouter: Günstige Alternative — Vergleich mit JoinGonka Gateway
- Das beste AI-Modell für Coding im Jahr 2026: Vergleich und Preise
- Günstige Alternative zu GitHub Copilot ohne Limits
- Günstige Alternative zu Windsurf ohne Credits und Limits
- Die günstigste API für AI-Agenten im Jahr 2026
- ZCode: günstige GLM-Inferenz anstelle des GLM Coding Plan
- JetBrains IDE + JoinGonka Gateway — eigener Endpoint statt Credits
- GitHub Copilot BYOK — eigene Modelle statt Kontingent
- Zed + JoinGonka Gateway — günstiges Inference im Editor
- Pi + JoinGonka Gateway — Terminal-Agent mit günstiger Inference
- Codex CLI: eigener Schlüssel statt Abonnement
- DeepSeek Harness: eigener Provider via JoinGonka Gateway
- MiniMax Code: MiniMax-Agent mit eigenem Schlüssel über Gonka
- Warp + JoinGonka Gateway — Terminal-Agent auf Ihrem eigenen Endpoint
- Trae + JoinGonka Gateway — Gonka-Netzwerkmodelle in der AI-IDE
- Cherry Studio + JoinGonka Gateway — Desktop AI-Client
- omp (Oh My Pi) + JoinGonka Gateway: Agent mit Modellrollen
- OpenHands + JoinGonka Gateway: Agent auf eigenem Endpunkt
- Qwen Code nach Schließung von qwen-oauth: Arbeit über JoinGonka Gateway
- Goose + JoinGonka Gateway: Eigener Provider und Schlüssel im Keyring
- Crush + JoinGonka Gateway: Charm-Agent auf Modellen des Gonka-Netzwerks
- Zoo Code + JoinGonka Gateway: Umzug von Roo Code auf Gonka-Modelle
- Kimi Code CLI: Moonshot AI Agent mit eigenem Schlüssel über Gonka
- Factory Droid + JoinGonka Gateway: BYOK mit Gonka Netzwerkmodellen
- MiMo Code + JoinGonka Gateway: Xiaomi Agent auf Gonka Netzwerkmodellen
Tools
ZCode: günstige GLM-Inferenz anstelle des GLM Coding Plan
Im Juni 2026 veröffentlichte Z.ai ZCode 3.0 — eine Desktop-Agenten-Entwicklungsumgebung, die das Unternehmen selbst als „Official Harness for GLM-5.2“ bezeichnet. Das Produkt erregte schnell Aufmerksamkeit: eine eigene Agenten-Engine, autonome Aufgaben via /goal, Multi-Agent-Modus und Remote-Sitzungsverwaltung direkt aus Telegram. Aber mit der Welle von Rezensionen kam auch eine Welle von Fragen von den ersten GLM Coding Plan-Abonnenten: Die Quote wird als „Prompts“ in 5-Stunden-Fenstern gezählt, zu Spitzenzeiten verdreifacht sich der Verbrauch, bei kleineren Tarifen gibt es nur eine parallele Anfrage, und auf Hacker News wird über plötzliche Sperrungen nach einem intensiven Arbeitstag geklagt.
Die gute Nachricht: ZCode unterstützt offiziell einen custom provider — man kann jeden OpenAI- oder Anthropic-kompatiblen API anschließen und für tatsächliche Tokens bezahlen, anstatt für Abonnement-Quoten. In diesem Guide erklären wir, was ZCode ist und wie der GLM Coding Plan funktioniert, und richten anschließend ZCode schrittweise auf das JoinGonka Gateway ein — ein Gateway für das dezentrale Gonka-Netzwerk, das GLM-5.3 Flash bedient, ein offenes Reasoning-Modell von Z.ai. Das Ergebnis: Dasselbe Tool, dieselben Open-Weight-Modelle, aber die Kosten basieren auf Tokens und sind um ein Vielfaches günstiger als bei zentralisierten APIs.
Was ist ZCode: eine agentische Entwicklungsumgebung von Z.ai
ZCode ist kein „Editor mit Chat-Sidebar“, sondern eine ADE: Sie beschreiben das Ziel, der Agent entwickelt einen Plan, bearbeitet Dateien, führt Überprüfungen durch und iteriert bis zum Ergebnis. Es läuft als Desktop-Applikation auf macOS und Windows (Build für Linux im Beta-Status).
Die Hauptfunktionen der Version 3.0:
- ZCode Agent — eigener Agent-Kern mit tiefer Integration von GLM-5.2; zusätzlich lassen sich Drittanbieter-Agenten anschließen (Claude Code, Codex, Gemini CLI und andere);
- Goal-Modus (
/goal) — langanhaltende autonome Aufgaben: Plan → Ausführung → schrittweise Verifizierung; - Multi-agent — parallele Arbeit mehrerer Agenten an einem Projekt;
- Remote-Verwaltung — Start und Kontrolle von Sitzungen über Telegram, WeChat und Feishu: Der Agent läuft auf Ihrem Computer, und Sie beantworten Fragen vom Handy aus.
Der Client selbst ist kostenlos, neuen Nutzern stellt Z.ai eine tägliche Quote von GLM-5.2-Token zum Kennenlernen bereit. Danach gibt es entweder den GLM Coding Plan oder einen eigenen API-Schlüssel. Und hier lohnt es sich, ins Detail zu gehen, denn der Aufbau des Abonnements ist der am meisten diskutierte Teil des Produkts.
GLM Coding Plan: Preis, Limits und Quoten
Der GLM Coding Plan ist das Abo von Z.ai und bietet Zugang zu den GLM-Modellen in ZCode und in rund zwei Dutzend Drittanbieter-Tools. Zum Zeitpunkt der Veröffentlichung (Juli 2026) sieht das Basisraster so aus – doch Preise und Aktionen ändern sich, prüfen Sie die aktuelle Seite z.ai/subscribe:
| Tarif | Preis, $/Monat | Kontingent | Parallele Anfragen |
|---|---|---|---|
| Lite | $18 (bei Aktionen – ab ~$12.6) | „Prompts“ in 5-Stunden-Fenstern + Wochenobergrenze | 1 |
| Pro | $72 | ×4 gegenüber Lite | 1 |
| Max | $160 | ×16 gegenüber Lite | bis zu 30 |
Worüber Abonnenten klagen (Threads auf Hacker News und GitHub):
- Spitzenlast-Multiplikator. In Stoßzeiten (14:00–18:00 UTC+8 – Abend in Asien, Morgen bis Mittag in Europa) wird pro Anfrage das Kontingent mit Faktor ×3 belastet, außerhalb der Spitze mit ×2. Die Ausgabenplanung richtet sich nach der Pekinger Zeitzone.
- Kontingent in „Prompts“, nicht in Tokens. Wie viele Tokens genau übrig sind, bleibt undurchsichtig; in den Threads finden sich Geschichten wie „~17M Tokens mit GLM verbraucht – und vier Tage Sperre kassiert“.
- Eine parallele Anfrage bei Lite und Pro. Für eine agentische Umgebung ist das spürbar: der Multi-Agent-Modus von ZCode selbst und alle parallelen Sub-Agenten landen in der Warteschlange.
- GLM-5.2 verbraucht das Kontingent schneller als die kleineren Modelle – das Flaggschiff verbrennt das Limit mit eigenem Multiplikator.
Das Fazit ist einfach: Für entspannte Solo-Entwicklung funktioniert das Abo ehrlich. Doch je „agentischer“ Ihr Modus – parallele Aufgaben, lange autonome Sessions, nächtliche Läufe –, desto häufiger wird das Kontingentmodell zur Lotterie. Die Alternative: Zahlung nach tatsächlichen Tokens – ohne Fenster, Multiplikatoren und Warteschlangen: So viel der Agent verbraucht hat, so viel wird abgebucht. Genau dieses Modell bietet der in ZCode integrierte Mechanismus für Custom Provider, und er ist in fünf Minuten eingerichtet.
BYOK in ZCode: eigener API-Schlüssel und custom provider
ZCode bringt offiziell Unterstützung für BYOK mit: Die Doku erlaubt ausdrücklich das Hinzufügen „jedes Dienstes, der mit den Protokollen von OpenAI oder Anthropic kompatibel ist" – öffentliche APIs, Unternehmenskanäle und sogar Self-Hosted-Installationen. Die Einrichtung läuft über drei Wege:
- Button Connect im Willkommensbildschirm → „Set Your API Key";
- Manage Models im Modell-Selektor;
- Zahnrad → Settings → Model Settings → Add Provider.
Für den Anbieter werden OpenAI Base URL und/oder Anthropic Base URL plus API Key angegeben – die Liste der verfügbaren Modelle zieht ZCode selbst nach.
Drei Stolperfallen, über die die meisten stolpern:
- Die Endpoints von Z.ai unterscheiden sich. Das Coding-Plan-Abo funktioniert nur über den coding-endpoint
https://api.z.ai/api/coding/paas/v4; der allgemeine/api/paas/v4liefert mit einem Abo-Schlüssel einen Fehler – die klassische Ursache für „ich bekomme 401/429, obwohl der Plan bezahlt ist". - „Läuft in Claude Code ≠ läuft in ZCode". Umgebungsvariablen wie
ANTHROPIC_BASE_URL, über die man Claude Code konfiguriert, liest ZCode nicht: Es hat einen eigenen Speicher für Anbieter-Einstellungen. Konfigurieren Sie direkt über Settings. - „Modell im Selektor sichtbar ≠ Schlüssel hat Kontingent". Die Modellliste wird aus der API des Anbieters gezogen, die Verfügbarkeit hängt aber vom Guthaben und den Limits des konkreten Schlüssels ab.
Jetzt zur Praxis: Wir binden das JoinGonka-Gateway an ZCode an und bekommen den GLM-Stack für Token.
Einrichtung des JoinGonka Gateways in ZCode: GLM per Token
JoinGonka Gateway — ein Gateway zum dezentralen Gonka-Netzwerk mit zwei nativen Protokollen: OpenAI-kompatibel /v1/chat/completions und Anthropic Messages /v1/messages. Das Modell ist pay-per-token: keine 5-Stunden-Fenster, keine ×3-Spitzenmultiplikatoren und kein Limit für parallele Anfragen; der Verbrauch ist in Echtzeit im Dashboard sichtbar, und das Gateway speichert keine Prompt-Inhalte.
Schritt für Schritt (aktuelles Interface Custom Provider):
| Schritt | Aktion |
|---|---|
| 1. Schlüssel | Registrieren Sie sich — gate.joingonka.ai/register (neue Konten erhalten 3M kostenlose Tokens), erstellen Sie einen API-Schlüssel im Bereich Keys. Weitere Informationen finden Sie in der API Quick Start. |
| 2. Provider | ZCode → Settings → Model Settings → Add Provider. Name: JoinGonka |
| 3. Base URL | https://gate.joingonka.ai/v1 |
| 4. API Key | Ihr Schlüssel im Format jg-… |
| 5. API format | Chat completions (/chat/completions) |
| 6. Modell | Add Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Auf die gleiche Weise werden MiniMaxAI/MiniMax-M2.7 und zai-org/GLM-5.3-Flash hinzugefügt — das Reasoning-Modell von Z.ai; die aktuelle Liste und Limits finden Sie unter GET /v1/models. |
In älteren ZCode-Versionen gibt es stattdessen zwei separate Felder: OpenAI Base URL (https://gate.joingonka.ai/v1) und Anthropic Base URL (https://gate.joingonka.ai — den Pfad fügt der Client selbst hinzu).
Überprüfung: Wählen Sie das erstellte Modell aus und stellen Sie dem Agenten eine beliebige Frage. Wenn eine Antwort kommt, funktioniert alles; bei Fehler 401 — Schlüssel prüfen, bei 402 — Kontostand prüfen. Falls bei DeepSeek V4 Flash „Model request failed“ bei Thought Level Max erscheint, stellen Sie Thought Level auf High und wiederholen Sie die Anfrage.
Tipp: Der Befehl npx @joingonka/setup --tool zcode gibt die fertigen Werte für diese Felder aus — Base URL, Schlüssel, Modell-ID und deren reale Limits (Kontextfenster und Antwortlimit) — und prüft mit einer Live-Anfrage, ob das Gateway sie akzeptiert. ZCode selbst kann nur über das UI konfiguriert werden — es gibt keine Datei, die man sicher bearbeiten könnte, daher müssen die Werte manuell eingetragen werden.
Preisvergleich: Coding Plan, Z.ai API, OpenRouter und Gonka
Was kostet GLM-Inferenz in verschiedenen Kanälen (Preise pro 1M Token; bei Wettbewerbern Stand September 2026, der Preis von JoinGonka wird live aus der Gateway-API in die Seite geladen):
| Kanal | Eingabe, $/1M | Ausgabe, $/1M | Zahlungsmodell |
|---|---|---|---|
| Z.ai API (GLM-5.2) | $1.40 (gecachte Eingabe — $0.26) | $4.40 | pro Token |
| GLM Coding Plan | $18—160/Monat | Abonnement: Kontingente nach «Prompts», ×3 Multiplikator zu Spitzenzeiten, Parallelitätslimits | |
| OpenRouter (z-ai/glm-5.2) | $1.40 | $4.40 | pro Token |
| OpenRouter (z-ai/glm-5.3-flash) | $0.09 | $0.30 | pro Token |
| JoinGonka Gateway | $0.0069 | $0.021 | pro Token, Netzwerk Gonka |
Der Unterschied um zwei bis drei Größenordnungen ist keine Marketing-Rundung, sondern eine andere Ökonomie: Die Berechnungen werden von den Teilnehmern des dezentralen Netzwerks durchgeführt, die an der Arbeit selbst verdienen und nicht an der Marge des Rechenzentrums. Eine detaillierte Analyse, wie das funktioniert und wo die Grenzen der Anwendbarkeit liegen, finden Sie im Artikel über die günstigste AI API.
Die Zeile JoinGonka zeigt den Preis für GLM-5.3 Flash im Netzwerk Gonka: Alle Modelle im Netzwerk haben den gleichen Tarif. Die Zahlen auf dieser Seite werden automatisch aktualisiert, man muss nichts manuell nachrechnen.
GLM im Netzwerk Gonka: GLM-5.3 Flash und häufig gestellte Fragen
Das Gonka-Netzwerk bedient jetzt das Z.ai-Modell: zai-org/GLM-5.3-Flash wurde durch den Governance-Vorschlag #101 angenommen und wird nun über das Gateway bereitgestellt, gleichberechtigt mit MiniMax M2.7 und DeepSeek V4 Flash. Das Flaggschiff GLM-5.2, das in den ersten Versionen dieses Leitfadens erwähnt wurde, wurde nicht in den produktiven Betrieb aufgenommen — das Netzwerk hat sich für ein leichteres und schnelleres Modell derselben Reihe entschieden. Base URL und Schlüssel bleiben gleich: In ZCode reicht es aus, das Modell als custom provider hinzuzufügen.
Über das Modell selbst: Open Weights unter MIT-Lizenz, MoE-Architektur mit 320B Parametern (18B aktiv pro Token), hybride Sparse- und Linear-Attention. Die Hauptbesonderheit ist, dass es sich um ein Reasoning-Modell handelt: Vor der Antwort denkt es nach, und dieser Denkprozess beansprucht selbst bei einfachen Fragen mehrere hundert Token. Für ZCode bedeutet das zwei Dinge: Unterschreiten Sie nicht das Antwortlängenlimit des Modells (ab 600 Token, selbst für kurze Antworten) und für schnelle Korrekturen senken Sie das Thought Level — auf API-Ebene entspricht das reasoning_effort: low. Eine detaillierte Analyse des Modells und seiner Limits finden Sie im Artikel GLM-5.3 Flash im Gonka-Netzwerk.
Häufige Fragen:
- Warum gibt es beim neuen Modell manchmal 429 oder eine Warteschlange? — Das Modell wird derzeit von einem kleinen Teil der Netzwerkknoten bedient; in Stoßzeiten können Anfragen auf einen freien Slot warten. Wiederholen Sie die Anfrage nach ein paar Sekunden — der Load Balancer findet einen aktiven Knoten. Den aktuellen Status finden Sie auf der Gateway-Statusseite.
- Was ist noch verfügbar? — Neben GLM-5.3 Flash gibt es MiniMax M2.7 und DeepSeek V4 Flash: Alle drei Modelle funktionieren in ZCode über denselben custom provider, die Konfiguration aus diesem Leitfaden ist vollständig einsatzbereit.
- Was ist mit dem Datenschutz? — Das Gateway speichert keine Inhalte von Prompts oder Antworten; in der Statistik werden nur aggregierte Verbrauchswerte geführt.
- Wann ist der Coding Plan dennoch günstiger? — Wenn Sie alleine arbeiten, innerhalb des Lite-Kontingents bleiben und keine parallelen Agenten ausführen, ist ein Abonnement mit Festpreis bequem und vorhersehbar. Rechnen Sie nach Ihrem Profil: Bei aktiver Agentenarbeit ist die Bezahlung pro Token über das Netzwerk um Größenordnungen günstiger; bei kleinen Code-Anpassungen ein paar Mal am Tag ist der Unterschied möglicherweise nicht spürbar.
- Ist das für andere Tools geeignet? — Ja: Dasselbe Endpoint funktioniert in Claude Code, Cursor, Cline und jedem OpenAI/Anthropic-kompatiblen Client.
Möchten Sie mehr erfahren?
Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.
Kostenlose Token erhalten →