Abschnitte der Wissensbasis ▾
Navigation
▸ Hier starten Nach RollenKategorien
- Cursor + Gonka AI – günstige LLM zum Codieren
- Claude Code + Gonka AI – LLM für das Terminal
- OpenClaw + Gonka AI – erschwingliche KI-Agenten
- OpenCode + Gonka AI – kostenlose KI für Code
- Continue.dev + Gonka AI – AI für VS Code/JetBrains
- Cline + Gonka AI – KI-Agent in VS Code
- Aider + Gonka AI – Paarprogrammierung mit KI
- LangChain + Gonka AI – KI-Anwendungen für wenige Cent
- n8n + Gonka AI – Automatisierung mit günstiger KI
- Open WebUI + Gonka AI – Ihr eigenes ChatGPT
- LibreChat + Gonka AI — Open-Source ChatGPT
- Hermes Agent + Gonka AI – Autonomer Agent für ein paar Cent
- Kilo Code + Gonka AI – KI-Agent in VS Code
- Roo Code + Gonka AI – Autonomer KI-Agent in VS Code
- LlamaIndex + Gonka AI – RAG-Anwendungen für kleines Geld
- PydanticAI + Gonka – typisierte KI-Agenten für kleines Geld
- Vercel AI SDK + Gonka AI – KI-Anwendungen mit TypeScript für kleines Geld
- TanStack AI + Gonka – KI-Anwendungen mit TypeScript für kleines Geld
- API Schnellstart — curl, Python, TypeScript
- JoinGonka Gateway — vollständige Übersicht
- Management Keys – SaaS auf Gonka
- Die günstigste AI API: Anbietervergleich 2026
- Cursor Pro Request-Limit erreicht — Analyse und eine günstige Alternative
- Claude Code ist günstiger — Rechnungsanalyse und Wechsel
- Cline verbrennt Geld — warum der Agent so viel verbraucht
- OpenClaw wird teuer — warum der Agent Tokens verbrennt und wie man spart
- OpenRouter: Günstige Alternative — Vergleich mit JoinGonka Gateway
- Das beste AI-Modell für Coding im Jahr 2026: Vergleich und Preise
- Günstige Alternative zu GitHub Copilot ohne Limits
- Günstige Alternative zu Windsurf ohne Credits und Limits
- Die günstigste API für AI-Agenten im Jahr 2026
- ZCode: günstige GLM-Inferenz anstelle des GLM Coding Plan
- JetBrains IDE + JoinGonka Gateway — eigener Endpoint statt Credits
- GitHub Copilot BYOK — eigene Modelle statt Kontingent
- Zed + JoinGonka Gateway — günstiges Inference im Editor
- Pi + JoinGonka Gateway — Terminal-Agent mit günstiger Inference
Tools
ZCode: günstige GLM-Inferenz anstelle des GLM Coding Plan
Im Juni 2026 veröffentlichte Z.ai ZCode 3.0 — eine agentische Desktop-Entwicklungsumgebung, die vom Unternehmen selbst als „Official Harness for GLM-5.2“ bezeichnet wird. Das Produkt erregte schnell Aufmerksamkeit: ein eigener Agent-Kern, autonome Aufgaben über /goal, Multi-Agent-Modus und Remotesteuerung der Sitzungen direkt aus Telegram. Aber mit der Welle von Reviews kamen auch die Fragen der ersten Abonnenten des GLM Coding Plan: Die Quote wird über „Prompts“ in fünfstündigen Fenstern berechnet, in Spitzenzeiten verdreifacht sich der Verbrauch, bei kleineren Tarifen gibt es nur eine parallele Anfrage, und auf Hacker News gibt es Beschwerden über plötzliche Sperrungen nach einem intensiven Arbeitstag.
Die gute Nachricht: ZCode unterstützt offiziell einen custom provider — man kann jede OpenAI- oder Anthropic-kompatible API anschließen und nach tatsächlichen Token bezahlen, anstatt nach Abonnement-Quoten. In diesem Leitfaden werden wir analysieren, was ZCode ist und wie der GLM Coding Plan funktioniert, und anschließend Schritt für Schritt ZCode mit dem JoinGonka Gateway einrichten — dem Gateway des dezentralen Gonka-Netzwerks, in dessen Register GLM-5.2 bereits hinzugefügt wurde. Das Ergebnis: dasselbe Tool, dieselben Open-Weight-Modelle, aber die Wirtschaftlichkeit basiert auf Token und ist Hunderte Male günstiger als bei zentralisierten APIs.
Was ist ZCode: eine agentische Entwicklungsumgebung von Z.ai
ZCode ist kein „Editor mit Chat-Sidebar“, sondern eine ADE: Sie beschreiben das Ziel, der Agent entwickelt einen Plan, bearbeitet Dateien, führt Überprüfungen durch und iteriert bis zum Ergebnis. Es läuft als Desktop-Applikation auf macOS und Windows (Build für Linux im Beta-Status).
Die Hauptfunktionen der Version 3.0:
- ZCode Agent — eigener Agent-Kern mit tiefer Integration von GLM-5.2; zusätzlich lassen sich Drittanbieter-Agenten anschließen (Claude Code, Codex, Gemini CLI und andere);
- Goal-Modus (
/goal) — langanhaltende autonome Aufgaben: Plan → Ausführung → schrittweise Verifizierung; - Multi-agent — parallele Arbeit mehrerer Agenten an einem Projekt;
- Remote-Verwaltung — Start und Kontrolle von Sitzungen über Telegram, WeChat und Feishu: Der Agent läuft auf Ihrem Computer, und Sie beantworten Fragen vom Handy aus.
Der Client selbst ist kostenlos, neuen Nutzern stellt Z.ai eine tägliche Quote von GLM-5.2-Token zum Kennenlernen bereit. Danach gibt es entweder den GLM Coding Plan oder einen eigenen API-Schlüssel. Und hier lohnt es sich, ins Detail zu gehen, denn der Aufbau des Abonnements ist der am meisten diskutierte Teil des Produkts.
GLM Coding Plan: Preis, Limits und Quoten
Der GLM Coding Plan ist das Abonnement von Z.ai, das Zugriff auf GLM-Modelle in ZCode und in zwei Dutzend Drittanbieter-Tools gewährt. Zum Zeitpunkt der Veröffentlichung (Juli 2026) sieht die Basisstruktur wie folgt aus — aber Preise und Aktionen ändern sich, prüfen Sie die aktuelle Seite z.ai/subscribe:
| Tarif | Preis, $/Monat | Quote | Parallele Anfragen |
|---|---|---|---|
| Lite | $18 (mit Aktionen — ab ~$12.6) | „Prompts“ in 5-Stunden-Fenstern + Wochenlimit | 1 |
| Pro | $72 | ×4 von Lite | 1 |
| Max | $160 | ×16 von Lite | bis zu 30 |
Worüber sich Abonnenten beschweren (Threads auf Hacker News und GitHub):
- Spitzen-Multiplikator. Zu Spitzenzeiten (14:00—18:00 UTC+8 — abends in Asien, vormittags/nachmittags in Europa) verbucht jede Anfrage die Quote mit einem Koeffizienten von ×3, außerhalb der Spitzenzeiten mit ×2. Der Verbrauch muss nach der Pekinger Zeitzone geplant werden.
- Quote nach „Prompts“, nicht nach Token. Wie viele Token genau übrig sind, ist intransparent; in Threads gibt es Berichte wie: „~17M Token bei GLM verbraucht — und für vier Tage gesperrt“.
- Eine parallele Anfrage bei Lite und Pro. Für eine agentische Umgebung spürt man das deutlich: Sowohl der Multi-Agent-Modus von ZCode als auch parallele Unteragenten stoßen an die Warteschlangenbegrenzung.
- GLM-5.2 verbraucht die Quote schneller als kleinere Modelle — das Flaggschiff verbrennt das Limit mit einem eigenen Multiplikator.
Das Fazit ist simpel: Für entspanntes Solo-Coding funktioniert das Abonnement fair. Aber je „agentischer“ Ihr Modus ist — parallele Aufgaben, lange autonome Sitzungen, nächtliche Durchläufe —, desto öfter wird das Quotenmodell zur Lotterie. Die Alternative ist die Abrechnung nach tatsächlichen Token: ohne Fenster, Multiplikatoren und Warteschlangen — so viel der Agent verbraucht hat, wird berechnet. Genau dieses Modell bietet der in ZCode integrierte Custom-Provider-Mechanismus, und die Einrichtung dauert fünf Minuten.
BYOK in ZCode: eigener API-Schlüssel und custom provider
ZCode unterstützt offiziell BYOK: Die Dokumentation erlaubt ausdrücklich das Hinzufügen von „jedem Dienst, der mit OpenAI- oder Anthropic-Protokollen kompatibel ist“ — öffentliche APIs, Unternehmenskanäle und sogar selbst gehostete Installationen. Die Konfiguration erfolgt auf drei Wegen:
- Connect-Button auf dem Welcome-Screen → „Set Your API Key“;
- Manage Models in der Modellauswahl;
- Zahnrad → Settings → Model Settings → Add Provider.
Für den Provider werden die OpenAI Base URL und/oder Anthropic Base URL sowie der API Key festgelegt — eine Liste der verfügbaren Modelle ruft ZCode automatisch ab.
Drei häufige Stolperfallen:
- Z.ai-Endpoints unterscheiden sich. Der Coding Plan funktioniert nur über den Coding-Endpoint
https://api.z.ai/api/coding/paas/v4; der allgemeine/api/paas/v4führt mit einem Abonnement-Key zu einem Fehler — die klassische Ursache für „Ich erhalte 401/429, obwohl der Plan bezahlt ist“. - „Funktioniert in Claude Code ≠ funktioniert in ZCode“. Umgebungsvariablen wie
ANTHROPIC_BASE_URL, mit denen Claude Code konfiguriert wird, liest ZCode nicht: Es verwendet einen eigenen Speicher für Provider-Einstellungen. Konfigurieren Sie diese ausschließlich über die Settings. - „Modell in der Auswahl sichtbar ≠ Key hat Kontingent“. Die Modellliste wird von der API des Providers abgerufen, die Verfügbarkeit hängt jedoch vom Guthaben und den Limits des jeweiligen Keys ab.
Weiter geht es mit der Praxis: Wir verbinden das JoinGonka-Gateway mit ZCode und erhalten den GLM-Stack für Token-basierte Abrechnung.
Einrichtung des JoinGonka Gateways in ZCode: GLM per Token
JoinGonka Gateway — ein Gateway zum dezentralen Gonka-Netzwerk mit zwei nativen Protokollen: OpenAI-kompatibel /v1/chat/completions und Anthropic Messages /v1/messages. Ökonomie — Pay-per-token: keine 5-Stunden-Fenster, keine ×3 Spitzen-Multiplikatoren und keine Limits für parallele Anfragen; der Verbrauch ist im Dashboard in Echtzeit sichtbar, das Gateway speichert den Inhalt der Prompts nicht.
Schritt für Schritt (aktuelle Custom Provider-Schnittstelle):
| Schritt | Aktion |
|---|---|
| 1. Key | Registrieren Sie sich — gate.joingonka.ai/register (neue Konten erhalten 10M kostenlose Token), erstellen Sie einen API-Key im Bereich Keys. Weitere Informationen unter API Quick Start. |
| 2. Provider | ZCode → Settings → Model Settings → Add Provider. Name: JoinGonka |
| 3. Base URL | https://gate.joingonka.ai/v1 |
| 4. API Key | Ihr Key im Format jg-… |
| 5. API format | Chat completions (/chat/completions) |
| 6. Modell | Add Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Ebenso werden moonshotai/Kimi-K2.6 und MiniMaxAI/MiniMax-M2.7 hinzugefügt; aktuelle Liste — GET /v1/models. |
In älteren ZCode-Versionen gibt es stattdessen zwei separate Felder: OpenAI Base URL (https://gate.joingonka.ai/v1) und Anthropic Base URL (https://gate.joingonka.ai — der Pfad wird vom Client selbst hinzugefügt).
Überprüfung: Wählen Sie das erstellte Modell aus und stellen Sie dem Agenten eine beliebige Frage. Wenn die Antwort ankommt, funktioniert alles; bei Fehler 401 — prüfen Sie den Key, bei 402 — den Kontostand. Wenn bei DeepSeek V4 Flash „Model request failed“ bei Thought Level Max erscheint, schalten Sie Thought Level auf High um und wiederholen Sie die Anfrage.
Tipp: Der Befehl npx @joingonka/setup --tool zcode gibt die fertigen Werte für die Felder unten aus (Base URL, Key, Modell-ID mit aktuellen Limits) und prüft per Live-Anfrage, ob das Gateway sie akzeptiert. ZCode lässt sich nur über die UI konfigurieren — es gibt keine Datei, die man sicher bearbeiten könnte, daher müssen die Werte manuell eingefügt werden.
Preisvergleich: Coding Plan, Z.ai API, OpenRouter und Gonka
Wie viel kostet GLM-Inferenz über verschiedene Kanäle (Preise pro 1M Token; bei Wettbewerbern Stand Juli 2026, der Preis von JoinGonka wird live über das API-Gateway auf die Seite geladen):
| Kanal | Eingabe, $/1M | Ausgabe, $/1M | Zahlungsmodell |
|---|---|---|---|
| Z.ai API (GLM-5.2) | $1.40 (gecachte Eingabe — $0.26) | $4.40 | pro Token |
| GLM Coding Plan | $18—160/Monat | Abonnement: Kontingente durch „Prompts“, Multiplikator ×3 bei Spitzenlast, Parallelitätslimits | |
| OpenRouter (z-ai/glm-5.2) | $0.93 | $3.00 | pro Token; keine kostenlose Variante von GLM-5.2 verfügbar |
| JoinGonka Gateway | $0.0032 | $0.0097 | pro Token, Gonka-Netzwerk |
Der Unterschied von zwei bis drei Größenordnungen ist kein Marketing-Rundungswert, sondern eine andere Wirtschaftsweise: Die Berechnungen werden von Teilnehmern eines dezentralen Netzwerks durchgeführt, die an der Arbeit selbst verdienen und nicht an der Marge eines Rechenzentrums. Eine detaillierte Analyse, wie das funktioniert und wo die Anwendungsgrenzen liegen, finden Sie im Artikel über die günstigste AI API.
Ein ehrlicher Hinweis zu GLM-5.2: Den genauen Preis für das Modell legt das Netzwerk zum Zeitpunkt der Aktivierung fest (in der obigen Tabelle steht der aktuelle Live-Preis der Netzwerkmodelle). Die Zahlen auf dieser Seite werden automatisch aktualisiert, Sie müssen nichts manuell neu berechnen.
GLM-5.2 im Gonka-Netzwerk: Status und häufige Fragen
Das Modell zai-org/GLM-5.2-FP8 wurde bereits zum On-Chain-Register des Gonka-Netzwerks hinzugefügt: Die Konfiguration legt ein Kontextfenster von bis zu 400K Token fest, und das Modell selbst gehört zu den schweren (eine Replik benötigt mehr als ein Terabyte VRAM). Der Rollout läuft gerade: Die Netzwerkknoten wärmen die Gewichte auf. Sobald die Prüfungen grün sind, erscheint das Modell automatisch in der Gateway-Liste – Base URL und Key bleiben unverändert, in ZCode muss es lediglich im Selektor ausgewählt werden.
Zum Modell selbst: Offene Gewichte unter MIT-Lizenz, MoE-Architektur mit ~750B Parametern (etwa 40B aktiv pro Token), natives Fenster bis zu 1M Token. Laut Z.ai erreicht das Modell bei SWE-bench Pro einen Wert von 62.1 – höher als GPT-5.5, und bei FrontierSWE liegt es etwa ein Prozent hinter Claude Opus 4.8. Für ein Open-Weight-Modell ist das der Spitzenplatz beim Coding.
Häufige Fragen:
- Warum treten direkt nach der Aktivierung eines neuen Modells 429-Fehler auf? – Das ist die Rollout-Phase: Einige Knoten laden noch die Gewichte. Wiederholen Sie die Anfrage nach ein paar Sekunden – der Load Balancer findet einen aktiven Knoten.
- Was ist heute schon verfügbar? – Kimi K2.6, MiniMax M2.7 und DeepSeek V4 Flash: Alle drei Modelle funktionieren in ZCode über denselben Custom Provider, die Konfiguration aus diesem Leitfaden ist bereits jetzt voll einsatzbereit.
- Was ist mit dem Datenschutz? – Das Gateway speichert keine Inhalte von Prompts oder Antworten; in der Statistik erscheinen nur aggregierte Verbrauchswerte.
- Wann ist der Coding Plan dennoch profitabler? – Wenn Sie solo arbeiten, das Lite-Kontingent einhalten und keine parallelen Agenten ausführen, ist ein Abonnement mit Festpreis praktisch und vorhersehbar. Rechnen Sie es für Ihr Profil durch: Bei aktiver Agenten-Arbeit ist die Zahlung pro Token über das Netzwerk um Größenordnungen günstiger; bei einfacher Code-Bearbeitung ein paar Mal am Tag spüren Sie den Unterschied vielleicht nicht.
- Ist das für andere Tools geeignet? – Ja: Derselbe Endpunkt funktioniert in Claude Code, Cursor, Cline und jedem OpenAI/Anthropic-kompatiblen Client.
Möchten Sie mehr erfahren?
Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.
10M kostenlose Token erhalten →