Sekcje bazy wiedzy ▾

Nawigacja

▸ Zacznij tutaj Według ról

Kategorie

Narzędzia 52
Słownik 12

Narzędzia

ZCode: tania inferencja GLM zamiast GLM Coding Plan

W czerwcu 2026 Z.ai wydało ZCode 3.0 — desktopowe środowisko programistyczne oparte na agentach, które firma nazywa „Official Harness for GLM-5.2”. Produkt szybko zyskał uwagę: własny rdzeń agentowy, autonomiczne zadania przez /goal, tryb multi-agent i zdalne zarządzanie sesjami bezpośrednio z Telegrama. Jednak wraz z falą recenzji pojawiła się fala pytań od pierwszych subskrybentów GLM Coding Plan: kwota jest liczona w „promptach” w pięciogodzinnych oknach, w godzinach szczytu zużycie jest mnożone przez trzy, w niższych planach dostępny jest tylko jeden równoległy zapytanie, a na Hacker News użytkownicy skarżą się na nagłe blokady po intensywnym dniu pracy.

Dobra wiadomość: ZCode oficjalnie obsługuje custom provider — można do niego podłączyć dowolny API kompatybilny z OpenAI lub Anthropic i płacić za faktyczne tokeny, a nie za subskrypcyjne kwoty. W tym przewodniku wyjaśnimy, czym jest ZCode i jak działa GLM Coding Plan, a następnie krok po kroku skonfigurujemy ZCode z JoinGonka Gateway — bramą zdecentralizowanej sieci Gonka, która obsługuje GLM-5.3 Flash — otwarty model reasoningowy samej Z.ai. Wynik: to samo narzędzie, te same modele open-weight, ale ekonomia oparta na tokenach i wielokrotnie tańsza niż w przypadku scentralizowanych API.

Czym jest ZCode: agentowe środowisko programistyczne od Z.ai

ZCode to nie „edytor z paskiem bocznym czatu”, a ADE: opisujesz cel, agent tworzy plan, poprawia pliki, uruchamia testy i iteruje do uzyskania wyniku. Działa jako aplikacja desktopowa na macOS i Windows (budowa dla Linux — w statusie beta).

Kluczowe możliwości wersji 3.0:

  • ZCode Agent — własne rdzeń agentowy z głęboką integracją GLM-5.2; poza nim można podłączać agentów zewnętrznych (Claude Code, Codex, Gemini CLI i inni);
  • Tryb Goal (/goal) — długie autonomiczne zadania: plan → wykonanie → weryfikacja krok po kroku;
  • Multi-agent — równoległa praca kilku agentów nad projektem;
  • Zdalne sterowanie — uruchamianie i kontrola sesji z Telegram, WeChat i Feishu: agent działa na twojej maszynie, a ty odpowiadasz na pytania z telefonu.

Sam klient jest darmowy, nowym użytkownikom Z.ai daje dzienną kwotę tokenów GLM-5.2 do zapoznania się. Dalej — albo subskrypcja GLM Coding Plan, albo własny API-klucz. I tutaj warto wgłębić się w szczegóły, ponieważ mechanizm subskrypcji jest najbardziej dyskutowaną częścią produktu.

GLM Coding Plan: cena, limity i kwoty

GLM Coding Plan to subskrypcja Z.ai dająca dostęp do modeli GLM w ZCode i w kilkudziesięciu zewnętrznych narzędziach. W momencie publikacji (lipiec 2026) podstawowa siatka wygląda tak — ale ceny i promocje się zmieniają, sprawdzaj aktualną stronę z.ai/subscribe:

PlanCena, $/mies.KwotaRównoległe zapytania
Lite$18 (w promocjach — od ~$12.6)„Prompty" w 5-godzinnych oknach + tygodniowy pułap1
Pro$72×4 względem Lite1
Max$160×16 względem Litedo 30

Na co skarżą się subskrybenci (wątki na Hacker News i GitHub):

  • Mnożnik szczytowy. W godzinach szczytu (14:00—18:00 UTC+8 — wieczór w Azji, rano-przedpołudnie w Europie) każde zapytanie pobiera kwotę ze współczynnikiem ×3, poza szczytem — ×2. Wydatki trzeba planować według strefy czasowej Pekinu.
  • Kwota w „promptach", nie w tokenach. Ile dokładnie tokenów zostało — nieprzejrzyste; w wątkach można spotkać historie typu „wypaliłem ~17M tokenów na GLM — i dostałem blokadę na cztery dni".
  • Jedno równoległe zapytanie w Lite i Pro. Dla środowiska agentowego to odczuwalne: tryb multi-agent samego ZCode i wszelkie równoległe sub-agenty trafiają do kolejki.
  • GLM-5.2 zużywa kwotę szybciej niż młodsze modele — flagowiec pali limit z własnym mnożnikiem.

Wniosek jest prosty: do spokojnej pracy solo subskrypcja uczciwie działa. Ale im bardziej „agentowy" jest twój tryb — równoległe zadania, długie autonomiczne sesje, nocne przebiegi — tym częściej model kwotowy zamienia się w loterię. Alternatywa to płatność za faktyczne tokeny: bez okien, mnożników i kolejek — ile agent zużył, tyle zostaje pobrane. Właśnie ten model daje mechanizm custom provider wbudowany w ZCode, a konfiguracja zajmuje pięć minut.

BYOK w ZCode: własny API-klucz i custom provider

ZCode ma oficjalnie wbudowane wsparcie dla BYOK: dokumentacja wprost pozwala dodawać „dowolną usługę zgodną z protokołami OpenAI lub Anthropic” — publiczne API, kanały korporacyjne, a nawet instalacje self-hosted. Konfiguruje się to na trzy sposoby:

  • przycisk Connect na ekranie powitalnym → „Set Your API Key”;
  • Manage Models w selektorze modelu;
  • koło zębate → Settings → Model Settings → Add Provider.

Dostawcy ustawia się OpenAI Base URL i/lub Anthropic Base URL oraz API Key — listę dostępnych modeli ZCode pobierze sam.

Trzy najczęstsze pułapki:

  • Endpointy Z.ai się różnią. Subskrypcja Coding Plan działa wyłącznie przez coding-endpoint https://api.z.ai/api/coding/paas/v4; ogólny /api/paas/v4 z kluczem subskrypcyjnym zwróci błąd — klasyczna przyczyna „mam 401/429, choć plan jest opłacony”.
  • „Działa w Claude Code ≠ działa w ZCode”. Zmiennych środowiskowych takich jak ANTHROPIC_BASE_URL, którymi konfiguruje się Claude Code, ZCode nie odczytuje: ma własny magazyn ustawień dostawców. Konfiguruj właśnie przez Settings.
  • „Model widać w selektorze ≠ klucz ma kwotę”. Lista modeli jest pobierana z API dostawcy, a dostępność zależy od salda i limitów konkretnego klucza.

A teraz praktyka: podłączamy do ZCode bramę JoinGonka i mamy stos GLM za tokeny.

Konfiguracja JoinGonka Gateway w ZCode: GLM za tokeny

JoinGonka Gateway — bramka do zdecentralizowanej sieci Gonka z dwoma natywnymi protokołami: zgodnym z OpenAI /v1/chat/completions oraz Anthropic Messages /v1/messages. Ekonomia — pay-per-token: brak 5-godzinnych okien, mnożników szczytowych ×3 oraz limitu jednego równoległego zapytania; zużycie jest widoczne w panelu w czasie rzeczywistym, bramka nie przechowuje treści promptów.

Krok po kroku (aktualny interfejs Custom Provider):

KrokDziałanie
1. KluczZarejestruj się — gate.joingonka.ai/register (nowe konta otrzymują 3M darmowych tokenów), utwórz klucz API w sekcji Keys. Więcej informacji — w API Quick Start.
2. ProviderZCode → Settings → Model Settings → Add Provider. Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keytwój klucz w formacie jg-…
5. API formatChat completions (/chat/completions)
6. ModelAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. W ten sam sposób dodaje się MiniMaxAI/MiniMax-M2.7 oraz zai-org/GLM-5.3-Flash — model reasoning samej Z.ai; aktualna lista i limity — GET /v1/models.

W starszych wersjach ZCode zamiast tego występują dwa oddzielne pola: OpenAI Base URL (https://gate.joingonka.ai/v1) oraz Anthropic Base URL (https://gate.joingonka.ai — ścieżkę klient doda sam).

Weryfikacja: wybierz utworzony model i zadaj agentowi dowolne pytanie. Jeśli odpowiedź nadeszła — wszystko działa; błąd 401 — sprawdź klucz, 402 — saldo konta. Jeśli przy DeepSeek V4 Flash pojawi się „Model request failed” przy Thought Level Max — przełącz Thought Level na High i powtórz zapytanie.

Wskazówka. Polecenie npx @joingonka/setup --tool zcode wyświetli gotowe wartości dla tych pól — base URL, klucz, id modelu oraz jego rzeczywiste limity: okno kontekstowe i limit odpowiedzi — a także sprawdzi aktywnym zapytaniem, czy bramka je przyjmuje. Sam ZCode konfiguruje się tylko przez UI — nie posiada pliku, który można bezpiecznie edytować, więc wartości należy wstawiać ręcznie.

Porównanie cen: Coding Plan, Z.ai API, OpenRouter oraz Gonka

Ile kosztuje GLM-inferencja na różnych kanałach (ceny za 1M tokenów; u konkurencji dane na wrzesień 2026, cena JoinGonka jest pobierana na stronę na żywo z API bramki):

KanałWejście, $/1MWyjście, $/1MModel płatności
Z.ai API (GLM-5.2)$1.40 (wejście w pamięci podręcznej — $0.26)$4.40za tokeny
GLM Coding Plan$18—160/miessubskrypcja: limity „promptów”, mnożnik ×3 w szczycie, limity równoległości
OpenRouter (z-ai/glm-5.2)$1.40$4.40za tokeny
OpenRouter (z-ai/glm-5.3-flash)$0.09$0.30za tokeny
JoinGonka Gateway$0.0069$0.021za tokeny, sieć Gonka

Różnica dwóch lub trzech rzędów wielkości to nie zaokrąglenie marketingowe, lecz inna ekonomia: obliczenia wykonują uczestnicy zdecentralizowanej sieci, zarabiający na samej pracy, a nie na marży centrum danych. Szczegółowa analiza tego, jak to działa i jakie są granice zastosowań — w artykule o najtańszym AI API.

Wiersz JoinGonka to cena GLM-5.3 Flash w sieci Gonka: wszystkie modele w sieci mają jednolity taryf. Liczby na tej stronie aktualizują się automatycznie, nic nie trzeba przeliczać ręcznie.

GLM w sieci Gonka: GLM-5.3 Flash i często zadawane pytania

Sieć Gonka obsługuje model Z.ai: zai-org/GLM-5.3-Flash przyjęty przez propozycję governance #101 i udostępniany przez gateway na równi z MiniMax M2.7 oraz DeepSeek V4 Flash. Flagowy GLM-5.2, o którym mowa była w pierwszych wersjach tego przewodnika, nie wszedł do składu bojowego — sieć wybrała lżejszy i szybszy model z tej samej linii. Base URL i klucz pozostają te same: w ZCode wystarczy dodać model jako custom provider.

O samym modelu: otwarte wagi na licencji MIT, architektura MoE z 320B parametrów (18B aktywnych na token), hybrydowa uwaga rozproszona i liniowa. Główną cechą jest to, że jest to reasoning-model: przed odpowiedzią analizuje dane, a rozumowanie zajmuje kilkaset tokenów nawet przy prostym pytaniu. Dla ZCode oznacza to dwie rzeczy: nie zaniżaj limitu długości odpowiedzi modelu (od 600 tokenów nawet dla krótkich replik) i dla szybkich poprawek obniżaj Thought Level — na poziomie API to reasoning_effort: low. Szczegółowa analiza modelu i jego limitów znajduje się w artykule GLM-5.3 Flash w sieci Gonka.

Częste pytania:

  • Dlaczego na nowym modelu występują 429 lub kolejki? — Model obsługuje na razie niewielka część hostów sieci; w szczytowych minutach zapytania mogą czekać na wolny slot. Powtórz zapytanie po kilku sekundach — balancer znajdzie aktywny węzeł. Aktualny stan na stronie statusu gatewaya.
  • Co jeszcze jest dostępne? — Oprócz GLM-5.3 Flash — MiniMax M2.7 oraz DeepSeek V4 Flash: wszystkie trzy modele działają w ZCode poprzez ten sam custom provider, konfiguracja z tego przewodnika jest w pełni funkcjonalna.
  • Co z prywatnością? — Gateway nie przechowuje zawartości promptów i odpowiedzi; w statystykach znajdują się tylko agregaty zużycia.
  • Kiedy Coding Plan jest jednak korzystniejszy? — Jeśli pracujesz solo, mieścisz się w limicie Lite i nie uruchamiasz równoległych agentów, subskrypcja ze stałą opłatą jest wygodna i przewidywalna. Przelicz według swojego profilu: przy aktywnej pracy agentowej płatność za tokeny przez sieć wychodzi o rzędy wielkości taniej, przy lekkiej poprawce kodu kilka razy dziennie różnica może nie być odczuwalna.
  • Czy sprawdzi się to dla innych narzędzi? — Tak: ten sam endpoint działa w Claude Code, Cursor, Cline i każdym kliencie kompatybilnym z OpenAI/Anthropic.
ZCode 3.0 to zauważalny IDE agentowe, ale jego natywna subskrypcja GLM Coding Plan opiera się na limitach: „prompty” w oknach 5-godzinnych, mnożnik ×3 w godzinach szczytu i jedno równoległe zapytanie w niższych taryfach. Im bardziej agentowe obciążenie, tym drożej i bardziej nieprzewidywalnie wychodzi. Oficjalny BYOK rozwiązuje ten problem: podłącz JoinGonka Gateway jako custom provider — i płać za faktyczne tokeny według cen zdecentralizowanej sieci Gonka, setki razy niższych niż w scentralizowanych API. GLM-5.3 Flash — otwarty reasoning-model od Z.ai — jest już obsługiwany przez sieć, obok niego MiniMax M2.7 i DeepSeek V4 Flash. Zacznij od darmowych tokenów startowych.

Chcesz wiedzieć więcej?

Zapoznaj się z innymi sekcjami lub zacznij zarabiać GNK już teraz.

Odbierz darmowe tokeny →