Розділи бази знань ▾

Навігація

▸ Почніть тут За ролями

Категорії

Інструменти 52
Глосарій 12

Інструменти

ZCode: дешевий GLM-інференс замість GLM Coding Plan

У червні 2026 Z.ai випустила ZCode 3.0 — десктопне агентне середовище розробки, яке сама компанія називає «Official Harness for GLM-5.2». Продукт швидко набрав увагу: власне агентне ядро, автономні завдання через /goal, multi-agent режим і віддалене керування сесіями прямо з Telegram. Але разом із хвилею оглядів прийшла і хвиля питань від перших підписників GLM Coding Plan: квота рахується «промптами» у п'ятигодинних вікнах, у пікові години розхід множиться на три, на молодших тарифах — один паралельний запит, а на Hacker News скаржаться на раптові блокування після насиченого дня роботи.

Хороша новина: ZCode офіційно підтримує custom provider — до нього можна підключити будь-який OpenAI- або Anthropic-сумісний API і платити за фактичні токени, а не за підписочні квоти. У цьому гайді розберемо, що таке ZCode і як влаштований GLM Coding Plan, а потім покроково налаштуємо ZCode на JoinGonka Gateway — шлюз децентралізованої мережі Gonka, яка обслуговує GLM-5.3 Flash — відкриту reasoning-модель самої Z.ai. Підсумок: той самий інструмент, ті самі open-weight моделі, але економіка — за токени і кратно дешевше централізованих API.

Що таке ZCode: агентне середовище розробки від Z.ai

ZCode — це не «редактор з чат-сайдбаром», а ADE: ви описуєте мету, агент будує план, править файли, запускає перевірки та ітерує до результату. Працює як десктопний додаток на macOS і Windows (збірка для Linux — у бета-статусі).

Ключові можливості версії 3.0:

  • ZCode Agent — власне агентне ядро з глибокою інтеграцією GLM-5.2; крім нього можна підключати сторонні агенти (Claude Code, Codex, Gemini CLI та інші);
  • Goal-режим (/goal) — довгі автономні завдання: план → виконання → верифікація по кроках;
  • Multi-agent — паралельна робота кількох агентів над проєктом;
  • Віддалене керування — запуск та контроль сесій з Telegram, WeChat і Feishu: агент працює на вашій машині, а ви відповідаєте на запитання з телефону.

Сам клієнт безкоштовний, новим користувачам Z.ai видає щоденну квоту токенів GLM-5.2 для знайомства. Далі — або підписка GLM Coding Plan, або свій API-ключ. І ось тут варто розібратися в деталях, тому що устрій підписки — найбільш обговорювана частина продукту.

GLM Coding Plan: ціна, ліміти та квоти

GLM Coding Plan — підписка Z.ai, що дає доступ до GLM-моделей у ZCode і в двох десятках сторонніх інструментів. На момент публікації (липень 2026) базова сітка виглядає так — але ціни й акції змінюються, звіряйтеся з живою сторінкою z.ai/subscribe:

ТарифЦіна, $/місКвотаПаралельні запити
Lite$18 (за акціями — від ~$12.6)«Промпти» в 5-годинних вікнах + тижнева стеля1
Pro$72×4 до Lite1
Max$160×16 до Liteдо 30

На що скаржаться підписники (треди Hacker News і GitHub):

  • Піковий множник. У години пік (14:00—18:00 UTC+8 — вечір по Азії, ранок-день по Європі) кожен запит списує квоту з коефіцієнтом ×3, поза піком — ×2. Планувати витрати доводиться за пекінським часовим поясом.
  • Квота «промптами», а не токенами. Скільки саме токенів залишилося — непрозоро; у тредах трапляються історії на кшталт «виробив ~17M токенів на GLM — і отримав блокування на чотири дні».
  • Один паралельний запит на Lite і Pro. Для агентного середовища це відчутно: multi-agent режим самого ZCode і будь-які паралельні суб-агенти впираються в чергу.
  • GLM-5.2 витрачає квоту швидше за молодші моделі — флагман палить ліміт із власним множником.

Висновок простий: для спокійної соло-розробки підписка чесно працює. Але чим «агентніший» ваш режим — паралельні задачі, довгі автономні сесії, нічні прогони — тим частіше квотна модель перетворюється на лотерею. Альтернатива — оплата за фактичні токени: без вікон, множників і черг — скільки агент витратив, стільки й списано. Саме цю модель дає вбудований у ZCode механізм custom provider, і налаштовується вона за п'ять хвилин.

BYOK у ZCode: свій API-ключ та custom provider

У ZCode офіційно вбудована підтримка BYOK: документація прямо дозволяє додавати «будь-який сервіс, сумісний із протоколами OpenAI або Anthropic» — публічні API, корпоративні канали й навіть self-hosted інсталяції. Налаштовується трьома шляхами:

  • кнопка Connect на welcome-екрані → «Set Your API Key»;
  • Manage Models у селекторі моделі;
  • шестерня → Settings → Model Settings → Add Provider.

Провайдеру задаються OpenAI Base URL та/або Anthropic Base URL плюс API Key — список доступних моделей ZCode підтягне сам.

Три граблі, об які спотикаються найчастіше:

  • Endpoint'и Z.ai розрізняються. Підписка Coding Plan працює лише через coding-endpoint https://api.z.ai/api/coding/paas/v4; загальний /api/paas/v4 з підписним ключем поверне помилку — класична причина «у мене 401/429, хоча план оплачено».
  • «Працює в Claude Code ≠ працює в ZCode». Змінні середовища на кшталт ANTHROPIC_BASE_URL, якими налаштовують Claude Code, ZCode не читає: у нього власне сховище налаштувань провайдерів. Конфігуруйте саме через Settings.
  • «Модель видно в селекторі ≠ у ключа є квота». Список моделей підтягується з API провайдера, а доступність залежить від балансу й лімітів конкретного ключа.

Далі — практика: підключаємо до ZCode шлюз JoinGonka і отримуємо GLM-стек за токени.

Налаштування JoinGonka Gateway у ZCode: GLM за токени

JoinGonka Gateway — шлюз до децентралізованої мережі Gonka з двома нативними протоколами: OpenAI-сумісний /v1/chat/completions та Anthropic Messages /v1/messages. Економіка — pay-per-token: жодних 5-годинних вікон, пікових множників ×3 та ліміту в один паралельний запит; витрати видно в дашборді в реальному часі, вміст промптів шлюз не зберігає.

Покроково (актуальний інтерфейс Custom Provider):

КрокДія
1. КлючЗареєструйтеся — gate.joingonka.ai/register (новим акаунтам — 3M безкоштовних токенів), створіть API-ключ у розділі Keys. Детальніше — в API Quick Start.
2. ПровайдерZCode → Settings → Model Settings → Add Provider. Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keyваш ключ вигляду jg-…
5. API formatChat completions (/chat/completions)
6. МодельAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Так само додаються MiniMaxAI/MiniMax-M2.7 та zai-org/GLM-5.3-Flash — reasoning-модель самої Z.ai; актуальний список і ліміти — GET /v1/models.

У старих версіях ZCode замість цього два окремі поля: OpenAI Base URL (https://gate.joingonka.ai/v1) та Anthropic Base URL (https://gate.joingonka.ai — шлях клієнт додасть сам).

Перевірка: оберіть створену модель і задайте агенту будь-яке запитання. Відповідь прийшла — все працює; помилка 401 — перевірте ключ, 402 — баланс акаунта. Якщо на DeepSeek V4 Flash з'являється «Model request failed» при Thought Level Max — перемкніть Thought Level на High і повторіть запит.

Підказка. Команда npx @joingonka/setup --tool zcode надрукує готові значення для цих полів — base URL, ключ, id моделі та її реальні ліміти: вікно контексту та стелю відповіді — і живим запитом перевірить, що шлюз їх приймає. Сам ZCode налаштовується тільки через UI — файлу, який можна безпечно правити, у нього немає, тому вставляти значення потрібно руками.

Порівняння цін: Coding Plan, Z.ai API, OpenRouter та Gonka

Скільки коштує GLM-інференс на різних каналах (ціни за 1M токенів; у конкурентів зафіксовані на вересень 2026, ціна JoinGonka підставляється на сторінку наживо з API шлюзу):

КаналВхід, $/1MВихід, $/1MМодель оплати
Z.ai API (GLM-5.2)$1.40 (кешований вхід — $0.26)$4.40за токени
GLM Coding Plan$18—160/міспідписка: квоти «промптами», множник ×3 в пік, ліміти паралельності
OpenRouter (z-ai/glm-5.2)$1.40$4.40за токени
OpenRouter (z-ai/glm-5.3-flash)$0.09$0.30за токени
JoinGonka Gateway$0.0069$0.021за токени, мережа Gonka

Різниця у два-три порядки — не маркетингове округлення, а інша економіка: обчислення виконують учасники децентралізованої мережі, які заробляють на самій роботі, а не на маржі дата-центру. Детальний розбір того, як це влаштовано і де межі застосовності, — у статті про найдешевший AI API.

Рядок JoinGonka — це ціна GLM-5.3 Flash у мережі Gonka: у всіх моделей мережі єдиний тариф. Цифри на цій сторінці оновлюються автоматично, нічого перераховувати вручну не доведеться.

GLM у мережі Gonka: GLM-5.3 Flash та часті запитання

Мережа Gonka обслуговує модель Z.ai: zai-org/GLM-5.3-Flash прийнята governance-пропозицією #101 і видається шлюзом нарівні з MiniMax M2.7 та DeepSeek V4 Flash. Флагманська GLM-5.2, про яку йшлося в перших версіях цього гайду, у бойовий склад так і не ввійшла — мережа обрала легшу та швидшу модель тієї ж лінійки. Base URL і ключ ті ж самі: у ZCode достатньо додати модель у custom provider.

Про саму модель: відкриті ваги під ліцензією MIT, архітектура MoE на 320B параметрів (18B активних на токен), гібридна розріджена та лінійна увага. Головна особливість — це reasoning-модель: перед відповіддю вона міркує, і міркування займають кілька сотень токенів навіть на просте запитання. Для ZCode це означає дві речі: не занижуйте ліміт довжини відповіді у моделі (від 600 токенів навіть для коротких реплік) і для швидких правок знижуйте Thought Level — на рівні API це reasoning_effort: low. Детальний розбір моделі та її лімітів — у статті GLM-5.3 Flash у мережі Gonka.

Часті запитання:

  • Чому на новій моделі бувають 429 або черга? — Модель обслуговує поки що невелика частина хостів мережі; у пікові хвилини запити можуть чекати на вільний слот. Повторіть запит через кілька секунд — балансувальник знайде живу ноду. Поточний стан — на сторінці статусу шлюзу.
  • Що ще доступно? — Окрім GLM-5.3 Flash — MiniMax M2.7 та DeepSeek V4 Flash: всі три моделі працюють у ZCode через той самий custom provider, конфігурація з цього гайду повністю робоча.
  • Що з приватністю? — Шлюз не зберігає вміст промптів та відповідей; у статистиці — лише агрегати витрат.
  • Коли Coding Plan усе ж таки вигідніший? — Якщо ви працюєте соло, вкладаєтеся в квоту Lite і не запускаєте паралельних агентів, підписка з фіксованим чеком зручна та передбачувана. Рахуйте за своїм профілем: при активній агентній роботі оплата за токени через мережу виходить на порядки дешевшою, при легкому редагуванні коду кілька разів на день різниця може не відчуватися.
  • Чи підійде це для інших інструментів? — Так: той самий endpoint працює в Claude Code, Cursor, Cline та будь-якому OpenAI/Anthropic-сумісному клієнті.
ZCode 3.0 — помітна агентна IDE, але її рідна підписка GLM Coding Plan влаштована квотно: «промпти» у 5-годинних вікнах, множник ×3 у пікові години та один паралельний запит на молодших тарифах. Чим агентніше навантаження, тим дорожче і непередбачуваніше воно обходиться. Офіційний BYOK вирішує питання: підключіть JoinGonka Gateway як custom provider — і платіть за фактичні токени за цінами децентралізованої мережі Gonka, у сотні разів нижчими за централізовані API. GLM-5.3 Flash — відкрита reasoning-модель самої Z.ai — вже обслуговується мережею, поруч із нею MiniMax M2.7 та DeepSeek V4 Flash. Почніть із безкоштовних стартових токенів.

Бажаєте дізнатися більше?

Вивчіть інші розділи або почніть заробляти GNK прямо зараз.

Отримати безкоштовні токени →