知识库章节 ▾

导航

▸ 从这里开始 按角色

类别

工具 52
词汇表 12

工具

ZCode:使用低成本 GLM 推理替代 GLM Coding Plan

2026 年 6 月,Z.ai 发布了 ZCode 3.0——一种桌面代理开发环境,公司自称为“GLM-5.2 的官方开发工具”。该产品迅速受到关注:拥有自主代理内核、通过 /goal 执行自主任务、多智能体模式以及直接从 Telegram 进行远程会话管理。但随着评价的浪潮而来的是 GLM Coding Plan 早期订阅者的疑问:配额在五小时窗口内按“提示词”计算,高峰时段消耗量乘三,低级套餐仅支持单个并行请求,Hacker News 上还有用户抱怨在繁忙工作一天后突然被封禁。

好消息是:ZCode 正式支持 自定义提供商 (custom provider)——你可以连接任何兼容 OpenAI 或 Anthropic 的 API,按实际 Token 使用量付费,而不是按订阅配额付费。在本指南中,我们将剖析 ZCode 是什么以及 GLM Coding Plan 的运作机制,然后逐步将 ZCode 配置到 JoinGonka Gateway——这是去中心化 Gonka 网络的网关,该网络为 Z.ai 自家的开放推理模型 GLM-5.3 Flash 提供服务。结论是:使用相同的工具,相同的开源权重模型,但经济效益基于 Token 计算,且比集中式 API 便宜多个数量级。

什么是 ZCode:来自 Z.ai 的智能体开发环境

ZCode 不仅仅是一个“带聊天侧边栏的编辑器”,而是一个 ADE:你描述目标,智能体负责制定计划、修改文件、运行检查并迭代直至出结果。它作为 macOS 和 Windows 上的桌面应用程序运行(Linux 版本处于 Beta 状态)。

3.0 版本的核心功能:

  • ZCode Agent — 原生智能体核心,深度集成 GLM-5.2;此外还支持接入第三方智能体(Claude Code、Codex、Gemini CLI 等);
  • Goal 模式 (/goal) — 长时间自主任务:计划 → 执行 → 分步验证;
  • Multi-agent — 项目的多智能体并行协同工作;
  • 远程控制 — 从 Telegram、WeChat 和 Feishu 启动并控制会话:智能体在你的机器上运行,而你通过手机回答问题。

客户端本身免费,Z.ai 为新用户提供每日 GLM-5.2 Token 配额以供体验。之后,要么选择 GLM Coding Plan 订阅,要么使用你自己的 API Key。这就是需要深入解读的地方,因为订阅机制是该产品讨论度最高的部分。

GLM Coding Plan:价格、限制与配额

GLM Coding Plan 是 Z.ai 的订阅服务,让你在 ZCode 以及二十多款第三方工具中使用 GLM 模型。本文发布时(2026 年 7 月)的基础价目如下——但价格和活动常有变动,请以 z.ai/subscribe 实时页面为准:

套餐价格,美元/月额度并发请求
Lite$18(活动价低至约 $12.6)按 5 小时窗口计算的「prompt」次数 + 每周上限1
Pro$72Lite 的 4 倍1
Max$160Lite 的 16 倍最高 30

订阅用户的吐槽(来自 Hacker News 和 GitHub 的讨论帖):

  • 高峰倍率。 高峰时段(UTC+8 14:00—18:00——亚洲傍晚、欧洲上午到下午)每个请求按 ×3 系数扣额度,非高峰 ×2。用个服务还得按北京时间算账。
  • 额度按「prompt」计,而非 token。 还剩多少 token 完全不透明;帖子里不乏「在 GLM 上烧了约 17M token——然后被封了四天」这样的经历。
  • Lite 和 Pro 只有一个并发请求。 在智能体场景里这很要命:ZCode 自身的 multi-agent 模式和任何并行子智能体都会排长队。
  • GLM-5.2 消耗额度更快,比小模型烧得凶——旗舰模型自带更高的倍率。

结论很简单:对于悠哉的单人开发,订阅确实物有所值。但你的工作模式越「智能体化」——并行任务、长时间自主会话、夜间批量运行——额度制就越像一场抽奖。替代方案是按实际 token 付费:没有窗口、没有倍率、没有排队——智能体用多少就扣多少。ZCode 内置的 custom provider 机制提供的正是这种模式,五分钟就能配好。

ZCode 中的 BYOK:使用自己的 API Key 和 custom provider

ZCode 官方内置支持 BYOK:文档明确允许添加「任何兼容 OpenAI 或 Anthropic 协议的服务」——公共 API、企业通道,甚至 self-hosted 部署。配置有三种方式:

  • 欢迎界面上的 Connect 按钮 → 「Set Your API Key」;
  • 模型选择器中的 Manage Models;
  • 齿轮图标 → Settings → Model Settings → Add Provider。

为提供商设置 OpenAI Base URL 和/或 Anthropic Base URL 以及 API Key——ZCode 会自己拉取可用模型列表。

最容易踩的三个坑:

  • Z.ai 的 endpoint 各不相同。Coding Plan 订阅只能通过 coding endpoint https://api.z.ai/api/coding/paas/v4 使用;用订阅密钥访问通用的 /api/paas/v4 会报错——这是「我套餐明明付了钱,却收到 401/429」的经典原因。
  • 「在 Claude Code 里能用 ≠ 在 ZCode 里能用。」用于配置 Claude Code 的 ANTHROPIC_BASE_URL 之类的环境变量,ZCode 不会读取:它有自己的提供商设置存储。请专门通过 Settings 进行配置。
  • 「模型在选择器里可见 ≠ 密钥有配额。」模型列表是从提供商的 API 拉取的,而可用性取决于具体密钥的余额和限额。

接下来是实操:我们把 JoinGonka 网关接入 ZCode,用 token 换取 GLM 全家桶。

在 ZCode 中配置 JoinGonka Gateway:按 Token 使用 GLM

JoinGonka Gateway 是通往去中心化 Gonka 网络的网关,支持两个原生协议:兼容 OpenAI 的 /v1/chat/completions 和 Anthropic Messages 的 /v1/messages。采用按 token 付费模式:无 5 小时窗口期、无 ×3 高峰倍数、无单次并发请求限制;仪表盘实时显示消耗情况,网关不会存储提示词内容。

步骤指南(当前 Custom Provider 界面):

步骤操作
1. 密钥注册 gate.joingonka.ai/register(新账户可获得 3M 免费 token),在 Keys 部分创建 API 密钥。详情请参阅 API Quick Start。
2. 服务商ZCode → Settings → Model Settings → Add Provider。Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Key填写你的密钥(格式为 jg-…)
5. API 格式Chat completions (/chat/completions)
6. 模型Add Model → Model ID 填写 deepseek-ai/DeepSeek-V4-Flash-0731,Context window 填写 380000。同样可以添加 MiniMaxAI/MiniMax-M2.7 和 zai-org/GLM-5.3-Flash(Z.ai 自有的推理模型);最新列表及限制请查看 GET /v1/models。

在旧版本的 ZCode 中,此处是两个独立字段:OpenAI Base URL (https://gate.joingonka.ai/v1) 和 Anthropic Base URL (https://gate.joingonka.ai — 客户端会自动添加路径)。

验证:选择创建的模型并向 Agent 提问。若收到回答则配置成功;若出现 401 错误请检查密钥,402 错误请检查账户余额。若 DeepSeek V4 Flash 在 Thought Level 为 Max 时出现 "Model request failed",请将 Thought Level 切换为 High 后重试。

提示:命令 npx @joingonka/setup --tool zcode 将打印出这些字段所需的数值(base URL、密钥、模型 ID 及其实际限制:上下文窗口和响应上限),并执行实时请求以验证网关是否接受。ZCode 仅能通过 UI 配置;由于没有可手动安全编辑的文件,必须手动填入数值。

价格对比:Coding Plan、Z.ai API、OpenRouter 与 Gonka

不同渠道的 GLM 推理成本(价格按 1M token 计算;竞品价格截至 2026 年 9 月,JoinGonka 价格直接从网关 API 实时填充到页面):

渠道输入 $/1M输出 $/1M支付模式
Z.ai API (GLM-5.2)$1.40 (缓存输入 — $0.26)$4.40按 token
GLM Coding Plan$18—160/月订阅制:按 "prompt" 配额,峰值 ×3 倍数,并发限制
OpenRouter (z-ai/glm-5.2)$1.40$4.40按 token
OpenRouter (z-ai/glm-5.3-flash)$0.09$0.30按 token
JoinGonka Gateway$0.0069$0.021按 token,Gonka 网络

两到三个数量级的差距并非营销手段,而是不同的经济模式:计算由去中心化网络的参与者完成,他们赚取的是工作本身的价值,而不是数据中心的利润率。关于其运作原理及适用边界的详细解析,请参阅文章 关于最便宜的 AI API。

JoinGonka 一行展示的是 GLM-5.3 Flash 在 Gonka 网络中的价格:网络内所有模型均采用统一费率。此页面上的数字会自动更新,无需手动重新计算。

Gonka 网络中的 GLM:GLM-5.3 Flash 及常见问题

Gonka 网络支持 Z.ai 模型:zai-org/GLM-5.3-Flash 已通过治理提案 #101 采纳,并通过网关与 MiniMax M2.7 和 DeepSeek V4 Flash 一同提供。本指南早期版本中提到的旗舰模型 GLM-5.2 并未进入生产环境——网络选择了同系列中更轻、更快的模型。Base URL 和密钥保持不变:在 ZCode 中,只需将该模型添加为 custom provider 即可。

关于该模型:采用 MIT 许可的开放权重,MoE 架构,拥有 320B 参数(每个 token 激活 18B),具备混合稀疏和线性注意力机制。其主要特征是推理模型:在回答之前它会先进行思考,即使是简单的问题,其思考过程也会占用数百个 token。对于 ZCode 而言,这意味着两点:不要将模型的回复长度限制设置得太低(即使是简短回复也建议至少 600 token),并且对于快速修改,请降低 Thought Level——在 API 层级即 reasoning_effort: low。关于该模型及其限制的详细分析,请参见文章 Gonka 网络上的 GLM-5.3 Flash。

常见问题:

  • 为什么新模型会出现 429 或排队? — 目前由一小部分网络主机提供服务;在高峰时段,请求可能需要等待空闲槽位。请在几秒钟后重试——负载均衡器会找到活动的节点。当前状态可在 网关状态页面 查看。
  • 还有什么可用模型? — 除了 GLM-5.3 Flash,还有 MiniMax M2.7 和 DeepSeek V4 Flash:这三款模型均可通过同一个 custom provider 在 ZCode 中使用,本指南中的配置完全适用。
  • 隐私如何保护? — 网关不存储 prompt 和回答的内容;统计数据仅包含用量汇总。
  • Coding Plan 在什么情况下更划算? — 如果您是个人开发者,在 Lite 配额内使用,且不运行并行代理,那么固定费用的订阅方案既方便又可预测。请根据您的使用情况计算:在进行活跃的代理任务时,通过网络按 token 付费比中心化 API 便宜几个数量级;如果只是每天偶尔进行代码修改,差异可能不明显。
  • 这适用于其他工具吗? — 是的:同一个 endpoint 也适用于 Claude Code、Cursor、Cline 以及任何兼容 OpenAI/Anthropic 的客户端。
ZCode 3.0 是一款出色的代理式 IDE,但其原生的 GLM Coding Plan 订阅采用配额制:5 小时窗口内的“prompts”、高峰时段 ×3 的乘数,以及入门计划中仅支持一个并行请求。代理任务越重,其成本就越昂贵且不可预测。官方的 BYOK 解决了这个问题:将 JoinGonka Gateway 作为 custom provider 连接——并按照去中心化 Gonka 网络的价格按实际 token 付费,价格比中心化 API 低数百倍。GLM-5.3 Flash——Z.ai 自己的开源推理模型——已由该网络提供服务,此外还有 MiniMax M2.7 和 DeepSeek V4 Flash。从免费的起始 token 开始尝试吧。

想了解更多?

探索其他章节或立即开始赚取 GNK。

获取免费 token →