지식 기반 섹션 ▾

내비게이션

▸ 여기서 시작하세요 역할별

카테고리

도구 36
용어집 12

도구

ZCode: GLM Coding Plan 대신 사용하는 저렴한 GLM 추론

2026년 6월, Z.ai는 자신들을 «GLM-5.2의 공식 하네스(Official Harness)»라고 명명한 데스크톱 에이전트 개발 환경인 ZCode 3.0을 출시했습니다. 자체 에이전트 코어, /goal 명령을 통한 자율 과제 실행, 멀티 에이전트 모드, Telegram을 통한 원격 세션 제어 등으로 큰 주목을 받았습니다. 그러나 리뷰 열풍과 함께 초기 GLM Coding Plan 구독자들로부터 의문이 제기되었습니다. 할당량 계산 기준이 5시간 간격의 «프롬프트»이며, 피크 타임에는 소비량이 3배로 늘어나고, 하위 요금제에서는 단일 병렬 요청만 가능한 데다, Hacker News에서는 작업량이 많은 날 이후 갑작스러운 차단에 대한 불만이 쏟아지고 있습니다.

좋은 소식은 ZCode가 custom provider를 공식 지원한다는 점입니다. 여기에 OpenAI 또는 Anthropic 호환 API를 연결하면 구독 할당량이 아닌 실제 토큰 사용량에 대해서만 비용을 지불할 수 있습니다. 이 가이드에서는 ZCode란 무엇이며 GLM Coding Plan이 어떻게 작동하는지 분석하고, 단계별로 ZCode를 JoinGonka Gateway(GLM-5.2를 지원하는 탈중앙화 Gonka 네트워크 게이트웨이)에 설정하는 방법을 안내합니다. 결과적으로 동일한 도구와 동일한 open-weight 모델을 사용하면서도, 비용은 중앙 집중식 API보다 수백 배 저렴해집니다.

ZCode란 무엇인가: Z.ai의 에이전트 개발 환경

ZCode는 단순한 «채팅 사이드바가 있는 에디터»가 아니라, 텍스트 에디터가 아닌 자율형 AI 에이전트를 중심으로 구축된 ADE입니다. 목표를 입력하면 에이전트가 계획을 세우고, 파일을 수정하고, 테스트를 실행하며 결과가 나올 때까지 반복 작업합니다. macOS와 Windows용 데스크톱 앱으로 작동하며(Linux 버전은 베타 상태), 다음은 주요 기능입니다.

  • ZCode Agent — GLM-5.2와 깊게 통합된 독자적인 에이전트 코어이며, 다른 제3자 에이전트(Claude Code, Codex, Gemini CLI 등)를 추가로 연결 가능합니다.
  • Goal 모드 (/goal) — 장시간 자율 과제: 계획 → 실행 → 단계별 검증.
  • 멀티 에이전트 — 프로젝트에서 여러 에이전트가 병렬로 작동.
  • 원격 제어 — Telegram, WeChat, Feishu를 통한 세션 시작 및 제어: 당신의 머신에서 에이전트가 작업하고 사용자는 스마트폰으로 질문에 답변할 수 있습니다.

클라이언트 자체는 무료이며, 신규 사용자에게는 GLM-5.2를 체험할 수 있도록 일일 토큰 할당량을 제공합니다. 그 이후에는 GLM Coding Plan 구독 또는 자체 API 키 사용으로 나뉩니다. 제품의 가장 논쟁적인 부분인 구독 체계에 대해 상세히 알아둘 필요가 있습니다.

GLM Coding Plan: 가격, 제한 및 할당량

GLM Coding Plan은 ZCode 및 여러 서드파티 도구에서 GLM 모델에 접근할 수 있게 해주는 Z.ai의 구독 서비스입니다. 게시 시점(2026년 7월)의 기본 요금제는 다음과 같으며, 가격 및 프로모션은 변경될 수 있으니 z.ai/subscribe 페이지를 확인하세요:

요금제가격 ($/월)할당량병렬 요청수
Lite$18 (프로모션 시 ~$12.6부터)5시간 주기 «프롬프트» + 주간 제한1
Pro$72Lite 대비 4배1
Max$160Lite 대비 16배최대 30

구독자들이 토로하는 불만사항(Hacker News 및 GitHub 스레드):

  • 피크 멀티플라이어: 피크 시간대(14:00—18:00 UTC+8 — 아시아 저녁, 유럽 오전~낮)에는 요청당 할당량 소비가 3배, 그 외 시간대는 2배가 적용됩니다. 베이징 표준시를 기준으로 할당량을 관리해야 합니다.
  • 토큰이 아닌 «프롬프트» 기준 할당량: 남아있는 정확한 토큰 양을 알기 어렵습니다. 스레드에서는 «GLM으로 약 17M 토큰을 사용하고 4일간 차단당했다»는 등의 사례가 공유됩니다.
  • Lite/Pro 단계의 병렬 요청 제한: 에이전트 환경에서는 매우 불편하며, ZCode 자체 멀티 에이전트 모드나 병렬 하위 에이전트 작업이 큐에서 밀리게 됩니다.
  • GLM-5.2의 높은 소모율: 플래그십 모델은 자체 멀티플라이어에 의해 할당량을 훨씬 더 빨리 소진합니다.

결론은 간단합니다. 일반적인 1인 개발에는 구독 모델이 무리 없이 작동합니다. 하지만 병렬 작업, 장시간 자동 세션, 야간 실행 등 «에이전트 모드»를 활발히 사용할수록 할당량 모델은 복불복이 됩니다. 이에 대한 대안은 실제 사용량만큼만 지불하는 것입니다. 시간 창(window), 멀티플라이어, 대기열 없이 에이전트가 소비한 만큼만 지불합니다. 이는 ZCode에 내장된 custom provider 메커니즘을 통해 실현 가능하며, 5분이면 설정이 끝납니다.

ZCode에서의 BYOK: 자체 API 키와 custom provider

ZCode는 BYOK을 공식적으로 지원합니다. 문서를 통해 "OpenAI 또는 Anthropic 프로토콜과 호환되는 서비스"(공용 API, 기업 채널, 심지어 self-hosted 설치본까지)를 추가하는 것이 명시적으로 허용됩니다. 설정 방법은 세 가지입니다:

  • 시작 화면의 Connect 버튼 → "Set Your API Key";
  • 모델 선택기의 Manage Models;
  • 톱니바퀴 아이콘 → Settings → Model Settings → Add Provider.

공급자에게 OpenAI Base URL 및/또는 Anthropic Base URLAPI Key를 지정하면 ZCode가 이용 가능한 모델 목록을 자동으로 불러옵니다.

가장 자주 발생하는 세 가지 실수:

  • Z.ai의 Endpoint는 서로 다릅니다. Coding Plan 구독은 오직 코딩 전용 엔드포인트 https://api.z.ai/api/coding/paas/v4 를 통해서만 작동합니다. 구독 키로 범용 /api/paas/v4 에 접근하면 오류가 발생하며, 이것이 "플랜을 결제했는데 왜 401/429 오류가 발생하는가"에 대한 고전적인 원인입니다.
  • "Claude Code에서 작동함 ≠ ZCode에서 작동함". Claude Code를 구성할 때 사용하는 ANTHROPIC_BASE_URL 같은 환경 변수는 ZCode에서 읽지 않습니다. ZCode는 자체적인 공급자 설정 저장소를 가지고 있으므로, 반드시 Settings를 통해 구성하십시오.
  • "모델이 선택기에 보임 ≠ 키에 할당량이 있음". 모델 목록은 공급자의 API에서 직접 가져오지만, 실제 사용 가능 여부는 해당 키의 잔액과 한도에 따라 달라집니다.

이제 실전으로 들어가서, ZCode와 JoinGonka 게이트웨이를 연결하여 토큰 기반으로 GLM 스택을 사용해 보겠습니다.

ZCode에서 JoinGonka Gateway 설정하기: GLM 토큰 과금

JoinGonka Gateway — OpenAI 호환 /v1/chat/completions 및 Anthropic Messages /v1/messages라는 두 가지 네이티브 프로토콜을 지원하는 Gonka 분산 네트워크 게이트웨이입니다. 경제 모델은 pay-per-token(종량제) 방식입니다. 5시간 시간 제한, 3배 피크 승수, 단일 병렬 요청 제한이 없습니다. 사용량은 Dashboard에서 실시간으로 확인할 수 있으며 게이트웨이는 프롬프트 내용을 저장하지 않습니다.

단계별 설정(최신 Custom Provider 인터페이스 기준):

단계작업
1. 키가입 — gate.joingonka.ai/register (신규 계정은 10M 무료 토큰 제공), Keys 섹션에서 API 키를 생성하세요. 자세한 내용은 API Quick Start를 확인하세요.
2. 프로바이더ZCode → Settings → Model Settings → Add Provider. 이름: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keyjg-… 형식의 키
5. API formatChat completions (/chat/completions)
6. 모델Add Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. 동일하게 moonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7을 추가하세요. 최신 목록은 GET /v1/models로 확인 가능합니다.

구버전 ZCode에서는 대신 두 개의 개별 필드를 사용합니다: OpenAI Base URL (https://gate.joingonka.ai/v1) 및 Anthropic Base URL (https://gate.joingonka.ai — 경로는 클라이언트가 직접 추가합니다).

확인 방법: 생성한 모델을 선택하고 에이전트에게 질문을 해보세요. 응답이 오면 정상 작동하는 것입니다. 오류 401이면 키를 확인하고, 402이면 계정 잔액을 확인하세요. DeepSeek V4 Flash 사용 시 Thought Level을 Max로 설정하면 «Model request failed» 오류가 발생할 수 있습니다. 이 경우 Thought Level을 High로 낮춰서 다시 요청하세요.

힌트. npx @joingonka/setup --tool zcode 명령어를 실행하면 아래 필드(base URL, 키, 최신 제한 사항이 반영된 모델 ID)에 입력할 준비된 값을 출력하며, 라이브 요청을 통해 게이트웨이가 정상적으로 수락하는지 검증합니다. ZCode는 UI를 통해서만 설정이 가능하며, 안전하게 수정할 수 있는 별도의 설정 파일이 없으므로 값을 직접 수동으로 입력해야 합니다.

가격 비교: Coding Plan, Z.ai API, OpenRouter, Gonka

다양한 채널에서의 GLM 추론 비용(1M 토큰당 가격; 경쟁사 가격은 2026년 7월 기준이며, JoinGonka 가격은 게이트웨이 API에서 실시간으로 가져옵니다):

채널입력, $/1M출력, $/1M결제 모델
Z.ai API (GLM-5.2)$1.40 (캐시된 입력 — $0.26)$4.40토큰당
GLM Coding Plan$18—160/월구독: '프롬프트' 할당량, 피크 시 3배 배수, 병렬 처리 제한
OpenRouter (z-ai/glm-5.2)$0.93$3.00토큰당; GLM-5.2 무료 옵션 없음
JoinGonka Gateway$0.0032$0.0097토큰당, Gonka 네트워크

두세 자릿수의 차이는 마케팅적 반올림이 아니라 근본적으로 다른 경제 구조입니다. 계산은 데이터 센터의 마진이 아닌 작업 자체로 수익을 창출하는 탈중앙화 네트워크 참여자들이 수행합니다. 이 구조와 적용 범위에 대한 자세한 분석은 가장 저렴한 AI API 관련 기사를 참조하세요.

GLM-5.2에 대한 솔직한 면책 조항: 네트워크는 모델 활성화 시점에 정확한 가격을 설정합니다(위 표는 네트워크 모델의 현재 실시간 가격입니다). 이 페이지의 숫자는 자동으로 업데이트되므로 수동으로 계산할 필요가 없습니다.

Gonka 네트워크 내 GLM-5.2: 현황 및 자주 묻는 질문

모델 zai-org/GLM-5.2-FP8이 Gonka 네트워크의 온체인 레지스트리에 추가되었습니다. 구성에서 최대 400K 토큰의 컨텍스트 윈도우가 지정되어 있으며, 모델 자체는 매우 거대한 모델(복제본당 1TB 이상의 VRAM 필요)입니다. 현재 네트워크 노드들이 가중치를 로드하는 배포 단계에 있습니다. 검사가 완료되면 모델은 자동으로 게이트웨이 모델 목록에 표시됩니다. 기본 URL과 키는 변경되지 않으며, ZCode의 선택기에서 선택하기만 하면 됩니다.

모델에 대하여: MIT 라이선스 하의 오픈 웨이트 모델이며, 구조는 MoE, 약 750B 파라미터(토큰당 약 40B 활성화), 최대 1M 토큰의 네이티브 윈도우를 지원합니다. Z.ai의 데이터에 따르면, SWE-bench Pro에서 62.1을 기록하여 GPT-5.5보다 높고, FrontierSWE에서는 Claude Opus 4.8에 약 1% 차이로 뒤처집니다. 오픈 웨이트 모델로서는 코딩 분야 최고 수준입니다.

자주 묻는 질문:

  • 새 모델을 활성화한 직후에 429 오류가 발생하는 이유는 무엇인가요? — 배포 단계이며 일부 노드가 아직 가중치를 로드 중이기 때문입니다. 몇 초 후에 다시 요청하면 로드 밸런서가 활성 노드를 찾습니다.
  • 오늘 바로 이용 가능한 모델은 무엇인가요? — Kimi K2.6, MiniMax M2.7, DeepSeek V4 Flash입니다. 이 세 모델은 모두 ZCode에서 동일한 커스텀 공급자를 통해 작동하며, 이 가이드의 구성 그대로 즉시 사용 가능합니다.
  • 개인정보 보호는 어떻게 되나요? — 게이트웨이는 프롬프트나 답변 내용을 저장하지 않으며, 통계에는 소비량만 집계됩니다.
  • 코딩 플랜이 더 유리한 경우는 언제인가요? — 혼자 작업하고, Lite 할당량 내에 머무르며, 병렬 에이전트를 실행하지 않는 경우에는 고정 요금 구독이 편리하고 예측 가능합니다. 본인의 이용 패턴을 계산해 보십시오. 활발한 에이전트 작업을 수행할 경우 네트워크를 통한 토큰 결제가 압도적으로 저렴하지만, 하루에 몇 번 정도 간단한 코드를 수정하는 경우에는 큰 차이를 느끼지 못할 수 있습니다.
  • 다른 도구에서도 사용할 수 있나요? — 네. 동일한 엔드포인트가 Claude Code, Cursor, Cline 및 모든 OpenAI/Anthropic 호환 클라이언트에서 작동합니다.
ZCode 3.0은 주목할 만한 에이전트형 IDE이지만, 기본 GLM Coding Plan 구독은 할당량 기반입니다. 5시간 윈도우 내 "프롬프트", 피크 시간대 ×3 배율, 하위 요금제에서의 단일 동시 요청 등이 제한 사항입니다. 에이전트 부하가 높을수록 비용은 더 비싸고 예측 불가능해집니다. 공식 BYOK가 이 문제를 해결합니다. JoinGonka Gateway를 커스텀 프로바이더로 연결하면 중앙 집중식 API보다 수백 배 저렴한 Gonka 분산 네트워크의 가격으로 실제 사용한 토큰만큼만 지불하면 됩니다. GLM-5.2는 이미 네트워크 레지스트리에 등록되어 모델 선택기에 자동으로 표시되며, Kimi K2.6, MiniMax M2.7, DeepSeek V4 Flash는 오늘부터 바로 사용할 수 있습니다. 10M 무료 토큰으로 시작하세요.

더 자세히 알고 싶으세요?

다른 섹션을 탐색하거나 지금 GNK를 얻기 시작하세요.

10M 무료 토큰 받기 →