지식 기반 섹션 ▾

내비게이션

▸ 여기서 시작하세요 역할별

카테고리

도구 52
용어집 12

도구

ZCode: GLM Coding Plan 대신 사용하는 저렴한 GLM 추론

2026년 6월, Z.ai는 데스크톱용 에이전트 개발 환경인 ZCode 3.0을 출시했으며, 회사 측은 이를 "GLM-5.2의 공식 하네스"라고 부릅니다. 이 제품은 빠르게 주목을 받았습니다. 자체 에이전트 코어, /goal을 통한 자율 작업, 멀티 에이전트 모드, 그리고 Telegram에서 직접 세션을 원격 제어하는 기능이 특징입니다. 그러나 리뷰가 쏟아지는 동시에 GLM Coding Plan 초기 구독자들의 의문도 제기되었습니다. 쿼터가 5시간 단위의 "프롬프트"로 계산되는 점, 피크 시간대에는 소비량이 3배로 증가하는 점, 하위 요금제에서는 단일 병렬 요청만 가능한 점, 그리고 Hacker News에서는 집중 작업 후 갑작스러운 차단에 대한 불만이 올라오고 있습니다.

좋은 소식은 ZCode가 공식적으로 custom provider를 지원한다는 점입니다. 이를 통해 OpenAI 또는 Anthropic 호환 API를 연결하여 구독 쿼터가 아닌 실제 사용한 토큰만큼만 지불할 수 있습니다. 이 가이드에서는 ZCode가 무엇인지, GLM Coding Plan이 어떻게 구성되어 있는지 살펴보고, ZCode를 Z.ai의 오픈 추론 모델인 GLM-5.3 Flash를 서비스하는 Gonka 분산 네트워크의 게이트웨이인 JoinGonka Gateway에 설정하는 방법을 단계별로 안내합니다. 결론: 도구와 오픈 웨이트 모델은 그대로 유지하면서 중앙 집중식 API보다 훨씬 저렴한 토큰 기반 경제를 누릴 수 있습니다.

ZCode란 무엇인가: Z.ai의 에이전트 개발 환경

ZCode는 단순한 «채팅 사이드바가 있는 에디터»가 아니라, 텍스트 에디터가 아닌 자율형 AI 에이전트를 중심으로 구축된 ADE입니다. 목표를 입력하면 에이전트가 계획을 세우고, 파일을 수정하고, 테스트를 실행하며 결과가 나올 때까지 반복 작업합니다. macOS와 Windows용 데스크톱 앱으로 작동하며(Linux 버전은 베타 상태), 다음은 주요 기능입니다.

  • ZCode Agent — GLM-5.2와 깊게 통합된 독자적인 에이전트 코어이며, 다른 제3자 에이전트(Claude Code, Codex, Gemini CLI 등)를 추가로 연결 가능합니다.
  • Goal 모드 (/goal) — 장시간 자율 과제: 계획 → 실행 → 단계별 검증.
  • 멀티 에이전트 — 프로젝트에서 여러 에이전트가 병렬로 작동.
  • 원격 제어 — Telegram, WeChat, Feishu를 통한 세션 시작 및 제어: 당신의 머신에서 에이전트가 작업하고 사용자는 스마트폰으로 질문에 답변할 수 있습니다.

클라이언트 자체는 무료이며, 신규 사용자에게는 GLM-5.2를 체험할 수 있도록 일일 토큰 할당량을 제공합니다. 그 이후에는 GLM Coding Plan 구독 또는 자체 API 키 사용으로 나뉩니다. 제품의 가장 논쟁적인 부분인 구독 체계에 대해 상세히 알아둘 필요가 있습니다.

GLM Coding Plan: 가격, 제한 및 할당량

GLM Coding Plan은 Z.ai의 구독으로, ZCode와 20여 개 서드파티 도구에서 GLM 모델에 접근할 수 있게 해준다. 발행 시점(2026년 7월)의 기본 요금표는 다음과 같지만, 가격과 프로모션은 바뀌니 최신 z.ai/subscribe 페이지에서 확인하길 바란다:

요금제가격, $/월쿼터병렬 요청
Lite$18 (프로모션 시 ~$12.6부터)5시간 윈도우의 '프롬프트' + 주간 상한1
Pro$72Lite의 ×41
Max$160Lite의 ×16최대 30

구독자들이 불만을 제기하는 점(Hacker News와 GitHub 스레드):

  • 피크 배수. 피크 시간대(14:00—18:00 UTC+8 — 아시아의 저녁, 유럽의 아침~낮)에는 각 요청이 쿼터를 ×3 계수로 차감하고, 비피크에는 ×2. 소비 계획을 베이징 시간 기준으로 세워야 한다.
  • 쿼터가 토큰이 아니라 '프롬프트' 단위. 남은 토큰이 얼마인지 불투명하며, 'GLM으로 약 17M 토큰을 썼더니 4일간 차단됐다'는 이야기가 스레드에 보인다.
  • Lite와 Pro는 병렬 요청이 1개. 에이전트 환경에서는 체감이 크다: ZCode 자체의 multi-agent 모드와 모든 병렬 서브 에이전트가 큐에 막힌다.
  • GLM-5.2는 하위 모델보다 쿼터를 빠르게 소모한다 — 플래그십은 자체 배수로 한도를 태운다.

결론은 간단하다. 차분한 솔로 개발에는 구독이 정직하게 작동한다. 하지만 '에이전트적' 운용 — 병렬 작업, 긴 자율 세션, 야간 실행 — 일수록 쿼터 모델은 복권이 되기 쉽다. 대안은 실제 토큰만큼 지불하는 것: 윈도우도 배수도 대기열도 없이 에이전트가 쓴 만큼만 차감된다. 바로 이 모델을 ZCode 내장 custom provider 메커니즘이 제공하며, 설정은 5분이면 끝난다.

ZCode에서의 BYOK: 자체 API 키와 custom provider

ZCode에는 BYOK 지원이 공식적으로 내장되어 있습니다: 문서에서 "OpenAI 또는 Anthropic 프로토콜과 호환되는 모든 서비스" — 공개 API, 기업 채널, 심지어 셀프호스팅 인스턴스까지 추가할 수 있도록 명시적으로 허용합니다. 설정 방법은 세 가지입니다:

  • 웰컴 화면의 Connect 버튼 → "Set Your API Key";
  • 모델 선택기의 Manage Models;
  • 톱니바퀴 → Settings → Model Settings → Add Provider.

프로바이더에는 OpenAI Base URL 및/또는 Anthropic Base URL과 API Key를 설정합니다 — 사용 가능한 모델 목록은 ZCode가 자동으로 가져옵니다.

가장 자주 발목을 잡는 세 가지 함정:

  • Z.ai의 엔드포인트는 다릅니다. Coding Plan 구독은 coding 엔드포인트 https://api.z.ai/api/coding/paas/v4를 통해서만 작동합니다; 구독 키로 일반 /api/paas/v4에 접근하면 오류가 반환됩니다 — "플랜은 결제했는데 401/429가 뜬다"의 전형적인 원인입니다.
  • "Claude Code에서 작동 ≠ ZCode에서 작동". Claude Code 설정에 쓰이는 ANTHROPIC_BASE_URL 같은 환경 변수를 ZCode는 읽지 않습니다: ZCode에는 자체 프로바이더 설정 저장소가 있습니다. 반드시 Settings를 통해 구성하세요.
  • "선택기에 모델이 보임 ≠ 키에 쿼터가 있음". 모델 목록은 프로바이더의 API에서 가져오지만, 접근 가능 여부는 특정 키의 잔액과 한도에 따라 달라집니다.

이제 실전입니다: ZCode에 JoinGonka 게이트웨이를 연결하고 토큰으로 GLM 스택을 얻어봅시다.

ZCode에서 JoinGonka Gateway 설정하기: GLM 토큰 과금

JoinGonka Gateway는 탈중앙화 네트워크 Gonka로 향하는 게이트웨이로, 두 가지 네이티브 프로토콜(OpenAI 호환 /v1/chat/completions 및 Anthropic Messages /v1/messages)을 제공합니다. 경제 모델은 pay-per-token 방식이며, 5시간 제한이나 ×3 피크 배율, 동시 요청 수 제한 등이 전혀 없습니다. 사용량은 대시보드에서 실시간으로 확인 가능하며, 게이트웨이는 프롬프트 내용을 저장하지 않습니다.

단계별 가이드(현재 Custom Provider 인터페이스 기준):

단계작업
1. 키gate.joingonka.ai/register에 가입하고(신규 계정은 3M 토큰 무료 제공), Keys 섹션에서 API 키를 생성하세요. 자세한 내용은 API Quick Start를 참조하세요.
2. 공급자ZCode → Settings → Model Settings → Add Provider. Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keyjg-… 형식의 본인 키
5. API formatChat completions (/chat/completions)
6. 모델Add Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000 입력. 동일한 방식으로 MiniMaxAI/MiniMax-M2.7 및 zai-org/GLM-5.3-Flash(Z.ai의 자체 추론 모델)도 추가 가능하며, 최신 목록 및 제한 사항은 GET /v1/models에서 확인할 수 있습니다.

구버전 ZCode에서는 대신 OpenAI Base URL (https://gate.joingonka.ai/v1)과 Anthropic Base URL (https://gate.joingonka.ai — 경로는 클라이언트가 자동 추가) 필드가 구분되어 있습니다.

확인: 생성한 모델을 선택하고 에이전트에게 질문을 던져보세요. 응답이 오면 정상 작동 중입니다. 401 에러 시 키를 확인하고, 402 에러 시 계정 잔액을 확인하세요. DeepSeek V4 Flash 사용 시 Thought Level을 Max로 설정했는데 "Model request failed"가 뜨면, Thought Level을 High로 변경하고 다시 요청하세요.

팁: npx @joingonka/setup --tool zcode 명령어를 입력하면 해당 필드(base URL, 키, 모델 ID, 컨텍스트 윈도우 및 응답 제한 등)에 필요한 설정값이 출력되며, 게이트웨이가 값을 수락하는지 실시간으로 테스트합니다. ZCode 자체는 UI를 통해서만 설정 가능하며, 직접 편집 가능한 설정 파일이 없으므로 값을 수동으로 입력해야 합니다.

가격 비교: Coding Plan, Z.ai API, OpenRouter, Gonka

채널별 GLM 인퍼런스 비용 (1M 토큰당 가격; 경쟁사 가격은 2026년 9월 기준 고정, JoinGonka 가격은 게이트웨이 API에서 페이지로 실시간 반영):

채널입력, $/1M출력, $/1M결제 모델
Z.ai API (GLM-5.2)$1.40 (캐시된 입력 — $0.26)$4.40토큰당 과금
GLM Coding Plan$18—160/월구독: "프롬프트" 쿼터, 피크 시 3배 멀티플라이어, 동시성 제한
OpenRouter (z-ai/glm-5.2)$1.40$4.40토큰당 과금
OpenRouter (z-ai/glm-5.3-flash)$0.09$0.30토큰당 과금
JoinGonka Gateway$0.0069$0.021토큰당 과금, Gonka 네트워크

두세 자릿수의 차이는 마케팅용 반올림이 아니라 근본적인 경제 모델의 차이입니다. 데이터 센터의 마진이 아닌, 작업을 수행하고 보상을 받는 분산형 네트워크 참여자들이 계산을 처리합니다. 구체적인 작동 원리와 적용 가능 범위는 가장 저렴한 AI API에 관한 기사에서 확인할 수 있습니다.

JoinGonka 행은 Gonka 네트워크 내 GLM-5.3 Flash 가격입니다. 네트워크 내 모든 모델은 동일한 요금제가 적용됩니다. 이 페이지의 수치는 자동으로 업데이트되므로 직접 다시 계산할 필요가 없습니다.

Gonka 네트워크 내 GLM: GLM-5.3 Flash 및 자주 묻는 질문

Gonka 네트워크는 Z.ai 모델을 지원합니다: zai-org/GLM-5.3-Flash는 거버넌스 제안 #101에 의해 채택되었으며 MiniMax M2.7 및 DeepSeek V4 Flash와 함께 게이트웨이를 통해 제공됩니다. 이 가이드의 초기 버전에서 언급된 플래그십 모델 GLM-5.2는 실제 배포되지 않았으며, 네트워크는 동일 라인업의 더 가볍고 빠른 모델을 선택했습니다. Base URL과 키는 동일합니다: ZCode에서 custom provider에 모델을 추가하기만 하면 됩니다.

모델 정보: MIT 라이선스 하의 오픈 웨이트, 320B 파라미터(토큰당 18B 활성)의 MoE 아키텍처, 하이브리드 희소(sparse) 및 선형 어텐션을 사용합니다. 가장 큰 특징은 추론(reasoning) 모델이라는 점입니다. 답변 전에 추론을 수행하므로 간단한 질문에도 수백 토큰이 소비됩니다. ZCode에서의 주의사항은 두 가지입니다: 모델의 응답 길이 제한을 너무 낮게 설정하지 마십시오(짧은 답변도 600 토큰 이상), 빠른 수정을 위해서는 Thought Level을 낮추십시오. API 수준에서 reasoning_effort: low입니다. 모델 및 제한 사항에 대한 자세한 내용은 Gonka 네트워크의 GLM-5.3 Flash 문서를 참조하십시오.

자주 묻는 질문:

  • 새 모델에서 429 오류나 대기열이 발생하는 이유는 무엇인가요? — 모델은 아직 네트워크 호스트의 일부에서만 제공되고 있습니다. 피크 시간대에는 요청이 빈 슬롯을 기다릴 수 있습니다. 몇 초 후 요청을 다시 시도하십시오. 로드 밸런서가 활성 노드를 찾습니다. 현재 상태는 게이트웨이 상태 페이지에서 확인할 수 있습니다.
  • 다른 어떤 모델을 사용할 수 있나요? — GLM-5.3 Flash 외에도 MiniMax M2.7 및 DeepSeek V4 Flash가 제공됩니다. 세 모델 모두 ZCode에서 동일한 custom provider를 통해 작동하며, 이 가이드의 설정으로 완벽하게 기능합니다.
  • 개인정보 보호는 어떻게 되나요? — 게이트웨이는 프롬프트나 답변 내용을 저장하지 않습니다. 통계에는 소비량만 기록됩니다.
  • Coding Plan이 더 유리한 경우는 언제인가요? — 혼자 작업하고 Lite 할당량을 준수하며 병렬 에이전트를 실행하지 않는다면 고정 요금제 구독이 편리하고 예측 가능합니다. 본인의 프로필에 맞춰 계산해 보십시오. 에이전트 작업이 활발할 경우 네트워크를 통한 토큰 결제가 압도적으로 저렴하며, 간단한 코드 수정만 하루 몇 번 수행한다면 차이를 느끼지 못할 수도 있습니다.
  • 다른 도구에서도 사용할 수 있나요? — 네. Claude Code, Cursor, Cline 및 모든 OpenAI/Anthropic 호환 클라이언트에서 동일한 엔드포인트가 작동합니다.
ZCode 3.0은 주목할만한 에이전트 IDE이지만, 기본 GLM Coding Plan은 할당량 방식입니다. 5시간 단위의 "프롬프트", 피크 시간대 ×3 배율, 하위 플랜에서의 단일 병렬 요청 제한이 있습니다. 에이전트 부하가 커질수록 비용은 예측 불가능해집니다. 공식 BYOK가 해결책입니다. JoinGonka Gateway를 custom provider로 연결하면 중앙 집중식 API보다 수백 배 저렴한 Gonka 탈중앙화 네트워크의 토큰 단가로 결제할 수 있습니다. Z.ai의 오픈 추론 모델인 GLM-5.3 Flash는 이미 네트워크에서 제공되며, MiniMax M2.7 및 DeepSeek V4 Flash도 함께 사용할 수 있습니다. 무료 스타터 토큰으로 시작해 보십시오.

더 자세히 알고 싶으세요?

다른 섹션을 탐색하거나 지금 GNK를 얻기 시작하세요.

무료 토큰 받기 →