Các phần cơ sở kiến thức ▾

Điều hướng

▸ Bắt đầu tại đây Theo vai trò

Danh mục

Công cụ 36
Bảng thuật ngữ 12

Công cụ

ZCode: suy luận GLM giá rẻ thay thế cho GLM Coding Plan

Vào tháng 6 năm 2026, Z.ai đã phát hành ZCode 3.0 — một môi trường phát triển đại lý trên desktop, được chính công ty gọi là «Official Harness for GLM-5.2». Sản phẩm thu hút sự chú ý nhanh chóng: nhân đại lý riêng, các tác vụ tự chủ thông qua /goal, chế độ đa đại lý và quản lý phiên từ xa trực tiếp từ Telegram. Tuy nhiên, cùng với làn sóng đánh giá là làn sóng câu hỏi từ những người dùng đầu tiên của GLM Coding Plan: hạn ngạch được tính theo "prompt" trong cửa sổ năm giờ, vào giờ cao điểm mức tiêu thụ nhân ba, với các gói thấp cấp chỉ có một yêu cầu song song, và trên Hacker News, người dùng phàn nàn về việc bị khóa tài khoản đột ngột sau một ngày làm việc cường độ cao.

Tin tốt: ZCode hỗ trợ chính thức custom provider — bạn có thể kết nối bất kỳ API nào tương thích với OpenAI hoặc Anthropic và trả phí theo token thực tế thay vì hạn ngạch đăng ký. Trong hướng dẫn này, chúng ta sẽ phân tích ZCode là gì và Kế hoạch GLM Coding hoạt động ra sao, sau đó thiết lập từng bước ZCode trên JoinGonka Gateway — cổng của mạng phi tập trung Gonka, nơi GLM-5.2 đã được thêm vào danh bạ. Kết quả: cùng một công cụ, cùng các mô hình open-weight, nhưng chi phí kinh tế được tính theo token và rẻ hơn hàng trăm lần so với các API tập trung.

ZCode là gì: môi trường phát triển đại lý từ Z.ai

ZCode không phải là "trình chỉnh sửa có thanh bên chat" mà là ADE: bạn mô tả mục tiêu, đại lý lập kế hoạch, sửa file, chạy các kiểm tra và lặp lại cho đến khi đạt kết quả. Hoạt động như một ứng dụng desktop trên macOS và Windows (bản build cho Linux đang ở trạng thái beta).

Các tính năng chính của phiên bản 3.0:

  • ZCode Agent — nhân đại lý riêng với tích hợp sâu GLM-5.2; ngoài ra, bạn có thể kết nối các đại lý bên thứ ba (Claude Code, Codex, Gemini CLI và các loại khác);
  • Chế độ Goal (/goal) — các tác vụ tự chủ dài hạn: lập kế hoạch → thực thi → xác minh từng bước;
  • Multi-agent — nhiều đại lý làm việc song song trên một dự án;
  • Quản lý từ xa — khởi chạy và kiểm soát các phiên từ Telegram, WeChat và Feishu: đại lý làm việc trên máy của bạn và bạn trả lời các câu hỏi từ điện thoại.

Bản thân client là miễn phí, với người dùng mới Z.ai cung cấp hạn ngạch token GLM-5.2 hàng ngày để trải nghiệm. Sau đó — hoặc là đăng ký GLM Coding Plan, hoặc là sử dụng API-key của riêng bạn. Và đây là nơi cần đi sâu vào chi tiết, vì mô hình đăng ký là phần được thảo luận nhiều nhất của sản phẩm.

GLM Coding Plan: giá, giới hạn và hạn ngạch

GLM Coding Plan — gói đăng ký của Z.ai, cấp quyền truy cập vào các mô hình GLM trong ZCode và trong hai mươi công cụ khác. Tại thời điểm xuất bản (tháng 7 năm 2026), bảng giá cơ bản trông như sau — nhưng giá cả và khuyến mãi thường xuyên thay đổi, hãy kiểm tra trang web trực tiếp tại z.ai/subscribe:

GóiGiá, $/thángHạn ngạchYêu cầu song song
Lite$18 (trong các chương trình khuyến mãi — từ ~$12.6)"Prompts" trong cửa sổ 5 giờ + giới hạn hàng tuần1
Pro$72×4 so với Lite1
Max$160×16 so với Litetối đa 30

Những gì người dùng phàn nàn (các chủ đề trên Hacker News và GitHub):

  • Hệ số giờ cao điểm. Trong giờ cao điểm (14:00—18:00 UTC+8 — buổi chiều ở châu Á, buổi sáng-trưa ở châu Âu), mỗi yêu cầu trừ hạn ngạch với hệ số ×3, ngoài giờ cao điểm — ×2. Phải lập kế hoạch chi phí theo múi giờ Bắc Kinh.
  • Hạn ngạch theo "prompts", không phải token. Chính xác còn bao nhiêu token là không minh bạch; trong các chủ đề có những câu chuyện kiểu "đã sử dụng ~17M token trên GLM — và bị khóa trong bốn ngày".
  • Một yêu cầu song song trên Lite và Pro. Đối với môi trường đại lý, đây là một vấn đề đáng kể: chế độ đa đại lý của chính ZCode và bất kỳ tiểu đại lý song song nào đều bị tắc nghẽn trong hàng đợi.
  • GLM-5.2 tiêu thụ hạn ngạch nhanh hơn các mô hình thấp cấp hơn — dòng flagship đốt hạn ngạch với hệ số nhân riêng.

Kết luận rất đơn giản: để lập trình solo một cách ổn định, gói đăng ký hoạt động rất tốt. Nhưng chế độ của bạn càng "đại lý" — các tác vụ song song, phiên tự chủ dài hạn, chạy đêm — thì mô hình hạn ngạch càng dễ trở thành một trò chơi may rủi. Giải pháp thay thế — thanh toán theo token thực tế: không có cửa sổ thời gian, không hệ số nhân và không hàng đợi — agent tiêu thụ bao nhiêu, trừ bấy nhiêu. Đây chính là mô hình mà cơ chế custom provider tích hợp trong ZCode cung cấp, và việc thiết lập chỉ mất năm phút.

BYOK trong ZCode: API-key của riêng bạn và custom provider

ZCode hỗ trợ chính thức BYOK: tài liệu cho phép thêm "bất kỳ dịch vụ nào tương thích với giao thức OpenAI hoặc Anthropic" — API công khai, kênh doanh nghiệp và thậm chí các cài đặt self-hosted. Cấu hình qua ba cách:

  • nút Connect trên màn hình chào mừng → «Set Your API Key»;
  • Manage Models trong bộ chọn model;
  • biểu tượng bánh răng → Settings → Model Settings → Add Provider.

Đối với nhà cung cấp, hãy thiết lập OpenAI Base URL và/hoặc Anthropic Base URL cộng với API Key — danh sách các model khả dụng sẽ được ZCode tự động tải xuống.

Ba lỗi thường gặp nhất:

  • Endpoint của Z.ai khác nhau. Gói đăng ký Coding Plan chỉ hoạt động thông qua coding-endpoint https://api.z.ai/api/coding/paas/v4; endpoint chung /api/paas/v4 với key đăng ký sẽ trả về lỗi — lý do kinh điển cho "tôi bị lỗi 401/429 dù đã thanh toán gói".
  • «Hoạt động trong Claude Code ≠ hoạt động trong ZCode». ZCode không đọc các biến môi trường như ANTHROPIC_BASE_URL được dùng để cấu hình Claude Code: nó có bộ lưu trữ thiết lập nhà cung cấp riêng biệt. Hãy cấu hình thông qua Settings.
  • «Model hiển thị trong bộ chọn ≠ key có hạn mức». Danh sách model được lấy từ API của nhà cung cấp, nhưng quyền truy cập phụ thuộc vào số dư và hạn mức cụ thể của key đó.

Tiếp theo là thực hành: kết nối cổng JoinGonka vào ZCode để nhận GLM-stack theo số lượng token.

Cấu hình JoinGonka Gateway trong ZCode: GLM theo token

JoinGonka Gateway — cổng kết nối vào mạng lưới phi tập trung Gonka với hai giao thức gốc: tương thích OpenAI /v1/chat/completions và Anthropic Messages /v1/messages. Mô hình kinh tế — pay-per-token: không có cửa sổ 5 giờ, không hệ số cao điểm ×3 và không giới hạn một yêu cầu song song; mức tiêu thụ được hiển thị trong bảng điều khiển theo thời gian thực, cổng kết nối không lưu trữ nội dung prompt.

Các bước thực hiện (giao diện Custom Provider hiện tại):

BướcHành động
1. KeyĐăng ký — gate.joingonka.ai/register (tài khoản mới nhận 10M token miễn phí), tạo API key trong phần Keys. Chi tiết hơn — tại API Quick Start.
2. ProviderZCode → Settings → Model Settings → Add Provider. Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keykey của bạn dạng jg-…
5. API formatChat completions (/chat/completions)
6. ModelAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Tương tự, hãy thêm moonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7; danh sách cập nhật — GET /v1/models.

Trong các phiên bản ZCode cũ, thay vào đó có hai trường riêng biệt: OpenAI Base URL (https://gate.joingonka.ai/v1) và Anthropic Base URL (https://gate.joingonka.ai — client sẽ tự thêm đường dẫn).

Kiểm tra: chọn model đã tạo và đặt cho agent bất kỳ câu hỏi nào. Nếu nhận được phản hồi — mọi thứ đều ổn; lỗi 401 — kiểm tra lại key, 402 — số dư tài khoản. Nếu trên DeepSeek V4 Flash xuất hiện «Model request failed» ở Thought Level Max — hãy chuyển Thought Level sang High và thử lại.

Gợi ý. Lệnh npx @joingonka/setup --tool zcode sẽ in ra các giá trị sẵn sàng cho các trường bên dưới (base URL, key, ID model với giới hạn hiện tại) và kiểm tra bằng một yêu cầu trực tiếp xem cổng kết nối có chấp nhận chúng hay không. ZCode chỉ được thiết lập qua UI — không có file nào có thể chỉnh sửa an toàn, vì vậy bạn cần nhập thủ công.

So sánh giá: Coding Plan, Z.ai API, OpenRouter và Gonka

Chi phí suy luận GLM trên các kênh khác nhau (giá cho mỗi 1M token; giá của các đối thủ được chốt vào tháng 7 năm 2026, giá JoinGonka được cập nhật trực tiếp trên trang từ cổng API):

KênhĐầu vào, $/1MĐầu ra, $/1MMô hình thanh toán
Z.ai API (GLM-5.2)$1.40 (đầu vào đã cache — $0.26)$4.40theo token
GLM Coding Plan$18—160/thángđăng ký: hạn ngạch theo "prompt", hệ số nhân ×3 vào giờ cao điểm, giới hạn song song
OpenRouter (z-ai/glm-5.2)$0.93$3.00theo token; không có tùy chọn miễn phí cho GLM-5.2
JoinGonka Gateway$0.0032$0.0097theo token, mạng lưới Gonka

Sự khác biệt từ hai đến ba bậc độ lớn không phải là làm tròn theo marketing, mà là một nền kinh tế khác: các tính toán được thực hiện bởi những người tham gia mạng lưới phi tập trung, kiếm tiền từ chính công việc thay vì từ lợi nhuận của trung tâm dữ liệu. Phân tích chi tiết về cách thức hoạt động và giới hạn áp dụng nằm trong bài viết về AI API rẻ nhất.

Tuyên bố miễn trừ trách nhiệm trung thực về GLM-5.2: mạng lưới sẽ đặt giá chính xác cho mô hình tại thời điểm kích hoạt (trong bảng trên là giá thực tế hiện tại của các mô hình mạng lưới). Các con số trên trang này được cập nhật tự động, không cần phải tính toán thủ công.

GLM-5.2 trong mạng Gonka: trạng thái và câu hỏi thường gặp

Mô hình zai-org/GLM-5.2-FP8 đã được thêm vào sổ cái on-chain của mạng lưới Gonka: cấu hình thiết lập cửa sổ ngữ cảnh lên tới 400K token, và bản thân mô hình thuộc loại nặng (cần hơn một terabyte VRAM cho mỗi replica). Hiện đang trong quá trình triển khai: các node mạng đang khởi động trọng số. Ngay khi các kiểm tra chuyển sang màu xanh, mô hình sẽ tự động xuất hiện trong danh sách mô hình của gateway — base URL và khóa không thay đổi, trong ZCode chỉ cần chọn nó trong bộ chọn.

Về chính mô hình: trọng số mở theo giấy phép MIT, kiến trúc MoE với ~750B tham số (khoảng 40B tham số hoạt động trên mỗi token), cửa sổ native lên tới 1M token. Theo dữ liệu từ Z.ai, trên SWE-bench Pro mô hình đạt 62.1 — cao hơn GPT-5.5, và trên FrontierSWE chỉ thua kém Claude Opus 4.8 khoảng một phần trăm. Đối với một mô hình open-weight, đây là vị trí hàng đầu trong lập trình.

Các câu hỏi thường gặp:

  • Tại sao ngay sau khi bật mô hình mới lại gặp lỗi 429? — Đây là giai đoạn triển khai: một số node vẫn đang tải trọng số. Hãy thử lại yêu cầu sau vài giây — bộ cân bằng tải sẽ tìm thấy một node đang hoạt động.
  • Hiện có gì khả dụng? — Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash: cả ba mô hình đều hoạt động trong ZCode thông qua cùng một custom provider, cấu hình từ hướng dẫn này hoàn toàn hoạt động ngay bây giờ.
  • Còn về quyền riêng tư? — Gateway không lưu trữ nội dung của các prompt và phản hồi; trong thống kê — chỉ có số liệu tổng hợp về mức tiêu thụ.
  • Khi nào thì Coding Plan có lợi hơn? — Nếu bạn làm việc solo, nằm trong hạn ngạch Lite và không chạy các đại lý song song, việc đăng ký với chi phí cố định là thuận tiện và dễ dự đoán. Hãy tính toán dựa trên cấu hình của bạn: nếu làm việc tích cực với đại lý, thanh toán cho token qua mạng lưới rẻ hơn gấp nhiều lần, còn khi chỉ sửa mã nhẹ vài lần một ngày thì sự khác biệt có thể không đáng kể.
  • Nó có phù hợp cho các công cụ khác không? — Có: cùng một endpoint hoạt động trong Claude Code, Cursor, Cline và bất kỳ client tương thích OpenAI/Anthropic nào.
ZCode 3.0 là một IDE agentic đáng chú ý, nhưng gói đăng ký GLM Coding Plan mặc định của nó dựa trên hạn ngạch: "lời nhắc" trong cửa sổ 5 giờ, hệ số nhân ×3 vào giờ cao điểm và chỉ một yêu cầu đồng thời ở các gói thấp. Tải công việc càng mang tính agentic thì chi phí càng đắt đỏ và khó dự đoán. BYOK chính thức giải quyết vấn đề này: kết nối JoinGonka Gateway dưới dạng custom provider và thanh toán cho các token thực tế theo mức giá của mạng phi tập trung Gonka, thấp hơn hàng trăm lần so với các API tập trung. GLM-5.2 đã có sẵn trong danh mục mạng và sẽ tự động xuất hiện trong bộ chọn mô hình của bạn, trong khi Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash đã hoạt động ngay hôm nay. Bắt đầu với 10M token miễn phí.

Muốn tìm hiểu thêm?

Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.

Nhận 10M token miễn phí →