Các phần cơ sở kiến thức ▾

Điều hướng

▸ Bắt đầu tại đây Theo vai trò

Danh mục

Công cụ 52
Bảng thuật ngữ 12

Công cụ

ZCode: suy luận GLM giá rẻ thay thế cho GLM Coding Plan

Vào tháng 6 năm 2026, Z.ai đã phát hành ZCode 3.0 — một môi trường phát triển tác nhân (agentic development environment) trên máy tính để bàn, được chính công ty gọi là "Official Harness for GLM-5.2". Sản phẩm nhanh chóng thu hút sự chú ý: nhân tác nhân (agent core) riêng, các tác vụ tự chủ thông qua /goal, chế độ đa tác nhân (multi-agent) và điều khiển phiên làm việc từ xa ngay từ Telegram. Nhưng cùng với làn sóng đánh giá, cũng có làn sóng câu hỏi từ những người đăng ký GLM Coding Plan đầu tiên: hạn mức được tính bằng "lời nhắc" (prompts) trong các khoảng thời gian năm giờ, trong giờ cao điểm mức tiêu thụ nhân ba, với các gói thấp hơn thì chỉ có một yêu cầu song song, và trên Hacker News, người ta phàn nàn về việc đột ngột bị chặn sau một ngày làm việc cường độ cao.

Tin tốt là: ZCode hỗ trợ chính thức custom provider — bạn có thể kết nối bất kỳ API tương thích OpenAI hoặc Anthropic nào với nó và trả tiền cho số lượng token thực tế thay vì hạn mức đăng ký. Trong hướng dẫn này, chúng ta sẽ tìm hiểu ZCode là gì và GLM Coding Plan hoạt động ra sao, sau đó thiết lập từng bước ZCode trên JoinGonka Gateway — cổng kết nối của mạng phi tập trung Gonka, phục vụ GLM-5.3 Flash — một mô hình suy luận mở của chính Z.ai. Kết quả: cùng một công cụ, cùng các mô hình open-weight, nhưng kinh tế hơn — trả theo token và rẻ hơn gấp nhiều lần so với các API tập trung.

ZCode là gì: môi trường phát triển đại lý từ Z.ai

ZCode không phải là "trình chỉnh sửa có thanh bên chat" mà là ADE: bạn mô tả mục tiêu, đại lý lập kế hoạch, sửa file, chạy các kiểm tra và lặp lại cho đến khi đạt kết quả. Hoạt động như một ứng dụng desktop trên macOS và Windows (bản build cho Linux đang ở trạng thái beta).

Các tính năng chính của phiên bản 3.0:

  • ZCode Agent — nhân đại lý riêng với tích hợp sâu GLM-5.2; ngoài ra, bạn có thể kết nối các đại lý bên thứ ba (Claude Code, Codex, Gemini CLI và các loại khác);
  • Chế độ Goal (/goal) — các tác vụ tự chủ dài hạn: lập kế hoạch → thực thi → xác minh từng bước;
  • Multi-agent — nhiều đại lý làm việc song song trên một dự án;
  • Quản lý từ xa — khởi chạy và kiểm soát các phiên từ Telegram, WeChat và Feishu: đại lý làm việc trên máy của bạn và bạn trả lời các câu hỏi từ điện thoại.

Bản thân client là miễn phí, với người dùng mới Z.ai cung cấp hạn ngạch token GLM-5.2 hàng ngày để trải nghiệm. Sau đó — hoặc là đăng ký GLM Coding Plan, hoặc là sử dụng API-key của riêng bạn. Và đây là nơi cần đi sâu vào chi tiết, vì mô hình đăng ký là phần được thảo luận nhiều nhất của sản phẩm.

GLM Coding Plan: giá, giới hạn và hạn ngạch

GLM Coding Plan là gói đăng ký của Z.ai, cho phép truy cập các mô hình GLM trong ZCode và hơn hai chục công cụ bên thứ ba. Tại thời điểm đăng bài (tháng 7/2026), bảng giá cơ bản như sau — nhưng giá và khuyến mãi luôn thay đổi, hãy kiểm tra trang z.ai/subscribe để cập nhật:

GóiGiá, $/thángHạn mứcYêu cầu song song
Lite$18 (theo khuyến mãi — từ ~$12.6)«Prompt» trong khung 5 giờ + trần hàng tuần1
Pro$72×4 so với Lite1
Max$160×16 so với Liteđến 30

Những gì người đăng ký phàn nàn (các thread trên Hacker News và GitHub):

  • Hệ số giờ cao điểm. Vào giờ cao điểm (14:00—18:00 UTC+8 — buổi tối ở châu Á, sáng-đầu chiều ở châu Âu) mỗi yêu cầu trừ hạn mức với hệ số ×3, ngoài cao điểm — ×2. Bạn phải lên kế hoạch chi tiêu theo múi giờ Bắc Kinh.
  • Hạn mức tính bằng «prompt», không phải token. Còn chính xác bao nhiêu token — không minh bạch; trên các thread có những câu chuyện kiểu «đã dùng ~17M token trên GLM — và bị khóa bốn ngày».
  • Chỉ một yêu cầu song song trên Lite và Pro. Với môi trường agent, điều này khá đáng kể: chế độ multi-agent của chính ZCode và mọi sub-agent song song đều phải xếp hàng.
  • GLM-5.2 tiêu hạn mức nhanh hơn các mô hình thấp hơn — mô hình đầu bảng đốt hạn mức với hệ số riêng.

Kết luận đơn giản: với một lập trình viên solo làm việc nhẹ nhàng, gói đăng ký hoạt động trung thực. Nhưng càng «agent» chế độ của bạn — tác vụ song song, phiên tự động dài, chạy đêm — thì mô hình hạn mức càng biến thành trò may rủi. Giải pháp thay thế — trả tiền theo token thực tế: không khung giờ, không hệ số, không xếp hàng — agent dùng bao nhiêu thì trừ bấy nhiêu. Đó chính là mô hình mà cơ chế custom provider tích hợp trong ZCode mang lại, và bạn có thể thiết lập trong năm phút.

BYOK trong ZCode: API-key của riêng bạn và custom provider

ZCode chính thức hỗ trợ tích hợp sẵn BYOK: tài liệu hướng dẫn cho phép rõ ràng việc thêm "bất kỳ dịch vụ nào tương thích với giao thức OpenAI hoặc Anthropic" — API công khai, kênh doanh nghiệp và thậm chí cả các bản cài đặt self-hosted. Có ba cách cấu hình:

  • nút Connect trên màn hình chào mừng → "Set Your API Key";
  • Manage Models trong bộ chọn mô hình;
  • biểu tượng bánh răng → Settings → Model Settings → Add Provider.

Nhà cung cấp được thiết lập OpenAI Base URL và/hoặc Anthropic Base URL cùng với API Key — ZCode sẽ tự động tải danh sách mô hình có sẵn.

Ba cạm bẫy mà người dùng hay vấp phải nhất:

  • Các endpoint của Z.ai khác nhau. Gói đăng ký Coding Plan chỉ hoạt động qua coding-endpoint https://api.z.ai/api/coding/paas/v4; endpoint chung /api/paas/v4 với key đăng ký sẽ báo lỗi — đây là nguyên nhân kinh điển của lỗi "tôi bị 401/429 dù đã thanh toán gói".
  • "Chạy được trong Claude Code ≠ chạy được trong ZCode". Các biến môi trường như ANTHROPIC_BASE_URL dùng để cấu hình Claude Code sẽ không được ZCode đọc: nó có kho lưu trữ cài đặt nhà cung cấp riêng. Hãy cấu hình trực tiếp qua Settings.
  • "Mô hình hiện trong bộ chọn ≠ key có hạn ngạch". Danh sách mô hình được tải từ API của nhà cung cấp, còn tính khả dụng phụ thuộc vào số dư và giới hạn của từng key cụ thể.

Tiếp theo là phần thực hành: kết nối gateway JoinGonka với ZCode và nhận stack GLM bằng token.

Cấu hình JoinGonka Gateway trong ZCode: GLM theo token

JoinGonka Gateway — cổng kết nối tới mạng phi tập trung Gonka với hai giao thức gốc: /v1/chat/completions tương thích OpenAI và /v1/messages của Anthropic. Cơ chế kinh tế là pay-per-token: không có các cửa sổ 5 giờ, không hệ số cao điểm ×3 và không giới hạn một yêu cầu song song; chi phí được hiển thị trong bảng điều khiển theo thời gian thực, cổng kết nối không lưu trữ nội dung của các prompt.

Từng bước (giao diện Custom Provider hiện tại):

BướcHành động
1. KhóaĐăng ký — gate.joingonka.ai/register (tài khoản mới nhận 3M token miễn phí), tạo API-key trong phần Keys. Chi tiết xem tại API Quick Start.
2. ProviderZCode → Settings → Model Settings → Add Provider. Name: JoinGonka
3. Base URLhttps://gate.joingonka.ai/v1
4. API Keykhóa của bạn có dạng jg-…
5. API formatChat completions (/chat/completions)
6. Mô hìnhAdd Model → Model ID deepseek-ai/DeepSeek-V4-Flash-0731, Context window 380000. Tương tự thêm MiniMaxAI/MiniMax-M2.7 và zai-org/GLM-5.3-Flash — mô hình suy luận của chính Z.ai; danh sách hiện tại và giới hạn — GET /v1/models.

Trong các phiên bản cũ của ZCode, thay vào đó là hai trường riêng biệt: OpenAI Base URL (https://gate.joingonka.ai/v1) và Anthropic Base URL (https://gate.joingonka.ai — client sẽ tự thêm đường dẫn).

Kiểm tra: chọn mô hình đã tạo và hỏi agent bất kỳ câu hỏi nào. Nếu nhận được phản hồi — mọi thứ đều hoạt động; lỗi 401 — kiểm tra lại khóa, 402 — số dư tài khoản. Nếu trên DeepSeek V4 Flash xuất hiện «Model request failed» khi Thought Level là Max — hãy chuyển Thought Level sang High và thử lại yêu cầu.

Gợi ý. Lệnh npx @joingonka/setup --tool zcode sẽ in ra các giá trị sẵn sàng cho các trường này — base URL, khóa, id mô hình và các giới hạn thực tế của nó: cửa sổ ngữ cảnh và giới hạn phản hồi — đồng thời kiểm tra bằng yêu cầu trực tiếp rằng cổng đã chấp nhận chúng. Bản thân ZCode chỉ được cấu hình thông qua UI — nó không có tệp tin có thể chỉnh sửa an toàn, vì vậy bạn cần nhập các giá trị bằng tay.

So sánh giá: Coding Plan, Z.ai API, OpenRouter và Gonka

Chi phí cho GLM-inference trên các kênh khác nhau (giá cho 1M token; giá của các đối thủ được ghi nhận vào tháng 9 năm 2026, giá của JoinGonka được hiển thị trực tiếp trên trang từ API của cổng kết nối):

KênhInput, $/1MOutput, $/1MMô hình thanh toán
Z.ai API (GLM-5.2)$1.40 (input đã cache — $0.26)$4.40theo token
GLM Coding Plan$18—160/thángđăng ký: hạn mức «prompt», hệ số nhân ×3 lúc cao điểm, giới hạn song song
OpenRouter (z-ai/glm-5.2)$1.40$4.40theo token
OpenRouter (z-ai/glm-5.3-flash)$0.09$0.30theo token
JoinGonka Gateway$0.0069$0.021theo token, mạng lưới Gonka

Sự khác biệt hai đến ba bậc không phải là làm tròn theo marketing, mà là một nền kinh tế khác: việc tính toán được thực hiện bởi những người tham gia mạng lưới phi tập trung, những người kiếm tiền từ công việc thực tế chứ không phải từ lợi nhuận của trung tâm dữ liệu. Phân tích chi tiết về cách thức hoạt động và phạm vi áp dụng — trong bài viết về AI API rẻ nhất.

Dòng JoinGonka là giá của GLM-5.3 Flash trong mạng lưới Gonka: tất cả các mô hình trong mạng đều có biểu phí thống nhất. Các số liệu trên trang này được cập nhật tự động, bạn không cần phải tính toán lại thủ công.

GLM trong mạng lưới Gonka: GLM-5.3 Flash và các câu hỏi thường gặp

Mạng lưới Gonka hiện đang hỗ trợ mô hình Z.ai: zai-org/GLM-5.3-Flash đã được chấp nhận thông qua đề xuất quản trị #101 và được cung cấp qua gateway song song với MiniMax M2.7 và DeepSeek V4 Flash. GLM-5.2 (mô hình chủ đạo được nhắc đến trong các phiên bản đầu của hướng dẫn này) đã không được đưa vào sử dụng thực tế — mạng lưới đã chọn một mô hình nhẹ hơn và nhanh hơn cùng dòng. Base URL và API key vẫn giữ nguyên: trong ZCode, bạn chỉ cần thêm mô hình trong custom provider.

Về mô hình này: mã nguồn mở theo giấy phép MIT, kiến trúc MoE với 320B tham số (18B tham số hoạt động trên mỗi token), kết hợp giữa sự chú ý thưa và tuyến tính (hybrid sparse and linear attention). Điểm nổi bật chính là mô hình reasoning (lập luận): trước khi trả lời, nó thực hiện suy luận, và phần suy luận này chiếm hàng trăm token ngay cả với các câu hỏi đơn giản. Đối với ZCode, điều này có nghĩa là: đừng hạ thấp giới hạn độ dài câu trả lời của mô hình (từ 600 token trở lên ngay cả cho các phản hồi ngắn) và đối với các chỉnh sửa nhanh, hãy giảm Thought Level — ở cấp độ API là reasoning_effort: low. Phân tích chi tiết về mô hình và các giới hạn của nó có trong bài viết GLM-5.3 Flash trong mạng lưới Gonka.

Các câu hỏi thường gặp:

  • Tại sao mô hình mới đôi khi bị lỗi 429 hoặc xếp hàng? — Hiện tại chỉ có một phần nhỏ các host của mạng lưới đang phục vụ mô hình này; trong những phút cao điểm, yêu cầu có thể phải chờ slot trống. Hãy thử lại sau vài giây — bộ cân bằng tải sẽ tìm thấy node đang hoạt động. Trạng thái hiện tại có trên trang trạng thái gateway.
  • Còn gì khác khả dụng? — Ngoài GLM-5.3 Flash còn có MiniMax M2.7 và DeepSeek V4 Flash: cả ba mô hình đều hoạt động trong ZCode thông qua cùng một custom provider, cấu hình trong hướng dẫn này hoàn toàn có thể sử dụng được.
  • Vấn đề bảo mật thì sao? — Gateway không lưu trữ nội dung prompt và câu trả lời; trong thống kê chỉ có dữ liệu tổng hợp về mức tiêu thụ.
  • Khi nào Coding Plan mang lại lợi ích hơn? — Nếu bạn làm việc solo, nằm trong hạn ngạch Lite và không chạy các tác nhân (agents) song song, gói đăng ký với chi phí cố định sẽ tiện lợi và dễ dự đoán hơn. Hãy tính toán dựa trên hồ sơ của bạn: khi làm việc với tác nhân tích cực, việc trả phí theo token qua mạng lưới sẽ rẻ hơn rất nhiều, còn nếu chỉ chỉnh sửa code nhẹ vài lần mỗi ngày, sự khác biệt có thể không đáng kể.
  • Nó có phù hợp với các công cụ khác không? — Có: endpoint tương tự hoạt động trên Claude Code, Cursor, Cline và bất kỳ client tương thích OpenAI/Anthropic nào.
ZCode 3.0 là một IDE tác nhân đáng chú ý, nhưng gói đăng ký GLM Coding Plan gốc của nó dựa trên hạn ngạch: "prompts" trong các khoảng thời gian 5 giờ, hệ số ×3 vào giờ cao điểm và chỉ một yêu cầu song song ở các gói thấp. Tải công việc càng liên quan đến tác nhân, chi phí càng đắt đỏ và khó dự đoán. Tính năng BYOK chính thức sẽ giải quyết vấn đề này: kết nối JoinGonka Gateway như một custom provider — và trả phí theo số lượng token thực tế với giá của mạng lưới phi tập trung Gonka, rẻ hơn hàng trăm lần so với các API tập trung. GLM-5.3 Flash — mô hình lập luận mở của chính Z.ai — đã được mạng lưới hỗ trợ, bên cạnh MiniMax M2.7 và DeepSeek V4 Flash. Hãy bắt đầu với các token khởi đầu miễn phí.

Muốn tìm hiểu thêm?

Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.

Nhận token miễn phí →