Các phần cơ sở kiến thức ▾

Công nghệ

GLM-5.3 Flash: mô hình lập luận Z.ai trong mạng Gonka

Vào tháng 9 năm 2026, một mô hình mới đã xuất hiện trong mạng Gonka — GLM-5.3 Flash từ phòng thí nghiệm Z.ai của Trung Quốc. Đề xuất quản trị #101 về việc bổ sung nó đã được thông qua, các host đã tải trọng số và mô hình đã có sẵn thông qua gateway của chúng tôi cùng với MiniMax M2.7 và DeepSeek V4 Flash. Đồng thời, Kimi K2.6 đã rời khỏi mạng, còn GLM-5.2 — flagship từng nằm trong danh sách chờ triển khai — đã không được đưa vào vận hành thực tế; mạng đã chọn một mô hình nhẹ hơn cùng dòng.

GLM-5.3 Flash khác biệt với các mô hình khác trong mạng ở một đặc điểm then chốt: đây là mô hình lập luận (reasoning model). Trước khi trả lời, nó sẽ suy luận — và các suy luận này tiêu tốn token, thời gian và yêu cầu cài đặt truy vấn chính xác. Ai đặt max_tokens: 200 cho một "câu trả lời ngắn" sẽ nhận lại phản hồi trống. Chúng ta sẽ cùng phân tích mô hình này là gì, các đặc tính của nó trong mạng Gonka, cách thức hoạt động của ngân sách lập luận, tình trạng các công cụ và JSON, chi phí và khi nào nên chọn nó thay vì hai mô hình còn lại của mạng.

GLM-5.3 Flash là gì và ai đứng sau nó

Z.ai là thương hiệu quốc tế của phòng thí nghiệm Zhipu AI, bắt nguồn từ Đại học Thanh Hoa. Dòng GLM đã phát triển từ năm 2023 (ChatGLM), và bắt đầu từ GLM-4.5 vào mùa hè năm 2025, công ty đã phát hành trọng số của các mô hình hàng đầu theo giấy phép MIT, khiến loạt sản phẩm này trở thành một trong những dòng mô hình mở đáng chú ý nhất trên thế giới. Các sản phẩm riêng của Z.ai — môi trường phát triển ZCode và gói đăng ký GLM Coding Plan — đều được xây dựng xung quanh các mô hình này.

GLM-5.3 Flash là mô hình nhẹ trong dòng 5.3. "Nhẹ" ở đây mang tính tương đối: đây là mô hình MoE với 320 tỷ tham số, trong đó mỗi token kích hoạt khoảng 18 tỷ tham số. Trọng số được phân phối ở định dạng FP8, giấy phép là MIT. Điểm đặc biệt về kiến trúc là cơ chế chú ý lai (hybrid attention): một phần các lớp sử dụng chú ý thưa (sparse), một phần sử dụng chú ý tuyến tính, giúp giảm đáng kể chi phí bộ nhớ và thời gian cho ngữ cảnh dài so với chú ý toàn phần truyền thống.

Đặc tính thứ hai định hình hành vi của mô hình là suy luận tích hợp (built-in reasoning). GLM-5.3 Flash được huấn luyện để suy nghĩ trước rồi mới trả lời: quá trình suy luận được tách biệt khỏi câu trả lời và được gửi đến máy khách dưới dạng một trường riêng biệt. Suy luận có thể bật hoặc tắt thông qua tham số reasoning_effort, và mặc định là đầy đủ. Điều này khiến mô hình mạnh mẽ trong các nhiệm vụ đòi hỏi phân tích logic phức tạp — và đòi hỏi các cài đặt truy vấn cụ thể, như được đề cập dưới đây.

Sự khác biệt giữa "Flash" và GLM-5.3 bản cao cấp được thể hiện rõ qua giá của nhà cung cấp: trên OpenRouter tại thời điểm xuất bản, Flash có giá $0.09 cho một triệu token đầu vào và $0.30 cho một triệu token đầu ra, trong khi mô hình cao cấp là $1.40 và $4.40. Trong mạng lưới Gonka không tồn tại sự phân cấp này: tất cả các mô hình trong mạng được cung cấp với một mức giá duy nhất.

Đặc tính của GLM-5.3 Flash trong mạng Gonka

Cũng như các mô hình mạng khác, điều quan trọng là phải phân biệt giữa các đặc tính của mô hình "nguyên bản" và các tham số vận hành của một triển khai cụ thể: những tham số này được xác định bởi cấu hình vLLM-inference trên các GPU-host của mạng lưới. Các giá trị thực tế thông qua Gateway của chúng tôi là:

  • Cửa sổ ngữ cảnh: 390 000 token. Đây là mức tối thiểu đã được kiểm chứng bằng truy vấn, không phải con số lấy từ thẻ mô hình: đầu vào 390 013 token đã được chấp nhận và xử lý, chúng tôi đã chạy prefill lớn trực tiếp đến các host của mạng. Cấu hình kỹ thuật của các host cho phép 400 000, nhưng chúng tôi chỉ công bố những gì đã được kiểm chứng.
  • Đầu ra tối đa: 8 192 token cho mỗi câu trả lời. Quan trọng: giới hạn này bao gồm cả token suy luận và câu trả lời thực tế. Một mô hình đã suy luận 3000 token với giới hạn 4096 sẽ chỉ để lại khoảng 1000 token cho câu trả lời.
  • Reasoning và tool calling: mô hình được triển khai với trình phân tích suy luận và trình phân tích gọi công cụ — các suy luận xuất hiện trong trường reasoning_content, còn các lệnh gọi công cụ nằm trong trường tool_calls tiêu chuẩn, giống như bất kỳ mô hình tương thích OpenAI nào.
  • Tốc độ: trong các phép đo của chúng tôi qua cổng, token đầu tiên đến sau khoảng 0,75 giây, tốc độ tạo từ 25–44 token mỗi giây tùy thuộc vào tải. Đối với một mô hình reasoning, điều này là nhanh — nhưng hãy nhớ rằng vài trăm token đầu tiên sẽ dành cho việc suy luận, và câu trả lời có thể nhìn thấy sẽ bắt đầu muộn hơn.
  • Yêu cầu về VRAM của host: khoảng 560 GB trên mỗi bản sao theo các tham số on-chain của mô hình — cao hơn so với MiniMax M2.7 (320 GB) và DeepSeek V4 Flash (280 GB). Ngưỡng phần cứng càng cao, số lượng host có thể triển khai mô hình càng ít, điều này ảnh hưởng trực tiếp đến công suất của nó trong mạng lưới — chi tiết về điều này nằm trong phần về kịch bản và hạn chế.

Giá inference trong mạng Gonka không phụ thuộc vào việc lựa chọn mô hình: GLM-5.3 Flash có sẵn ở mức phí tương tự như MiniMax M2.7 và DeepSeek V4 Flash, — thông qua JoinGonka Gateway, mức phí là $0.0069 cho mỗi triệu token đầu vào và $0.021 cho mỗi triệu token đầu ra. Các token suy luận được tính phí như token đầu ra. Kinh tế học của mạng lưới — là một chủ đề riêng biệt: giá được xác định bằng tính toán cho công việc tính toán, không phải theo giá của nhà cung cấp.

Lập luận và ngân sách token: cách để không nhận phản hồi trống

Sai lầm phổ biến nhất khi lần đầu làm quen với GLM-5.3 Flash là: nhà phát triển gửi một câu hỏi ngắn với max_tokens: 256 quen thuộc, nhận lại finish_reason: "length" và một trường content trống. Không có gì bị hỏng cả — mô hình đã tiêu tốn toàn bộ giới hạn cho việc suy luận và chưa đến được phần trả lời. Theo các đo lường của chúng tôi, ngay cả với một câu hỏi tầm thường, việc suy luận cũng chiếm 250–450 token, và với các nhiệm vụ phức tạp hơn thì lên đến hàng nghìn.

Ba quy tắc thực hành:

Cài đặtKhuyến nghịLý do
max_tokensKhông ít hơn 600 ngay cả với câu trả lời ngắn; cho nhiệm vụ thực tế — từ 2000 trở lênGiới hạn dùng chung cho suy luận và câu trả lời; suy luận chiếm hàng trăm token đầu tiên
streamtrue bất cứ nơi nào có thểSuy luận và câu trả lời hiển thị theo thời gian thực: thấy được tiến trình, không phải chờ "màn hình trống", và các câu trả lời dài không bị quá hạn thời gian proxy
reasoning_effortlow khi không cần suy luận; không chỉ định khi cầnCông tắc nhị phân: low tắt suy luận, mọi giá trị khác giữ nó ở mức đầy đủ. Gateway chuyển đổi noneminimal thành low, còn medium, high, xhighmax được coi là dư thừa. Các trường enable_thinking, chat_template_kwargs, reasoning.enabledthinking.type bị mạng lưới bỏ qua

Ví dụ truy vấn cho nhiệm vụ ngắn — với suy luận hạn chế và giới hạn đủ:

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-token-cua-ban" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "reasoning_effort": "low",
    "max_tokens": 800,
    "messages": [{"role": "user", "content": "Nói tên thủ đô của Úc bằng một từ"}]
  }'

Trong phản hồi, suy luận nằm trong message.reasoning_content, còn câu trả lời nằm trong message.content; trong luồng (stream), chúng đến dưới dạng các delta riêng biệt. Hầu hết các ứng dụng tương thích OpenAI âm thầm bỏ qua trường lạ, vì vậy suy luận không bị "rò rỉ" vào văn bản trả lời — nhưng chúng được tính vào completion_tokens và được thanh toán như token đầu ra. Nếu không cần suy luận, GLM-5.3 Flash không phải là lựa chọn tốt nhất: cho các câu trả lời ngắn và nhanh, MiniMax M2.7 tiết kiệm hơn.

Một lưu ý riêng cho các kịch bản tác nhân (agentic scenarios): các công cụ như Cline hoặc Cursor thường tự đặt giới hạn đầu ra nhỏ cho các yêu cầu hệ thống — nén ngữ cảnh, tạo tiêu đề cuộc hội thoại. Nếu yêu cầu như vậy gửi đến GLM-5.3 Flash với giới hạn chỉ vài trăm token, nó sẽ trả về rỗng. Hãy kiểm tra cài đặt giới hạn trong công cụ hoặc gửi các yêu cầu hệ thống đến một mô hình khác trong mạng lưới.

Công cụ, JSON và so sánh với các mô hình khác trong mạng lưới

Các mô hình tư duy (reasoning models) đôi khi hoạt động không tốt với các khung tác nhân (agent frameworks): việc suy luận xen vào giữa các lệnh gọi công cụ và phá vỡ định dạng. Với GLM-5.3 Flash, chúng tôi đã chạy toàn bộ chu trình tác nhân — mô tả công cụ, lệnh gọi, trả về kết quả, vòng gọi thứ hai — và nó hoạt động bình thường trên đường dẫn tương thích với OpenAI: các lệnh gọi đến một cách có cấu trúc trong tool_calls, các tham số hợp lệ, và vòng gọi thứ hai không làm lẫn lộn lịch sử. Chế độ JSON (response_format: {"type": "json_object"}) cũng hoạt động — mô hình trả về một đối tượng hợp lệ, trong khi phần suy luận nằm ngoài phản hồi. Đối với các tác nhân, quy tắc ngân sách tương tự vẫn áp dụng: cần giới hạn đầu ra đủ lớn, nếu không lệnh gọi công cụ có thể bị cắt đứt giữa chừng.

Cách GLM-5.3 Flash so sánh với hai mô hình khác trong mạng lưới:

Tham sốGLM-5.3 FlashMiniMax M2.7DeepSeek V4 Flash
Ngữ cảnh mạng lưới390 000200 000380 000
Đầu ra mỗi phản hồi8 1928 19232 768
Kiến trúcMoE 320B (~18B hoạt động), chú ý hỗn hợp (hybrid attention)MoE + chú ý tuyến tínhMoE 284B (~13B hoạt động)
VRAM mỗi bản sao560 GB320 GB280 GB
Điểm mạnhLogic phức tạp, phân tích mã, các tác vụ "suy nghĩ"; ngữ cảnh dài nhất mạng lướiTác vụ hàng ngày, phản hồi ngắn nhanh, mô hình mặc địnhNgữ cảnh dài thứ hai, đầu ra dài nhất, lập trình tác nhân
Giá qua Gatewaygiống nhau — $0.0069 đầu vào / $0.021 đầu ra mỗi 1M

Hệ quả thực tế của việc thống nhất giá vẫn như trước: mô hình được chọn dựa trên tác vụ chứ không phải ngân sách. Cần suy nghĩ về logic phức tạp — GLM-5.3 Flash; cần đọc toàn bộ kho lưu trữ — DeepSeek V4 Flash; cần phản hồi nhanh gọn — MiniMax M2.7.

Cách sử dụng GLM-5.3 Flash qua JoinGonka Gateway

Mô hình khả dụng thông qua JoinGonka Gateway bằng API tương thích với OpenAI và Anthropic. ID mô hình: zai-org/GLM-5.3-Flash. Khóa dạng jg-… được tạo trong tài khoản cá nhân ngay sau khi đăng ký; các tài khoản mới được tặng 3M token miễn phí — đủ để chạy mô hình cho các tác vụ của bạn và chọn ngân sách suy luận.

Gọi API trực tiếp (Định dạng OpenAI, đã bật stream — chế độ được khuyến nghị cho mô hình reasoning):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-khóa-của-bạn" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "stream": true,
    "max_tokens": 4000,
    "messages": [{"role": "user", "content": "Tìm lỗi trong hàm này và giải thích nó: …"}]
  }'

Trong các công cụ phát triển, mô hình được kết nối giống như các mô hình khác trong mạng: base URL https://gate.joingonka.ai/v1, khóa jg-… và ID mô hình. Các hướng dẫn cho Cursor, Claude Code, Cline, Continue và các công cụ khác được tập hợp trong phần «Công cụ»; trình cài đặt npx @joingonka/setup sẽ thêm gateway vào cấu hình công cụ bằng một lệnh. Đối với khách hàng sử dụng Anthropic Messages API, chỉ cần đặt ANTHROPIC_BASE_URL=https://gate.joingonka.ai.

Bạn có thể thử mà không cần đăng ký trong chat miễn phí: chọn GLM-5.3 Flash trong danh sách mô hình — các suy luận ở đó được hiển thị trong một khối thu gọn riêng biệt, vì vậy bạn có thể dễ dàng thấy mô hình «suy nghĩ» bao lâu trước khi trả lời.

Khi nào nên chọn GLM-5.3 Flash — các kịch bản và những điều cần lưu ý

Các kịch bản mạnh mẽ cho mô hình này:

  • Các tác vụ cần suy nghĩ. Phân tích logic kinh doanh phức tạp, tìm kiếm lỗi không rõ ràng, thiết kế sơ đồ dữ liệu, toán học và suy luận nhiều bước — đó là lý do tại sao các mô hình suy luận tồn tại. Ở đây, việc suy luận được đền đáp bằng chất lượng phản hồi.
  • Đánh giá và giải thích mã nguồn. Mô hình phân tách mã của người khác và lập luận về các nhận xét, và quá trình suy luận từ reasoning_content có thể được hiển thị cho người dùng như là "tại sao tôi quyết định như vậy".
  • Trích xuất có cấu trúc với kiểm tra. Chế độ JSON cộng với suy luận mang lại kết quả chính xác hơn trên các dữ liệu đầu vào không rõ ràng so với việc trả lời trực tiếp không cần suy nghĩ.
  • Các pipeline đại lý với vai trò "người lập kế hoạch". Trong sự kết hợp của nhiều mô hình, GLM-5.3 Flash nên được đặt vào nơi quyết định "phải làm gì", còn các bước thực thi nhanh hãy để cho MiniMax M2.7 đảm nhiệm.

Khi nào các mô hình khác trong mạng lưới hợp lý hơn: cho các phản hồi ngắn và nhanh, tự động hoàn thiện và các yêu cầu số lượng lớn giá rẻ — MiniMax M2.7 (suy luận ở đó chỉ làm tăng độ trễ và chi phí); cho các tài liệu và kho lưu trữ cần nằm trọn trong một yêu cầu — DeepSeek V4 Flash với ngữ cảnh 380K.

Những điều cần lưu ý trước khi chuyển tải công việc. GLM-5.3 Flash là mô hình mới nhất và nặng nhất về phần cứng trong mạng lưới, và hiện tại chỉ có một số ít máy chủ phục vụ nó. Điều này có nghĩa là dư địa năng lực thấp hơn so với MiniMax M2.7 và DeepSeek V4 Flash: trong những phút cao điểm, các yêu cầu có thể phải đợi lâu hơn để có slot trống hoặc nhận phản hồi quá tải, điều này nên được thử lại sau vài giây. Rào cản thứ hai là thời gian: nhà cung cấp hiện đang phân phối mô hình mạng lưới sẽ ngắt phản hồi vào khoảng phút thứ năm của quá trình tạo; với tốc độ 25–44 token mỗi giây, con số này là khoảng 7–10 nghìn token, vì vậy các quá trình tạo rất dài nên được chia nhỏ thành các bước. Thành phần mạng lưới thay đổi theo bình chọn, vì vậy hãy luôn lấy danh sách mô hình hiện tại và giới hạn của chúng từ GET https://gate.joingonka.ai/v1/models, và tình trạng sẵn sàng cũng như độ trễ hiện tại — tại trang trạng thái cổng (gateway status page). Nhờ giá cả thống nhất, việc thử nghiệm không tốn phí: chuyển đổi mô hình chỉ là một dòng trong yêu cầu.

GLM-5.3 Flash là mô hình suy luận (reasoning) mở từ Z.ai (MoE 320B tham số, khoảng 18B kích hoạt, FP8, giấy phép MIT, chú ý lai), được thêm vào mạng lưới Gonka theo đề xuất quản trị #101 vào tháng 9 năm 2026. Trước khi trả lời, mô hình sẽ suy luận, và phần suy luận được tính vào giới hạn đầu ra: hãy đặt max_tokens từ 600 trở lên ngay cả cho câu trả lời ngắn, bật stream và với các tác vụ đơn giản hãy tắt suy luận thông qua reasoning_effort: low — mọi giá trị khác đều giữ nó ở mức đầy đủ (none và minimal được gateway chuyển thành low). Tool calling (bao gồm cả các vòng lặp) và chế độ JSON hoạt động bình thường; ngữ cảnh trong mạng lưới là 390.000 token, đầu ra tối đa 8.192. Giá tương đương với MiniMax M2.7 và DeepSeek V4 Flash: thông qua JoinGonka Gateway — $0.0069 cho một triệu token đầu vào và $0.021 cho một triệu token đầu ra. Định danh: zai-org/GLM-5.3-Flash; danh sách mạng lưới hiện tại — GET /v1/models.

Muốn tìm hiểu thêm?

Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.

Thử GLM-5.3 Flash qua Gateway →