Các phần cơ sở kiến thức ▾

Công nghệ

Qwen3-235B: mô hình mà Gonka đã từng phục vụ

Mạng lưới Gonka không chỉ cho thuê GPU — nó phục vụ các mô hình AI để inference. Trong một thời gian dài, mô hình chính và duy nhất của mạng lưới là Qwen3-235B-A22B-Instruct, được phát triển bởi Alibaba Cloud. Theo thời gian, mạng lưới đã chuyển sang kiến trúc đa mô hình (multi-model), và Qwen3-235B đã được gỡ bỏ khỏi mạng: ngày nay Gonka phục vụ Kimi K2.6 từ Moonshot AI, MiniMax M2.7DeepSeek V4 Flash. Hãy cùng tìm hiểu Qwen3-235B là gì, vai trò của nó trong mạng lưới Gonka và những gì đã thay thế nó — là một mô hình MoE open-source đáng chú ý, nó vẫn là một chuẩn mực hữu ích.

Qwen3-235B là gì

Qwen3-235B-A22B-Instruct-2507-FP8 là một mô hình ngôn ngữ lớn (LLM) thuộc gia đình Qwen3, được phát triển bởi đội ngũ Qwen tại Alibaba Cloud. Tên đầy đủ được giải thích như sau: Qwen3 — thế hệ thứ ba của dòng, 235B — tổng cộng 235 tỷ tham số, A22B — 22 tỷ tham số hoạt động trên mỗi yêu cầu, Instruct — phiên bản được đào tạo để tuân theo hướng dẫn, 2507 — phiên bản phát hành tháng 7 năm 2025, FP8 — lượng tử hóa 8 bit để tối ưu hóa bộ nhớ.

Đặc điểm kiến trúc chính là MoE (Mixture of Experts). Không giống như các mô hình "dense" (GPT-5.5, Claude Sonnet 4.6), nơi mỗi token đi qua tất cả các tham số, mô hình MoE chỉ kích hoạt một tập hợp con các "chuyên gia" — các khối mạng thần kinh chuyên biệt — cho mỗi yêu cầu. Trong trường hợp của Qwen3-235B, từ 235 tỷ tham số, chỉ 22 tỷ được kích hoạt cho mỗi token — chưa đến 10%. Điều này mang lại chất lượng tương đương với các mô hình có hơn 200 tỷ tham số với chi phí tính toán của một mô hình 22 tỷ tham số.

Trong thực tế, điều này có nghĩa là: mô hình thông minh hơn những gì người ta mong đợi từ tốc độ của nó. Nó xử lý các yêu cầu nhanh hơn đáng kể so với các mô hình dense có chất lượng tương đương, đồng thời yêu cầu VRAM ít hơn nhiều cho inference. Đó là lý do tại sao MoE đã trở thành kiến trúc thống trị cho các mô hình lớn nhất từ năm 2025—2026.

Cửa sổ ngữ cảnh của Qwen3-235B là 131.072 token (~100.000 từ) — đủ để phân tích toàn bộ sách, cơ sở mã hoặc tài liệu pháp lý dài chỉ trong một yêu cầu. Mô hình hỗ trợ 119 ngôn ngữ, bao gồm tiếng Nga, tiếng Anh, tiếng Trung, tiếng Ả Rập, tiếng Hindi và hàng chục ngôn ngữ khác — làm cho nó trở thành một trong những mô hình đa ngôn ngữ nhất trên thị trường.

Đặc điểm và điểm chuẩn

Qwen3-235B cạnh tranh với các mô hình đóng và mở lớn nhất. Dưới đây là so sánh các đặc điểm chính:

Mô hìnhTham sốNgữ cảnhMoEOpen SourceGiá (cho 1M token)
Qwen3-235B (Alibaba)235B (22B hoạt động)131KCó (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (ước tính)128KCó (giả định)Không$5.00
Claude Sonnet 4.6 (Anthropic)Chưa tiết lộ200KKhông (giả định)Không$3.00
Llama 4 Maverick (Meta)400B (17B hoạt động)1MCó (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B hoạt động)128KCó (MIT)$0.55

Qwen3-235B thể hiện mức chất lượng tương đương với GPT-5.5 và Claude Sonnet 4.6 trên hầu hết các điểm chuẩn, trong khi là một mô hình MoE với trọng số mở, nó rẻ hơn nhiều lần so với các lựa chọn thay thế độc quyền: Kiến trúc MoE chỉ kích hoạt một phần tham số cho mỗi yêu cầu và giảm đáng kể chi phí tính toán. Mạng Gonka hiện đang áp dụng cùng nguyên tắc inference phi tập trung giá rẻ này cho các mô hình hiện tại của mình — Kimi K2.6MiniMax M2.7, khả dụng qua JoinGonka Gateway với mức giá $0.0047 cho 1M token (rẻ hơn hàng trăm đến hàng nghìn lần so với GPT-5.5 và Claude).

Trên các điểm chuẩn MMLU-Pro, HumanEval, MATH-500 và GSM8K, mô hình nằm trong top 3 mô hình open-source tốt nhất, chỉ đứng sau DeepSeek-R1 trong các tác vụ suy luận toán học (reasoning). Trong các tác vụ tạo mã, dịch thuật và tuân thủ hướng dẫn, Qwen3-235B ổn định vượt qua Llama 4 Maverick và tương đương với Claude Sonnet 4.6.

Cách Gonka sử dụng Qwen3-235B

Khi Qwen3-235B là mô hình chính của mạng lưới, nó hoạt động trên mạng lưới Gonka theo cách phân tán — thông qua giao thức DiLoCo, được điều chỉnh cho inference. Mô hình đầy đủ ở định dạng FP8 yêu cầu khoảng 640 GB video memory (VRAM), điều không thể chứa trên một GPU duy nhất — ngay cả H100 80GB hay H200 141GB cũng không đủ. Do đó, mô hình được chia thành các lớp (tensor parallelism + pipeline parallelism) giữa nhiều ML-node.

Trong thực tế, Qwen3-235B chạy trên một cụm gồm 8-16 GPU-node, mỗi node có tối thiểu 40 GB VRAM. Transfer Agents định tuyến yêu cầu đến cụm cần thiết, vLLM trên mỗi node xử lý phần đoạn của nó, các kết quả được tổng hợp và trả về cho người dùng. Toàn bộ quá trình chỉ mất vài trăm mili giây — người dùng không hề cảm thấy yêu cầu của mình được xử lý bởi hàng chục GPU ở nhiều nơi trên hành tinh. Mạng lưới vẫn áp dụng nguyên tắc inference phân tán tương tự ngay bây giờ — cho các mô hình đang hoạt động.

Một chi tiết kỹ thuật quan trọng: Gonka sử dụng vLLM làm engine cho serving. vLLM là một dự án nguồn mở mang lại khả năng tạo văn bản hiệu năng cao thông qua PagedAttention — thuật toán tối ưu hóa việc sử dụng VRAM khi xử lý song song nhiều yêu cầu. Điều này cho phép mạng lưới phục vụ hàng ngàn người dùng đồng thời mà không làm giảm chất lượng.

Mô hình hỗ trợ native tool calling — gọi hàm và công cụ trực tiếp từ câu trả lời của mô hình. Khả năng này đã được thêm vào Gonka qua PR #767 với ngưỡng 0.958 để xác định lệnh gọi công cụ. Trên Qwen3-235B, điều này cho phép các nhà phát triển xây dựng các tác nhân AI (AI agents) tương tác với các API bên ngoài, cơ sở dữ liệu và công cụ — tất cả thông qua một yêu cầu duy nhất. Hỗ trợ tool calling vẫn được duy trì trong các mô hình mạng hiện tại.

Mạng lưới Gonka sở hữu hơn 4 000 GPU (H100, H200, A100, RTX 4090 và các loại khác), được kết hợp thành 120+ ML-node. Đây là một trong những mạng lưới GPU phân tán lớn nhất thế giới dành cho AI inference — và nếu trước đây sức mạnh này hướng đến Qwen3-235B, thì ngày nay nó phục vụ các mô hình mạng hiện tại — Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash.

Có thể thử Qwen3-235B bây giờ không

Trả lời thẳng: qua mạng Gonka thì không còn nữa. Qwen3-235B đã bị loại bỏ khỏi mạng, vì vậy bạn không thể gọi nó bằng định danh qwen3-235b-a22b qua Gateway của chúng tôi được nữa. Vì đây là mô hình mã nguồn mở (Apache 2.0), bạn vẫn có thể tự chạy nó hoặc truy cập qua các dịch vụ lưu trữ mô hình open-weights của bên thứ ba — ví dụ như OpenRouter (ước tính $0.071/$0.100 cho 1 triệu token).

Nếu bạn cần inference phi tập trung giá rẻ, lý do chính khiến mọi người đến với Gonka — nó vẫn còn đó, chỉ là hiện đang chạy trên các mô hình đang hoạt động của mạng. Thông qua JoinGonka API Gateway, các mô hình Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash đã sẵn sàng qua API tương thích với OpenAI: bất kỳ mã nào viết cho OpenAI đều hoạt động mà không cần sửa đổi — chỉ cần thay đổi URL, API-key và tên mô hình.

Ví dụ truy vấn đến mô hình hiện tại:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Объясни MoE-архитектуру"}]
  }'

Chi phí: $0.0047 cho 1 triệu token — rẻ hơn khoảng 800 lần so với GPT-5.5 ($5.00/1M) và rẻ hơn khoảng 500 lần so với Claude Sonnet 4.6 ($3.00/1M). Khi đăng ký, bạn nhận được miễn phí 1.5M token để thử nghiệm.

Gateway tương thích với các công cụ phát triển phổ biến: Quick Start mô tả cách kết nối qua Python, Node.js và curl. Các tích hợp IDE cũng được hỗ trợ — Cursor, Continue, Cline, Aider và Claude Code — cùng các framework cho AI-agent: LangChain, n8n, LibreChat, Open WebUI.

Để bắt đầu nhanh:

  1. Đăng ký tại gate.joingonka.ai (kết nối ví hoặc tạo ví mới)
  2. Lấy API-key trong Dashboard
  3. Thay thế api.openai.com bằng gate.joingonka.ai/api trong mã của bạn
  4. Chỉ định mô hình mạng hiện tại — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 hoặc deepseek-ai/DeepSeek-V4-Flash-0731 (danh sách đầy đủ tại endpoint GET /v1/models)

Inference phi tập trung cấp doanh nghiệp với mức giá dự án sở thích vẫn tồn tại — Qwen3-235B chỉ nhường chỗ cho các mô hình mới hơn của mạng. Sự kết hợp giữa giá cả và chất lượng tương tự hiện đang hoạt động trên Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash.

Qwen3-235B-A22B là một mô hình MoE với 235 tỷ tham số (22 tỷ tham số hoạt động) từ Alibaba Cloud, ban đầu là mô hình chính của mạng lưới Gonka dành cho AI inference phi tập trung. Nhờ kiến trúc MoE, nó mang lại chất lượng ngang hàng với các mô hình độc quyền hàng đầu với chi phí tính toán thấp hơn đáng kể. Hiện tại, Qwen3-235B đã được rút khỏi mạng lưới: các mô hình hiện tại của Gonka là Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash, có sẵn thông qua JoinGonka Gateway qua API tương thích với OpenAI với giá $0.0047/1M token. Bản thân Qwen3-235B vẫn là mã nguồn mở (Apache 2.0) và có sẵn trên các dịch vụ lưu trữ mô hình open-weights của bên thứ ba.

Muốn tìm hiểu thêm?

Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.

Thử các mô hình Gonka hiện tại →