Các phần cơ sở kiến thức ▾

Công nghệ

Qwen3-235B: mô hình mà Gonka đã từng phục vụ

Mạng lưới Gonka không chỉ cho thuê GPU — nó phục vụ các mô hình AI để inference. Trong một thời gian dài, mô hình chính và duy nhất của mạng lưới là Qwen3-235B-A22B-Instruct, được phát triển bởi Alibaba Cloud. Theo thời gian, mạng lưới đã chuyển sang kiến trúc đa mô hình (multi-model), và Qwen3-235B đã được gỡ bỏ khỏi mạng: hiện tại Gonka đang phục vụ Kimi K2.6 từ Moonshot AI và MiniMax M2.7. Hãy xem xét Qwen3-235B là gì, vai trò của nó trong mạng lưới Gonka và những gì đã thay thế nó — với tư cách là một mô hình MoE mã nguồn mở đáng chú ý, nó vẫn là một cột mốc tham chiếu hữu ích.

Qwen3-235B là gì

Qwen3-235B-A22B-Instruct-2507-FP8 là một mô hình ngôn ngữ lớn (LLM) thuộc gia đình Qwen3, được phát triển bởi đội ngũ Qwen tại Alibaba Cloud. Tên đầy đủ được giải thích như sau: Qwen3 — thế hệ thứ ba của dòng, 235B — tổng cộng 235 tỷ tham số, A22B — 22 tỷ tham số hoạt động trên mỗi yêu cầu, Instruct — phiên bản được đào tạo để tuân theo hướng dẫn, 2507 — phiên bản phát hành tháng 7 năm 2025, FP8 — lượng tử hóa 8 bit để tối ưu hóa bộ nhớ.

Đặc điểm kiến trúc chính là MoE (Mixture of Experts). Không giống như các mô hình "dense" (GPT-5.5, Claude Sonnet 4.6), nơi mỗi token đi qua tất cả các tham số, mô hình MoE chỉ kích hoạt một tập hợp con các "chuyên gia" — các khối mạng thần kinh chuyên biệt — cho mỗi yêu cầu. Trong trường hợp của Qwen3-235B, từ 235 tỷ tham số, chỉ 22 tỷ được kích hoạt cho mỗi token — chưa đến 10%. Điều này mang lại chất lượng tương đương với các mô hình có hơn 200 tỷ tham số với chi phí tính toán của một mô hình 22 tỷ tham số.

Trong thực tế, điều này có nghĩa là: mô hình thông minh hơn những gì người ta mong đợi từ tốc độ của nó. Nó xử lý các yêu cầu nhanh hơn đáng kể so với các mô hình dense có chất lượng tương đương, đồng thời yêu cầu VRAM ít hơn nhiều cho inference. Đó là lý do tại sao MoE đã trở thành kiến trúc thống trị cho các mô hình lớn nhất từ năm 2025—2026.

Cửa sổ ngữ cảnh của Qwen3-235B là 131.072 token (~100.000 từ) — đủ để phân tích toàn bộ sách, cơ sở mã hoặc tài liệu pháp lý dài chỉ trong một yêu cầu. Mô hình hỗ trợ 119 ngôn ngữ, bao gồm tiếng Nga, tiếng Anh, tiếng Trung, tiếng Ả Rập, tiếng Hindi và hàng chục ngôn ngữ khác — làm cho nó trở thành một trong những mô hình đa ngôn ngữ nhất trên thị trường.

Đặc điểm và điểm chuẩn

Qwen3-235B cạnh tranh với các mô hình đóng và mở lớn nhất. Dưới đây là bảng so sánh các đặc điểm chính:

Mô hìnhTham sốContextMoEOpen SourceGiá (mỗi 1M token)
Qwen3-235B (Alibaba)235B (22B active)131KCó (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (ước tính)128KCó (giả định)Không$5.00
Claude Sonnet 4.6 (Anthropic)Chưa tiết lộ200KKhông (giả định)Không$3.00
Llama 4 Maverick (Meta)400B (17B active)1MCó (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B active)128KCó (MIT)$0.55

Qwen3-235B thể hiện mức chất lượng tương đương với GPT-5.5 và Claude Sonnet 4.6 trên hầu hết các benchmark, trong khi là một mô hình MoE open-weights, nó có chi phí rẻ hơn nhiều so với các đối thủ độc quyền: kiến trúc MoE chỉ kích hoạt một phần tham số cho mỗi truy vấn và giảm đáng kể chi phí tính toán. Gonka áp dụng cùng nguyên tắc inference phi tập trung giá rẻ này vào các mô hình đang hoạt động của mạng lưới σήμερα — Kimi K2.6MiniMax M2.7, khả dụng thông qua JoinGonka Gateway với mức giá $0.003 cho 1M token (rẻ hơn hàng ngàn lần so với GPT-5.5 và Claude).

Trên các benchmark MMLU-Pro, HumanEval, MATH-500 và GSM8K, mô hình này đứng trong top 3 các mô hình open-source tốt nhất, chỉ xếp sau DeepSeek-R1 trong các tác vụ suy luận (reasoning) toán học. Trong các tác vụ tạo mã, dịch thuật và tuân theo hướng dẫn, Qwen3-235B thường xuyên vượt qua Llama 4 Maverick và tương đương với Claude Sonnet 4.6.

Cách Gonka sử dụng Qwen3-235B

Khi Qwen3-235B là mô hình chính của mạng lưới, nó vận hành trong mạng lưới Gonka theo cách phân tán — thông qua giao thức DiLoCo, được tinh chỉnh cho việc inferencing. Mô hình đầy đủ ở định dạng FP8 yêu cầu khoảng 640 GB bộ nhớ video (VRAM), điều không thể chứa trên một GPU duy nhất — ngay cả H100 80GB hay H200 141GB cũng không đủ. Do đó, mô hình được chia theo các lớp (tensor parallelism + pipeline parallelism) giữa nhiều ML-node.

Trên thực tế, Qwen3-235B đã vận hành trên một cụm gồm 8-16 GPU-node, mỗi node có tối thiểu 40 GB VRAM. Các Transfer Agents định tuyến các yêu cầu đến cụm cần thiết, vLLM trên mỗi node sẽ xử lý phần mô hình của nó, các kết quả được tổng hợp lại và trả về cho người dùng. Toàn bộ quá trình chỉ mất vài trăm mili giây — người dùng hoàn toàn không cảm nhận được rằng yêu cầu của mình được xử lý bởi hàng chục GPU ở khắp nơi trên thế giới. Nguyên tắc inference phân tán này vẫn được mạng lưới áp dụng cho đến ngày nay — đối với các mô hình hiện tại.

Một chi tiết kỹ thuật quan trọng: Gonka sử dụng vLLM làm công cụ serving. vLLM là một dự án mã nguồn mở cung cấp khả năng tạo văn bản hiệu năng cao thông qua PagedAttention — một thuật toán tối ưu hóa việc sử dụng VRAM khi xử lý song song nhiều yêu cầu. Điều này cho phép mạng lưới phục vụ hàng ngàn người dùng đồng thời mà không làm giảm chất lượng.

Mô hình hỗ trợ tool calling gốc — gọi các chức năng và công cụ trực tiếp từ phản hồi của mô hình. Tính năng này đã được thêm vào Gonka thông qua PR #767 với ngưỡng 0.958 để xác định các lệnh gọi công cụ. Trên Qwen3-235B, điều này cho phép các nhà phát triển xây dựng các tác nhân AI tương tác với API bên ngoài, cơ sở dữ liệu và các công cụ — tất cả thông qua một yêu cầu duy nhất. Hỗ trợ tool calling vẫn được duy trì trong các mô hình hiện tại của mạng lưới.

Mạng lưới Gonka sở hữu hơn 4 000 GPU (H100, H200, A100, RTX 4090 và các loại khác), kết hợp thành hơn 120 ML-node. Đây là một trong những mạng lưới GPU phân tán lớn nhất thế giới dành cho AI inference — và nếu trước đây nguồn lực này tập trung vào Qwen3-235B, thì ngày nay nó phục vụ các mô hình hiện hành của mạng lưới là Kimi K2.6MiniMax M2.7.

Có thể thử Qwen3-235B bây giờ không

Câu trả lời trực tiếp: thông qua mạng lưới Gonka — hiện tại thì không. Qwen3-235B đã được gỡ khỏi mạng lưới, do đó bạn không thể gọi nó qua định danh qwen3-235b-a22b thông qua Gateway của chúng tôi nữa. Vì mô hình này là nguồn mở (Apache 2.0), bạn vẫn có thể tự triển khai hoặc truy cập nó qua các bên cung cấp hosting open-weights — ví dụ như qua OpenRouter (dự kiến $0.071/$0.100 cho 1M token).

Nếu bạn cần inference phi tập trung giá rẻ mà Gonka cung cấp, nó vẫn ở đó, chỉ là hiện đang hoạt động trên các mô hình khác của mạng lưới. Thông qua JoinGonka API Gateway, bạn có thể truy cập Kimi K2.6MiniMax M2.7 bằng OpenAI-compatible API: mọi mã viết cho OpenAI sẽ hoạt động mà không cần sửa đổi — chỉ cần thay thế URL, API key và tên mô hình.

Ví dụ truy vấn đến mô hình đang hoạt động:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Giải thích kiến trúc MoE"}]
  }'

Chi phí: $0.003 cho 1 triệu token — rẻ hơn 1.700 lần so với GPT-5.5 ($5.00/1M) và rẻ hơn 1.000 lần so với Claude Sonnet 4.6 ($3.00/1M). Khi đăng ký, bạn nhận được 10 triệu token miễn phí để kiểm thử.

Gateway tương thích với các công cụ phát triển phổ biến: Quick Start hướng dẫn kết nối qua Python, Node.js và curl. Các tích hợp IDE cũng được hỗ trợ — Cursor, Continue, Cline, Aider và Claude Code — và các framework cho AI agent: LangChain, n8n, LibreChat, Open WebUI.

Để bắt đầu nhanh:

  1. Đăng ký tại gate.joingonka.ai (kết nối ví hoặc tạo mới)
  2. Nhận API key trong Dashboard
  3. Thay thế api.openai.com bằng gate.joingonka.ai/api trong code của bạn
  4. Chỉ định mô hình mạng lưới hiện tại — moonshotai/Kimi-K2.6 hoặc MiniMaxAI/MiniMax-M2.7 (danh sách đầy đủ tại endpoint GET /v1/models)

Inference phi tập trung cấp doanh nghiệp với chi phí dự án hobby vẫn luôn ở đó — Qwen3-235B chỉ nhường chỗ cho các mô hình mới hơn của mạng lưới. Sự kết hợp giữa giá cả và chất lượng tương tự hiện đang hoạt động trên Kimi K2.6MiniMax M2.7.

Qwen3-235B-A22B là mô hình MoE với 235 tỷ tham số (22 tỷ tham số hoạt động) từ Alibaba Cloud, ban đầu là mô hình chính của mạng Gonka cho AI inference phi tập trung. Nhờ kiến trúc MoE, nó mang lại chất lượng ngang hàng với các mô hình độc quyền hàng đầu với chi phí tính toán thấp hơn đáng kể. Hiện tại, Qwen3-235B đã được rút khỏi mạng: các mô hình hiện tại của Gonka là Kimi K2.6 và MiniMax M2.7, có sẵn thông qua JoinGonka Gateway với OpenAI-compatible API với giá $0.003/1M token. Bản thân Qwen3-235B vẫn là mã nguồn mở (Apache 2.0) và có sẵn trên các dịch vụ lưu trữ mô hình open-weights bên thứ ba.

Muốn tìm hiểu thêm?

Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.

Thử các mô hình Gonka hiện tại →