Các phần cơ sở kiến thức ▾
Điều hướng
▸ Bắt đầu tại đây Theo vai tròDanh mục
- Kiến trúc mạng Gonka: Sprint, Transfer Agents, DiLoCo
- Nhà phát triển: Cách kiếm GNK
- Tự lưu trữ: Hướng dẫn từng bước
- Chọn GPU cho Gonka: khuyến nghị về phần cứng
- Qwen3-235B: mô hình mà Gonka đã từng phục vụ
- Kimi K2.6: Mô hình thứ hai của mạng Gonka
- MiniMax M2.7: Mô hình của mạng Gonka
- DeepSeek V4 Flash: mô hình mạng lưới Gonka với bối cảnh 380K
Công nghệ
Qwen3-235B: mô hình mà Gonka đã từng phục vụ
Qwen3-235B là gì
Qwen3-235B-A22B-Instruct-2507-FP8 là một mô hình ngôn ngữ lớn (LLM) thuộc gia đình Qwen3, được phát triển bởi đội ngũ Qwen tại Alibaba Cloud. Tên đầy đủ được giải thích như sau: Qwen3 — thế hệ thứ ba của dòng, 235B — tổng cộng 235 tỷ tham số, A22B — 22 tỷ tham số hoạt động trên mỗi yêu cầu, Instruct — phiên bản được đào tạo để tuân theo hướng dẫn, 2507 — phiên bản phát hành tháng 7 năm 2025, FP8 — lượng tử hóa 8 bit để tối ưu hóa bộ nhớ.
Đặc điểm kiến trúc chính là MoE (Mixture of Experts). Không giống như các mô hình "dense" (GPT-5.5, Claude Sonnet 4.6), nơi mỗi token đi qua tất cả các tham số, mô hình MoE chỉ kích hoạt một tập hợp con các "chuyên gia" — các khối mạng thần kinh chuyên biệt — cho mỗi yêu cầu. Trong trường hợp của Qwen3-235B, từ 235 tỷ tham số, chỉ 22 tỷ được kích hoạt cho mỗi token — chưa đến 10%. Điều này mang lại chất lượng tương đương với các mô hình có hơn 200 tỷ tham số với chi phí tính toán của một mô hình 22 tỷ tham số.
Trong thực tế, điều này có nghĩa là: mô hình thông minh hơn những gì người ta mong đợi từ tốc độ của nó. Nó xử lý các yêu cầu nhanh hơn đáng kể so với các mô hình dense có chất lượng tương đương, đồng thời yêu cầu VRAM ít hơn nhiều cho inference. Đó là lý do tại sao MoE đã trở thành kiến trúc thống trị cho các mô hình lớn nhất từ năm 2025—2026.
Cửa sổ ngữ cảnh của Qwen3-235B là 131.072 token (~100.000 từ) — đủ để phân tích toàn bộ sách, cơ sở mã hoặc tài liệu pháp lý dài chỉ trong một yêu cầu. Mô hình hỗ trợ 119 ngôn ngữ, bao gồm tiếng Nga, tiếng Anh, tiếng Trung, tiếng Ả Rập, tiếng Hindi và hàng chục ngôn ngữ khác — làm cho nó trở thành một trong những mô hình đa ngôn ngữ nhất trên thị trường.
Đặc điểm và điểm chuẩn
Qwen3-235B cạnh tranh với các mô hình đóng và mở lớn nhất. Dưới đây là so sánh các đặc điểm chính:
| Mô hình | Tham số | Ngữ cảnh | MoE | Open Source | Giá (cho 1M token) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B hoạt động) | 131K | Có | Có (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (ước tính) | 128K | Có (giả định) | Không | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Chưa tiết lộ | 200K | Không (giả định) | Không | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B hoạt động) | 1M | Có | Có (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B hoạt động) | 128K | Có | Có (MIT) | $0.55 |
Qwen3-235B thể hiện mức chất lượng tương đương với GPT-5.5 và Claude Sonnet 4.6 trên hầu hết các điểm chuẩn, trong khi là một mô hình MoE với trọng số mở, nó rẻ hơn nhiều lần so với các lựa chọn thay thế độc quyền: Kiến trúc MoE chỉ kích hoạt một phần tham số cho mỗi yêu cầu và giảm đáng kể chi phí tính toán. Mạng Gonka hiện đang áp dụng cùng nguyên tắc inference phi tập trung giá rẻ này cho các mô hình hiện tại của mình — Kimi K2.6 và MiniMax M2.7, khả dụng qua JoinGonka Gateway với mức giá $0.0047 cho 1M token (rẻ hơn hàng trăm đến hàng nghìn lần so với GPT-5.5 và Claude).
Trên các điểm chuẩn MMLU-Pro, HumanEval, MATH-500 và GSM8K, mô hình nằm trong top 3 mô hình open-source tốt nhất, chỉ đứng sau DeepSeek-R1 trong các tác vụ suy luận toán học (reasoning). Trong các tác vụ tạo mã, dịch thuật và tuân thủ hướng dẫn, Qwen3-235B ổn định vượt qua Llama 4 Maverick và tương đương với Claude Sonnet 4.6.
Cách Gonka sử dụng Qwen3-235B
Khi Qwen3-235B là mô hình chính của mạng lưới, nó hoạt động trên mạng lưới Gonka theo cách phân tán — thông qua giao thức DiLoCo, được điều chỉnh cho inference. Mô hình đầy đủ ở định dạng FP8 yêu cầu khoảng 640 GB video memory (VRAM), điều không thể chứa trên một GPU duy nhất — ngay cả H100 80GB hay H200 141GB cũng không đủ. Do đó, mô hình được chia thành các lớp (tensor parallelism + pipeline parallelism) giữa nhiều ML-node.
Trong thực tế, Qwen3-235B chạy trên một cụm gồm 8-16 GPU-node, mỗi node có tối thiểu 40 GB VRAM. Transfer Agents định tuyến yêu cầu đến cụm cần thiết, vLLM trên mỗi node xử lý phần đoạn của nó, các kết quả được tổng hợp và trả về cho người dùng. Toàn bộ quá trình chỉ mất vài trăm mili giây — người dùng không hề cảm thấy yêu cầu của mình được xử lý bởi hàng chục GPU ở nhiều nơi trên hành tinh. Mạng lưới vẫn áp dụng nguyên tắc inference phân tán tương tự ngay bây giờ — cho các mô hình đang hoạt động.
Một chi tiết kỹ thuật quan trọng: Gonka sử dụng vLLM làm engine cho serving. vLLM là một dự án nguồn mở mang lại khả năng tạo văn bản hiệu năng cao thông qua PagedAttention — thuật toán tối ưu hóa việc sử dụng VRAM khi xử lý song song nhiều yêu cầu. Điều này cho phép mạng lưới phục vụ hàng ngàn người dùng đồng thời mà không làm giảm chất lượng.
Mô hình hỗ trợ native tool calling — gọi hàm và công cụ trực tiếp từ câu trả lời của mô hình. Khả năng này đã được thêm vào Gonka qua PR #767 với ngưỡng 0.958 để xác định lệnh gọi công cụ. Trên Qwen3-235B, điều này cho phép các nhà phát triển xây dựng các tác nhân AI (AI agents) tương tác với các API bên ngoài, cơ sở dữ liệu và công cụ — tất cả thông qua một yêu cầu duy nhất. Hỗ trợ tool calling vẫn được duy trì trong các mô hình mạng hiện tại.
Mạng lưới Gonka sở hữu hơn 4 000 GPU (H100, H200, A100, RTX 4090 và các loại khác), được kết hợp thành 120+ ML-node. Đây là một trong những mạng lưới GPU phân tán lớn nhất thế giới dành cho AI inference — và nếu trước đây sức mạnh này hướng đến Qwen3-235B, thì ngày nay nó phục vụ các mô hình mạng hiện tại — Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash.
Có thể thử Qwen3-235B bây giờ không
Trả lời thẳng: qua mạng Gonka thì không còn nữa. Qwen3-235B đã bị loại bỏ khỏi mạng, vì vậy bạn không thể gọi nó bằng định danh qwen3-235b-a22b qua Gateway của chúng tôi được nữa. Vì đây là mô hình mã nguồn mở (Apache 2.0), bạn vẫn có thể tự chạy nó hoặc truy cập qua các dịch vụ lưu trữ mô hình open-weights của bên thứ ba — ví dụ như OpenRouter (ước tính $0.071/$0.100 cho 1 triệu token).
Nếu bạn cần inference phi tập trung giá rẻ, lý do chính khiến mọi người đến với Gonka — nó vẫn còn đó, chỉ là hiện đang chạy trên các mô hình đang hoạt động của mạng. Thông qua JoinGonka API Gateway, các mô hình Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash đã sẵn sàng qua API tương thích với OpenAI: bất kỳ mã nào viết cho OpenAI đều hoạt động mà không cần sửa đổi — chỉ cần thay đổi URL, API-key và tên mô hình.
Ví dụ truy vấn đến mô hình hiện tại:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Объясни MoE-архитектуру"}]
}'Chi phí: $0.0047 cho 1 triệu token — rẻ hơn khoảng 800 lần so với GPT-5.5 ($5.00/1M) và rẻ hơn khoảng 500 lần so với Claude Sonnet 4.6 ($3.00/1M). Khi đăng ký, bạn nhận được miễn phí 1.5M token để thử nghiệm.
Gateway tương thích với các công cụ phát triển phổ biến: Quick Start mô tả cách kết nối qua Python, Node.js và curl. Các tích hợp IDE cũng được hỗ trợ — Cursor, Continue, Cline, Aider và Claude Code — cùng các framework cho AI-agent: LangChain, n8n, LibreChat, Open WebUI.
Để bắt đầu nhanh:
- Đăng ký tại gate.joingonka.ai (kết nối ví hoặc tạo ví mới)
- Lấy API-key trong Dashboard
- Thay thế
api.openai.combằnggate.joingonka.ai/apitrong mã của bạn - Chỉ định mô hình mạng hiện tại —
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7hoặcdeepseek-ai/DeepSeek-V4-Flash-0731(danh sách đầy đủ tại endpointGET /v1/models)
Inference phi tập trung cấp doanh nghiệp với mức giá dự án sở thích vẫn tồn tại — Qwen3-235B chỉ nhường chỗ cho các mô hình mới hơn của mạng. Sự kết hợp giữa giá cả và chất lượng tương tự hiện đang hoạt động trên Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash.
Muốn tìm hiểu thêm?
Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.
Thử các mô hình Gonka hiện tại →