Mga Seksyon ng Base ng Kaalaman ▾
Nabigasyon
▸ Magsimula rito Ayon sa papelMga Kategorya
- Arkitektura ng Network ng Gonka: Sprint, Transfer Agents, DiLoCo
- Mga Developer: Paano Kumita ng GNK
- Self-hosting: Gabay na Hakbang-hakbang
- Pagpili ng GPU para sa Gonka: mga rekomendasyon sa hardware
- Qwen3-235B: ang modelong dati nang sinusuportahan ng Gonka
- Kimi K2.6: Ikalawang Modelo ng Gonka Network
- MiniMax M2.7: Gonka network model
Teknolohiya
Qwen3-235B: ang modelong dati nang sinusuportahan ng Gonka
Ano ang Qwen3-235B
Ang Qwen3-235B-A22B-Instruct-2507-FP8 ay isang malaking modelo ng wika (LLM) ng pamilya ng Qwen3, na binuo ng Qwen team sa Alibaba Cloud. Ang buong pangalan ay nangangahulugang: Qwen3 — ang ikatlong henerasyon ng serye, 235B — 235 bilyong parameter sa kabuuan, A22B — 22 bilyong aktibong parameter sa bawat kahilingan, Instruct — bersyon na sanay na sundin ang mga tagubilin, 2507 — paglabas ng Hulyo 2025, FP8 — 8-bit quantization para sa pag-optimize ng memorya.
Ang pangunahing arkitektural na feature — MoE (Mixture of Experts). Hindi tulad ng 'dense' na mga modelo (GPT-5.5, Claude Sonnet 4.6), kung saan ang bawat token ay dumadaan sa lahat ng mga parameter, ang MoE-modelo ay nag-aaktibo para sa bawat kahilingan lamang ng isang subset ng mga 'eksperto' — mga espesyalisadong bloke ng neural network. Sa kaso ng Qwen3-235B mula sa 235 bilyong parameter, tanging 22 bilyon lamang ang aktibo sa bawat token — mas mababa sa 10%. Nagbibigay ito ng kalidad ng antas ng mga modelo na may 200B+ parameter na may computational na gastos ng modelo na 22B.
Sa praktikal, nangangahulugan ito: mas matalino ang modelo kaysa sa inaasahan mula sa bilis nito. Pinoproseso nito ang mga kahilingan nang mas mabilis kaysa sa mga siksik na modelo ng maihahambing na kalidad, habang nangangailangan ng mas kaunting VRAM para sa inference. Ito ang dahilan kung bakit naging dominanteng arkitektura ang MoE para sa pinakamalaking modelo ng 2025–2026.
Ang context window ng Qwen3-235B ay 131,072 token (~100,000 salita) — sapat ito para sa pagsusuri ng buong libro, codebase, o mahabang legal na dokumento sa isang kahilingan. Sinusuportahan ng modelo ang 119 na wika, kabilang ang Russian, English, Chinese, Arabic, Hindi at dose-dosenang iba pa — na ginagawa itong isa sa pinakamaraming wika na modelo sa merkado.
Mga Katangian at Benchmark
Ang Qwen3-235B ay nakikipagkumpitensya sa pinakamalalaking closed at open models. Narito ang paghahambing ng mga pangunahing katangian:
| Model | Parameters | Context | MoE | Open Source | Presyo (bawat 1M tokens) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B active) | 131K | Oo | Oo (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (est.) | 128K | Oo (assumption) | Hindi | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Hindi inilabas | 200K | Hindi (assumption) | Hindi | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B active) | 1M | Oo | Oo (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B active) | 128K | Oo | Oo (MIT) | $0.55 |
Ang Qwen3-235B ay nagpapakita ng kalidad na maihahambing sa GPT-5.5 at Claude Sonnet 4.6 sa karamihan ng benchmarks, at bilang isang open-weights MoE-model, mas mura ito nang maraming beses kaysa sa mga proprietary na alternatibo: ang MoE-architecture ay nag-a-activate lamang ng bahagi ng parameters bawat request, na nagpapababa ng computational costs. Ang prinsipyo ng murang decentralized inference ay ginagamit na ngayon ng network ng Gonka sa kanilang mga kasalukuyang models — Kimi K2.6 at MiniMax M2.7, na available sa pamamagitan ng JoinGonka Gateway sa halagang $0.003 bawat 1M tokens (libo-libong beses na mas mura kaysa sa GPT-5.5 at Claude).
Sa mga benchmark gaya ng MMLU-Pro, HumanEval, MATH-500, at GSM8K, ang model ay kabilang sa top 3 open-source models, pangalawa lang sa DeepSeek-R1 sa mga mathematical reasoning task. Sa pag-generate ng code, pagsasalin, at pagsunod sa instruction, ang Qwen3-235B ay patuloy na nalalagpasan ang Llama 4 Maverick at maihahambing sa Claude Sonnet 4.6.
Paano ginamit ng Gonka ang Qwen3-235B
Noong ang Qwen3-235B ay ang pangunahing modelo ng network, gumagana ito sa Gonka network nang distributed — sa pamamagitan ng DiLoCo protocol, na inangkop para sa inference. Ang buong modelo sa format na FP8 ay nangangailangan ng humigit-kumulang 640 GB ng video memory (VRAM), na hindi maipagkakasya sa iisang GPU — kahit ang H100 80GB o H200 141GB ay hindi sapat. Kaya naman, ang modelo ay hinati-hati sa mga layer (tensor parallelism + pipeline parallelism) sa pagitan ng maraming ML-node.
Sa praktika, ang Qwen3-235B ay tumatakbo sa isang cluster na may 8—16 na GPU-node, na ang bawat isa ay may hindi bababa sa 40 GB ng VRAM. Ang mga Transfer Agent ay nagro-route ng request sa tamang cluster, ang vLLM sa bawat node ay nagpoproseso ng sarili nitong bahagi ng modelo, ang mga resulta ay pinagsasama-sama at ibinabalik sa user. Ang buong proseso ay tumatagal ng daan-daang millisecond — hindi nararamdaman ng user na ang kanyang request ay ipinroseso ng sampung GPU sa iba't ibang panig ng mundo. Ang parehong prinsipyo ng distributed inference ay ginagamit pa rin ng network ngayon — sa mga kasalukuyang modelo.
Isang mahalagang teknikal na detalye: Ang Gonka ay gumagamit ng vLLM bilang serving engine. Ang vLLM ay isang open-source project na nagbibigay ng high-performance text generation sa pamamagitan ng PagedAttention — isang algorithm na nag-o-optimize sa paggamit ng video memory habang sabay-sabay na nagpoproseso ng maraming request. Pinapayagan nito ang network na magsilbi sa libu-libong sabay-sabay na user nang hindi bumababa ang kalidad.
Sinusuportahan ng modelo ang native tool calling — ang pagtawag ng mga function at tool nang direkta mula sa sagot ng modelo. Ang kakayahang ito ay idinagdag sa Gonka sa pamamagitan ng PR #767 na may threshold na 0.958 para sa pagtukoy ng tool calls. Sa Qwen3-235B, pinapayagan nito ang mga developer na bumuo ng mga AI agent na nakikipag-ugnayan sa mga external API, database, at tool — lahat sa pamamagitan ng iisang request. Ang support para sa tool calling ay nananatili sa mga kasalukuyang modelo ng network.
Ang Gonka network ay may higit sa 4 000 GPU (H100, H200, A100, RTX 4090 at iba pa), na pinagsama sa 120+ ML-node. Ito ay isa sa pinakamalaking distributed GPU network para sa AI inference sa mundo — at kung dati ay nakatuon ang lakas na ito sa Qwen3-235B, ngayon ay nagsisilbi na ito sa mga kasalukuyang modelo ng network na Kimi K2.6 at MiniMax M2.7.
Maaari ko bang subukan ang Qwen3-235B ngayon
Direktang sagot: sa pamamagitan ng network ng Gonka — hindi na. Ang Qwen3-235B ay inalis na sa network, kaya hindi na ito maaaring tawagin gamit ang identifier na qwen3-235b-a22b sa pamamagitan ng ating Gateway. Dahil ang model ay open (Apache 2.0), maaari mo pa rin itong patakbuhin nang mag-isa o gamitin ito sa pamamagitan ng third-party open-weights model hostings — halimbawa, sa pamamagitan ng OpenRouter (tinatayang nasa $0.071/$0.100 bawat 1M tokens).
Kung kailangan mo ang murang decentralized inference na hinahanap sa Gonka, narito pa rin ito at gumagana sa mga kasalukuyang model ng network. Sa pamamagitan ng JoinGonka API Gateway, available ang Kimi K2.6 at MiniMax M2.7 sa pamamagitan ng OpenAI-compatible API: anumang code na isinulat para sa OpenAI ay gagana nang walang pagbabago — palitan lamang ang URL, API-key, at ang pangalan ng model.
Halimbawa ng request sa kasalukuyang model:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Paliwanag tungkol sa MoE-architecture"}]
}'Presyo: $0.003 bawat 1 milyong tokens — ito ay 1,700 beses na mas mura kaysa sa GPT-5.5 ($5.00/1M) at 1,000 beses na mas mura kaysa sa Claude Sonnet 4.6 ($3.00/1M). Pag-signup, makakatanggap ka ng 10 milyong libreng tokens para sa testing.
Ang Gateway ay compatible sa mga sikat na development tools: ang Quick Start ay naglalarawan ng pag-connect sa pamamagitan ng Python, Node.js, at curl. Suportado rin ang mga IDE-integration — Cursor, Continue, Cline, Aider, at Claude Code — at mga framework para sa AI-agents: LangChain, n8n, LibreChat, Open WebUI.
Para sa mabilis na simula:
- Mag-register sa gate.joingonka.ai (ikonekta ang iyong wallet o gumawa ng bago)
- Kumuha ng API-key sa Dashboard
- Palitan ang
api.openai.comnggate.joingonka.ai/apisa iyong code - Ilagay ang aktwal na model ng network —
moonshotai/Kimi-K2.6oMiniMaxAI/MiniMax-M2.7(makikita ang buong listahan sa endpoint naGET /v1/models)
Ang decentralized enterprise-level inference sa presyong pang-hobby project ay hindi nawala — ang Qwen3-235B ay pinalitan lamang ng mas bagong mga model ng network. Ang parehong balanse sa presyo at kalidad ay gumagana na ngayon sa Kimi K2.6 at MiniMax M2.7.
Gusto mo pang matuto?
Galugarin ang iba pang mga seksyon o simulang kumita ng GNK ngayon.
Subukan ang mga kasalukuyang modelo ng Gonka →