ज्ञानकोश अनुभाग ▾
नेविगेशन
▸ यहाँ से शुरू करें भूमिका के अनुसारश्रेणियाँ
- Gonka नेटवर्क आर्किटेक्चर: Sprint, Transfer Agents, DiLoCo
- डेवलपर्स: GNK कैसे कमाएं
- सेल्फ़-होस्टिंग: चरण-दर-चरण मार्गदर्शिका
- Gonka के लिए GPU का चयन: हार्डवेयर सिफारिशें
- Qwen3-235B: वह मॉडल जिसे Gonka पहले होस्ट करता था
- Kimi K2.6: गोंका नेटवर्क का दूसरा मॉडल
- MiniMax M2.7: Gonka नेटवर्क मॉडल
- DeepSeek V4 Flash: 380K संदर्भ वाला Gonka नेटवर्क मॉडल
प्रौद्योगिकी
Qwen3-235B: वह मॉडल जिसे Gonka पहले होस्ट करता था
Qwen3-235B क्या है
Qwen3-235B-A22B-Instruct-2507-FP8 Qwen3 परिवार का एक बड़ा भाषा मॉडल (LLM) है, जिसे अलीबाबा क्लाउड में Qwen टीम द्वारा विकसित किया गया है। पूरा नाम इस प्रकार विस्तृत है: Qwen3 — तीसरी पीढ़ी की श्रृंखला, 235B — कुल 235 बिलियन पैरामीटर, A22B — प्रत्येक अनुरोध पर 22 बिलियन सक्रिय पैरामीटर, Instruct — निर्देशों का पालन करने के लिए प्रशिक्षित संस्करण, 2507 — जुलाई 2025 का रिलीज, FP8 — मेमोरी ऑप्टिमाइजेशन के लिए 8-बिट क्वांटाइजेशन।
कुंजी वास्तुशिल्प विशेषता — MoE (मिक्सचर ऑफ एक्सपर्ट्स) है। 'घने' मॉडलों (GPT-5.5, Claude Sonnet 4.6) के विपरीत, जहां प्रत्येक टोकन सभी मापदंडों से गुजरता है, MoE-मॉडल प्रत्येक अनुरोध के लिए केवल 'विशेषज्ञों' के एक उपसमुच्चय को सक्रिय करता है — न्यूरल नेटवर्क के विशेष ब्लॉक। Qwen3-235B के मामले में, 235 बिलियन मापदंडों में से, प्रत्येक टोकन के लिए केवल 22 बिलियन सक्रिय होते हैं — 10% से भी कम। यह 200B+ मापदंडों वाले मॉडल के स्तर की गुणवत्ता प्रदान करता है, जबकि 22B वाले मॉडल के कम्प्यूटेशनल खर्चों पर।
व्यावहारिक रूप से इसका मतलब है: मॉडल अपनी गति से उम्मीद से अधिक स्मार्ट है। यह तुलनीय गुणवत्ता वाले घने मॉडलों की तुलना में अनुरोधों को काफी तेजी से संसाधित करता है, जबकि अनुमान के लिए कहीं कम VRAM की आवश्यकता होती है। यही कारण है कि MoE 2025-2026 के सबसे बड़े मॉडलों के लिए प्रमुख वास्तुकला बन गया है।
Qwen3-235B की संदर्भ विंडो 131,072 टोकन (~100,000 शब्द) है — यह पूरे किताबों, कोड बेस या लंबे कानूनी दस्तावेजों को एक ही अनुरोध में विश्लेषण करने के लिए पर्याप्त है। मॉडल 119 भाषाओं का समर्थन करता है, जिसमें रूसी, अंग्रेजी, चीनी, अरबी, हिंदी और दर्जनों अन्य शामिल हैं — जो इसे बाजार में सबसे बहुभाषी मॉडलों में से एक बनाता है।
विशेषताएं और बेंचमार्क
Qwen3-235B सबसे बड़े क्लोज्ड और ओपन मॉडल के साथ प्रतिस्पर्धा करता है। यहाँ मुख्य विशेषताओं की तुलना दी गई है:
| मॉडल | पैरामीटर्स | कॉन्टेक्स्ट | MoE | Open Source | कीमत (1M टोकन के लिए) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B सक्रिय) | 131K | हाँ | हाँ (Apache 2.0) | $0.07+ (होस्टिंग) |
| GPT-5.5 (OpenAI) | ~1.8T (अनुमान) | 128K | हाँ (माना गया) | नहीं | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | खुलासा नहीं हुआ | 200K | नहीं (माना गया) | नहीं | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B सक्रिय) | 1M | हाँ | हाँ (Llama License) | $0.20+ (होस्टिंग) |
| DeepSeek-R1 (DeepSeek) | 671B (37B सक्रिय) | 128K | हाँ | हाँ (MIT) | $0.55 |
Qwen3-235B अधिकांश बेंचमार्क पर GPT-5.5 और Claude Sonnet 4.6 के बराबर गुणवत्ता का स्तर प्रदर्शित करता है, और एक open-weights MoE-मॉडल होने के नाते यह प्रोप्रायटरी विकल्पों की तुलना में बहुत सस्ता है: MoE-आर्किटेक्चर अनुरोध पर केवल कुछ पैरामीटर्स को सक्रिय करता है और कंप्यूटिंग लागत को काफी कम कर देता है। Gonka नेटवर्क आज अपने वर्तमान मॉडलों — Kimi K2.6 और MiniMax M2.7 के लिए इसी सस्ते डिसेंट्रलाइज्ड inference सिद्धांत को लागू करता है, जो JoinGonka Gateway के माध्यम से $0.0047 प्रति 1M टोकन पर उपलब्ध हैं (GPT-5.5 और Claude से सैकड़ों-हजारों गुना सस्ते)।
MMLU-Pro, HumanEval, MATH-500 और GSM8K बेंचमार्क पर, यह मॉडल शीर्ष तीन open-source मॉडलों में शामिल है, गणितीय तर्क (reasoning) के कार्यों में केवल DeepSeek-R1 से पीछे है। कोड जनरेशन, अनुवाद और निर्देश पालन के कार्यों में, Qwen3-235B लगातार Llama 4 Maverick से आगे है और Claude Sonnet 4.6 के बराबर है।
Gonka ने Qwen3-235B का उपयोग कैसे किया
जब Qwen3-235B नेटवर्क का मुख्य मॉडल था, तो यह Gonka नेटवर्क में वितरित रूप से काम करता था — DiLoCo प्रोटोकॉल के माध्यम से, जिसे inference के लिए अनुकूलित किया गया था। FP8 फॉर्मेट में पूर्ण मॉडल को लगभग 640 GB वीडियो मेमोरी (VRAM) की आवश्यकता होती है, जिसे एक GPU पर फिट करना असंभव है — यहाँ तक कि H100 80GB या H200 141GB भी पर्याप्त नहीं हैं। इसलिए मॉडल को कई ML-नोड्स के बीच लेयर्स (tensor parallelism + pipeline parallelism) द्वारा विभाजित किया गया था।
व्यवहार में, Qwen3-235B 8-16 GPU-नोड्स के क्लस्टर पर काम करता था, जिनमें से प्रत्येक में कम से कम 40 GB VRAM थी। Transfer Agents अनुरोध को सही क्लस्टर पर रूट करते थे, प्रत्येक नोड पर vLLM मॉडल के अपने हिस्से को प्रोसेस करता था, परिणामों को एग्रीगेट किया जाता था और यूजर को वापस भेज दिया जाता था। पूरी प्रक्रिया में सैकड़ों मिलीसेकंड लगते थे — यूजर को महसूस नहीं होता था कि उसका अनुरोध दुनिया भर के दर्जनों GPU द्वारा प्रोसेस किया जा रहा है। नेटवर्क अभी भी वितरित inference के उसी सिद्धांत को लागू करता है — अब वर्तमान मॉडलों के लिए।
महत्वपूर्ण तकनीकी विवरण: Gonka serving इंजन के रूप में vLLM का उपयोग करता है। vLLM एक open-source प्रोजेक्ट है जो PagedAttention के माध्यम से उच्च प्रदर्शन वाला टेक्स्ट जनरेशन सुनिश्चित करता है — यह एक एल्गोरिदम है जो कई अनुरोधों को समानांतर में प्रोसेस करते समय वीडियो मेमोरी के उपयोग को अनुकूलित करता है। यह नेटवर्क को गुणवत्ता में गिरावट के बिना हजारों एक साथ आने वाले यूजर को सर्व करने की अनुमति देता है।
मॉडल नेटिव tool calling को सपोर्ट करता है — मॉडल के उत्तर से सीधे कार्यों और उपकरणों को कॉल करना। यह क्षमता PR #767 के माध्यम से Gonka में जोड़ी गई थी, जिसमें टूल कॉल निर्धारित करने के लिए 0.958 की सीमा थी। Qwen3-235B पर, इसने डेवलपर्स को AI एजेंट बनाने की अनुमति दी जो बाहरी API, डेटाबेस और उपकरणों के साथ इंटरैक्ट करते थे — सब कुछ एक ही अनुरोध के माध्यम से। Tool calling के लिए सपोर्ट नेटवर्क के मौजूदा मॉडलों में भी बना हुआ है।
Gonka नेटवर्क में 4 000 से अधिक GPU (H100, H200, A100, RTX 4090 और अन्य) हैं, जो 120+ ML-नोड्स में संयुक्त हैं। यह AI inference के लिए दुनिया के सबसे बड़े वितरित GPU नेटवर्कों में से एक है — और यदि पहले यह शक्ति Qwen3-235B पर केंद्रित थी, तो आज यह नेटवर्क के वर्तमान मॉडलों को सर्व करती है — Kimi K2.6, MiniMax M2.7 और DeepSeek V4 Flash।
क्या अभी Qwen3-235B को आजमाया जा सकता है
सीधा जवाब: Gonka नेटवर्क के माध्यम से — अब और नहीं। Qwen3-235B को नेटवर्क से हटा दिया गया है, इसलिए इसे अब हमारे Gateway के जरिए qwen3-235b-a22b आइडेंटिफायर का उपयोग करके कॉल नहीं किया जा सकता है। चूंकि यह मॉडल ओपन (Apache 2.0) है, इसलिए आप इसे अभी भी स्वयं चला सकते हैं या थर्ड-पार्टी open-weights मॉडल होस्टिंग का उपयोग कर सकते हैं — उदाहरण के लिए, OpenRouter के माध्यम से (अनुमानित $0.071/$0.100 प्रति 1M टोकन)।
यदि आपको वही सस्ता डिसेंट्रलाइज्ड inference चाहिए, जिसके लिए लोग Gonka पर आते हैं — तो वह कहीं नहीं गया है, वह बस अब नेटवर्क के सक्रिय मॉडलों पर काम कर रहा है। JoinGonka API Gateway के माध्यम से Kimi K2.6, MiniMax M2.7 और DeepSeek V4 Flash OpenAI-संगत API के जरिए उपलब्ध हैं: OpenAI के लिए लिखा गया कोई भी कोड बिना किसी बदलाव के काम करता है — बस URL, API-key और मॉडल का नाम बदलें।
सक्रिय मॉडल के लिए अनुरोध का उदाहरण:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoE-आर्किटेक्चर समझाएं"}]
}'लागत: $0.0047 प्रति 1 मिलियन टोकन — यह GPT-5.5 ($5.00/1M) से ~800 गुना सस्ता और Claude Sonnet 4.6 ($3.00/1M) से ~500 गुना सस्ता है। पंजीकरण पर आपको टेस्टिंग के लिए मुफ्त 1.5M टोकन मिलते हैं।
Gateway लोकप्रिय डेवलपमेंट टूल्स के साथ संगत है: Quick Start में Python, Node.js और curl के माध्यम से कनेक्शन का वर्णन किया गया है। इसके अलावा, IDE-इंटीग्रेशन — Cursor, Continue, Cline, Aider और Claude Code — और AI-एजेंट फ्रेमवर्क: LangChain, n8n, LibreChat, Open WebUI भी समर्थित हैं।
त्वरित शुरुआत के लिए:
- gate.joingonka.ai पर रजिस्टर करें (अपना वॉलेट कनेक्ट करें या नया बनाएं)
- Dashboard से API-key प्राप्त करें
- अपने कोड में
api.openai.comकोgate.joingonka.ai/apiसे बदलें - वर्तमान नेटवर्क मॉडल निर्दिष्ट करें —
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7याdeepseek-ai/DeepSeek-V4-Flash-0731(पूरी सूचीGET /v1/modelsएंडपॉइंट पर उपलब्ध है)
एंटरप्राइज-लेवल का डिसेंट्रलाइज्ड inference, हॉबी-प्रोजेक्ट की कीमत पर, कहीं नहीं गया है — Qwen3-235B ने केवल नेटवर्क के नए मॉडलों के लिए जगह बनाई है। कीमत और गुणवत्ता का वही संयोजन अब Kimi K2.6, MiniMax M2.7 और DeepSeek V4 Flash पर काम करता है।
अधिक जानना चाहते हैं?
अन्य अनुभागों का अन्वेषण करें या अभी GNK कमाना शुरू करें।
Gonka के वर्तमान मॉडल आज़माएँ →