ज्ञानकोश अनुभाग ▾
प्रौद्योगिकी
Qwen3-235B: वह मॉडल जिसे Gonka पहले होस्ट करता था
Qwen3-235B क्या है
Qwen3-235B-A22B-Instruct-2507-FP8 Qwen3 परिवार का एक बड़ा भाषा मॉडल (LLM) है, जिसे अलीबाबा क्लाउड में Qwen टीम द्वारा विकसित किया गया है। पूरा नाम इस प्रकार विस्तृत है: Qwen3 — तीसरी पीढ़ी की श्रृंखला, 235B — कुल 235 बिलियन पैरामीटर, A22B — प्रत्येक अनुरोध पर 22 बिलियन सक्रिय पैरामीटर, Instruct — निर्देशों का पालन करने के लिए प्रशिक्षित संस्करण, 2507 — जुलाई 2025 का रिलीज, FP8 — मेमोरी ऑप्टिमाइजेशन के लिए 8-बिट क्वांटाइजेशन।
कुंजी वास्तुशिल्प विशेषता — MoE (मिक्सचर ऑफ एक्सपर्ट्स) है। 'घने' मॉडलों (GPT-5.5, Claude Sonnet 4.6) के विपरीत, जहां प्रत्येक टोकन सभी मापदंडों से गुजरता है, MoE-मॉडल प्रत्येक अनुरोध के लिए केवल 'विशेषज्ञों' के एक उपसमुच्चय को सक्रिय करता है — न्यूरल नेटवर्क के विशेष ब्लॉक। Qwen3-235B के मामले में, 235 बिलियन मापदंडों में से, प्रत्येक टोकन के लिए केवल 22 बिलियन सक्रिय होते हैं — 10% से भी कम। यह 200B+ मापदंडों वाले मॉडल के स्तर की गुणवत्ता प्रदान करता है, जबकि 22B वाले मॉडल के कम्प्यूटेशनल खर्चों पर।
व्यावहारिक रूप से इसका मतलब है: मॉडल अपनी गति से उम्मीद से अधिक स्मार्ट है। यह तुलनीय गुणवत्ता वाले घने मॉडलों की तुलना में अनुरोधों को काफी तेजी से संसाधित करता है, जबकि अनुमान के लिए कहीं कम VRAM की आवश्यकता होती है। यही कारण है कि MoE 2025-2026 के सबसे बड़े मॉडलों के लिए प्रमुख वास्तुकला बन गया है।
Qwen3-235B की संदर्भ विंडो 131,072 टोकन (~100,000 शब्द) है — यह पूरे किताबों, कोड बेस या लंबे कानूनी दस्तावेजों को एक ही अनुरोध में विश्लेषण करने के लिए पर्याप्त है। मॉडल 119 भाषाओं का समर्थन करता है, जिसमें रूसी, अंग्रेजी, चीनी, अरबी, हिंदी और दर्जनों अन्य शामिल हैं — जो इसे बाजार में सबसे बहुभाषी मॉडलों में से एक बनाता है।
विशेषताएं और बेंचमार्क
Qwen3-235B सबसे बड़े क्लोज्ड और ओपन मॉडल के साथ प्रतिस्पर्धा करता है। मुख्य विशेषताओं की तुलना यहाँ देखें:
| मॉडल | पैरामीटर्स | कॉन्टेक्स्ट | MoE | Open Source | कीमत (प्रति 1M टोकन) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B सक्रिय) | 131K | हाँ | हाँ (Apache 2.0) | $0.07+ (होस्टिंग) |
| GPT-5.5 (OpenAI) | ~1.8T (अनुमानित) | 128K | हाँ (अनुमानित) | नहीं | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | खुलासा नहीं | 200K | नहीं (अनुमानित) | नहीं | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B सक्रिय) | 1M | हाँ | हाँ (Llama License) | $0.20+ (होस्टिंग) |
| DeepSeek-R1 (DeepSeek) | 671B (37B सक्रिय) | 128K | हाँ | हाँ (MIT) | $0.55 |
Qwen3-235B अधिकांश बेंचमार्क पर GPT-5.5 और Claude Sonnet 4.6 के बराबर गुणवत्ता का स्तर प्रदर्शित करता है, और एक open-weights MoE-मॉडल के रूप में, यह मालिकाना विकल्पों की तुलना में कई गुना सस्ता है: MoE-आर्किटेक्चर प्रत्येक अनुरोध पर केवल पैरामीटर्स के एक हिस्से को सक्रिय करता है और कम्प्यूटेशनल लागत को काफी कम कर देता है। Gonka नेटवर्क सस्ती विकेन्द्रीकृत inference के उसी सिद्धांत को आज अपने मौजूदा मॉडलों पर लागू करता है — Kimi K2.6 और MiniMax M2.7, जो JoinGonka Gateway के माध्यम से 1M टोकन के लिए $0.003 पर उपलब्ध हैं (GPT-5.5 और Claude से हजारों गुना सस्ता)।
MMLU-Pro, HumanEval, MATH-500 और GSM8K बेंचमार्क पर, यह मॉडल शीर्ष तीन open-source मॉडलों में से एक है, जो गणितीय तर्क (reasoning) कार्यों में केवल DeepSeek-R1 से पीछे है। कोड जनरेशन, अनुवाद और निर्देश पालन कार्यों में, Qwen3-235B लगातार Llama 4 Maverick से आगे है और Claude Sonnet 4.6 के बराबर है।
Gonka ने Qwen3-235B का उपयोग कैसे किया
जब Qwen3-235B नेटवर्क का मुख्य मॉडल था, तब यह Gonka नेटवर्क में डिस्ट्रीब्यूटेड तरीके से काम करता था — DiLoCo प्रोटोकॉल के माध्यम से, जिसे inference के लिए अनुकूलित किया गया था। FP8 फॉर्मेट में एक पूर्ण मॉडल को लगभग 640 GB वीडियो मेमोरी (VRAM) की आवश्यकता होती है, जिसे एक एकल GPU पर फिट करना असंभव है — यहाँ तक कि H100 80GB या H200 141GB भी पर्याप्त नहीं हैं। इसलिए मॉडल को कई ML-nodes के बीच लेयर द्वारा विभाजित (tensor parallelism + pipeline parallelism) किया गया था।
व्यवहार में, Qwen3-235B 8—16 GPU-नोड्स के क्लस्टर पर चलती थी, जिसमें प्रत्येक में कम से कम 40 GB VRAM होती थी। Transfer Agents अनुरोध को आवश्यक क्लस्टर पर रूट करते थे, प्रत्येक नोड पर vLLM मॉडल के अपने हिस्से को प्रोसेस करता था, और परिणामों को एग्रीगेट करके उपयोगकर्ता को वापस भेज दिया जाता था। पूरी प्रक्रिया में सैकड़ों मिलीसेकंड लगते थे — उपयोगकर्ता को यह महसूस नहीं होता था कि उनका अनुरोध दुनिया भर के दर्जनों GPU द्वारा संसाधित किया गया है। नेटवर्क अब भी डिस्ट्रीब्यूटेड inference के उसी सिद्धांत को लागू करता है — अब सक्रिय नेटवर्क मॉडल के लिए।
महत्वपूर्ण तकनीकी विवरण: Gonka सर्विंग के लिए इंजन के रूप में vLLM का उपयोग करता है। vLLM एक ओपन-सोर्स प्रोजेक्ट है जो PagedAttention के माध्यम से उच्च-प्रदर्शन टेक्स्ट जनरेशन प्रदान करता है — एक एल्गोरिदम जो कई अनुरोधों को समानांतर रूप से संसाधित करते समय VRAM उपयोग को अनुकूलित करता है। यह नेटवर्क को गुणवत्ता में गिरावट के बिना हजारों समवर्ती उपयोगकर्ताओं को सेवा देने की अनुमति देता है।
मॉडल नेटिव टूल कॉलिंग का समर्थन करता है — मॉडल के उत्तर से सीधे फ़ंक्शन और टूल को कॉल करना। यह क्षमता Gonka में PR #767 के माध्यम से जोड़ी गई थी, जिसमें टूल कॉल निर्धारित करने के लिए 0.958 की थ्रेशोल्ड थी। Qwen3-235B पर, इसने डेवलपर्स को AI-एजेंट बनाने की अनुमति दी जो बाहरी API, डेटाबेस और टूल के साथ इंटरैक्ट करते हैं — सब कुछ एक ही अनुरोध के माध्यम से। टूल कॉलिंग का समर्थन सक्रिय नेटवर्क मॉडल में भी बना हुआ है।
Gonka नेटवर्क में 120+ ML-nodes में एकीकृत 4 000 से अधिक GPU (H100, H200, A100, RTX 4090 और अन्य) हैं। यह दुनिया के सबसे बड़े डिस्ट्रीब्यूटेड GPU-नेटवर्कों में से एक है AI inference के लिए — और यदि यह शक्ति पहले Qwen3-235B के लिए निर्देशित थी, तो आज यह नेटवर्क के सक्रिय मॉडल, Kimi K2.6 और MiniMax M2.7 को सेवा प्रदान करती है।
क्या अभी Qwen3-235B को आजमाया जा सकता है
सीधा उत्तर: Gonka नेटवर्क के माध्यम से — अब नहीं। Qwen3-235B को नेटवर्क से हटा दिया गया है, इसलिए इसे हमारे Gateway के माध्यम से qwen3-235b-a22b आइडेंटिफ़ायर द्वारा कॉल नहीं किया जा सकता है। चूँकि मॉडल ओपन (Apache 2.0) है, इसे अभी भी स्वतंत्र रूप से चलाया जा सकता है या तृतीय-पक्ष open-weights मॉडल होस्टिंग के माध्यम से उपयोग किया जा सकता है — उदाहरण के लिए, OpenRouter (अनुमानित $0.071/$0.100 प्रति 1M टोकन)।
यदि आपको वह सस्ती विकेन्द्रीकृत inference चाहिए जिसके लिए लोग Gonka पर आते हैं — वह कहीं नहीं गई है, बस अब नेटवर्क के सक्रिय मॉडलों पर काम कर रही है। JoinGonka API Gateway के माध्यम से Kimi K2.6 और MiniMax M2.7 OpenAI-संगत API पर उपलब्ध हैं: OpenAI के लिए लिखा गया कोई भी कोड बिना किसी बदलाव के काम करता है — बस URL, API-की और मॉडल का नाम बदलें।
सक्रिय मॉडल के लिए अनुरोध का उदाहरण:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoE-आर्किटेक्चर समझाएं"}]
}'कीमत: 1 मिलियन टोकन के लिए $0.003 — यह GPT-5.5 ($5.00/1M) से 1,700 गुना और Claude Sonnet 4.6 ($3.00/1M) से 1,000 गुना सस्ता है। पंजीकरण पर आप परीक्षण के लिए 10 मिलियन मुफ्त टोकन प्राप्त करते हैं।
Gateway लोकप्रिय डेवलपमेंट टूल के साथ संगत है: Quick Start Python, Node.js और curl के माध्यम से कनेक्शन का वर्णन करता है। IDE-इंटीग्रेशन — Cursor, Continue, Cline, Aider और Claude Code — और AI-एजेंट फ़्रेमवर्क: LangChain, n8n, LibreChat, Open WebUI भी समर्थित हैं।
जल्दी शुरू करने के लिए:
- gate.joingonka.ai पर रजिस्टर करें (वॉलेट कनेक्ट करें या नया बनाएँ)
- Dashboard में API-की प्राप्त करें
- अपने कोड में
api.openai.comकोgate.joingonka.ai/apiसे बदलें - नेटवर्क का वर्तमान मॉडल निर्दिष्ट करें —
moonshotai/Kimi-K2.6याMiniMaxAI/MiniMax-M2.7(पूरी सूची —GET /v1/modelsएंडपॉइंट में)
हॉबी प्रोजेक्ट की कीमत पर एंटरप्राइज-स्तर की विकेन्द्रीकृत inference कहीं नहीं गई है — Qwen3-235B ने केवल नेटवर्क के नए मॉडलों के लिए जगह बनाई है। कीमत और गुणवत्ता का वही संयोजन अब Kimi K2.6 और MiniMax M2.7 पर काम करता है।
अधिक जानना चाहते हैं?
अन्य अनुभागों का अन्वेषण करें या अभी GNK कमाना शुरू करें।
Gonka के वर्तमान मॉडल आज़माएँ →