علم کے مرکز کے حصے ▾
نیویگیشن
▸ یہاں سے شروع کریں کردار کے لحاظ سےزمرہ جات
- گونکا نیٹ ورک کا فن تعمیر: اسپرنٹ، ٹرانسفر ایجنٹس، ڈیلکو
- ڈویلپرز: GNK کیسے کمائیں
- خود ہوسٹنگ: مرحلہ بہ مرحلہ گائیڈ
- Gonka کے لیے GPU کا انتخاب: ہارڈ ویئر کی سفارشات
- Qwen3-235B: وہ ماڈل جسے پہلے Gonka سرو کرتا تھا
- Kimi K2.6: گونکا نیٹ ورک کا دوسرا ماڈل
- MiniMax M2.7: Gonka نیٹ ورک ماڈل
- DeepSeek V4 Flash: 380K کانٹیکسٹ کے ساتھ Gonka نیٹ ورک ماڈل
ٹیکنالوجی
Qwen3-235B: وہ ماڈل جسے پہلے Gonka سرو کرتا تھا
Qwen3-235B کیا ہے؟
Qwen3-235B-A22B-Instruct-2507-FP8 ایک بڑا لسانی ماڈل (LLM) ہے جو Qwen3 خاندان سے تعلق رکھتا ہے، جسے Alibaba Cloud میں Qwen ٹیم نے تیار کیا ہے۔ مکمل نام کی وضاحت یوں ہے: Qwen3 – سیریز کی تیسری نسل، 235B – کل 235 بلین پیرامیٹرز، A22B – ہر درخواست پر 22 بلین فعال پیرامیٹرز، Instruct – ہدایات پر عمل کرنے کی تربیت یافتہ ورژن، 2507 – جولائی 2025 کا ریلیز، FP8 – میموری کی اصلاح کے لیے 8-bit کوانٹائزیشن۔
کلیدی آرکیٹیکچرل خصوصیت – MoE (Mixture of Experts) ہے۔ 'گھنے' ماڈلز (GPT-5.5، Claude Sonnet 4.6) کے برخلاف، جہاں ہر ٹوکن تمام پیرامیٹرز سے گزرتا ہے، MoE-ماڈل ہر درخواست پر 'ماہرین' کے صرف ایک ذیلی سیٹ کو فعال کرتا ہے – نیورل نیٹ ورک کے مخصوص بلاکس۔ Qwen3-235B کے معاملے میں 235 بلین پیرامیٹرز میں سے ہر ٹوکن پر صرف 22 بلین فعال ہوتے ہیں – 10% سے بھی کم۔ یہ 200B+ پیرامیٹرز والے ماڈلز کے برابر معیار فراہم کرتا ہے جبکہ 22B والے ماڈل کی کمپیوٹیشنل لاگت پر۔
عملی طور پر اس کا مطلب ہے: ماڈل اپنی رفتار سے کہیں زیادہ ذہین ہے۔ یہ موازنہ معیار کے گھنے ماڈلز کے مقابلے میں درخواستوں کو نمایاں طور پر تیزی سے پروسیس کرتا ہے، جبکہ انفرنس کے لیے کئی گنا کم VRAM کی ضرورت ہوتی ہے۔ یہی وجہ ہے کہ MoE 2025-2026 کے سب سے بڑے ماڈلز کے لیے غالب آرکیٹیکچر بن گیا۔
Qwen3-235B کی کنٹیکسٹ ونڈو 131,072 ٹوکنز (~100,000 الفاظ) ہے – یہ ایک درخواست میں پوری کتابوں، کوڈ بیسز یا لمبے قانونی دستاویزات کا تجزیہ کرنے کے لیے کافی ہے۔ ماڈل 119 زبانوں کو سپورٹ کرتا ہے، بشمول روسی، انگریزی، چینی، عربی، ہندی اور دسیوں دیگر – جو اسے مارکیٹ میں سب سے زیادہ کثیر لسانی ماڈلز میں سے ایک بناتا ہے۔
خصوصیات اور بینچ مارکس
Qwen3-235B سب سے بڑے بند اور کھلے ماڈلز کے ساتھ مقابلہ کرتی ہے۔ اہم خصوصیات کا موازنہ نیچے دیا گیا ہے:
| ماڈل | پیرامیٹرز | کانٹیکسٹ | MoE | Open Source | قیمت (فی 1M ٹوکنز) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B فعال) | 131K | ہاں | ہاں (Apache 2.0) | $0.07+ (ہوسٹنگ) |
| GPT-5.5 (OpenAI) | ~1.8T (تخمینہ) | 128K | ہاں (متوقع) | نہیں | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | افشا نہیں کیا گیا | 200K | نہیں (متوقع) | نہیں | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B فعال) | 1M | ہاں | ہاں (Llama License) | $0.20+ (ہوسٹنگ) |
| DeepSeek-R1 (DeepSeek) | 671B (37B فعال) | 128K | ہاں | ہاں (MIT) | $0.55 |
Qwen3-235B زیادہ تر بینچ مارکس پر GPT-5.5 اور Claude Sonnet 4.6 کے معیار کا مظاہرہ کرتی ہے، اور ایک open-weights MoE-ماڈل کے طور پر یہ ملکیتی اینالاگز سے کئی گنا سستی ہے: MoE-آرکیٹیکچر ہر درخواست پر صرف کچھ پیرامیٹرز کو فعال کرتا ہے اور کمپیوٹ اخراجات کو کم کرتا ہے۔ Gonka نیٹ ورک آج اپنے ماڈلز کے لیے—Kimi K2.6 اور MiniMax M2.7—یہی سستی ڈی سینٹرلائزڈ inference اپروچ استعمال کر رہا ہے، جو JoinGonka Gateway کے ذریعے $0.0047 فی 1M ٹوکنز پر دستیاب ہے (GPT-5.5 اور Claude سے سینکڑوں—ہزاروں گنا سستا)۔
MMLU-Pro, HumanEval, MATH-500 اور GSM8K بینچ مارکس پر ماڈل بہترین اوپن سورس ماڈلز میں شامل ہے، جو ریاضیاتی استدلال (reasoning) کے کاموں میں صرف DeepSeek-R1 سے پیچھے ہے۔ کوڈ جنریشن، ترجمہ اور ہدایات پر عمل کرنے کے کاموں میں Qwen3-235B مستقل طور پر Llama 4 Maverick سے آگے ہے اور Claude Sonnet 4.6 کے برابر ہے۔
Gonka نے Qwen3-235B کو کیسے استعمال کیا
جب Qwen3-235B نیٹ ورک کا بنیادی ماڈل تھا، تو یہ inference کے لیے موافق DiLoCo پروٹوکول کے ذریعے Gonka نیٹ ورک پر ڈسٹری بیوٹڈ طریقے سے کام کرتا تھا۔ FP8 فارمیٹ میں مکمل ماڈل کو تقریباً 640 GB ویڈیو میموری (VRAM) درکار ہوتی ہے، جسے ایک ہی GPU میں فٹ کرنا ناممکن ہے — یہاں تک کہ H100 80GB یا H200 141GB بھی ناکافی ہیں۔ اس لیے ماڈل کو لیئرز (tensor parallelism + pipeline parallelism) کے لحاظ سے متعدد ML-نوڈز کے درمیان تقسیم کیا گیا تھا۔
عملی طور پر، Qwen3-235B 8-16 GPU نوڈز کے کلسٹر پر کام کرتا تھا، جس میں ہر نوڈ کے پاس کم از کم 40 GB VRAM ہوتی تھی۔ Transfer Agents درخواست کو درست کلسٹر تک پہنچاتے، ہر نوڈ پر موجود vLLM ماڈل کے اپنے حصے کو پروسیس کرتا، اور نتائج یکجا ہو کر صارف تک پہنچ جاتے۔ پورا عمل چند سو ملی سیکنڈز لیتا تھا — صارف کو یہ محسوس نہیں ہوتا تھا کہ اس کی درخواست دنیا کے مختلف حصوں میں موجود ایک درجن GPU کے ذریعے پروسیس ہوئی ہے۔ نیٹ ورک اب بھی ڈسٹری بیوٹڈ inference کا وہی اصول موجودہ ماڈلز کے لیے استعمال کرتا ہے۔
ایک اہم تکنیکی تفصیل: Gonka سرونگ انجن کے طور پر vLLM کا استعمال کرتا ہے۔ vLLM ایک open-source پروجیکٹ ہے جو PagedAttention کے ذریعے ہائی پرفارمنس ٹیکسٹ جنریشن فراہم کرتا ہے — یہ ایک ایسا الگورتھم ہے جو متعدد درخواستوں کو متوازی پروسیس کرتے وقت ویڈیو میموری کے استعمال کو بہتر بناتا ہے۔ یہ نیٹ ورک کو معیار میں کمی کے بغیر ہزاروں بیک وقت صارفین کو سروس دینے کے قابل بناتا ہے۔
ماڈل native tool calling کو سپورٹ کرتا ہے — یعنی ماڈل کے جواب سے براہ راست فنکشنز اور ٹولز کو کال کرنا۔ یہ سہولت PR #767 کے ذریعے Gonka میں شامل کی گئی تھی جس میں ٹول کالز کی نشاندہی کے لیے 0.958 کی حد مقرر تھی۔ Qwen3-235B پر، اس نے ڈویلپرز کو ایسے AI-ایجنٹ بنانے کی اجازت دی جو بیرونی API، ڈیٹا بیس اور ٹولز کے ساتھ تعامل کر سکیں — سب کچھ ایک ہی درخواست کے ذریعے۔ Tool calling کی سپورٹ نیٹ ورک کے موجودہ ماڈلز میں بھی برقرار ہے۔
Gonka نیٹ ورک میں 4,000 سے زیادہ GPU (H100, H200, A100, RTX 4090 اور دیگر) شامل ہیں، جو 120+ ML-نوڈز میں اکٹھے ہیں۔ یہ AI inference کے لیے دنیا کے سب سے بڑے ڈسٹری بیوٹڈ GPU نیٹ ورکس میں سے ایک ہے — اور اگرچہ پہلے یہ صلاحیت Qwen3-235B پر مرکوز تھی، آج یہ نیٹ ورک کے موجودہ ماڈلز — Kimi K2.6، MiniMax M2.7 اور DeepSeek V4 Flash — کو سرو کرتی ہے۔
کیا Qwen3-235B کو ابھی آزمانا ممکن ہے؟
براہ راست جواب: Gonka نیٹ ورک کے ذریعے—اب نہیں۔ Qwen3-235B کو نیٹ ورک سے ہٹا دیا گیا ہے، لہذا ہمارے Gateway کے ذریعے qwen3-235b-a22b شناخت کنندہ کا استعمال کرتے ہوئے اسے کال کرنا اب ممکن نہیں ہے۔ چونکہ ماڈل اوپن سورس (Apache 2.0) ہے، آپ اب بھی اسے خود چلا سکتے ہیں یا اوپن-ویٹ ماڈلز کی تھرڈ پارٹی ہوسٹنگ استعمال کر سکتے ہیں—مثال کے طور پر، OpenRouter کے ذریعے (فی 1M ٹوکن تقریباً $0.071/$0.100)۔
اگر آپ کو وہی سستا ڈی سینٹرلائزڈ (decentralized) inference چاہیے جس کے لیے لوگ Gonka میں آتے ہیں—تو وہ کہیں نہیں گیا، بس اب نیٹ ورک کے موجودہ ماڈلز پر کام کر رہا ہے۔ JoinGonka API Gateway کے ذریعے OpenAI-مطابقت پذیر API استعمال کرتے ہوئے Kimi K2.6, MiniMax M2.7 اور DeepSeek V4 Flash دستیاب ہیں: OpenAI کے لیے لکھا گیا کوئی بھی کوڈ بغیر کسی تبدیلی کے کام کرے گا—بس URL، API-کی اور ماڈل کا نام تبدیل کرنا کافی ہے۔
موجودہ ماڈل کے لیے درخواست کی ایک مثال:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoE-آرکیٹیکچر کی وضاحت کریں"}]
}'لاگت: $0.0047 فی 1 ملین ٹوکن — یہ GPT-5.5 ($5.00/1M) سے تقریباً 800 گنا اور Claude Sonnet 4.6 ($3.00/1M) سے تقریباً 500 گنا سستا ہے۔ سائن اپ کرنے پر، آپ کو ٹیسٹنگ کے لیے مفت 1.5M ٹوکن ملتے ہیں۔
Gateway مقبول ڈویلپمنٹ ٹولز کے ساتھ مطابقت رکھتا ہے: Quick Start میں Python، Node.js اور curl کے ذریعے کنیکٹ کرنے کا طریقہ بیان کیا گیا ہے۔ اس کے علاوہ IDE انٹیگریشنز—Cursor، Continue، Cline، Aider اور Claude Code—اور AI-ایجنٹ فریم ورکس: LangChain، n8n، LibreChat، Open WebUI بھی سپورٹڈ ہیں۔
فوری شروعات کے لیے:
- gate.joingonka.ai پر رجسٹر کریں (اپنا والیٹ کنیکٹ کریں یا نیا بنائیں)
- ڈیش بورڈ سے API-کی حاصل کریں
- اپنے کوڈ میں
api.openai.comکوgate.joingonka.ai/apiسے تبدیل کریں - نیٹ ورک کا موجودہ ماڈل منتخب کریں —
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7یاdeepseek-ai/DeepSeek-V4-Flash-0731(مکمل فہرستGET /v1/modelsاینڈپوائنٹ میں دیکھیں)
ہابی-پروجیکٹ کی قیمت پر انٹرپرائز-لیول کا ڈی سینٹرلائزڈ inference کہیں نہیں گیا — Qwen3-235B نے صرف نیٹ ورک کے نئے ماڈلز کے لیے جگہ بنائی ہے۔ قیمت اور معیار کا وہی امتزاج اب Kimi K2.6, MiniMax M2.7 اور DeepSeek V4 Flash پر کام کر رہا ہے۔
مزید جاننا چاہتے ہیں؟
دیگر حصوں کو دریافت کریں یا ابھی GNK کمانا شروع کریں۔
Gonka کے موجودہ ماڈلز آزمائیں →