علم کے مرکز کے حصے ▾

ٹیکنالوجی

Qwen3-235B: وہ ماڈل جسے پہلے Gonka سرو کرتا تھا

Gonka نیٹ ورک صرف GPU کرائے پر نہیں دیتا — بلکہ یہ inference کے لیے AI-ماڈلز کی سروس دیتا ہے۔ طویل عرصے تک نیٹ ورک کا بنیادی اور واحد ماڈل Alibaba Cloud کا تیار کردہ Qwen3-235B-A22B-Instruct تھا۔ وقت کے ساتھ ساتھ نیٹ ورک ملٹی ماڈل آرکیٹیکچر کی طرف منتقل ہوا اور Qwen3-235B کو ہٹا دیا گیا: آج Gonka Moonshot AI کا Kimi K2.6 اور MiniMax M2.7 پیش کرتا ہے۔ آئیے دیکھتے ہیں کہ Qwen3-235B کیا ہے، اس نے Gonka نیٹ ورک میں کیا کردار ادا کیا اور اس کی جگہ کن ماڈلز نے لی — ایک نمایاں open-source MoE-ماڈل کے طور پر یہ اب بھی ایک مفید حوالہ ہے۔

Qwen3-235B کیا ہے؟

Qwen3-235B-A22B-Instruct-2507-FP8 ایک بڑا لسانی ماڈل (LLM) ہے جو Qwen3 خاندان سے تعلق رکھتا ہے، جسے Alibaba Cloud میں Qwen ٹیم نے تیار کیا ہے۔ مکمل نام کی وضاحت یوں ہے: Qwen3 – سیریز کی تیسری نسل، 235B – کل 235 بلین پیرامیٹرز، A22B – ہر درخواست پر 22 بلین فعال پیرامیٹرز، Instruct – ہدایات پر عمل کرنے کی تربیت یافتہ ورژن، 2507 – جولائی 2025 کا ریلیز، FP8 – میموری کی اصلاح کے لیے 8-bit کوانٹائزیشن۔

کلیدی آرکیٹیکچرل خصوصیت – MoE (Mixture of Experts) ہے۔ 'گھنے' ماڈلز (GPT-5.5، Claude Sonnet 4.6) کے برخلاف، جہاں ہر ٹوکن تمام پیرامیٹرز سے گزرتا ہے، MoE-ماڈل ہر درخواست پر 'ماہرین' کے صرف ایک ذیلی سیٹ کو فعال کرتا ہے – نیورل نیٹ ورک کے مخصوص بلاکس۔ Qwen3-235B کے معاملے میں 235 بلین پیرامیٹرز میں سے ہر ٹوکن پر صرف 22 بلین فعال ہوتے ہیں – 10% سے بھی کم۔ یہ 200B+ پیرامیٹرز والے ماڈلز کے برابر معیار فراہم کرتا ہے جبکہ 22B والے ماڈل کی کمپیوٹیشنل لاگت پر۔

عملی طور پر اس کا مطلب ہے: ماڈل اپنی رفتار سے کہیں زیادہ ذہین ہے۔ یہ موازنہ معیار کے گھنے ماڈلز کے مقابلے میں درخواستوں کو نمایاں طور پر تیزی سے پروسیس کرتا ہے، جبکہ انفرنس کے لیے کئی گنا کم VRAM کی ضرورت ہوتی ہے۔ یہی وجہ ہے کہ MoE 2025-2026 کے سب سے بڑے ماڈلز کے لیے غالب آرکیٹیکچر بن گیا۔

Qwen3-235B کی کنٹیکسٹ ونڈو 131,072 ٹوکنز (~100,000 الفاظ) ہے – یہ ایک درخواست میں پوری کتابوں، کوڈ بیسز یا لمبے قانونی دستاویزات کا تجزیہ کرنے کے لیے کافی ہے۔ ماڈل 119 زبانوں کو سپورٹ کرتا ہے، بشمول روسی، انگریزی، چینی، عربی، ہندی اور دسیوں دیگر – جو اسے مارکیٹ میں سب سے زیادہ کثیر لسانی ماڈلز میں سے ایک بناتا ہے۔

خصوصیات اور بینچ مارکس

Qwen3-235B سب سے بڑے کلوزڈ اور اوپن ماڈلز کے ساتھ مقابلہ کر رہا ہے۔ اہم خصوصیات کا موازنہ درج ذیل ہے:

ماڈلپیرامیٹرزکنٹیکسٹMoEOpen Sourceقیمت (فی 1M ٹوکن)
Qwen3-235B (Alibaba)235B (22B فعال)131Kجی ہاںجی ہاں (Apache 2.0)$0.07+ (ہوسٹنگ)
GPT-5.5 (OpenAI)~1.8T (تخمینہ)128Kجی ہاں (تخمینہ)نہیں$5.00
Claude Sonnet 4.6 (Anthropic)خفیہ200Kنہیں (تخمینہ)نہیں$3.00
Llama 4 Maverick (Meta)400B (17B فعال)1Mجی ہاںجی ہاں (Llama License)$0.20+ (ہوسٹنگ)
DeepSeek-R1 (DeepSeek)671B (37B فعال)128Kجی ہاںجی ہاں (MIT)$0.55

Qwen3-235B زیادہ تر بینچ مارکس پر GPT-5.5 اور Claude Sonnet 4.6 کے برابر معیار دکھاتا ہے، جبکہ ایک open-weights MoE-ماڈل کے طور پر یہ کمرشل حریفوں سے کئی گنا سستا ہے: MoE-آرکیٹیکچر ہر درخواست پر صرف کچھ پیرامیٹرز کو فعال کرتا ہے اور کمپیوٹیشن اخراجات کو نمایاں طور پر کم کرتا ہے۔ Gonka نیٹ ورک آج اپنے موجودہ ماڈلز — Kimi K2.6 اور MiniMax M2.7 میں یہی سستی ڈیسینٹرلائزڈ انفرنس استعمال کرتا ہے، جو JoinGonka Gateway کے ذریعے $0.003 فی 1M ٹوکن پر دستیاب ہیں (یعنی GPT-5.5 اور Claude سے ہزار گنا سستا)۔

MMLU-Pro, HumanEval, MATH-500 اور GSM8K بینچ مارکس پر یہ ماڈل سرفہرست تین اوپن سورس ماڈلز میں شامل ہے، صرف ریاضیاتی ریزننگ (reasoning) میں DeepSeek-R1 سے کچھ پیچھے ہے۔ کوڈ جنریشن، ترجمہ اور ہدایات پر عمل کرنے میں Qwen3-235B مستقل طور پر Llama 4 Maverick سے آگے اور Claude Sonnet 4.6 کے برابر کارکردگی کا مظاہرہ کرتا ہے۔

Gonka نے Qwen3-235B کو کیسے استعمال کیا

جب Qwen3-235B نیٹ ورک کا بنیادی ماڈل تھا، تو یہ Gonka نیٹ ورک پر ڈسٹریبیوٹڈ انداز میں کام کرتا تھا — DiLoCo پروٹوکول کے ذریعے، جسے inference کے لیے ایڈاپٹ کیا گیا تھا۔ FP8 فارمیٹ میں مکمل ماڈل کو تقریباً 640 GB ویڈیو میموری (VRAM) کی ضرورت ہوتی ہے، جو کہ ایک GPU پر سما جانا ناممکن ہے — یہاں تک کہ H100 80GB یا H200 141GB بھی کافی نہیں ہیں۔ اسی لیے ماڈل کو تہوں (tensor parallelism + pipeline parallelism) کے مطابق متعدد ML-نوڈز کے درمیان تقسیم کیا گیا تھا۔

عملی طور پر، Qwen3-235B 8-16 GPU-نوڈز کے کلستر پر کام کرتا تھا، جن میں سے ہر ایک میں کم از کم 40 GB VRAM تھی۔ Transfer Agents درخواست کو مطلوبہ کلستر تک پہنچاتے تھے، ہر نوڈ پر मौजूद vLLM ماڈل کے اپنے حصے کو پروسیس کرتا تھا، اور نتائج کو اکٹھا کر کے صارف کو واپس بھیج دیا جاتا تھا۔ پورا عمل چند سو ملی سیکنڈ لیتا تھا — صارف کو محسوس ہی نہیں ہوتا تھا کہ اس کی درخواست دنیا کے مختلف حصوں میں موجود درجنوں GPU کے ذریعے پروسیس کی گئی ہے۔ نیٹ ورک اب بھی اسی ڈسٹریبیوٹڈ inference کے اصول کو موجودہ ماڈلز پر لاگو کرتا ہے۔

ایک اہم تکنیکی تفصیل: Gonka سرونگ کے انجن کے طور پر vLLM استعمال کرتا ہے۔ vLLM ایک اوپن سورس پروجیکٹ ہے جو PagedAttention کے ذریعے ہائی پرفارمنس ٹیکسٹ جنریشن فراہم کرتا ہے — یہ ایک ایسا الگورتھم ہے جو ایک ساتھ کثیر درخواستوں کو پروسیس کرتے وقت ویڈیو میموری کے استعمال کو بہتر بناتا ہے۔ یہ نیٹ ورک کو معیار میں کمی کیے بغیر ہزاروں صارفین کو سروس دینے کی سہولت دیتا ہے۔

یہ ماڈل native tool calling کو سپورٹ کرتا ہے — یعنی براہ راست ماڈل کے جواب سے ہی فنکشنز اور ٹولز کو کال کرنا۔ یہ صلاحیت Gonka میں PR #767 کے ذریعے شامل کی گئی تھی جس میں ٹول کالز کی تشخیص کے لیے تھریش ہولڈ 0.958 تھا۔ Qwen3-235B پر یہ ڈویلپرز کو ایسے AI-ایجنٹ بنانے کی اجازت دیتا تھا جو بیرونی API، ڈیٹا بیس اور ٹولز کے ساتھ ایک ہی درخواست کے ذریعے بات چیت کر سکتے تھے۔ ٹول کالنگ سپورٹ موجودہ ماڈلز میں بھی برقرار رکھی گئی ہے۔

Gonka نیٹ ورک میں 4 000 سے زائد GPU (H100, H200, A100, RTX 4090 اور دیگر) ہیں، جو 120+ ML-نوڈز میں ضم ہیں۔ یہ AI inference کے لیے دنیا کے سب سے بڑے ڈسٹریبیوٹڈ GPU نیٹ ورکس میں سے ایک ہے — اور اگر یہ طاقت پہلے Qwen3-235B کے لیے مختص تھی، تو آج یہ نیٹ ورک کے موجودہ ماڈلز، Kimi K2.6 اور MiniMax M2.7 کو سروس فراہم کر رہی ہے۔

کیا Qwen3-235B کو ابھی آزمانا ممکن ہے؟

براہ راست جواب: Gonka نیٹ ورک کے ذریعے — اب نہیں۔ Qwen3-235B کو نیٹ ورک سے ہٹا دیا گیا ہے، اس لیے ہمارے Gateway کے ذریعے qwen3-235b-a22b آئی ڈی استعمال کر کے اسے کال نہیں کیا جا سکتا۔ ماڈل چونکہ اوپن (Apache 2.0) ہے، آپ اسے خود رن کر سکتے ہیں یا تھرڈ پارٹی ہوسٹنگ کے ذریعے اس تک رسائی حاصل کر سکتے ہیں — مثال کے طور پر OpenRouter (تقریباً $0.071/$0.100 فی 1M ٹوکن)۔

اگر آپ کو وہی سستی ڈیسینٹرلائزڈ انفرنس چاہیے جس کے لیے لوگ Gonka استعمال کرتے ہیں — تو وہ ابھی بھی موجود ہے، بس نیٹ ورک کے موجودہ ماڈلز پر کام کرتا ہے۔ JoinGonka API Gateway کے ذریعے Kimi K2.6 اور MiniMax M2.7 OpenAI-مطابقت پذیر API کے ساتھ دستیاب ہیں: OpenAI کے لیے لکھا گیا کوئی بھی کوڈ یہاں بغیر کسی تبدیلی کے کام کرتا ہے — بس URL، API-کنجی اور ماڈل کا نام تبدیل کریں۔

موجودہ ماڈل کی درخواست کی مثال:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "MoE-آرکیٹیکچر کی وضاحت کریں"}]
  }'

قیمت: $0.003 فی 1 ملین ٹوکن — یہ GPT-5.5 ($5.00/1M) سے 1,700 گنا اور Claude Sonnet 4.6 ($3.00/1M) سے 1,000 گنا سستا ہے۔ رجسٹریشن پر آپ کو ٹیسٹنگ کے لیے 10 ملین مفت ٹوکنز ملتے ہیں۔

Gateway معروف ڈویلپمنٹ ٹولز کے ساتھ ہم آہنگ ہے: Quick Start میں Python, Node.js اور curl کے ذریعے کنکشن کے طریقے بیان کیے گئے ہیں۔ نیز IDE انٹیگریشنز — Cursor, Continue, Cline, Aider اور Claude Code — اور AI-ایجنٹ فریم ورکس (LangChain, n8n, LibreChat, Open WebUI) کو سپورٹ کیا جاتا ہے۔

فوری آغاز کے لیے:

  1. gate.joingonka.ai پر رجسٹر کریں (اپنا والیٹ کنیکٹ کریں یا نیا بنائیں)
  2. Dashboard سے API-کنجی حاصل کریں
  3. اپنے کوڈ میں api.openai.com کو gate.joingonka.ai/api سے بدل دیں
  4. موجودہ نیٹ ورک ماڈل بتائیں — moonshotai/Kimi-K2.6 یا MiniMaxAI/MiniMax-M2.7 (مکمل فہرست GET /v1/models اینڈ پوائنٹ پر ہے)

ہابی پروجیکٹ کی قیمت میں انٹرپرائز لیول ڈیسینٹرلائزڈ انفرنس اب بھی دستیاب ہے — Qwen3-235B صرف نئے ماڈلز کے لیے اپنی جگہ چھوڑ چکا ہے۔ قیمت اور معیار کا وہی امتزاج اب Kimi K2.6 اور MiniMax M2.7 پر دستیاب ہے۔

Qwen3-235B-A22B — Alibaba Cloud کا 235 ارب پیرامیٹرز (22 ارب فعال) والا ایک MoE ماڈل ہے، جو ابتدائی مراحل میں غیر مرکزی AI inference کے لیے Gonka نیٹ ورک کا بنیادی ماڈل تھا۔ اپنے MoE آرکیٹیکچر کی بدولت، یہ کمپیوٹیشنل اخراجات میں نمایاں کمی کے ساتھ اعلیٰ ترین ملکیتی ماڈلز کے معیار فراہم کرتا ہے۔ اب Qwen3-235B کو نیٹ ورک سے ہٹا دیا گیا ہے: موجودہ Gonka ماڈلز Kimi K2.6 اور MiniMax M2.7 ہیں، جو JoinGonka Gateway کے ذریعے OpenAI-مطابقت پذیر API پر $0.003 فی 1M ٹوکنز کی قیمت پر دستیاب ہیں۔ Qwen3-235B خود اوپن (Apache 2.0) ہے اور تھرڈ پارٹی open-weights ہوسٹنگ سروسز پر دستیاب ہے۔

مزید جاننا چاہتے ہیں؟

دیگر حصوں کو دریافت کریں یا ابھی GNK کمانا شروع کریں۔

Gonka کے موجودہ ماڈلز آزمائیں →