علم کے مرکز کے حصے ▾
نیویگیشن
▸ یہاں سے شروع کریں کردار کے لحاظ سےزمرہ جات
- گونکا نیٹ ورک کا فن تعمیر: اسپرنٹ، ٹرانسفر ایجنٹس، ڈیلکو
- ڈویلپرز: GNK کیسے کمائیں
- خود ہوسٹنگ: مرحلہ بہ مرحلہ گائیڈ
- Gonka کے لیے GPU کا انتخاب: ہارڈ ویئر کی سفارشات
- Qwen3-235B: وہ ماڈل جسے پہلے Gonka سرو کرتا تھا
- Kimi K2.6: ماڈل جو پہلے Gonka کے زیر انتظام تھا
- MiniMax M2.7: Gonka نیٹ ورک ماڈل
- DeepSeek V4 Flash: 380K کانٹیکسٹ کے ساتھ Gonka نیٹ ورک ماڈل
- GLM-5.3 Flash: Gonka نیٹ ورک میں Z.ai کا reasoning-ماڈل
ٹیکنالوجی
GLM-5.3 Flash: Gonka نیٹ ورک میں Z.ai کا reasoning-ماڈل
ستمبر 2026 میں Gonka نیٹ ورک میں ایک نیا فعال ماڈل متعارف کرایا گیا — چینی لیب Z.ai کا GLM-5.3 Flash۔ اس کے اضافے کے لیے گورننس پروپوزل #101 پاس ہوا، ہوسٹس نے ویٹس لوڈ کیے اور ماڈل MiniMax M2.7 اور DeepSeek V4 Flash کے ساتھ ہمارے گیٹ وے پر دستیاب ہو گیا۔ اسی دوران Kimi K2.6 نیٹ ورک سے ہٹ گیا اور فلیگ شپ GLM-5.2، جو طویل عرصے سے تعیناتی کا منتظر تھا، نیٹ ورک میں شامل نہیں ہو سکا — نیٹ ورک نے اسی سیریز کا ایک ہلکا ماڈل منتخب کیا۔
GLM-5.3 Flash نیٹ ورک کے دیگر ماڈلز سے ایک بنیادی خصوصیت میں مختلف ہے: یہ ایک reasoning-ماڈل ہے۔ جواب دینے سے پہلے یہ سوچتا ہے — اور اس سوچ یا ریزننگ کے لیے ٹوکنز اور وقت درکار ہوتا ہے اور درست ریکویسٹ سیٹنگز کی ضرورت ہوتی ہے۔ جو لوگ max_tokens: 200 کے ساتھ «مختصر جواب» کی درخواست کرتے ہیں، انہیں خالی جواب مل سکتا ہے۔ ہم تفصیل سے جائزہ لیں گے کہ یہ ماڈل کیا ہے، Gonka نیٹ ورک میں اس کی خصوصیات کیا ہیں، ریزننگ بجٹ کیسے کام کرتا ہے، ٹولز اور JSON کا معاملہ، اس کی قیمت اور اسے دیگر ماڈلز کے بجائے کب استعمال کرنا چاہیے۔
GLM-5.3 Flash کیا ہے اور اس کے پیچھے کون ہے
Z.ai بیجنگ کی Zhipu AI لیب کا ایک بین الاقوامی برانڈ ہے، جو سنگھوا یونیورسٹی سے نکلا ہے۔ GLM فیملی 2023 (ChatGLM) سے تیار ہو رہی ہے، اور موسم گرما 2025 میں GLM-4.5 کے اجراء کے بعد سے، کمپنی اپنے فلیگ شپ ماڈلز کے ویٹ (weights) کو MIT لائسنس کے تحت جاری کر رہی ہے، جس کی وجہ سے یہ سیریز دنیا کی سب سے نمایاں اوپن ویٹ ماڈل سیریز میں سے ایک بن گئی ہے۔ Z.ai کی اپنی مصنوعات - ZCode ڈویلپمنٹ ماحول اور GLM Coding Plan سبسکرپشن - انہی ماڈلز کے گرد تیار کی گئی ہیں۔
GLM-5.3 Flash 5.3 سیریز کا ایک ہلکا ماڈل ہے۔ یہاں "ہلکا" نسبتاً ہے: یہ ایک MoE-ماڈل ہے جس میں 320 بلین پیرامیٹرز ہیں، جن میں سے ہر ٹوکن کے لیے تقریباً 18 بلین فعال ہوتے ہیں۔ ویٹ FP8 فارمیٹ میں تقسیم کیے گئے ہیں، لائسنس MIT ہے۔ آرکیٹیکچرل خصوصیت ہائبرڈ اٹینشن ہے: کچھ لیئرز اس پارس (sparse) اٹینشن استعمال کرتی ہیں، کچھ لینیئر، اور یہ کلاسک مکمل اٹینشن کے مقابلے میں لمبے سیاق و سباق (context) کے لیے میموری اور وقت کے لحاظ سے نمایاں طور پر سستی ہے۔
ماڈل کے رویے کا تعین کرنے والی دوسری خصوصیت بلٹ ان ریزننگ (reasoning) ہے۔ GLM-5.3 Flash پہلے سوچنے اور پھر جواب دینے کے لیے تربیت یافتہ ہے: سوچنے کا عمل جواب سے الگ ہوتا ہے اور کلائنٹ کو ایک الگ فیلڈ میں دیا جاتا ہے۔ ریزننگ کو reasoning_effort پیرامیٹر کے ذریعے فعال یا غیر فعال کیا جاتا ہے، اور ڈیفالٹ طور پر یہ مکمل ہوتا ہے۔ یہ ماڈل کو ان کاموں میں مضبوط بناتا ہے جہاں الجھی ہوئی منطق کو سمجھنے کی ضرورت ہو، لیکن یہ ریکویسٹ سیٹنگز کے بارے میں بھی تقاضا کرتا ہے، جس کا ذکر ذیل میں ہے۔
"Flash" اور بڑے GLM-5.3 کے درمیان فرق وینڈر کی قیمتوں میں واضح ہے: اشاعت کے وقت OpenRouter پر Flash کی قیمت $0.09 فی ملین ان پٹ اور $0.30 فی ملین آؤٹ پٹ ٹوکن ہے، جبکہ بڑے ماڈل کی قیمت $1.40 اور $4.40 ہے۔ Gonka نیٹ ورک میں یہ سیڑھی موجود نہیں ہے: نیٹ ورک کے تمام ماڈلز ایک ہی ریٹ پر دیے جاتے ہیں۔
Gonka نیٹ ورک میں GLM-5.3 Flash کی خصوصیات
نیٹ ورک کے دیگر ماڈلز کی طرح، 'آؤٹ آف دی باکس' ماڈل کی خصوصیات اور مخصوص تعیناتی (deployment) کے ورکنگ پیرامیٹرز کے درمیان فرق کرنا ضروری ہے: یہ نیٹ ورک GPU ہوسٹس پر vLLM-inferenced کنفیگریشن کے ذریعے سیٹ کیے جاتے ہیں۔ ہمارے گیٹ وے کے ذریعے اصل اقدار یہ ہیں:
- کانٹیکسٹ ونڈو: 390,000 ٹوکنز۔ یہ ہماری درخواستوں کے ذریعے ثابت شدہ کم از کم حد ہے، نہ کہ ماڈل کارڈ کی کوئی فرضی تعداد: 390,013 ٹوکنز کا ان پٹ قبول اور پروسیس کیا گیا ہے، بڑا prefill ہم نے براہ راست نیٹ ورک ہوسٹس پر چلایا ہے۔ ہوسٹس کی تکنیکی سیٹنگز 400,000 تک کی اجازت دیتی ہیں، لیکن ہم وہی شائع کر رہے ہیں جو تصدیق شدہ ہے۔
- زیادہ سے زیادہ آؤٹ پٹ: فی جواب 8,192 ٹوکنز۔ اہم: اس حد میں استدلال (reasoning) کے ٹوکن اور خود جواب دونوں شامل ہیں۔ وہ ماڈل جس نے 4096 کی حد میں 3000 ٹوکن سوچنے میں صرف کیے، وہ جواب کے لیے صرف ایک ہزار چھوڑے گا۔
- Reasoning اور tool calling: ماڈل کو ریزننگ پارسر اور ٹول کالنگ پارسر کے ساتھ تعینات کیا گیا ہے — استدلال
reasoning_contentفیلڈ میں آتا ہے، اور ٹولز کی کالز معیاریtool_callsفیلڈ میں آتی ہیں، جیسا کہ کسی بھی OpenAI-مطابقت پذیر ماڈل میں ہوتا ہے۔ - رفتار: ہمارے گیٹ وے کے پیمائش کے مطابق، پہلا ٹوکن تقریباً 0.75 سیکنڈ میں آتا ہے، جنریشن کی رفتار لوڈ کے لحاظ سے 25–44 ٹوکن فی سیکنڈ ہوتی ہے۔ ایک reasoning-ماڈل کے لیے یہ تیز ہے — لیکن یاد رکھیں کہ پہلے چند سو ٹوکن استدلال میں صرف ہوں گے اور نظر آنے والا جواب بعد میں شروع ہوگا۔
- ہوسٹ کی VRAM کی ضرورت: فی ریپلیکا تقریباً 560 جی بی (آن چین ماڈل پیرامیٹرز کے مطابق) — جو MiniMax M2.7 (320 جی بی) اور DeepSeek V4 Flash (280 جی بی) سے زیادہ ہے۔ ہارڈ ویئر کی حد (threshold) جتنی زیادہ ہوگی، اتنے ہی کم ہوسٹس ماڈل کو تعینات کرنے کے قابل ہوں گے، جو نیٹ ورک میں اس کی صلاحیت کو براہ راست متاثر کرتا ہے — اس بارے میں منظرناموں اور حدود کے سیکشن میں بتایا گیا ہے۔
Gonka نیٹ ورک میں انفرنس کی قیمت ماڈل کے انتخاب پر منحصر نہیں ہے: GLM-5.3 Flash اسی ریٹ پر دستیاب ہے جو MiniMax M2.7 اور DeepSeek V4 Flash کے لیے ہے — JoinGonka گیٹ وے کے ذریعے یہ فی ملین ان پٹ ٹوکنز $0.0069 اور فی ملین آؤٹ پٹ ٹوکنز $0.021 ہے۔ استدلال کے ٹوکنز آؤٹ پٹ ٹوکنز کے طور پر چارج کیے جاتے ہیں۔ نیٹ ورک کی معاشیات ایک الگ موضوع ہے: قیمت وینڈر کی قیمت کے بجائے کمپیوٹیشنل کام کے حساب سے طے ہوتی ہے۔
ریزننگ اور ٹوکن بجٹ: خالی جواب کیسے نہ حاصل کریں
GLM-5.3 Flash کے ساتھ پہلی بار کام کرتے وقت سب سے عام غلطی یہ ہے: ڈویلپر معمول کے max_tokens: 256 کے ساتھ ایک چھوٹا سوال بھیجتا ہے، اور finish_reason: "length" اور خالی content فیلڈ حاصل کرتا ہے۔ کچھ بھی ٹوٹا نہیں ہے — ماڈل نے اپنی تمام حد ریزننگ میں خرچ کر دی ہے اور جواب تک پہنچ ہی نہیں پایا۔ ہمارے پیمائش کے مطابق، ایک معمولی سوال کے لیے بھی ریزننگ 250–450 ٹوکن لیتی ہے، اور کسی معنی خیز کام کے لیے ہزاروں۔
تین عملی اصول:
| سیٹنگ | تجویز | وجہ |
|---|---|---|
max_tokens | چھوٹے جوابات کے لیے بھی 600 سے کم نہیں؛ حقیقی کاموں کے لیے 2000 سے شروع کریں | حد ریزننگ اور جواب کے لیے مشترک ہے؛ ریزننگ پہلے چند سو ٹوکن کھا جاتی ہے |
stream | جہاں ممکن ہو true رکھیں | ریزننگ اور جواب جنریشن کے ساتھ آتے ہیں: پیش رفت نظر آتی ہے، "خالی اسکرین" کا انتظار نہیں ہوتا، اور لمبے جوابات پراکسی ٹائم آؤٹ کا شکار نہیں ہوتے |
reasoning_effort | جب ریزننگ کی ضرورت نہ ہو تو low؛ جب ضرورت ہو تو کچھ نہ لکھیں | سوئچ بائنری ہے: low ریزننگ کو آف کر دیتا ہے، کوئی بھی دوسری ویلیو اسے مکمل رکھتی ہے۔ گیٹ وے none اور minimal کو low بناتا ہے، جبکہ medium، high، xhigh اور max کو زائد سمجھ کر ہٹا دیتا ہے۔ نیٹ ورک enable_thinking، chat_template_kwargs، reasoning.enabled اور thinking.type فیلڈز کو نظر انداز کر دیتا ہے |
مختصر کام کے لیے ریکویسٹ کی مثال — محدود ریزننگ اور کافی حد کے ساتھ:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-ваш-ключ" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"reasoning_effort": "low",
"max_tokens": 800,
"messages": [{"role": "user", "content": "آسٹریلیا کا دارالحکومت ایک لفظ میں بتائیں"}]
}'جواب میں ریزننگ message.reasoning_content میں ہوتی ہے، اور خود جواب message.content میں؛ اسٹریم میں وہ الگ ڈیلٹا کے طور پر آتے ہیں۔ زیادہ تر OpenAI-مطابقت پذیر کلائنٹس ناواقف فیلڈ کو خاموشی سے نظر انداز کر دیتے ہیں، اس لیے ریزننگ جواب کے متن میں "لیک" نہیں ہوتی — لیکن یہ completion_tokens میں شامل ہوتی ہے اور آؤٹ پٹ ٹوکن کے طور پر ادا کی جاتی ہے۔ اگر ریزننگ بالکل نہیں چاہیے، تو GLM-5.3 Flash بہترین انتخاب نہیں ہے: تیز مختصر جوابات کے لیے MiniMax M2.7 زیادہ کفایتی ہے۔
ایجنٹک منظرناموں کے لیے ایک الگ انتباہ: Cline یا Cursor جیسے ٹولز اکثر سروس ریکویسٹس کے لیے چھوٹی آؤٹ پٹ لمٹ مقرر کرتے ہیں — سیاق و سباق کی کمپریشن، مکالمے کے عنوان کی تخلیق۔ اگر ایسی ریکویسٹ چند سو ٹوکن کی لمٹ کے ساتھ GLM-5.3 Flash پر جاتی ہے، تو وہ خالی واپس آئے گی۔ ٹول میں لمٹ سیٹنگ چیک کریں یا سروس ریکویسٹ نیٹ ورک کے کسی دوسرے ماڈل کو دیں۔
ٹولز، JSON اور نیٹ ورک کے دیگر ماڈلز کے ساتھ موازنہ
Reasoning-ماڈلز کبھی کبھار ایجنٹ فریم ورکس کے ساتھ اچھی طرح مطابقت نہیں رکھتے: استدلال (reasoning) ٹول کالز کے درمیان آ جاتا ہے اور فارمیٹ کو خراب کر دیتا ہے۔ GLM-5.3 Flash کے ساتھ ہم نے مکمل ایجنٹ سائیکل چلایا — ٹولز کی تفصیل، کال، رزلٹ واپس آنا، اور سیکنڈ راؤنڈ کال — اور OpenAI-مطابقت پذیر راستے پر یہ معمول کے مطابق کام کرتا ہے: کالز tool_calls میں ڈھانچہ جاتی انداز میں آتی ہیں، آرگومنٹس درست ہیں، اور سیکنڈ راؤنڈ ہسٹری کو الجھاتا نہیں ہے۔ JSON موڈ بھی کام کرتا ہے (response_format: {"type": "json_object"}) — ماڈل ایک درست آبجیکٹ دیتا ہے، اور استدلال (reasoning) جواب کے باہر رہتا ہے۔ ایجنٹس کے لیے بھی وہی بجٹ کا اصول لاگو ہوتا ہے: آؤٹ پٹ کی حد کو کافی رکھنا پڑتا ہے، ورنہ ٹول کال درمیان میں ہی رک سکتی ہے۔
نیٹ ورک کے دیگر دو ماڈلز کے ساتھ GLM-5.3 Flash کا موازنہ:
| پیرامیٹر | GLM-5.3 Flash | MiniMax M2.7 | DeepSeek V4 Flash |
|---|---|---|---|
| نیٹ ورک میں کانٹیکسٹ | 390,000 | 200,000 | 380,000 |
| فی رسپانس آؤٹ پٹ | 8,192 | 8,192 | 32,768 |
| آرکیٹیکچر | MoE 320B (~18B فعال)، ہائبرڈ اٹینشن | MoE + لکیری اٹینشن | MoE 284B (~13B فعال) |
| فی ریپلیکا VRAM | 560 GB | 320 GB | 280 GB |
| مضبوط پہلو | پیچیدہ منطق، کوڈ پارسنگ، "سوچنے" والے کام؛ نیٹ ورک کا طویل ترین کانٹیکسٹ | روزمرہ کے کام، تیز مختصر جوابات، ڈیفالٹ ماڈل | نیٹ ورک کا دوسرا طویل ترین کانٹیکسٹ، طویل ترین آؤٹ پٹ، ایجنٹ کوڈنگ |
| Gateway کے ذریعے قیمت | ایک جیسی — $0.0069 ان پٹ / $0.021 آؤٹ پٹ فی 1M کے لیے | ||
ایک جیسی قیمت کا عملی نتیجہ وہی ہے جو پہلے تھا: ماڈل بجٹ کے مطابق نہیں بلکہ کام کے مطابق منتخب کیا جاتا ہے۔ پیچیدہ منطق پر سوچنے کی ضرورت ہے — GLM-5.3 Flash؛ پوری ریپوزٹری پڑھنی ہے — DeepSeek V4 Flash؛ تیز اور درست جواب چاہیے — MiniMax M2.7۔
JoinGonka Gateway کے ذریعے GLM-5.3 Flash کا استعمال کیسے کریں
ماڈل JoinGonka Gateway کے ذریعے OpenAI اور Anthropic-مطابقت پذیر API کے ذریعے دستیاب ہے۔ ماڈل آئی ڈی: zai-org/GLM-5.3-Flash۔ رجسٹریشن کے فوراً بعد ڈیش بورڈ سے jg-… طرز کی کلید تیار کی جا سکتی ہے؛ نئے اکاؤنٹس کو 3M مفت ٹوکن دیے جاتے ہیں — جو آپ کے اپنے کاموں پر ماڈل کو چلانے اور بجٹ کا اندازہ لگانے کے لیے کافی ہیں۔
براہ راست API کال (OpenAI-فارمیٹ، اسٹریم فعال — reasoning-ماڈل کے لیے تجویز کردہ موڈ):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-آپکی-کلید" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"stream": true,
"max_tokens": 4000,
"messages": [{"role": "user", "content": "اس فنکشن میں غلطی تلاش کریں اور اس کی وضاحت کریں: …"}]
}'ڈویلپمنٹ ٹولز میں ماڈل کو نیٹ ورک کے دیگر ماڈلز کی طرح ہی جوڑا جاتا ہے: base URL https://gate.joingonka.ai/v1، کلید jg-… اور ماڈل آئی ڈی استعمال کریں۔ Cursor, Claude Code, Cline, Continue اور دیگر ٹولز کے لیے گائیڈز «Tools» سیکشن میں موجود ہیں؛ npx @joingonka/setup انسٹالر ایک کمانڈ میں ٹول کی کنفیگریشن میں گیٹ وے کو شامل کر دے گا۔ Anthropic Messages API کے صارفین کے لیے صرف ANTHROPIC_BASE_URL=https://gate.joingonka.ai سیٹ کرنا کافی ہے۔
رجسٹریشن کے بغیر ٹرائی کرنے کے لیے مفت چیٹ استعمال کریں: ماڈلز کی فہرست سے GLM-5.3 Flash منتخب کریں — وہاں سوچنے کے مراحل ایک الگ فولڈ ایبل بلاک میں دکھائے جاتے ہیں، تاکہ یہ واضح ہو کہ جواب دینے سے پہلے ماڈل کتنا «سوچتا» ہے۔
GLM-5.3 Flash کا انتخاب کب کریں — منظرنامے اور اہم نکات
اس ماڈل کے لیے مضبوط استعمال کے منظرنامے:
- ایسے کام جہاں سوچنے کی ضرورت ہو۔ پیچیدہ بزنس لاجک کا تجزیہ، غیر واضح بگ تلاش کرنا، ڈیٹا اسکیما ڈیزائن کرنا، ریاضی اور کثیر مرحلہ وار نتائج اخذ کرنا—یہی وہ کام ہیں جن کے لیے reasoning-ماڈلز موجود ہیں۔ یہاں استدلال جواب کے معیار کے ذریعے اپنی قیمت ادا کر دیتا ہے۔
- کوڈ کا ریویو اور وضاحت۔ ماڈل دوسروں کے کوڈ کو تفصیل سے الگ کرتا ہے اور تبصروں کے حق میں دلائل دیتا ہے، اور
reasoning_contentسے استدلال کی لہر کو صارف کو یہ دکھانے کے لیے استعمال کیا جا سکتا ہے کہ "میں نے یہ فیصلہ کیوں کیا"۔ - تصدیق کے ساتھ سٹرکچرڈ ایکسٹریکشن۔ JSON موڈ اور استدلال کو ملا کر غیر واضح ان پٹ ڈیٹا پر بغیر سوچے سمجھے جواب دینے کے مقابلے میں زیادہ درست نتائج حاصل ہوتے ہیں۔
- "پلانر" کردار کے ساتھ ایجنٹ پائپ لائنز۔ متعدد ماڈلز کے مجموعے میں GLM-5.3 Flash کو وہاں رکھیں جہاں یہ فیصلہ کیا جاتا ہے کہ "کیا کرنا ہے"، اور تیز رفتار عمل آوری کے کام MiniMax M2.7 کو دیں۔
کب نیٹ ورک کا دوسرا ماڈل استعمال کرنا زیادہ مناسب ہے: فوری اور مختصر جوابات، آٹو کمپلیشن اور بڑی تعداد میں سستی درخواستوں کے لیے—MiniMax M2.7 (وہاں استدلال صرف تاخیر اور خرچ بڑھاتا ہے)؛ ان دستاویزات اور ریپوزٹریز کے لیے جو ایک ہی درخواست میں مکمل فٹ ہونی چاہئیں—380K کنٹیکسٹ والا DeepSeek V4 Flash۔
لوڈ منتقل کرنے سے پہلے کیا یاد رکھیں۔ GLM-5.3 Flash نیٹ ورک کا تازہ ترین اور ہارڈویئر کے لحاظ سے سب سے بھاری ماڈل ہے، اور فی الحال یہ صرف چند ہوسٹس پر چل رہا ہے۔ اس کا مطلب ہے کہ MiniMax M2.7 اور DeepSeek V4 Flash کے مقابلے میں اس کی گنجائش کم ہے: چوٹی کے اوقات میں درخواستیں فری سلاٹ کے لیے زیادہ انتظار کر سکتی ہیں یا اوورلوڈ کا پیغام مل سکتا ہے، جسے چند سیکنڈ بعد دوبارہ آزمانا چاہیے۔ دوسری حد وقت ہے: جو پرووائیڈر فی الحال اس نیٹ ورک ماڈل کو فراہم کر رہا ہے، وہ جنریشن کے تقریباً پانچ منٹ بعد جواب کاٹ دیتا ہے؛ 25–44 ٹوکن فی سیکنڈ کی رفتار پر یہ تقریباً 7–10 ہزار ٹوکن ہے، اس لیے بہت طویل جنریشنز کو چھوٹے مراحل میں تقسیم کرنا بہتر ہے۔ نیٹ ورک کی ساخت ووٹنگ کے ذریعے تبدیل ہوتی ہے، لہذا ماڈلز کی موجودہ فہرست اور ان کی حدود ہمیشہ لائیو GET https://gate.joingonka.ai/v1/models سے دیکھیں، اور موجودہ دستیابی اور لیٹنسی گیٹ وے اسٹیٹس پیج پر دیکھیں۔ ایک ہی قیمت کی وجہ سے تجربہ کرنے میں کوئی خرچ نہیں: ماڈل سوئچ کرنا صرف درخواست میں ایک لائن تبدیل کرنے جتنا آسان ہے۔
مزید جاننا چاہتے ہیں؟
دیگر حصوں کو دریافت کریں یا ابھی GNK کمانا شروع کریں۔
Gateway کے ذریعے GLM-5.3 Flash ٹرائی کریں →