علم کے مرکز کے حصے ▾

ٹیکنالوجی

Kimi K2.6: ماڈل جو پہلے Gonka کے زیر انتظام تھا

ایک طویل عرصے تک Gonka نیٹ ورک Alibaba Cloud کے Qwen3-235B ماڈل پر کام کرتا رہا۔ مئی 2026 میں یہ تبدیل ہوا: DevShards میکانزم کے ذریعے متعدد ماڈلز کی سپورٹ شروع کی گئی اور پہلی شمولیت چینی کمپنی Moonshot AI کے Kimi K2.6 کی تھی۔ بعد میں اس میں MiniMax M2.7 اور DeepSeek V4 Flash شامل ہوئے اور Qwen3-235B کو نیٹ ورک سے ہٹا دیا گیا۔ ستمبر 2026 میں Kimi K2.6 کی باری آئی: ہوسٹس نے اسے ہوسٹ کرنا بند کر دیا اور گورننس تجویز #101 نے باضابطہ طور پر اس کے اخراج کی تصدیق کی — اس کی جگہ نیٹ ورک میں GLM-5.3 Flash کو شامل کیا گیا۔ آج Gonka تین ماڈلز کو ہوسٹ کرتا ہے: MiniMax M2.7, DeepSeek V4 Flash اور GLM-5.3 Flash۔ آئیے جانتے ہیں کہ Kimi K2.6 کیا ہے، یہ MiniMax M2.7 سے کیسے مختلف تھا، Gonka نے تکنیکی طور پر ملٹی-ماڈلنگ کو کیسے نافذ کیا، ماڈل نیٹ ورک سے کیوں نکلا اور فی الحال اس کی جگہ کیا منتخب کیا جائے۔

Moonshot AI کا Kimi K2.6 کیا ہے؟

Kimi K2.6 — ایک بڑا لسانی ماڈل (LLM) ہے جو Kimi سیریز کا حصہ ہے اور بیجنگ کی کمپنی Moonshot AI نے تیار کیا ہے۔ Moonshot AI چین کی سرکردہ AI لیبارٹریوں میں سے ایک ہے، جسے 2023 میں Yang Zhilin کی قیادت میں محققین کی ایک ٹیم نے قائم کیا۔ کمپنی نے Alibaba، Tencent اور دیگر بڑے سرمایہ کاروں سے فنڈنگ حاصل کی اور «چینی AI شیروں» کی فہرست میں شامل ہوئی — وہ کمپنیاں جو ایشیا میں AI کی ترقی کی رفتار کا تعین کرتی ہیں۔

Kimi سیریز 2024 سے جانی جاتی ہے۔ ابتدائی ورژنز (K1، K1.5) نے فوراً اپنی غیرمعمولی طور پر طویل کانٹیکسٹ ونڈو کی وجہ سے توجہ حاصل کی — ایک درخواست میں 200,000 ٹوکنز تک، جو ریلیز کے وقت عوامی طور پر دستیاب ماڈلز کے لیے ایک ریکارڈ تھا۔ طویل کانٹیکسٹ کا مطلب ہے ایک درخواست میں پوری کتاب، درمیانے سائز کے کوڈ بیس یا قانونی دستاویزات کے مجموعے کا تجزیہ کرنے کی عملی صلاحیت۔ Kimi کی ریلیز کے وقت یہ خصوصیت ایک مضبوط مسابقتی برتری تھی۔

K2 ورژن 2025 میں آیا اور ایک بنیادی آرکیٹیکچرل چھلانگ لایا — MoE (Mixture of Experts) پر منتقلی۔ یہی آرکیٹیکچر Qwen3-235B اور DeepSeek-R1 کی بنیاد ہے — یہ 2025—2026 کے سب سے بڑے ماڈلز کے لیے عملی طور پر معیار بن گیا ہے۔ MoE مجموعی طور پر سینکڑوں بلین پیرامیٹرز رکھنے کی اجازت دیتا ہے، لیکن ہر درخواست پر صرف ایک ذیلی مجموعہ فعال کرتا ہے (عام طور پر 5—10%)، جو کہ مساوی معیار کے ساتھ inference کی کمپیوٹیشنل لاگت کو یکسر کم کرتا ہے۔

K2.6 — اس مضمون کے لکھنے کے وقت K2 سیریز کی تازہ ترین تکرار ہے۔ Moonshot AI کے عوامی بیانات کے مطابق، اس ورژن میں ماڈل کی reasoning (منطقی استدلال)، کوڈ جنریشن اور نیٹو ٹول کالنگ میں صلاحیتیں بہتر بنائی گئی ہیں۔ جب ماڈل Gonka نیٹ ورک کے ذریعے پیش کیا جا رہا تھا، تو یہ moonshotai/Kimi-K2.6 شناخت کنندہ کے تحت دستیاب تھا؛ اب گیٹ وے یہ شناخت کنندہ قبول نہیں کرتا — ماڈلز کی موجودہ فہرست ہمیشہ GET /v1/models فراہم کرتا ہے۔

Kimi K2.6 اور MiniMax M2.7 کا موازنہ

دونوں ماڈل چین کی سب سے بڑی AI لیبارٹریوں کی فلیگ شپ ڈیویلپمنٹس کی نمائندگی کرتے ہیں؛ جب تک دونوں نیٹ ورک کے ذریعے چلائے جاتے تھے، وہ ایک متحد OpenAI-مطابقت پذیر انٹرفیس JoinGonka Gateway کے ذریعے دستیاب تھے — آج اس جوڑی میں سے صرف MiniMax M2.7 گیٹ وے کے ذریعے دستیاب ہے۔ اس کے ساتھ ہی، ان کی مضبوطیاں اور ورثہ الگ الگ ہیں، جو ان کے درمیان انتخاب کو «کون سا بہتر ہے» کا سوال نہیں، بلکہ «کون سا کام کے لیے موزوں ہے» کا سوال بناتا ہے۔

خصوصیتKimi K2.6MiniMax M2.7
تیار کنندہMoonshot AI (بیجنگ)MiniMax (شنگھائی)
کمپنی کے قیام کا سال20232021
آرکیٹیکچرMoEMoE + لکیری attention
کنٹیکسٹ ونڈو200,000 ٹوکنز200,000 ٹوکنز
مضبوط پہلوReasoning، طویل کنٹیکسٹ، code generationطویل کنٹیکسٹ، موثر (لکیری) attention
JoinGonka کے ذریعے قیمت— (ماڈل نیٹ ورک سے ہٹا دیا گیا ہے)$0.0069 فی 1M ٹوکنز
API شناخت کنندہmoonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7
Gonka نیٹ ورک میں حیثیتمئی سے ستمبر 2026 تک چلایا گیا، ہٹا دیا گیا (proposal #101)فعال ماڈل (مئی 2026 سے، اپ گریڈ v0.2.13)

Reasoning کے بینچ مارکس (MATH-500, GSM8K, AIME) پر Kimi K2 سیریز تاریخی طور پر open-weights ماڈلز کے اوپری گروپ میں نتائج دکھاتی ہے، جو DeepSeek-R1 اور o1-اسٹائل کے ماڈلز کے ساتھ مقابلہ کرتی ہے۔ کوڈ جنریشن کے کاموں (HumanEval, MBPP) پر دونوں ماڈل قریبی سطح پر رہتے ہیں۔ MiniMax M2.7 کی مضبوطی بہت طویل تسلسل کے لیے موثر (لکیری) attention ہے، جبکہ Kimi اپنے مضبوط reasoning اور Kimi سیریز کے طویل کنٹیکسٹ کے لیے جانی جاتی ہے۔

2026 میں بینچ مارکس کے بارے میں ایک اہم انتباہ: عوامی ٹیسٹوں میں ٹاپ ماڈلز کے درمیان فرق فیصد کے اکائیوں میں سمٹ گیا ہے، اور یہ فرق اکثر بینچ مارکس کی شماریاتی غلطی کی حد میں ہی ہوتا ہے۔ عملی کام کے لیے یہ اہم نہیں ہے کہ «کون MMLU میں 2% زیادہ ہے»، بلکہ کام کی نوعیت اہم ہے: آپ ماڈل کو کیا کنٹیکسٹ بھیج رہے ہیں، منطقی زنجیریں کتنی پیچیدہ ہیں، کیا گفتگو کی طویل تاریخ درکار ہے، کون سی زبانیں استعمال ہو رہی ہیں۔ اس لیے اوپر دی گئی جدول ماڈلز کی درجہ بندی نہیں کرتی — یہ تیزی سے یہ سمجھنے میں مدد کرتی ہے کہ ہر ماڈل کس پروفائل کے کام کے لیے آپٹمائز کیا گیا ہے۔

آج کے عملی انتخاب کے لیے: Kimi K2.6 کا طاقچہ — طویل کنٹیکسٹ (بڑی دستاویزات کا تجزیہ، بڑے کوڈ بیس کو پڑھنا، تاریخ کو محفوظ رکھتے ہوئے طویل گفتگو) اور پیچیدہ reasoning-ٹاسک — نیٹ ورک کی موجودہ ترکیب میں دو ماڈلز کے ذریعے کور کیے جاتے ہیں۔ استدلال کے لیے GLM-5.3 Flash ذمہ دار ہے: یہ جواب دینے سے پہلے سوچتی ہے، اور پیچیدہ منطق کے لیے اسی کا انتخاب کرنا چاہیے؛ اس میں نیٹ ورک کا طویل ترین کنٹیکسٹ (390K) ہے۔ بغیر استدلال کے بڑے پرامپٹس اور طویل ایجنٹ سیشنز کے لیے — DeepSeek V4 Flash (380K، دوسرا طویل ترین کنٹیکسٹ)۔ اگر ترجیح بہت طویل ان پٹ تسلسل اور تیز جواب کے ساتھ سٹریمنگ ڈیٹا کی پروسیسنگ ہے — تو موثر attention کے ساتھ MiniMax M2.7۔ پروڈکشن میں اچھی حکمت عملی تبدیل نہیں ہوئی ہے — اپنے کوڈ میں نیٹ ورک کے چند ماڈلز کو رکھیں: model پیرامیٹر کے ذریعے تیز تبدیلی آپ کو ایپلیکیشن کے آرکیٹیکچر کو تبدیل کیے بغیر کام کے لحاظ سے ان کے درمیان سوئچ کرنے کی اجازت دیتی ہے۔

DevShards: گونکا نے دوسرا ماڈل کیسے لانچ کیا

۲۰۲۶ کے موسم بہار تک پورا Gonka نیٹ ورک بالکل ایک ہی ماڈل کی خدمت کرتا تھا — Qwen3-235B۔ فن تعمیر کے لحاظ سے یہ ایک سوچے سمجھے فیصلے تھا: تقسیم شدہ inference DiLoCo کے ذریعے ہوتا ہے، جس کے لیے نیٹ ورک کے تمام شرکا کو ایک ہی ماڈل ویڈیو میموری میں رکھنا ضروری ہے، ورنہ اس کی ضمانت ممکن نہیں کہ کوئی بھی نوڈ کسی بھی درخواست پر کارروائی کر سکے۔ FP8 فارمیٹ میں مکمل Qwen3-235B تقریباً ۶۴۰ GB VRAM لیتی ہے، جو بذات خود ہر ML نوڈ کے لیے ایک بہت بڑا عہد ہے۔

ملٹی ماڈل نیٹ ورک کی طرف بڑھنے کے لیے ایسا طریقہ درکار تھا جو بیک وقت kئی ماڈل رکھنے دے، مگر ہر ہوسٹ کو سب چلانے پر مجبور نہ کرے۔ یہی طریقہ DevShards بنے — نیٹ ورک کے الگ الگ شارڈز، جن میں سے ہر ایک کسی ایک ماڈل میں مہارت رکھتا ہے۔ ایک ہی شارڈ کے نوڈز ایک ہی ماڈل پر کام کرتے ہیں، اور نیٹ ورک روٹر درخواست کو مطلوبہ ماڈل والے شارڈ کی طرف بھیجتا ہے۔

یہ خیال ہوا سے نہیں آیا — اسے Gonka Improvement Proposal #800 «Multi-Model PoC» میں باقاعدہ شکل دی گئی، جو ۲۰۲۶ کے موسم بہار میں کمیونٹی ووٹنگ کے لیے پیش کیا گیا۔ تجویز کو نیٹ ورک کے شرکا اور ویلیڈیٹرز کی حمایت حاصل ہوئی اور اسے اپریل—مئی ۲۰۲۶ میں نافذ کیا گیا۔ Kimi K2.6 پہلا ماڈل تھا جو الگ DevShard پر چلایا گیا — یعنی عملاً نئے طریقے کی آزمائشی تعبیر۔ تجربہ کامیاب رہا: اس کے فوراً بعد اپنے اپنے شارڈز پر MiniMax M2.7، DeepSeek V4 Flash اور GLM-5.3 Flash آئے — ہر ایک اپنے ہوسٹس کے سیٹ اور اپنی معیشت کے ساتھ۔ یہی طریقہ اُلٹی سمت بھی کام کرتا ہے: جس ماڈل کو ہوسٹس سپورٹ کرنا چھوڑ دیں، وہ ووٹنگ کے ذریعے نیٹ ورک سے نکال دیا جاتا ہے — ستمبر ۲۰۲۶ میں خود Kimi K2.6 بھی اسی طرح رخصت ہوا۔

صارفین اور ڈویلپرز کے لیے اس کا مطلب کیا ہے:

  • ایک API — کئی ماڈل۔ JoinGonka Gateway کے ذریعے endpoint یا کیز بدلنے کی ضرورت نہیں: درخواست کے باڈی میں صرف دوسرا model بتا دیں۔ OpenAI کے مطابق فارمیٹ مکمل طور پر برقرار رہتا ہے۔
  • قیمت وہی۔ جب تک Kimi K2.6 خدمت دیتا رہا، اس کی بلنگ MiniMax M2.7 ہی کی شرح پر ہوتی رہی؛ موجودہ ماڈلز کے لیے بھی نیٹ ورک کا واحد ٹیرف برقرار ہے — Gateway کے ذریعے ۱M ٹوکنز پر $0.0069۔ واحد پرائسنگ صارفین کے ماڈلز کے درمیان منتقلی کو آسان بنانے کا سوچا سمجھا فیصلہ ہے۔
  • استحکام شارڈ کے لوڈ پر منحصر ہے۔ ابتدائی مرحلے میں نئے ماڈل کے شارڈ پر ہوسٹس کم ہوتے ہیں، اس لیے درخواستیں مرکوز ہونے پر ماڈل عارضی طور پر 429 too many concurrent requests واپس کر سکتا ہے۔ یہ نئے ماڈل کا معمول کا مرحلہ ہے: دلچسپی بڑھنے کے ساتھ ہوسٹس اس کے شارڈ سے جڑتے جاتے ہیں اور حدود بڑھتی جاتی ہیں۔ اُلٹا بھی درست ہے — ہوسٹس شارڈ چھوڑ دیں تو ماڈل کی گنجائش گھٹ جاتی ہے؛ نیٹ ورک میں Kimi K2.6 کی کہانی بھی اسی طرح ختم ہوئی۔
  • Tool calling ہر ماڈل کا اپنا ہوتا ہے۔ Gonka نیٹ ورک پر Kimi K2.6 کے آغاز میں خودکار ٹول انتخاب (tool_choice: "auto") میں معمولی مسائل ریکارڈ ہوئے، جو بعد میں نوڈ اپڈیٹ سے دور ہو گئے۔ سبق نیٹ ورک کے کسی بھی ماڈل کے لیے متعلق رہتا ہے: ٹول کال کا فارمیٹ مخصوص ماڈل کا مخصوص نوڈ پر خاصہ ہوتا ہے، اس لیے پروڈکشن میں اہم منظرناموں کے لیے پہلے ہی اپنی درخواستوں پر منتخب ماڈل کے رویے کی جانچ کر لیں۔

کس چیز سے تبدیل کیا گیا ہے اور اب کیا منتخب کریں

سیدھا جواب: Gonka نیٹ ورک کے ذریعے Kimi K2.6 اب دستیاب نہیں۔ ستمبر 2026 کے آغاز میں ہوسٹس نے اس کی خدمت بند کر دی، اور governance تجویز #101 نے ماڈل کو نیٹ ورک کی ماڈل فہرست سے حتمی طور پر نکال دیا — model: "moonshotai/Kimi-K2.6" کے ساتھ کوئی درخواست گیٹ وے مسترد کر دے گا۔ چونکہ ماڈل کے ویٹس کھلے ہیں، اسے اب بھی تھرڈ پارٹی open-weights ہوسٹنگ (مثلاً OpenRouter) سے حاصل کیا جا سکتا ہے، یا خود ڈیپلائے کیا جا سکتا ہے۔

البتہ اگر آپ کو وہی سستا ڈی سینٹرلائزڈ inference چاہیے جس کے لیے لوگ Gonka میں آتے ہیں — وہ تو غائب نہیں ہوا، بس نیٹ ورک کے فعال ماڈلز پر چل رہا ہے۔ JoinGonka API Gateway کے ذریعے OpenAI- اور Anthropic-مطابق API پر تین ماڈلز دستیاب ہیں، اور ہر ایک Kimi کی جس چیز کی قدر کی جاتی تھی اس کا ایک حصہ پورا کرتا ہے:

  • GLM-5.3 Flash (zai-org/GLM-5.3-Flash) — Z.ai کا reasoning ماڈل: جواب سے پہلے سوچتا ہے، اسی لیے پیچیدہ منطق، کوڈ تجزیے اور «سوچنے» والے کاموں کے لیے یہی لینا چاہیے؛ نیٹ ورک کا سب سے لمبا کانٹیکسٹ (390K) بھی اسی کا ہے۔ سوچ جواب کی حد میں شامل ہوتی ہے — max_tokens کچھ بڑھا کر رکھیں اور stream آن رکھیں۔
  • DeepSeek V4 Flash (deepseek-ai/DeepSeek-V4-Flash-0731) — نیٹ ورک کے طویل ترین کانٹیکسٹ میں سے ایک (380K)، سب سے لمبا آؤٹ پٹ اور مضبوط ایجنٹک کوڈنگ: بڑی ریپوزٹریاں، ٹول کالز کی لمبی زنجیریں۔
  • MiniMax M2.7 (MiniMaxAI/MiniMax-M2.7) — گیٹ وے کا ڈیفالٹ ماڈل: روزمرہ کاموں پر تیز اور متوازن جوابات، لمبی دستاویزات اور اسٹریمنگ پروسیسنگ۔

Kimi K2.6 سے منتقل ہونا یعنی ایک لائن بدلنا۔ OpenAI کے لیے لکھا گیا کوئی بھی کوڈ بغیر تبدیلی چلے گا: صرف URL، API کلید اور ماڈل کا نام بدلنا کافی ہے۔

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMaxAI/MiniMax-M2.7",
    "messages": [{"role": "user", "content": "Explain the difference between MoE and dense models"}]
  }'

ڈیولپمنٹ ٹولز میں بھی قاعدہ وہی ہے: جہاں بھی سیٹنگز میں moonshotai/Kimi-K2.6 تھا، وہاں فعال ماڈلز میں سے کسی ایک کی شناخت ڈال دیں۔ Cursor میں یہ Custom Model فیلڈ ہے، Claude Code میں ANTHROPIC_MODEL ماحولی متغیر یا --model فلیگ، OpenClaw، Cline اور Continue.dev میں پرووائیڈر کنفیگ میں ماڈل کا نام، LangChain اور n8n میں کلائنٹ کی ابتدا کے وقت model پیرامیٹر۔ npx @joingonka/setup انسٹالر ایک ہی کمانڈ میں گیٹ وے اور تازہ ترین ماڈل ٹول کی کنفیگ میں لکھ دے گا۔ دستیاب ماڈلز کی فہرست ہمیشہ GET /v1/models اینڈ پوائنٹ پر تازہ رہتی ہے — وہاں سے اسے ایپ کے UI میں متحرک طور پر کھینچ لینا آسان ہے، تاکہ نیٹ ورک سے کوئی ماڈل جانا یا آنا آپ کی پروڈکٹ نہ توڑے۔

رجسٹریشن کے بغیر /try صفحے پر مفت چیٹ میں آزما سکتے ہیں — وہاں نیٹ ورک کے فعال ماڈلز دستیاب ہیں۔ JoinGonka Gateway پر رجسٹریشن کرنے پر نیٹ ورک کے کسی بھی ماڈل کو جانچنے کے لیے مفت 3M ٹوکن ملتے ہیں — تینوں پر اپنے کام چلا کر سمجھ بوجھ سے متبادل چننے کے لیے کافی۔

Kimi K2.6 کی کہانی نے Gonka نیٹ ورک کے لیے کیا دکھایا: DevShards کا نظام دونوں طرف کام آیا۔ اس نے نیٹ ورک روکے بغیر ماڈلز شامل کرنے کا موقع دیا — Kimi کے بعد MiniMax M2.7، DeepSeek V4 Flash اور GLM-5.3 Flash آئے — اور اسی نے وہ ماڈل بے تکلف نکالنے کا موقع بھی دیا جسے ہوسٹس نے سہارنا چھوڑ دیا تھا۔ ایک ہی ماڈل سے بندھا نیٹ ورک بنیادی طور پر نازک ہوتا ہے؛ ووٹنگ سے ترکیب بدلنے کے قابل نیٹ ورک نرمی اور تسلسل کے ساتھ ارتقا پذیر ہوتا ہے۔ ڈیولپر کے لیے اس سے ایک سادہ اصول نکلتا ہے: «ہمیشہ کے لیے ماڈل چننا» نہیں، بلکہ ماڈل کا نام کنفیگریشن میں رکھنا اور زندہ فہرست جانچتے رہنا۔

Kimi K2.6 — Moonshot AI کا ایک MoE-ماڈل ہے جس میں طویل کنٹیکسٹ اور مضبوط reasoning-صلاحیتیں ہیں۔ مئی 2026 میں یہ Qwen3-235B کے بعد Gonka نیٹ ورک کا دوسرا ماڈل بنا، جسے DevShards میکانزم (فی ماڈل الگ شارڈ) کے ذریعے چلایا گیا، اور ستمبر 2026 تک نیٹ ورک نے اس کی سروس دی، جب میزبانوں نے اسے سپورٹ کرنا چھوڑ دیا اور گورننس تجویز #101 نے اسے ہٹا دیا۔ اب JoinGonka Gateway کے OpenAI-مطابقت پذیر API کے ذریعے MiniMax M2.7، DeepSeek V4 Flash اور GLM-5.3 Flash دستیاب ہیں — نیٹ ورک کے مقررہ ریٹ $0.0069 فی 1M ٹوکن پر؛ Kimi کا نِش (reasoning اور طویل کنٹیکسٹ) اب GLM-5.3 Flash اور DeepSeek V4 Flash پورا کر رہے ہیں۔ Kimi K2.6 خود ایک اوپن ماڈل کے طور پر موجود ہے اور تھرڈ پارٹی اوپن-ویٹ ہوسٹنگ پر دستیاب ہے۔

مزید جاننا چاہتے ہیں؟

دیگر حصوں کو دریافت کریں یا ابھی GNK کمانا شروع کریں۔

Gonka کے موجودہ ماڈلز کو آزمائیں →