أقسام قاعدة المعرفة ▾

تكنولوجيا

GLM-5.3 Flash: نموذج الاستنتاج Z.ai في شبكة Gonka

في سبتمبر 2026، ظهر نموذج جديد في شبكة Gonka وهو GLM-5.3 Flash من مختبر Z.ai الصيني. تمت الموافقة على مقترح الحوكمة #101 لإضافته، وقام المضيفون برفع الأوزان، وأصبح النموذج متاحاً عبر بوابتنا جنباً إلى جنب مع MiniMax M2.7 و DeepSeek V4 Flash. في الوقت نفسه، غادر Kimi K2.6 الشبكة، بينما النموذج الرائد GLM-5.2، الذي كان مدرجاً في السجل انتظاراً للنشر، لم يدخل الخدمة الفعلية؛ حيث اختارت الشبكة نموذجاً أخف من نفس السلسلة.

يتميز GLM-5.3 Flash عن النماذج الأخرى في الشبكة بخاصية جوهرية واحدة: إنه نموذج استنتاج (reasoning model). قبل أن يجيب، يقوم بالاستنتاج — وهذه الاستنتاجات تستهلك رموزاً (tokens) ووقتاً وتتطلب إعدادات دقيقة للاستعلام. من يضبط max_tokens: 200 لـ "إجابة قصيرة" سيحصل على رد فارغ. سنحلل ما هو هذا النموذج، وخصائصه في شبكة Gonka، وكيف تعمل ميزانية الاستنتاج، وحالة الأدوات و JSON، والتكلفة، ومتى يجب اختياره بدلاً من النموذجين الآخرين في الشبكة.

ما هو GLM-5.3 Flash ومن يقف وراءه

Z.ai هي علامة تجارية دولية لمختبر Zhipu AI، الذي نشأ من جامعة تسينغهوا. تطورت عائلة GLM منذ عام 2023 (ChatGLM)، وبدءاً من GLM-4.5 في صيف 2025، قامت الشركة بنشر أوزان النماذج الرائدة بموجب ترخيص MIT، مما جعل السلسلة واحدة من أبرز السلاسل في العالم ذات الأوزان المفتوحة. منتجات Z.ai الخاصة — بيئة التطوير ZCode واشتراك GLM Coding Plan — مبنية حول هذه النماذج نفسها.

GLM-5.3 Flash هو نموذج خفيف من عائلة 5.3. كلمة "خفيف" هنا نسبية: إنه نموذج MoE بـ 320 مليار بارامتر، يتم تفعيل حوالي 18 مليار منها لكل رمز. يتم توزيع الأوزان بصيغة FP8، والترخيص هو MIT. ميزة المعمارية هي الانتباه الهجين (hybrid attention): تستخدم بعض الطبقات انتباهاً متناثراً (sparse)، بينما تستخدم طبقات أخرى انتباهاً خطياً، وهذا يقلل بشكل ملحوظ من تكلفة الذاكرة والوقت للسياق الطويل مقارنة بالانتباه الكامل التقليدي.

الخاصية الثانية التي تحدد سلوك النموذج هي التفكير المدمج (built-in reasoning). تم تدريب GLM-5.3 Flash على التفكير أولاً ثم الإجابة: مسار التفكير مفصول عن الإجابة ويتم تقديمه للعميل في حقل منفصل. يتم تفعيل وإيقاف التفكير عبر معلمة reasoning_effort، وهي مفعلة بالكامل افتراضياً. هذا يجعل النموذج قوياً في المهام التي تتطلب تحليل منطق معقد — ويتطلب ضبط إعدادات الطلب، وهو ما سيتم شرحه أدناه.

الفرق بين "Flash" ونموذج GLM-5.3 الأكبر يظهر بوضوح في الأسعار لدى المزود: على OpenRouter وقت النشر، تبلغ تكلفة Flash $0.09 لكل مليون رمز إدخال و $0.30 لكل مليون رمز إخراج، بينما النموذج الأكبر يكلف $1.40 و $4.40. في شبكة Gonka لا يوجد هذا التدرج: جميع نماذج الشبكة متاحة بتعرفة موحدة.

خصائص GLM-5.3 Flash في شبكة Gonka

كما هو الحال مع نماذج الشبكة الأخرى، من المهم التمييز بين خصائص النموذج "الجاهز" ومعلمات التشغيل الخاصة بنشر معين: يتم تحديدها بواسطة تكوين vLLM-inference على مضيفات GPU في الشبكة. القيم الفعلية عبر البوابة الخاصة بنا هي:

  • نافذة السياق: 390,000 رمز (tokens). هذا هو الحد الأدنى المثبت بالاستعلامات، وليس الرقم المأخوذ من بطاقة النموذج: تم قبول ومعالجة إدخال بحجم 390,013 رمز، وقد قمنا بتشغيل prefill كبير مباشرة إلى مضيفات الشبكة. يسمح الإعداد التقني للمضيفات بـ 400,000، ولكننا ننشر ما تم التحقق منه فقط.
  • الحد الأقصى للإخراج: 8,192 رمز لكل إجابة. مهم: يشمل هذا الحد رموز التفكير والإجابة نفسها. النموذج الذي فكر لمدة 3,000 رمز مع حد 4,096 سيترك حوالي ألف رمز للإجابة.
  • التفكير واستدعاء الأدوات (Reasoning and tool calling): تم نشر النموذج مع محلل تفكير ومحلل استدعاء أدوات — تأتي التفكير في حقل reasoning_content، بينما تأتي استدعاءات الأدوات في الحقل القياسي tool_calls، تمامًا مثل أي نموذج متوافق مع OpenAI.
  • السرعة: في قياساتنا عبر البوابة، يصل الرمز الأول بعد حوالي 0.75 ثانية، ويتم التوليد بسرعة 25-44 رمزًا في الثانية اعتمادًا على الحمل. بالنسبة لنموذج تفكير، هذا سريع — ولكن تذكر أن المئات الأولى من الرموز ستذهب للتفكير، وستبدأ الإجابة المرئية لاحقًا.
  • متطلبات VRAM للمضيف: حوالي 560 جيجابايت لكل نسخة وفقًا لمعلمات النموذج on-chain — أكثر من MiniMax M2.7 (320 جيجابايت) و DeepSeek V4 Flash (280 جيجابايت). كلما ارتفع عتبة الأجهزة، قل عدد المضيفات القادرة على نشر النموذج، وهذا يؤثر بشكل مباشر على سعته في الشبكة — المزيد حول هذا في قسم السيناريوهات والقيود.

لا يعتمد سعر الاستدلال في شبكة Gonka على اختيار النموذج: يتوفر GLM-5.3 Flash بنفس السعر مثل MiniMax M2.7 و DeepSeek V4 Flash — عبر بوابة JoinGonka، هذا هو $0.0069 لكل مليون رمز إدخال و $0.021 لكل مليون رمز إخراج. يتم احتساب رموز التفكير كرموز إخراج. اقتصاديات الشبكة — موضوع منفصل: يتم تحديد السعر بناءً على حساب العمل الحسابي، وليس بناءً على قائمة أسعار البائع.

الاستنتاج وميزانية الرموز: كيف لا تحصل على إجابة فارغة

الخطأ الأكثر شيوعاً عند التعامل الأول مع GLM-5.3 Flash هو: يرسل المطور سؤالاً قصيراً مع max_tokens: 256 المعتادة، فيحصل على finish_reason: "length" وحقل content فارغ. لا يوجد عطل — النموذج استهلك الحد الأقصى بالكامل في التفكير ولم يصل إلى الإجابة. وفقاً لقياساتنا، حتى في السؤال البسيط، يستغرق التفكير 250–450 رمزاً، وفي المهام الجوهرية — الآلاف.

ثلاث قواعد عملية:

الإعدادالتوصيةالسبب
max_tokensلا يقل عن 600 حتى للإجابات القصيرة؛ للمهام الحقيقية — من 2000 فما فوقالحد الأقصى مشترك للتفكير والإجابة؛ التفكير يستهلك المئات الأولى من الرموز
streamtrue أينما كان ذلك ممكناًالتفكير والإجابة يصلان تدريجياً أثناء التوليد: يمكن رؤية التقدم، لا يوجد انتظار لـ "شاشة فارغة"، والإجابات الطويلة لا تتجاوز مهلات البروكسي
reasoning_effortlow عند عدم الحاجة للتفكير؛ لا تحددها عند الحاجةالمفتاح ثنائي: low يعطل التفكير، أي قيمة أخرى تبقيه كاملاً. البوابة تحول none و minimal إلى low، بينما medium و high و xhigh و max تُعتبر زائدة. الحقول enable_thinking و chat_template_kwargs و reasoning.enabled و thinking.type يتم تجاهلها من قبل الشبكة

مثال على طلب لمهمة قصيرة — مع تفكير محدود وحد كافٍ:

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-your-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "reasoning_effort": "low",
    "max_tokens": 800,
    "messages": [{"role": "user", "content": "سُمِّ عاصمة أستراليا بكلمة واحدة"}]
  }'

في الرد، يقع التفكير في message.reasoning_content، أما الإجابة فتقع في message.content؛ في التدفق (stream) تصل على شكل دلتا منفصلة. معظم العملاء المتوافقين مع OpenAI يتجاهلون الحقل غير المألوف بصمت، لذا لا "تتسرب" أفكار التفكير إلى نص الإجابة — ولكنها تُحسب ضمن completion_tokens وتُدفع كرموز إخراج. إذا لم تكن هناك حاجة للتفكير إطلاقاً، فإن GLM-5.3 Flash ليس الخيار الأفضل: للردود القصيرة والسريعة، يعتبر MiniMax M2.7 أكثر اقتصادية.

تنبيه خاص لسيناريوهات الوكلاء (agentic scenarios): أدوات مثل Cline أو Cursor غالباً ما تضع حداً صغيراً للإخراج للطلبات الخدمية — ضغط السياق، توليد عنوان الحوار. إذا ذهب مثل هذا الطلب إلى GLM-5.3 Flash بحد بضع مئات من الرموز، فسيعود فارغاً. تحقق من إعداد الحد في الأداة أو وجه الطلبات الخدمية لنموذج آخر في الشبكة.

الأدوات، JSON والمقارنة مع نماذج أخرى في الشبكة

نماذج الاستدلال (Reasoning models) غالباً ما لا تتوافق بشكل جيد مع أطر عمل الوكلاء: حيث يتداخل الاستدلال بين استدعاءات الأدوات ويكسر التنسيق. مع نموذج GLM-5.3 Flash، قمنا بتشغيل دورة الوكيل بالكامل — وصف الأدوات، الاستدعاء، إرجاع النتيجة، جولة الاستدعاء الثانية — وهي تعمل بشكل طبيعي عبر المسار المتوافق مع OpenAI: تصل الاستدعاءات منظمة في tool_calls، وتكون الوسائط صالحة، والجولة الثانية لا تخلط بين سجل المحادثة. يعمل أيضاً وضع JSON (response_format: {"type": "json_object"}) — حيث يعيد النموذج كائناً صالحاً بينما يظل الاستدلال خارج الرد. تنطبق نفس قاعدة الميزانية على الوكلاء: يجب أن يكون حد المخرجات كافياً، وإلا قد ينقطع استدعاء الأداة في المنتصف.

كيف يقارن GLM-5.3 Flash بالنموذجين الآخرين في الشبكة:

المعلمةGLM-5.3 FlashMiniMax M2.7DeepSeek V4 Flash
سياق الشبكة390 000200 000380 000
المخرجات لكل رد8 1928 19232 768
البنيةMoE 320B (~18B نشط)، انتباه هجين (hybrid attention)MoE + انتباه خطيMoE 284B (~13B نشط)
VRAM لكل نسخة560 جيجابايت320 جيجابايت280 جيجابايت
نقاط القوةالمنطق المعقد، تحليل الكود، مهام "التفكير"؛ أطول سياق في الشبكةالمهام اليومية، الردود القصيرة السريعة، النموذج الافتراضيثاني أطول سياق، أطول مخرجات، برمجة الوكلاء
السعر عبر Gatewayمتطابق — $0.0069 مدخلات / $0.021 مخرجات لكل 1M

النتيجة العملية للسعر الموحد تظل كما كانت: يتم اختيار النموذج بناءً على المهمة وليس بناءً على الميزانية. إذا كنت بحاجة للتفكير في منطق معقد — GLM-5.3 Flash؛ إذا كنت بحاجة لقراءة المستودع بالكامل — DeepSeek V4 Flash؛ إذا كنت بحاجة لرد سريع ومنظم — MiniMax M2.7.

كيفية استخدام GLM-5.3 Flash عبر JoinGonka Gateway

النموذج متاح عبر JoinGonka Gateway باستخدام واجهة برمجة تطبيقات (API) متوافقة مع OpenAI و Anthropic. معرف النموذج: zai-org/GLM-5.3-Flash. يتم إنشاء مفتاح من النوع jg-… في حسابك الشخصي فور التسجيل؛ تحصل الحسابات الجديدة على 3M توكن مجاني — وهو ما يكفي لتجربة النموذج على مهامك وتحديد ميزانية الاستدلال.

استدعاء API مباشر (تنسيق OpenAI، تم تفعيل البث — الوضع الموصى به لنموذج الاستدلال):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-مفتاحك" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "stream": true,
    "max_tokens": 4000,
    "messages": [{"role": "user", "content": "اعثر على الخطأ في هذه الوظيفة واشرحه: …"}]
  }'

في أدوات التطوير، يتم توصيل النموذج بنفس طريقة النماذج الأخرى في الشبكة: base URL https://gate.joingonka.ai/v1، والمفتاح jg-…، ومعرف النموذج. تم تجميع أدلة Cursor و Claude Code و Cline و Continue وأدوات أخرى في قسم «الأدوات»؛ سيقوم المثبت npx @joingonka/setup بإضافة البوابة إلى تكوين الأداة بأمر واحد. للعملاء الذين يستخدمون Anthropic Messages API، يكفي ضبط ANTHROPIC_BASE_URL=https://gate.joingonka.ai.

يمكنك التجربة بدون تسجيل في الدردشة المجانية: اختر GLM-5.3 Flash من قائمة النماذج — يتم عرض الاستدلالات هناك في كتلة منفصلة مطوية، بحيث يمكنك بسهولة معرفة المدة التي "يفكر" فيها النموذج قبل الإجابة.

متى تختار GLM-5.3 Flash — السيناريوهات وما يجب مراعاته

سيناريوهات قوية لهذا النموذج:

  • المهام التي تتطلب تفكيرًا. تحليل منطق الأعمال المعقد، البحث عن أخطاء غير واضحة، تصميم مخططات البيانات، الرياضيات والاستنتاجات متعددة الخطوات — هذا هو السبب في وجود نماذج الاستدلال. هنا، تؤتي الاستدلالات ثمارها في جودة الإجابة.
  • مراجعة وشرح الكود. يقوم النموذج بتفكيك كود الآخرين ويقدم مبررات للملاحظات، ويمكن إظهار عملية التفكير من reasoning_content للمستخدم كإجابة على "لماذا اتخذت هذا القرار".
  • الاستخراج المهيكل مع التحقق. يوفر وضع JSON بالإضافة إلى الاستدلال نتائج أكثر دقة على البيانات المدخلة الغامضة مقارنة بالإجابة المباشرة دون تفكير.
  • خطوط أنابيب الوكلاء (Agent pipelines) مع دور "المخطط". في سلسلة من نماذج متعددة، من المنطقي وضع GLM-5.3 Flash في المكان الذي يتم فيه اتخاذ قرار "ماذا يجب فعله"، وترك خطوات التنفيذ السريعة لـ MiniMax M2.7.

متى يكون نموذج آخر من الشبكة أكثر منطقية: للإجابات القصيرة والسريعة، والإكمال التلقائي، والطلبات الضخمة منخفضة التكلفة — MiniMax M2.7 (حيث تضيف الاستدلالات هناك تأخيرًا واستهلاكًا فقط)؛ للمستندات والمستودعات التي يجب أن تتناسب مع طلب واحد بالكامل — DeepSeek V4 Flash بسياق 380K.

ما يجب مراعاته قبل نقل الأحمال. يعد GLM-5.3 Flash أحدث وأثقل نموذج في الشبكة من حيث الأجهزة، ويخدمه حاليًا جزء صغير من المضيفين. وهذا يعني احتياطي سعة أقل من MiniMax M2.7 و DeepSeek V4 Flash: في دقائق الذروة، قد تنتظر الطلبات وقتًا أطول للحصول على فتحة فارغة أو تتلقى ردًا بالتحميل الزائد، وهو ما يجب تكراره بعد بضع ثوانٍ. القيد الثاني هو الوقت: المزود الذي يوفر نموذج الشبكة حاليًا يقطع الإجابة الواحدة في حوالي الدقيقة الخامسة من الإنشاء؛ عند 25-44 توكن في الثانية، هذا يعادل حوالي 7-10 آلاف توكن، لذلك من الأفضل تقسيم عمليات الإنشاء الطويلة جدًا إلى خطوات. يتغير تكوين الشبكة بالتصويت، لذا احصل دائمًا على القائمة المحدثة للنماذج وحدودها من GET https://gate.joingonka.ai/v1/models، ومعرفة التوفر والتأخير الحالي — من صفحة حالة البوابة. بفضل السعر الموحد، لا تكلف التجربة شيئًا: تبديل النموذج هو سطر واحد في الطلب.

GLM-5.3 Flash هو نموذج تفكير (reasoning) مفتوح من Z.ai (MoE بـ 320B بارامتر، حوالي 18B مفعلة، FP8، ترخيص MIT، انتباه هجين)، تمت إضافته لشبكة Gonka بموجب مقترح الحوكمة #101 في سبتمبر 2026. قبل الإجابة، يقوم النموذج بالتفكير، ويُحسب التفكير ضمن حد الإخراج: حدد max_tokens من 600 حتى للإجابات القصيرة، وقم بتفعيل stream، وللمهام البسيطة قم بإيقاف التفكير عبر reasoning_effort: low — أي قيمة أخرى تبقيه كاملاً (none و minimal تحولهما البوابة إلى low). Tool calling (بما في ذلك الجولات المتكررة) ووضع JSON يعملان؛ السياق في الشبكة هو 390,000 رمز، والإخراج يصل إلى 8,192. السعر هو نفسه مثل MiniMax M2.7 و DeepSeek V4 Flash: عبر JoinGonka Gateway — $0.0069 لكل مليون رمز إدخال و $0.021 لكل مليون رمز إخراج. المعرف: zai-org/GLM-5.3-Flash؛ التكوين الحالي للشبكة — GET /v1/models.

تريد معرفة المزيد؟

استكشف الأقسام الأخرى أو ابدأ في كسب GNK الآن.

تجربة GLM-5.3 Flash عبر Gateway →