জ্ঞানকোষের বিভাগসমূহ ▾
নেভিগেশন
▸ এখানে শুরু করুন রোল অনুযায়ীবিভাগ
- গঞ্জা নেটওয়ার্কের আর্কিটেকচার: স্প্রিন্ট, ট্রান্সফার এজেন্ট, ডিলোকো
- ডেভেলপারদের জন্য: কিভাবে GNK উপার্জন করবেন
- নিজস্ব হোস্টিং: ধাপে ধাপে গাইড
- Gonka-এর জন্য GPU নির্বাচন: হার্ডওয়্যার সুপারিশ
- Qwen3-235B: যে মডেলটি আগে Gonka সার্ভিস দিতো
- Kimi K2.6: মডেল যা পূর্বে Gonka দ্বারা পরিচালিত হতো
- MiniMax M2.7: Gonka নেটওয়ার্কের মডেল
- DeepSeek V4 Flash: 380K কনটেক্সট সহ Gonka নেটওয়ার্ক মডেল
- GLM-5.3 Flash: Gonka নেটওয়ার্কে Z.ai এর reasoning-মডেল
প্রযুক্তি
GLM-5.3 Flash: Gonka নেটওয়ার্কে Z.ai এর reasoning-মডেল
২০২৬ সালের সেপ্টেম্বরে Gonka নেটওয়ার্কে একটি নতুন কার্যকরী মডেল যুক্ত হয়েছে — চীনের Z.ai ল্যাবের GLM-5.3 Flash। এটি যোগ করার জন্য গভর্নেন্স প্রস্তাব #101 পাশ হয়, হোস্টরা ওয়েট লোড করে এবং মডেলটি MiniMax M2.7 এবং DeepSeek V4 Flash-এর পাশাপাশি আমাদের গেটওয়েতে উপলব্ধ হয়। একই সময়ে Kimi K2.6 নেটওয়ার্ক থেকে বিদায় নেয় এবং ফ্ল্যাগশিপ GLM-5.2, যা দীর্ঘ সময় ধরে ডেপ্লয়মেন্টের অপেক্ষায় ছিল, তা মূল নেটওয়ার্কে যুক্ত হয়নি — নেটওয়ার্ক একই লাইনের একটি হালকা মডেল বেছে নিয়েছে।
GLM-5.3 Flash নেটওয়ার্কের অন্যান্য মডেল থেকে একটি প্রধান বৈশিষ্ট্যে আলাদা: এটি একটি reasoning-মডেল। উত্তর দেওয়ার আগে এটি চিন্তা করে — এবং এই চিন্তা বা রিজনিংয়ের জন্য টোকেন ও সময় খরচ হয় এবং সঠিক রিকোয়েস্ট সেটিংসের প্রয়োজন হয়। যারা max_tokens: 200 দিয়ে «সংক্ষিপ্ত উত্তরের» জন্য রিকোয়েস্ট করেন, তারা খালি উত্তর পেতে পারেন। আমরা বিস্তারিত আলোচনা করব এই মডেলটি কী, Gonka নেটওয়ার্কে এর বৈশিষ্ট্য কী, রিজনিং বাজেট কীভাবে কাজ করে, টুলস এবং JSON-এর অবস্থা, এর খরচ এবং কখন অন্যান্য মডেলের পরিবর্তে এটি ব্যবহার করা উচিত।
GLM-5.3 Flash কী এবং এর পেছনে কারা আছে
Z.ai — আন্তর্জাতিক ব্র্যান্ড যা বেইজিং-এর Zhipu AI ল্যাব থেকে এসেছে, যা সিংহুয়া বিশ্ববিদ্যালয় থেকে উদ্ভূত। GLM পরিবারটি ২০২৩ সাল থেকে (ChatGLM) বিকশিত হচ্ছে এবং ২০২৫-এর গ্রীষ্মে GLM-4.5 আসার পর থেকে কোম্পানি তাদের ফ্ল্যাগশিপ মডেলগুলোর ওজন MIT লাইসেন্সের অধীনে প্রকাশ করছে, যার ফলে এই সিরিজটি বিশ্বের অন্যতম গুরুত্বপূর্ণ ওপেন ওয়েট মডেল সিরিজে পরিণত হয়েছে। Z.ai-এর নিজস্ব পণ্য যেমন ZCode ডেভেলপমেন্ট এনভায়রনমেন্ট এবং GLM Coding Plan সাবস্ক্রিপশন এই মডেলগুলোর ওপর ভিত্তি করেই তৈরি।
GLM-5.3 Flash হলো ৫.৩ সিরিজের একটি হালকা মডেল। এখানে "হালকা" কথাটি আপেক্ষিক: এটি একটি MoE-মডেল, যার মোট ৩২০ বিলিয়ন প্যারামিটার রয়েছে, যার মধ্যে প্রতিটি টোকেনের জন্য প্রায় ১৮ বিলিয়ন প্যারামিটার সক্রিয় হয়। এর ওজনগুলো FP8 ফরম্যাটে বিতরণ করা হয়েছে এবং লাইসেন্সটি MIT। এর আর্কিটেকচারাল বৈশিষ্ট্য হলো হাইব্রিড অ্যাটেনশন: কিছু লেয়ার স্পার্স (sparse) অ্যাটেনশন ব্যবহার করে এবং কিছু লিনিয়ার, যা ক্লাসিক ফুল অ্যাটেনশনের তুলনায় দীর্ঘ কনটেক্সটের জন্য মেমোরি এবং সময় খরচ উল্লেখযোগ্যভাবে কমিয়ে আনে।
মডেলের আচরণ নির্ধারণকারী দ্বিতীয় বৈশিষ্ট্য হলো ইনবিল্ট রিজনিং (reasoning)। GLM-5.3 Flash প্রথমে চিন্তা করতে এবং তারপর উত্তর দিতে প্রশিক্ষিত: রিজনিং বা চিন্তার প্রক্রিয়াটি উত্তরের থেকে আলাদা করা হয়েছে এবং একটি আলাদা ফিল্ডে ক্লায়েন্টের কাছে পাঠানো হয়। রিজনিং-এর বিষয়টি reasoning_effort প্যারামিটারের মাধ্যমে চালু বা বন্ধ করা যায় এবং ডিফল্টভাবে এটি ফুল মোডে থাকে। এটি মডেলটিকে জটিল লজিক বোঝার কাজে শক্তিশালী করে তোলে, তবে এটি রিকোয়েস্ট সেটিংসের ক্ষেত্রে কিছুটা চাহিদাবহুল, যা নিচে আলোচনা করা হলো।
"Flash" এবং অরিজিনাল GLM-5.3-এর মধ্যে পার্থক্য ভেন্ডরের প্রাইসিংয়ে স্পষ্ট: প্রকাশের সময় OpenRouter-এ Flash-এর দাম প্রতি মিলিয়ন ইনপুট টোকেনের জন্য $০.০৯ এবং আউটপুট টোকেনের জন্য $০.৩০, যেখানে বড় মডেলটির দাম $১.৪০ এবং $৪.৪০। Gonka নেটওয়ার্কে এই পার্থক্য নেই: নেটওয়ার্কের সমস্ত মডেল একটি একক রেটে পাওয়া যায়।
Gonka নেটওয়ার্কে GLM-5.3 Flash-এর বৈশিষ্ট্য
নেটওয়ার্কের অন্যান্য মডেলগুলির মতোই, 'আউট-অফ-দ্য-বক্স' মডেলের বৈশিষ্ট্য এবং নির্দিষ্ট ডেপ্লয়মেন্টের কাজের প্যারামিটারগুলির মধ্যে পার্থক্য করা গুরুত্বপূর্ণ: এগুলি নেটওয়ার্ক GPU-হোস্টে vLLM-inferenced কনফিগারেশন দ্বারা সেট করা হয়। আমাদের Gateway-এর মাধ্যমে প্রকৃত মানগুলি নিম্নরূপ:
- কনটেক্সট উইন্ডো: ৩৯০,০০০ টোকেন। এটি আমাদের অনুসন্ধানের মাধ্যমে প্রমাণিত সর্বনিম্ন মান, মডেল কার্ডের কোনো সংখ্যা নয়: ৩৯০,০১৩ টোকেনের ইনপুট গৃহীত এবং প্রসেস করা হয়েছে, বড় prefill আমরা সরাসরি নেটওয়ার্ক হোস্টগুলিতে চালিয়েছি। হোস্টের টেকনিক্যাল সেটিংস ৪০০,০০০ পর্যন্ত অনুমতি দেয়, তবে আমরা যা যাচাই করেছি তা প্রকাশ করছি।
- সর্বোচ্চ আউটপুট: প্রতি রেসপন্সে ৮,১৯২ টোকেন। গুরুত্বপূর্ণ: এই লিমিটের মধ্যে যুক্তির টোকেন (reasoning tokens) এবং মূল উত্তর উভয়ই অন্তর্ভুক্ত। যে মডেলটি ৪০৯৬ লিমিটের মধ্যে ৩০০০ টোকেন চিন্তা করেছে, সেটি উত্তরের জন্য মাত্র এক হাজার টোকেন অবশিষ্ট রাখবে।
- Reasoning এবং tool calling: মডেলটি reasoning পার্সার এবং tool calling পার্সার সহ ডেপ্লয় করা হয়েছে — যুক্তিগুলি
reasoning_contentফিল্ডে আসে এবং টুলের কলগুলি স্ট্যান্ডার্ডtool_callsফিল্ডে আসে, যেমন যেকোনো OpenAI-সম্মত মডেলে থাকে। - গতি: আমাদের গেটওয়ে পরিমাপে, প্রথম টোকেনটি প্রায় ০.৭৫ সেকেন্ডে আসে, লোডের ওপর নির্ভর করে জেনারেশনের গতি প্রতি সেকেন্ডে ২৫–৪৪ টোকেন হয়। একটি reasoning-মডেলের জন্য এটি দ্রুত — তবে মনে রাখবেন যে প্রথম কয়েকশ টোকেন যুক্তিতে ব্যয় হবে এবং দৃশ্যমান উত্তর পরে শুরু হবে।
- হোস্টের VRAM প্রয়োজনীয়তা: প্রতি প্রতিলিপিতে প্রায় ৫৬০ জিবি (on-chain মডেল প্যারামিটার অনুযায়ী) — যা MiniMax M2.7 (৩২০ জিবি) এবং DeepSeek V4 Flash (২৮০ জিবি) এর চেয়ে বেশি। হার্ডওয়্যারের থ্রেশহোল্ড যত বেশি, তত কম হোস্ট মডেলটি ডেপ্লয় করতে সক্ষম, যা নেটওয়ার্কে এর ধারণক্ষমতাকে সরাসরি প্রভাবিত করে — এ বিষয়ে сценарии (scenarios) এবং সীমাবদ্ধতার বিভাগে বিস্তারিত বলা হয়েছে।
Gonka নেটওয়ার্কে ইনফারেন্সের দাম মডেল নির্বাচনের ওপর নির্ভর করে না: GLM-5.3 Flash একই রেটে উপলব্ধ যা MiniMax M2.7 এবং DeepSeek V4 Flash-এর ক্ষেত্রে প্রযোজ্য — JoinGonka Gateway-এর মাধ্যমে এটি প্রতি মিলিয়ন ইনপুট টোকেনের জন্য $0.0069 এবং আউটপুট টোকেনের জন্য $0.021। যুক্তির টোকেনগুলি (reasoning tokens) আউটপুট টোকেন হিসেবে চার্জ করা হয়। নেটওয়ার্ক অর্থনীতি একটি আলাদা বিষয়: মূল্য বিক্রেতার দামের পরিবর্তে কম্পিউটেশনাল কাজের গণনার ভিত্তিতে নির্ধারিত হয়।
রিজনিং এবং টোকেন বাজেট: কীভাবে খালি উত্তর পাবেন না
GLM-5.3 Flash-এর সাথে প্রথমবার ব্যবহারের সময় সবচেয়ে সাধারণ ভুলটি হলো: একজন ডেভেলপার সাধারণ max_tokens: 256 সেটিংস দিয়ে একটি ছোট প্রশ্ন পাঠান, যার ফলে finish_reason: "length" এবং একটি খালি content ফিল্ড ফিরে আসে। এখানে কোনো সমস্যা নেই — মডেলটি তার সমস্ত লিমিট রিজনিং-এ খরচ করে ফেলেছে এবং উত্তরের জন্য আর জায়গা থাকেনি। আমাদের পরিমাপ অনুযায়ী, একটি সাধারণ প্রশ্নের জন্যও রিজনিং-এ ২৫০–৪৫০ টোকেন খরচ হয়, এবং জটিল কাজে এটি কয়েক হাজার পর্যন্ত হতে পারে।
তিনটি ব্যবহারিক নিয়ম:
| সেটিং | সুপারিশ | কেন |
|---|---|---|
max_tokens | ছোট উত্তরের জন্য অন্তত ৬০০; বাস্তব কাজের জন্য ২০০০-এর বেশি | রিজনিং এবং উত্তর উভয়ের জন্যই লিমিটটি সাধারণ; রিজনিং প্রথম শত শত টোকেন খেয়ে ফেলে |
stream | সম্ভব হলে সব জায়গায় true রাখুন | রিজনিং এবং উত্তর জেনারেশনের সাথে সাথে আসে: প্রগ্রেস দেখা যায়, "ফাঁকা স্ক্রিন"-এর অপেক্ষা থাকে না এবং দীর্ঘ উত্তরগুলো প্রক্সি টাইমআউটে আটকে যায় না |
reasoning_effort | রিজনিং প্রয়োজন না হলে low; প্রয়োজনে কিছুই না লিখলে ডিফল্ট কাজ করবে | এটি একটি বাইনারি সুইচ: low রিজনিং বন্ধ করে, অন্য যেকোনো মান এটিকে ফুল মোডে রাখে। গেটওয়ে none এবং minimal-কে low হিসেবে গণ্য করে, আর medium, high, xhigh এবং max-কে অতিরিক্ত ধরে বাদ দেয়। নেটওয়ার্ক enable_thinking, chat_template_kwargs, reasoning.enabled এবং thinking.type ফিল্ডগুলো উপেক্ষা করে |
একটি ছোট কাজের জন্য রিকোয়েস্টের উদাহরণ — সীমিত রিজনিং এবং পর্যাপ্ত লিমিটসহ:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-ваш-ключ" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"reasoning_effort": "low",
"max_tokens": 800,
"messages": [{"role": "user", "content": "অস্ট্রেলিয়ার রাজধানী এক শব্দে বলো"}]
}'উত্তরে রিজনিং message.reasoning_content-এ থাকে এবং মূল উত্তরটি message.content-এ থাকে; স্ট্রিমিংয়ের সময় সেগুলো আলাদা ডেল্টা হিসেবে আসে। বেশিরভাগ OpenAI-সামঞ্জস্যপূর্ণ ক্লায়েন্ট অজানা ফিল্ডগুলো নীরবে উপেক্ষা করে, তাই রিজনিং উত্তরের টেক্সটের সাথে মিশে যায় না — তবে সেগুলো completion_tokens হিসেবে গণনা করা হয় এবং আউটপুট টোকেন হিসেবে চার্জ করা হয়। যদি রিজনিং একেবারেই প্রয়োজন না হয়, তবে GLM-5.3 Flash সেরা পছন্দ নয়: দ্রুত ছোট উত্তরের জন্য MiniMax M2.7 বেশি সাশ্রয়ী।
এজেন্টিক সিনারিওর জন্য একটি বিশেষ সতর্কতা: Cline বা Cursor-এর মতো টুলগুলো অনেক সময় সার্ভিস রিকোয়েস্টের জন্য ছোট আউটপুট লিমিট সেট করে — যেমন কনটেক্সট কমপ্রেশন বা ডায়ালগ টাইটেল জেনারেশন। যদি এমন রিকোয়েস্ট কয়েকশ টোকেনের লিমিটসহ GLM-5.3 Flash-এ পাঠানো হয়, তবে তা খালি ফিরে আসবে। টুলের লিমিট সেটিংস পরীক্ষা করুন অথবা সার্ভিস রিকোয়েস্টগুলো নেটওয়ার্কের অন্য মডেলের মাধ্যমে পাঠান।
টুলস, JSON এবং অন্যান্য নেটওয়ার্ক মডেলের সাথে তুলনা
Reasoning-মডেলগুলি মাঝে মাঝে এজেন্ট ফ্রেমওয়ার্কের সাথে ভালো খাপ খায় না: কারণ reasoning বা যুক্তি প্রদানের প্রক্রিয়া টুল কলগুলির মাঝে বাধা সৃষ্টি করে এবং ফরম্যাট নষ্ট করে দেয়। GLM-5.3 Flash-এর সাথে আমরা সম্পূর্ণ এজেন্ট সাইকেল চালিয়ে দেখেছি — টুলের বর্ণনা, কল, ফলাফল ফেরত, এবং দ্বিতীয় রাউন্ডের কল — এটি OpenAI-সামঞ্জস্যপূর্ণ পথে স্বাভাবিকভাবে কাজ করে: কলগুলি tool_calls-এ গঠনমূলকভাবে আসে, আর্গুমেন্টগুলি বৈধ থাকে এবং দ্বিতীয় রাউন্ডে হিস্ট্রি গুলিয়ে যায় না। JSON মোডও (response_format: {"type": "json_object"}) কাজ করে — মডেলটি একটি বৈধ অবজেক্ট প্রদান করে এবং reasoning বা যুক্তি প্রদানের অংশটি উত্তরের বাইরে থাকে। এজেন্টদের জন্য একই বাজেটের নিয়ম প্রযোজ্য: আউটপুট লিমিট পর্যাপ্ত রাখতে হয়, অন্যথায় টুল কল মাঝপথে বন্ধ হয়ে যেতে পারে।
নেটওয়ার্কের অন্য দুটি মডেলের সাথে GLM-5.3 Flash-এর তুলনা:
| প্যারামিটার | GLM-5.3 Flash | MiniMax M2.7 | DeepSeek V4 Flash |
|---|---|---|---|
| নেটওয়ার্কে কনটেক্সট | ৩৯০,০০০ | ২০০,০০০ | ৩৮০,০০০ |
| প্রতি রেসপন্স আউটপুট | ৮,১৯২ | ৮,১৯২ | ৩২,৭৬৮ |
| আর্কিটেকচার | MoE 320B (~১৮B অ্যাক্টিভ), হাইব্রিড অ্যাটেনশন | MoE + লিনিয়ার অ্যাটেনশন | MoE ২৮৪B (~১৩B অ্যাক্টিভ) |
| প্রতি রেপ্লিকা VRAM | ৫৬০ GB | ৩২০ GB | ২৮০ GB |
| শক্তিশালী দিক | জটিল লজিক, কোড বিশ্লেষণ, "চিন্তা" করার কাজ; নেটওয়ার্কের দীর্ঘতম কনটেক্সট | দৈনন্দিন কাজ, দ্রুত ছোট উত্তর, ডিফল্ট মডেল | নেটওয়ার্কের দ্বিতীয় দীর্ঘতম কনটেক্সট, দীর্ঘতম আউটপুট, এজেন্ট কোডিং |
| Gateway-এর মাধ্যমে মূল্য | একই — $0.0069 ইনপুট / $0.021 আউটপুট প্রতি 1M-এর জন্য | ||
একই মূল্যের ব্যবহারিক ফলাফল আগের মতোই: বাজেট অনুযায়ী নয়, বরং কাজের ধরন অনুযায়ী মডেল নির্বাচন করা হয়। জটিল লজিক নিয়ে চিন্তার প্রয়োজন হলে — GLM-5.3 Flash; পুরো রিপোজিটরি পড়ার প্রয়োজন হলে — DeepSeek V4 Flash; দ্রুত ও সঠিক উত্তর প্রয়োজন হলে — MiniMax M2.7।
JoinGonka Gateway এর মাধ্যমে GLM-5.3 Flash কীভাবে ব্যবহার করবেন
মডেলটি JoinGonka Gateway এর মাধ্যমে OpenAI এবং Anthropic-সামঞ্জস্যপূর্ণ API ব্যবহার করে অ্যাক্সেস করা যায়। মডেল শনাক্তকারী (ID): zai-org/GLM-5.3-Flash। নিবন্ধনের পরপরই ড্যাশবোর্ড থেকে jg-… ফরম্যাটের একটি কি (key) তৈরি করা যায়; নতুন অ্যাকাউন্টগুলোতে 3M ফ্রি টোকেন দেওয়া হয় — যা আপনার নিজের প্রজেক্টে মডেলটি পরীক্ষা করে দেখার এবং বাজেটের হিসাব মেলানোর জন্য যথেষ্ট।
সরাসরি API কল (OpenAI-ফরম্যাট, স্ট্রিম সক্ষম করা—reasoning-মডেলের জন্য এটিই প্রস্তাবিত মোড):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-আপনার-কি" \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"stream": true,
"max_tokens": 4000,
"messages": [{"role": "user", "content": "এই ফাংশনে ভুলটি খুঁজে বের করুন এবং ব্যাখ্যা করুন: …"}]
}'ডেভেলপমেন্ট টুলের ক্ষেত্রে, নেটওয়ার্কের অন্যান্য মডেলের মতোই এই মডেলটি যুক্ত করা যায়: base URL https://gate.joingonka.ai/v1, jg-… কি এবং মডেল শনাক্তকারী ব্যবহার করুন। Cursor, Claude Code, Cline, Continue এবং অন্যান্য টুলের জন্য গাইডগুলো «Tools» সেকশনে দেওয়া আছে; npx @joingonka/setup ইনস্টলারটি এক কমান্ডেই টুলের কনফিগারেশনে গেটওয়ে যুক্ত করে দেবে। Anthropic Messages API ব্যবহারকারী ক্লায়েন্টদের জন্য কেবল ANTHROPIC_BASE_URL=https://gate.joingonka.ai সেট করলেই যথেষ্ট।
নিবন্ধন ছাড়াই পরীক্ষা করতে চাইলে ফ্রি চ্যাট ব্যবহার করুন: মডেলের তালিকা থেকে GLM-5.3 Flash নির্বাচন করুন — সেখানে চিন্তার প্রক্রিয়াগুলো একটি আলাদা কোলাপসিবল ব্লকে দেখানো হয়, যাতে বোঝা যায় উত্তর দেওয়ার আগে মডেলটি কতটা সময় «চিন্তা» করছে।
কখন GLM-5.3 Flash ব্যবহার করবেন — পরিস্থিতি এবং বিবেচ্য বিষয়
এই মডেলের জন্য শক্তিশালী ব্যবহারের ক্ষেত্র:
- চিন্তা করার প্রয়োজন এমন কাজ। জটিল বিজনেস লজিক বিশ্লেষণ, অস্পষ্ট বাগ খোঁজা, ডেটা স্কিমা ডিজাইন করা, গণিত এবং মাল্টি-স্টেপ সিদ্ধান্ত গ্রহণ—যা রিজনিং মডেলের প্রধান কাজ। এখানে রিজনিংয়ের মাধ্যমে উত্তরের মান অনেক বেশি পাওয়া যায়।
- কোড রিভিউ এবং ব্যাখ্যা। মডেলটি অন্যের কোড বিস্তারিত বিশ্লেষণ করে এবং মন্তব্যের স্বপক্ষে যুক্তি দেয়, আর
reasoning_contentথেকে প্রাপ্ত রিজনিংয়ের ধারা ব্যবহারকারীকে "কেন আমি এই সিদ্ধান্ত নিয়েছি" তা বোঝানোর জন্য দেখানো যেতে পারে। - যাচাইসহ স্ট্রাকচার্ড এক্সট্রাকশন। JSON মোড এবং রিজনিং একসাথে ব্যবহার করলে অস্পষ্ট ইনপুট ডেটা থেকে চিন্তাবিহীন উত্তরের তুলনায় অনেক নির্ভুল ফলাফল পাওয়া যায়।
- "প্ল্যানার" রোলসহ এজেন্ট পাইপলাইন। একাধিক মডেলের সমন্বয়ে GLM-5.3 Flash কে সেখানে রাখুন যেখানে "কী করতে হবে" তা নির্ধারণ করা হয়, আর দ্রুত এক্সিকিউশনের কাজ MiniMax M2.7 কে দিন।
কখন নেটওয়ার্কের অন্য মডেল ব্যবহার করা যুক্তিযুক্ত: দ্রুত ও ছোট উত্তর, অটো-কমপ্লিশন এবং বিশাল পরিমাণে সস্তা রিকোয়েস্টের জন্য—MiniMax M2.7 (সেখানে রিজনিং শুধু দেরি এবং খরচ বাড়ায়); যেসব ডকুমেন্ট এবং রিপোজিটরি একটি রিকোয়েস্টের মধ্যে পুরোটা ফিট করতে হয়, সেগুলোর জন্য—380K কনটেক্সটসহ DeepSeek V4 Flash।
লোড পরিবর্তনের আগে যা মনে রাখা জরুরি। GLM-5.3 Flash নেটওয়ার্কের সবচেয়ে নতুন এবং হার্ডওয়্যারের দিক থেকে সবচেয়ে ভারী মডেল, এবং বর্তমানে এটি কেবল অল্প সংখ্যক হোস্টে চলছে। এর অর্থ হলো MiniMax M2.7 এবং DeepSeek V4 Flash এর তুলনায় এর ধারণক্ষমতা কিছুটা কম: পিক আওয়ারে রিকোয়েস্টগুলো ফ্রি স্লটের জন্য বেশিক্ষণ অপেক্ষা করতে পারে অথবা ওভারলোডের মেসেজ পেতে পারে, যা কয়েক সেকেন্ড পর পুনরায় চেষ্টা করা উচিত। দ্বিতীয় সীমাবদ্ধতা হলো সময়: যে প্রোভাইডার বর্তমানে নেটওয়ার্কের এই মডেলটি প্রদান করছে, তারা জেনারেশনের প্রায় পাঁচ মিনিট পর রেসপন্স বন্ধ করে দেয়; প্রতি সেকেন্ডে 25–44 টোকেন স্পিডে এটি প্রায় 7–10 হাজার টোকেন, তাই দীর্ঘ জেনারেশনগুলোকে ছোট ছোট ধাপে ভাগ করে নেওয়া ভালো। নেটওয়ার্কের গঠন ভোটিংয়ের মাধ্যমে পরিবর্তিত হয়, তাই মডেলের বর্তমান তালিকা এবং তাদের লিমিট সবসময় লাইভ GET https://gate.joingonka.ai/v1/models থেকে দেখুন, এবং বর্তমান প্রাপ্যতা ও ল্যাটেন্সি দেখুন গেটওয়ে স্ট্যাটাস পেজে। একই দামের কারণে এক্সপেরিমেন্ট করতে কোনো খরচ নেই: মডেল সুইচ করা মানে রিকোয়েস্টের একটি লাইন পরিবর্তন করা।
আরও জানতে চান?
অন্যান্য বিভাগগুলি অন্বেষণ করুন অথবা এখনই GNK উপার্জন শুরু করুন।
Gateway-এর মাধ্যমে GLM-5.3 Flash ব্যবহার করে দেখুন →