জ্ঞানকোষের বিভাগসমূহ ▾
নেভিগেশন
▸ এখানে শুরু করুন রোল অনুযায়ীবিভাগ
- গঞ্জা নেটওয়ার্কের আর্কিটেকচার: স্প্রিন্ট, ট্রান্সফার এজেন্ট, ডিলোকো
- ডেভেলপারদের জন্য: কিভাবে GNK উপার্জন করবেন
- নিজস্ব হোস্টিং: ধাপে ধাপে গাইড
- Gonka-এর জন্য GPU নির্বাচন: হার্ডওয়্যার সুপারিশ
- Qwen3-235B: যে মডেলটি আগে Gonka সার্ভিস দিতো
- Kimi K2.6: গংকা নেটওয়ার্কের দ্বিতীয় মডেল
- MiniMax M2.7: Gonka নেটওয়ার্কের মডেল
প্রযুক্তি
Qwen3-235B: যে মডেলটি আগে Gonka সার্ভিস দিতো
Qwen3-235B কী?
Qwen3-235B-A22B-Instruct-2507-FP8 হল Qwen3 পরিবারের একটি বৃহৎ ভাষা মডেল (LLM), যা Alibaba Cloud-এর Qwen দল দ্বারা তৈরি করা হয়েছে। সম্পূর্ণ নামটির ব্যাখ্যা হল: Qwen3 — তৃতীয় প্রজন্মের সিরিজ, 235B — মোট 235 বিলিয়ন প্যারামিটার, A22B — প্রতি অনুরোধে 22 বিলিয়ন সক্রিয় প্যারামিটার, Instruct — নির্দেশনা অনুসরণ করার জন্য প্রশিক্ষিত সংস্করণ, 2507 — জুলাই 2025 রিলিজ, FP8 — মেমরি অপ্টিমাইজেশনের জন্য 8-বিট কোয়ান্টিজেশন।
মুখ্য স্থাপত্য বৈশিষ্ট্য হল MoE (Mixture of Experts)। "ঘন" মডেলগুলির (GPT-5.5, Claude Sonnet 4.6) থেকে ভিন্ন, যেখানে প্রতিটি টোকেন সমস্ত প্যারামিটারের মধ্য দিয়ে যায়, MoE-মডেল প্রতিটি অনুরোধের জন্য কেবল "বিশেষজ্ঞদের" একটি উপসেট সক্রিয় করে – নিউরাল নেটওয়ার্কের বিশেষায়িত ব্লক। Qwen3-235B-এর ক্ষেত্রে, 235 বিলিয়ন প্যারামিটারের মধ্যে প্রতিটি টোকেনের জন্য কেবল 22 বিলিয়ন সক্রিয় হয় – 10% এরও কম। এটি 200B+ প্যারামিটার সহ মডেলগুলির স্তরের গুণমান দেয়, 22B মডেলের গণনার খরচ সহ।
ব্যবহারিকভাবে এর অর্থ হল: মডেলটি তার গতির তুলনায় অনেক বেশি স্মার্ট। এটি তুলনামূলক মানের ঘন মডেলগুলির চেয়ে উল্লেখযোগ্যভাবে দ্রুত অনুরোধগুলি প্রক্রিয়া করে, একই সাথে ইনফারেন্সের জন্য অনেক কম VRAM প্রয়োজন হয়। এই কারণেই MoE 2025-2026 সালের বৃহত্তম মডেলগুলির জন্য একটি প্রভাবশালী স্থাপত্য হয়ে উঠেছে।
Qwen3-235B-এর প্রাসঙ্গিক উইন্ডো হল 131,072 টোকেন (~100,000 শব্দ) – এটি একটি একক অনুরোধে সম্পূর্ণ বই, কোডবেস বা দীর্ঘ আইনি নথি বিশ্লেষণের জন্য যথেষ্ট। মডেলটি 119টি ভাষা সমর্থন করে, যার মধ্যে রাশিয়ান, ইংরেজি, চীনা, আরবি, হিন্দি এবং আরও কয়েক ডজন ভাষা রয়েছে – যা এটিকে বাজারের সবচেয়ে বহুভাষিক মডেলগুলির মধ্যে একটি করে তোলে।
বৈশিষ্ট্য এবং বেঞ্চমার্ক
Qwen3-235B সবচেয়ে বড় ক্লোজড ও ওপেন মডেলগুলোর সাথে পাল্লা দিচ্ছে। মূল বৈশিষ্ট্যগুলোর তুলনা নিচে দেওয়া হলো:
| মডেল | প্যারামিটার | কনটেক্সট | MoE | Open Source | খরচ (প্রতি 1M টোকেন) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B অ্যাক্টিভ) | 131K | হ্যাঁ | হ্যাঁ (Apache 2.0) | $0.07+ (হোস্টিং) |
| GPT-5.5 (OpenAI) | ~1.8T (আনুমানিক) | 128K | হ্যাঁ (অনুমানিত) | না | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | প্রকাশিত নয় | 200K | না (অনুমানিত) | না | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B অ্যাক্টিভ) | 1M | হ্যাঁ | হ্যাঁ (Llama License) | $0.20+ (হোস্টিং) |
| DeepSeek-R1 (DeepSeek) | 671B (37B অ্যাক্টিভ) | 128K | হ্যাঁ | হ্যাঁ (MIT) | $0.55 |
Qwen3-235B অধিকাংশ বেঞ্চমার্কে GPT-5.5 এবং Claude Sonnet 4.6-এর সমতুল্য মানের পারফরম্যান্স দেখায়। একটি open-weights MoE-মডেল হিসেবে এটি বাণিজ্যিক বিকল্পের তুলনায় অনেক সস্তা: MoE-আর্কিটেকচার প্রতিটি অনুরোধে মাত্র কিছু প্যারামিটার সক্রিয় করে এবং কম্পিউট খরচ কমায়। Gonka নেটওয়ার্ক একইভাবে তাদের বর্তমান মডেলগুলোতে — Kimi K2.6 এবং MiniMax M2.7 — এই ডিসেন্ট্রালাইজড inference প্রয়োগ করে, যা JoinGonka Gateway-এর মাধ্যমে $0.003 প্রতি 1M টোকেনে পাওয়া যায় (যা GPT-5.5 এবং Claude-এর চেয়ে হাজার গুণ সস্তা)।
MMLU-Pro, HumanEval, MATH-500 এবং GSM8K বেঞ্চমার্কে মডেলটি সেরা তিনটি ওপেন-সোর্স মডেলের একটি, যদিও গাণিতিক যুক্তির (reasoning) ক্ষেত্রে DeepSeek-R1-এর চেয়ে কিছুটা পিছিয়ে। কোড জেনারেশন, অনুবাদ এবং নির্দেশাবলী পালনের ক্ষেত্রে Qwen3-235B ধারাবাহিকভাবে Llama 4 Maverick-এর চেয়ে এগিয়ে এবং Claude Sonnet 4.6-এর সমতুল্য।
Gonka যেভাবে Qwen3-235B ব্যবহার করত
যখন Qwen3-235B নেটওয়ার্কের প্রধান মডেল ছিল, তখন এটি Gonka নেটওয়ার্কে ডিস্ট্রিবিউটেড পদ্ধতিতে কাজ করত — DiLoCo প্রোটোকলের মাধ্যমে, যা inference-এর জন্য অ্যাডাপ্ট করা হয়েছিল। FP8 ফরম্যাটে সম্পূর্ণ মডেলটির জন্য প্রায় 640 GB ভিডিও মেমরি (VRAM) প্রয়োজন, যা একটি সিঙ্গেল GPU-তে রাখা অসম্ভব — এমনকি H100 80GB বা H200 141GB-ও যথেষ্ট নয়। তাই মডেলটিকে একাধিক ML-নোডের মধ্যে লেয়ার অনুযায়ী ভাগ করা হয়েছিল (tensor parallelism + pipeline parallelism)।
বাস্তবিক ক্ষেত্রে, Qwen3-235B ৮-১৬টি GPU-নোডের একটি ক্লাস্টারে কাজ করত, যার প্রতিটিতে কমপক্ষে 40 GB VRAM ছিল। Transfer Agents রিকোয়েস্টটিকে সঠিক ক্লাস্টারে রাউট করত, প্রতিটি নোডের vLLM মডেলের নিজস্ব অংশ প্রসেস করত, এবং ফলাফলগুলো একত্রিত করে ব্যবহারকারীর কাছে পাঠানো হতো। পুরো প্রক্রিয়াটি কয়েকশ মিলিসেকেন্ড সময় নিত — ব্যবহারকারী বুঝতেই পারতেন না যে তার রিকোয়েস্টটি পৃথিবীর বিভিন্ন প্রান্তের দশটি GPU দ্বারা প্রসেস করা হয়েছে। নেটওয়ার্কটি সেই একই ডিস্ট্রিবিউটেড inference নীতি এখন বর্তমান মডেলগুলোর ক্ষেত্রেও ব্যবহার করে।
একটি গুরুত্বপূর্ণ প্রযুক্তিগত বিবরণ: Gonka serving-এর ইঞ্জিন হিসেবে vLLM ব্যবহার করে। vLLM একটি ওপেন-সোর্স প্রজেক্ট, যা PagedAttention-এর মাধ্যমে হাই-পারফরম্যান্স টেক্সট জেনারেশন নিশ্চিত করে — এটি এমন একটি অ্যালগরিদম যা একাধিক রিকোয়েস্ট একসাথে প্রসেস করার সময় ভিডিও মেমরির ব্যবহার অপ্টিমাইজ করে। এটি নেটওয়ার্কটিকে গুণমান অবনতি ছাড়াই হাজার হাজার গ্রাহককে সেবা দেওয়ার সুবিধা দেয়।
মডেলটি native tool calling সাপোর্ট করে — অর্থাৎ মডেলের উত্তরের মাধ্যমেই সরাসরি ফাংশন এবং টুল কল করা। এই সক্ষমতাটি Gonka-তে PR #767 এর মাধ্যমে যোগ করা হয়েছিল, যেখানে টুল কল শনাক্ত করার জন্য থ্রেশহোল্ড ছিল 0.958। Qwen3-235B-তে এটি ডেভেলপারদের এমন AI-এজেন্ট তৈরি করতে সাহায্য করত যা বাইরের API, ডাটাবেস এবং টুলগুলোর সাথে একটি সিঙ্গেল রিকোয়েস্টের মাধ্যমে ইন্টারঅ্যাক্ট করতে পারে। টুল কলিং সাপোর্ট বর্তমান মডেলগুলোতেও বজায় রাখা হয়েছে।
Gonka নেটওয়ার্কে 4 000-এর বেশি GPU (H100, H200, A100, RTX 4090 এবং অন্যান্য) রয়েছে, যা ১২০+ ML-নোডে যুক্ত। এটি AI inference-এর জন্য বিশ্বের অন্যতম বৃহত্তম ডিস্ট্রিবিউটেড GPU নেটওয়ার্ক — এবং আগে এই ক্ষমতাটি Qwen3-235B-এর জন্য নির্ধারিত থাকলেও, আজ এটি নেটওয়ার্কের বর্তমান মডেল, Kimi K2.6 এবং MiniMax M2.7-কে সেবা দিচ্ছে।
এখন কি Qwen3-235B ব্যবহার করা সম্ভব?
সরাসরি উত্তর: Gonka নেটওয়ার্কের মাধ্যমে — এখন আর সম্ভব নয়। Qwen3-235B নেটওয়ার্ক থেকে সরিয়ে নেওয়া হয়েছে, তাই আমাদের Gateway-এর মাধ্যমে qwen3-235b-a22b আইডি দিয়ে আর কল করা যাবে না। মডেলটি যেহেতু ওপেন (Apache 2.0), আপনি এটি নিজে রান করতে পারেন অথবা ওপেন-ওয়েট মডেল হোস্টিংয়ের মাধ্যমে অ্যাক্সেস করতে পারেন — উদাহরণস্বরূপ, OpenRouter (প্রতি 1M টোকেনে প্রায় $0.071/$0.100)।
আপনি যদি সেই সস্তা ডিসেন্ট্রালাইজড inference চান যার জন্য সবাই Gonka ব্যবহার করে — সেটি এখনো আছে, শুধু এখন নেটওয়ার্কের বর্তমান মডেলগুলোতে কাজ করে। JoinGonka API Gateway-এর মাধ্যমে Kimi K2.6 এবং MiniMax M2.7 OpenAI-সামঞ্জস্যপূর্ণ API-এর সাথে পাওয়া যাচ্ছে: OpenAI-এর জন্য লেখা যেকোনো কোড কোনো পরিবর্তন ছাড়াই এখানে কাজ করে — শুধু URL, API-কি এবং মডেলের নাম পরিবর্তন করলেই হবে।
চলমান মডেলের অনুরোধের উদাহরণ:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoE-আর্কিটেকচার ব্যাখ্যা করো"}]
}'খরচ: প্রতি 1 মিলিয়ন টোকেনে $0.003 — এটি GPT-5.5 ($5.00/1M)-এর চেয়ে ১,৭০০ গুণ এবং Claude Sonnet 4.6 ($3.00/1M)-এর চেয়ে ১,০০০ গুণ সস্তা। রেজিস্ট্রেশনের সময় আপনি টেস্টিংয়ের জন্য ১০ মিলিয়ন ফ্রি টোকেন পাবেন।
Gateway জনপ্রিয় ডেভেলপমেন্ট টুলগুলোর সাথে সামঞ্জস্যপূর্ণ: Quick Start-এ Python, Node.js এবং curl-এর মাধ্যমে কানেকশন বর্ণনা করা হয়েছে। এছাড়াও IDE ইন্টিগ্রেশন — Cursor, Continue, Cline, Aider এবং Claude Code — এবং AI-এজেন্ট ফ্রেমওয়ার্ক — LangChain, n8n, LibreChat, Open WebUI সাপোর্ট করা হয়।
দ্রুত শুরুর জন্য:
- gate.joingonka.ai-এ রেজিস্টার করুন (ওয়ালেট কানেক্ট করুন বা নতুন তৈরি করুন)
- Dashboard থেকে API-কি সংগ্রহ করুন
- আপনার কোডে
api.openai.com-এর পরিবর্তেgate.joingonka.ai/apiব্যবহার করুন - বর্তমান নেটওয়ার্ক মডেলটি উল্লেখ করুন —
moonshotai/Kimi-K2.6বাMiniMaxAI/MiniMax-M2.7(সম্পূর্ণ লিস্টGET /v1/modelsএন্ডপয়েন্টে পাওয়া যাবে)
একটি হবি প্রজেক্টের খরচে এন্টারপ্রাইজ-লেভেল ডিসেন্ট্রালাইজড inference এখনো বিদ্যমান — Qwen3-235B কেবল নতুন মডেলগুলোর জন্য জায়গা ছেড়ে দিয়েছে। একই দাম ও মানের সুবিধা এখন Kimi K2.6 এবং MiniMax M2.7-এর মাধ্যমে পাওয়া যাচ্ছে।
আরও জানতে চান?
অন্যান্য বিভাগগুলি অন্বেষণ করুন অথবা এখনই GNK উপার্জন শুরু করুন।
Gonka-এর বর্তমান মডেলগুলো ট্রাই করুন →