علم کے مرکز کے حصے ▾
نیویگیشن
▸ یہاں سے شروع کریں کردار کے لحاظ سےزمرہ جات
- Cursor + Gonka AI – کوڈنگ کے لیے سستا LLM
- Claude Code + Gonka AI – ٹرمینل کے لیے LLM
- OpenClaw + Gonka AI – سستے AI ایجنٹس
- OpenCode: ٹرمینل میں اپنا ماڈل
- Continue.dev + Gonka AI – VS Code/JetBrains کے لیے AI
- Cline + Gonka AI – VS Code میں AI ایجنٹ
- Aider + Gonka AI – AI کے ساتھ جوڑا پروگرامنگ
- LangChain + Gonka AI – AI ایپلیکیشنز بہت کم قیمت پر
- n8n + Gonka AI – سستے AI کے ساتھ آٹومیشن
- Open WebUI + Gonka AI – اپنا ChatGPT
- LibreChat + Gonka AI — اوپن سورس ChatGPT
- Hermes Agent + DeepSeek, Gonka نیٹ ورک پر — انتہائی کم قیمت میں خودمختار ایجنٹ
- Kilo Code + Gonka AI — VS Code میں AI ایجنٹ
- Roo Code + Gonka AI — VS Code میں خودمختار AI ایجنٹ
- لاما انڈیکس + گونکا AI — RAG-ایپلی کیشنز صرف چند روپے میں
- PydanticAI + گونکا — ٹائپ شدہ AI-ایجنٹ صرف چند روپے میں
- Vercel AI SDK + گونکا AI — TypeScript پر AI-ایپلی کیشنز صرف چند روپے میں
- TanStack AI + گونکا — TypeScript پر AI-ایپلی کیشنز صرف چند روپے میں
- API فوری آغاز — curl, Python, TypeScript
- JoinGonka Gateway — مکمل جائزہ
- مینجمنٹ کیز — Gonka پر SaaS
- سب سے سستا AI API: 2026 کے فراہم کنندگان کا موازنہ
- Cursor Pro کوٹہ ختم — تجزیہ اور سستا متبادل
- Claude Code سستا ہے — بل کا تجزیہ اور تبدیلی
- Cline پیسے ضائع کر رہا ہے — ایجنٹ اتنا زیادہ خرچ کیوں کرتا ہے
- OpenClaw مہنگا ہے — کیوں ایجنٹ ٹوکن ضائع کرتا ہے اور کیسے بچت کریں
- OpenRouter: سستا متبادل — JoinGonka Gateway کے ساتھ موازنہ
- کوڈنگ 2026 کے لیے بہترین AI-ماڈل: موازنہ اور قیمتیں
- حدود کے بغیر GitHub Copilot کا سستا متبادل
- کریڈٹ اور حدود کے بغیر Windsurf کا سستا متبادل
- 2026 میں AI-ایجنٹس کے لیے سب سے سستا API
- ZCode: GLM Coding Plan کی بجائے سستا GLM-inferenced
- JetBrains IDE + JoinGonka Gateway — کریڈٹس کے بجائے اپنا endpoint
- GitHub Copilot BYOK — کوٹہ کے بجائے اپنے ماڈلز
- Zed + JoinGonka Gateway — ایڈیٹر میں سستا انفیرنس
- Pi + JoinGonka Gateway — سستے انفرنس پر ٹرمینل ایجنٹ
- Codex CLI: سبسکرپشن کے بجائے اپنی کی (key)
ٹولز
لاما انڈیکس + گونکا AI — RAG-ایپلی کیشنز صرف چند روپے میں
LlamaIndex Python میں RAG ایپلیکیشنز اور AI ایجنٹس بنانے کے لیے ایک سرکردہ فریم ورک ہے (اس کا LlamaIndex.TS نامی TypeScript ورژن بھی موجود ہے)۔ یہ دستاویزات کو لوڈ کرنے، چنکنگ، انڈیکسنگ، ویکٹر سرچ اور جوابات جمع کرنے کا کام سنبھالتا ہے — آپ صرف ڈیٹا بیان کرتے ہیں، اور LlamaIndex اسے کسی بھی LLM کے اوپر ایک سوال و جواب کے نظام میں تبدیل کر دیتا ہے۔
ایک مسئلہ یہ ہے کہ انفرنس کی قیمت۔ RAG فطری طور پر بہت زیادہ ٹوکن استعمال کرتا ہے: ہر سوال کے لیے ماڈل کو ایک درخواست اور کچھ تلاش شدہ سیاق و سباق بھیجے جاتے ہیں، اور بڑے مجموعوں کی انڈیکسنگ کے لیے ایمبیڈنگز شامل ہو جاتی ہیں۔ پروڈکشن کی سطح پر، یہ روزانہ ہزاروں درخواستیں بناتی ہیں۔ OpenAI ($2.50–15 فی 1M ٹوکن) یا Anthropic ($3–15 فی 1M) کے ساتھ، ایک سادہ سوال و جواب کا سروس بھی ماہانہ دسیوں ہزار ڈالر کا خرچ بن سکتا ہے۔
LlamaIndex OpenAILike کلاس کے ذریعے کسی بھی OpenAI-compatible اینڈ پوائنٹ کے ساتھ مقامی طور پر کام کرتا ہے۔ اس کا مطلب ہے کہ JoinGonka Gateway صرف چند لائنوں میں کنیکٹ ہو جاتا ہے — بغیر کسی کسٹم پرووائیڈر یا پیچ کے۔ نتیجہ: وہی RAG سسٹم غیر مرکزی Gonka نیٹ ورک کے ذریعے $0.0069/1M ان پٹ ٹوکن (آؤٹ پٹ ×3) پر کام کرتا ہے — جو کلاؤڈ API کے مقابلے میں سینکڑوں اور ہزاروں گنا سستا ہے۔
فوری آغاز: OpenAILike کے ذریعے کنکشن
JoinGonka API-کی: gate.joingonka.ai/register پر رجسٹر کریں — شروع میں ہم دیتے ہیں 3M مفت ٹوکنز — اور Dashboard میں jg-xxx کی بنائیں۔
تنصیب:
pip install llama-index llama-index-llms-openai-likeکسی بھی OpenAI-مطابقت پذیر API کے لیے، LlamaIndex llama_index.llms.openai_like پیکج سے OpenAILike کلاس فراہم کرتا ہے۔ Gonka کے لیے ریکویسٹ کی ایک مختصر مثال:
from llama_index.llms.openai_like import OpenAILike
llm = OpenAILike(
api_base="https://gate.joingonka.ai/v1",
api_key="jg-your-key",
model="MiniMaxAI/MiniMax-M2.7",
is_chat_model=True, # Gonka ایک چیٹ-اینڈ پوائنٹ ہے
is_function_calling_model=True, # مقامی ٹول کالنگ سپورٹڈ ہے
context_window=200000, # نیٹ ورک ماڈلز کے لیے 200K
max_tokens=8192, # Gateway کے ذریعے آؤٹ پٹ کی حد
)
response = llm.complete("RAG کیا ہے، تین جملوں میں وضاحت کریں۔")
print(response)OpenAILike کے بارے میں اہم بات: لازمی طور پر is_chat_model=True درج کریں — ورنہ LlamaIndex ایسے completion-اینڈ پوائنٹ پر جائے گا جو ہمارے پاس نہیں ہے۔ is_function_calling_model=True مقامی ٹول کالز کو فعال کرتا ہے۔ context_window کو ماڈل کے مطابق سیٹ کریں تاکہ LlamaIndex کانٹیکسٹ کو درست طریقے سے کاٹ سکے۔
مثال: کویری انجن کے ساتھ RAG-پائپ لائن
LlamaIndex کا کلاسک منظرنامہ آپ کی دستاویزات کا انڈیکس بنانا اور query_engine کے ذریعے استفسار کرنا ہے۔ گلوبل LLM ایک بار Settings.llm کے ذریعے سیٹ کیا جاتا ہے، اس کے بعد پوری پائپ لائن خود بخود Gonka استعمال کرتی ہے۔
from llama_index.core import (
VectorStoreIndex,
SimpleDirectoryReader,
Settings,
)
from llama_index.llms.openai_like import OpenAILike
from llama_index.embeddings.huggingface import HuggingFaceEmbedding
# 1. Gonka کے ذریعے LLM (ایک بار — عالمی سطح پر)
Settings.llm = OpenAILike(
api_base="https://gate.joingonka.ai/v1",
api_key="jg-آپ-کی-کی",
model="MiniMaxAI/MiniMax-M2.7",
is_chat_model=True,
context_window=200000,
max_tokens=8192,
)
# 2. مقامی ایمبیڈنگز (مفت، بغیر OpenAI کے)
Settings.embed_model = HuggingFaceEmbedding(
model_name="BAAI/bge-small-en-v1.5"
)
# 3. ./data فولڈر سے دستاویزات لوڈ اور انڈیکس کرنا
documents = SimpleDirectoryReader("data").load_data()
index = VectorStoreIndex.from_documents(documents)
# 4. نالج بیس سے استفسار
query_engine = index.as_query_engine()
response = query_engine.query("یہ دستاویز کس بارے میں ہے؟")
print(response)ایمبیڈنگز کے بارے میں اہم نکتہ: ڈیفالٹ طور پر VectorStoreIndex OpenAI کی ایمبیڈنگز (text-embedding-ada-002) استعمال کرتا ہے — یہ OpenAI کے الگ معاوضے والے کالز ہیں، Gonka کے نہیں۔ OpenAI سے مکمل نجات پانے کے لیے، Settings.embed_model کے ذریعے ایک مقامی ماڈل سیٹ کریں (جیسا کہ اوپر کی مثال میں ہے — HuggingFaceEmbedding، پیکیج pip install llama-index-embeddings-huggingface)۔ تب جنریشن Gonka کے ذریعے ہوگی، اور ویکٹرائزیشن مقامی طور پر اور مفت ہوگی۔
لاگت: ایک RAG-پائپ لائن ریکوسٹ (تلاش + جنریشن) تقریباً 2–5K LLM ٹوکن استعمال کرتی ہے۔ Gonka کے ذریعے یہ سینٹ کا معمولی حصہ ہے؛ جو OpenAI/Anthropic کے مقابلے میں 3–4 گنا سستا ہے۔ روزانہ ہزاروں ریکوسٹ پر یہ فرق ہر ماہ ہزاروں ڈالر کی بچت میں بدل جاتا ہے۔
RAG-ورک لوڈ کی لاگت کا موازنہ
RAG-ایپلی کیشن صرف ایک بار کا چیٹ نہیں ہے، بلکہ درخواستوں کا ایک مستقل سلسلہ ہے: ہر صارف کا سوال تقریباً 2–5K LLM ٹوکن استعمال کرتا ہے۔ مختلف فراہم کنندگان کے ساتھ اخراجات کا موازنہ کرتے ہیں۔ JoinGonka Gateway کے ذریعے Gonka کی قیمت: ان پٹ تقریباً $0.0069/1M، آؤٹ پٹ ×3۔
| سیناریو | LLM ٹوکن | OpenAI / Anthropic | JoinGonka Gonka |
|---|---|---|---|
| نالج بیس سے ایک سوال | ~4K | $0.01 — $0.06 | ~$0.00004 |
| سپورٹ چیٹ بوٹ (1K درخواستیں/دن) | ~4M/دن | $10 — $60 روزانہ | ~$0.038 روزانہ |
| انڈیکسنگ + Q&A (1M الفاظ) | ~5M | $12 — $75 | ~$0.048 |
| پروڈکشن سروس، 50K درخواستیں/ماہ | ~200M/ماہ | $500 — $3,000 ماہانہ | ~$1.92 ماہانہ |
مفت 3M ٹوکن کے ساتھ آپ ابتدائی RAG-پائپ لائن ٹیسٹ کر سکتے ہیں، ٹیسٹ ڈیٹا انڈیکس کر سکتے ہیں اور ہزاروں درخواستیں چلا سکتے ہیں — بغیر ایک پیسہ خرچ کیے۔ پروڈکشن والیومز پر، JoinGonka Gateway RAG کو ایک مہنگی سروس سے بدل کر ایک ایسی سروس بناتا ہے جس کا خرچ نہ ہونے کے برابر ہے۔
ایجنٹس، ٹول کالنگ اور ماڈل انتخاب
LlamaIndex نہ صرف دستاویزات کے جوابات دے سکتا ہے بلکہ ٹولز کے ساتھ ایجنٹس بنانے کی بھی صلاحیت رکھتا ہے۔ Gonka کے تینوں ماڈلز نیٹو tool calling کو سپورٹ کرتے ہیں — ایجنٹس بغیر ٹیکسٹ پارس کیے سٹرکچرڈ انداز میں فنکشن کال کرتے ہیں۔ ٹول کے ساتھ ایجنٹ کی مثال:
import asyncio
from llama_index.core.agent.workflow import FunctionAgent
from llama_index.llms.openai_like import OpenAILike
llm = OpenAILike(
api_base="https://gate.joingonka.ai/v1",
api_key="jg-آپ-کی-کی",
model="MiniMaxAI/MiniMax-M2.7",
is_chat_model=True,
is_function_calling_model=True,
context_window=200000,
max_tokens=8192,
)
def multiply(a: float, b: float) -> float:
"""دو نمبروں کو ضرب دیتا ہے۔"""
return a * b
agent = FunctionAgent(
tools=[multiply],
llm=llm,
system_prompt="آپ ایک مددگار اسسٹنٹ ہیں۔ حساب کتاب کے لیے ٹولز استعمال کریں۔",
)
async def main():
result = await agent.run("1234 کو 5678 سے ضرب دیں تو کیا جواب ہوگا؟")
print(result)
asyncio.run(main())ماڈل کا انتخاب (model فیلڈ اور متعلقہ context_window / max_tokens لمٹس):
ماڈل (model) | کانٹیکسٹ | زیادہ سے زیادہ آؤٹ پٹ | کب استعمال کریں |
|---|---|---|---|
MiniMaxAI/MiniMax-M2.7 | 200K | 8192 | ڈیفالٹ (مثال کے مطابق): tool calling، ایجنٹس، RAG |
deepseek-ai/DeepSeek-V4-Flash-0731 | 380K | 32768 | نیٹ ورک کا دوسرا سب سے طویل کانٹیکسٹ، سب سے زیادہ آؤٹ پٹ، سستے بڑے پرامپٹس |
zai-org/GLM-5.3-Flash | 390K | 8192 | Reasoning ماڈل: پیچیدہ منطق، نیٹ ورک کا سب سے طویل کانٹیکسٹ؛ استدلال کے لیے کچھ max_tokens استعمال ہوتے ہیں |
Gateway کے ذریعے max_tokens کی لمٹ MiniMax M2.7 اور GLM-5.3 Flash کے لیے 8192 تک، اور DeepSeek V4 Flash کے لیے 32768 تک ہے۔ اگر نان-اسٹریمنگ ریکوسٹ کے لیے max_tokens سیٹ نہ کیا جائے تو بائی ڈیفالٹ 1500 ٹوکنز تک واپس آئیں گے — RAG جوابات اور ایجنٹ کے اقدامات کے لیے اس ویلیو کو واضح طور پر سیٹ کریں۔
TypeScript: LlamaIndex.TS کے لیے بھی یہی راستہ ہے — @llamaindex/openai پیکیج کی OpenAI کلاس baseURL اور apiKey قبول کرتی ہے (یا OPENAI_BASE_URL / OPENAI_API_KEY ویری ایبلز سے پڑھتی ہے)، اس لیے وہی Gateway Node.js اسٹیک میں بھی کنیکٹ کیا جا سکتا ہے۔ اگر آپ Python فریم ورکس پر AI ایپلی کیشنز بنا رہے ہیں، تو LangChain کی گائیڈ بھی دیکھیں۔