علم کے مرکز کے حصے ▾

نیویگیشن

▸ یہاں سے شروع کریں کردار کے لحاظ سے

زمرہ جات

ٹولز 37
لغت 12

ٹولز

لاما انڈیکس + گونکا AI — RAG-ایپلی کیشنز صرف چند روپے میں

LlamaIndex Python میں RAG ایپلیکیشنز اور AI ایجنٹس بنانے کے لیے ایک سرکردہ فریم ورک ہے (اس کا LlamaIndex.TS نامی TypeScript ورژن بھی موجود ہے)۔ یہ دستاویزات کو لوڈ کرنے، چنکنگ، انڈیکسنگ، ویکٹر سرچ اور جوابات جمع کرنے کا کام سنبھالتا ہے — آپ صرف ڈیٹا بیان کرتے ہیں، اور LlamaIndex اسے کسی بھی LLM کے اوپر ایک سوال و جواب کے نظام میں تبدیل کر دیتا ہے۔

ایک مسئلہ یہ ہے کہ انفرنس کی قیمت۔ RAG فطری طور پر بہت زیادہ ٹوکن استعمال کرتا ہے: ہر سوال کے لیے ماڈل کو ایک درخواست اور کچھ تلاش شدہ سیاق و سباق بھیجے جاتے ہیں، اور بڑے مجموعوں کی انڈیکسنگ کے لیے ایمبیڈنگز شامل ہو جاتی ہیں۔ پروڈکشن کی سطح پر، یہ روزانہ ہزاروں درخواستیں بناتی ہیں۔ OpenAI ($2.50–15 فی 1M ٹوکن) یا Anthropic ($3–15 فی 1M) کے ساتھ، ایک سادہ سوال و جواب کا سروس بھی ماہانہ دسیوں ہزار ڈالر کا خرچ بن سکتا ہے۔

LlamaIndex OpenAILike کلاس کے ذریعے کسی بھی OpenAI-compatible اینڈ پوائنٹ کے ساتھ مقامی طور پر کام کرتا ہے۔ اس کا مطلب ہے کہ JoinGonka Gateway صرف چند لائنوں میں کنیکٹ ہو جاتا ہے — بغیر کسی کسٹم پرووائیڈر یا پیچ کے۔ نتیجہ: وہی RAG سسٹم غیر مرکزی Gonka نیٹ ورک کے ذریعے $0.0069/1M ان پٹ ٹوکن (آؤٹ پٹ ×3) پر کام کرتا ہے — جو کلاؤڈ API کے مقابلے میں سینکڑوں اور ہزاروں گنا سستا ہے۔

فوری آغاز: OpenAILike کے ذریعے کنکشن

JoinGonka API-کی: gate.joingonka.ai/register پر رجسٹر کریں — شروع میں ہم دیتے ہیں 3M مفت ٹوکنز — اور Dashboard میں jg-xxx کی بنائیں۔

تنصیب:

pip install llama-index llama-index-llms-openai-like

کسی بھی OpenAI-مطابقت پذیر API کے لیے، LlamaIndex llama_index.llms.openai_like پیکج سے OpenAILike کلاس فراہم کرتا ہے۔ Gonka کے لیے ریکویسٹ کی ایک مختصر مثال:

from llama_index.llms.openai_like import OpenAILike

llm = OpenAILike(
    api_base="https://gate.joingonka.ai/v1",
    api_key="jg-your-key",
    model="MiniMaxAI/MiniMax-M2.7",
    is_chat_model=True,            # Gonka ایک چیٹ-اینڈ پوائنٹ ہے
    is_function_calling_model=True, # مقامی ٹول کالنگ سپورٹڈ ہے
    context_window=200000,         # نیٹ ورک ماڈلز کے لیے 200K
    max_tokens=8192,               # Gateway کے ذریعے آؤٹ پٹ کی حد
)

response = llm.complete("RAG کیا ہے، تین جملوں میں وضاحت کریں۔")
print(response)

OpenAILike کے بارے میں اہم بات: لازمی طور پر is_chat_model=True درج کریں — ورنہ LlamaIndex ایسے completion-اینڈ پوائنٹ پر جائے گا جو ہمارے پاس نہیں ہے۔ is_function_calling_model=True مقامی ٹول کالز کو فعال کرتا ہے۔ context_window کو ماڈل کے مطابق سیٹ کریں تاکہ LlamaIndex کانٹیکسٹ کو درست طریقے سے کاٹ سکے۔

مثال: کویری انجن کے ساتھ RAG-پائپ لائن

LlamaIndex کا کلاسک منظرنامہ آپ کی دستاویزات کا انڈیکس بنانا اور query_engine کے ذریعے استفسار کرنا ہے۔ گلوبل LLM ایک بار Settings.llm کے ذریعے سیٹ کیا جاتا ہے، اس کے بعد پوری پائپ لائن خود بخود Gonka استعمال کرتی ہے۔

from llama_index.core import (
    VectorStoreIndex,
    SimpleDirectoryReader,
    Settings,
)
from llama_index.llms.openai_like import OpenAILike
from llama_index.embeddings.huggingface import HuggingFaceEmbedding

# 1. Gonka کے ذریعے LLM (ایک بار — عالمی سطح پر)
Settings.llm = OpenAILike(
    api_base="https://gate.joingonka.ai/v1",
    api_key="jg-آپ-کی-کی",
    model="MiniMaxAI/MiniMax-M2.7",
    is_chat_model=True,
    context_window=200000,
    max_tokens=8192,
)

# 2. مقامی ایمبیڈنگز (مفت، بغیر OpenAI کے)
Settings.embed_model = HuggingFaceEmbedding(
    model_name="BAAI/bge-small-en-v1.5"
)

# 3. ./data فولڈر سے دستاویزات لوڈ اور انڈیکس کرنا
documents = SimpleDirectoryReader("data").load_data()
index = VectorStoreIndex.from_documents(documents)

# 4. نالج بیس سے استفسار
query_engine = index.as_query_engine()
response = query_engine.query("یہ دستاویز کس بارے میں ہے؟")
print(response)

ایمبیڈنگز کے بارے میں اہم نکتہ: ڈیفالٹ طور پر VectorStoreIndex OpenAI کی ایمبیڈنگز (text-embedding-ada-002) استعمال کرتا ہے — یہ OpenAI کے الگ معاوضے والے کالز ہیں، Gonka کے نہیں۔ OpenAI سے مکمل نجات پانے کے لیے، Settings.embed_model کے ذریعے ایک مقامی ماڈل سیٹ کریں (جیسا کہ اوپر کی مثال میں ہے — HuggingFaceEmbedding، پیکیج pip install llama-index-embeddings-huggingface)۔ تب جنریشن Gonka کے ذریعے ہوگی، اور ویکٹرائزیشن مقامی طور پر اور مفت ہوگی۔

لاگت: ایک RAG-پائپ لائن ریکوسٹ (تلاش + جنریشن) تقریباً 2–5K LLM ٹوکن استعمال کرتی ہے۔ Gonka کے ذریعے یہ سینٹ کا معمولی حصہ ہے؛ جو OpenAI/Anthropic کے مقابلے میں 3–4 گنا سستا ہے۔ روزانہ ہزاروں ریکوسٹ پر یہ فرق ہر ماہ ہزاروں ڈالر کی بچت میں بدل جاتا ہے۔

RAG-ورک لوڈ کی لاگت کا موازنہ

RAG-ایپلی کیشن صرف ایک بار کا چیٹ نہیں ہے، بلکہ درخواستوں کا ایک مستقل سلسلہ ہے: ہر صارف کا سوال تقریباً 2–5K LLM ٹوکن استعمال کرتا ہے۔ مختلف فراہم کنندگان کے ساتھ اخراجات کا موازنہ کرتے ہیں۔ JoinGonka Gateway کے ذریعے Gonka کی قیمت: ان پٹ تقریباً $0.0069/1M، آؤٹ پٹ ×3۔

سیناریوLLM ٹوکنOpenAI / AnthropicJoinGonka Gonka
نالج بیس سے ایک سوال~4K$0.01 — $0.06~$0.00004
سپورٹ چیٹ بوٹ (1K درخواستیں/دن)~4M/دن$10 — $60 روزانہ~$0.038 روزانہ
انڈیکسنگ + Q&A (1M الفاظ)~5M$12 — $75~$0.048
پروڈکشن سروس، 50K درخواستیں/ماہ~200M/ماہ$500 — $3,000 ماہانہ~$1.92 ماہانہ

مفت 3M ٹوکن کے ساتھ آپ ابتدائی RAG-پائپ لائن ٹیسٹ کر سکتے ہیں، ٹیسٹ ڈیٹا انڈیکس کر سکتے ہیں اور ہزاروں درخواستیں چلا سکتے ہیں — بغیر ایک پیسہ خرچ کیے۔ پروڈکشن والیومز پر، JoinGonka Gateway RAG کو ایک مہنگی سروس سے بدل کر ایک ایسی سروس بناتا ہے جس کا خرچ نہ ہونے کے برابر ہے۔

ایجنٹس، ٹول کالنگ اور ماڈل انتخاب

LlamaIndex نہ صرف دستاویزات کے جوابات دے سکتا ہے بلکہ ٹولز کے ساتھ ایجنٹس بنانے کی بھی صلاحیت رکھتا ہے۔ Gonka کے تینوں ماڈلز نیٹو tool calling کو سپورٹ کرتے ہیں — ایجنٹس بغیر ٹیکسٹ پارس کیے سٹرکچرڈ انداز میں فنکشن کال کرتے ہیں۔ ٹول کے ساتھ ایجنٹ کی مثال:

import asyncio
from llama_index.core.agent.workflow import FunctionAgent
from llama_index.llms.openai_like import OpenAILike

llm = OpenAILike(
    api_base="https://gate.joingonka.ai/v1",
    api_key="jg-آپ-کی-کی",
    model="MiniMaxAI/MiniMax-M2.7",
    is_chat_model=True,
    is_function_calling_model=True,
    context_window=200000,
    max_tokens=8192,
)

def multiply(a: float, b: float) -> float:
    """دو نمبروں کو ضرب دیتا ہے۔"""
    return a * b

agent = FunctionAgent(
    tools=[multiply],
    llm=llm,
    system_prompt="آپ ایک مددگار اسسٹنٹ ہیں۔ حساب کتاب کے لیے ٹولز استعمال کریں۔",
)

async def main():
    result = await agent.run("1234 کو 5678 سے ضرب دیں تو کیا جواب ہوگا؟")
    print(result)

asyncio.run(main())

ماڈل کا انتخاب (model فیلڈ اور متعلقہ context_window / max_tokens لمٹس):

ماڈل (model)کانٹیکسٹزیادہ سے زیادہ آؤٹ پٹکب استعمال کریں
MiniMaxAI/MiniMax-M2.7200K8192ڈیفالٹ (مثال کے مطابق): tool calling، ایجنٹس، RAG
deepseek-ai/DeepSeek-V4-Flash-0731380K32768نیٹ ورک کا دوسرا سب سے طویل کانٹیکسٹ، سب سے زیادہ آؤٹ پٹ، سستے بڑے پرامپٹس
zai-org/GLM-5.3-Flash390K8192Reasoning ماڈل: پیچیدہ منطق، نیٹ ورک کا سب سے طویل کانٹیکسٹ؛ استدلال کے لیے کچھ max_tokens استعمال ہوتے ہیں

Gateway کے ذریعے max_tokens کی لمٹ MiniMax M2.7 اور GLM-5.3 Flash کے لیے 8192 تک، اور DeepSeek V4 Flash کے لیے 32768 تک ہے۔ اگر نان-اسٹریمنگ ریکوسٹ کے لیے max_tokens سیٹ نہ کیا جائے تو بائی ڈیفالٹ 1500 ٹوکنز تک واپس آئیں گے — RAG جوابات اور ایجنٹ کے اقدامات کے لیے اس ویلیو کو واضح طور پر سیٹ کریں۔

TypeScript: LlamaIndex.TS کے لیے بھی یہی راستہ ہے — @llamaindex/openai پیکیج کی OpenAI کلاس baseURL اور apiKey قبول کرتی ہے (یا OPENAI_BASE_URL / OPENAI_API_KEY ویری ایبلز سے پڑھتی ہے)، اس لیے وہی Gateway Node.js اسٹیک میں بھی کنیکٹ کیا جا سکتا ہے۔ اگر آپ Python فریم ورکس پر AI ایپلی کیشنز بنا رہے ہیں، تو LangChain کی گائیڈ بھی دیکھیں۔

LlamaIndex + Gonka = سستی قیمت پر پروڈکشن کے لیے تیار RAG اور ایجنٹس۔ OpenAILike (is_chat_model=True) کے ذریعے کنیکٹ کریں، نیٹو ٹول کالنگ، لوکل ایمبیڈنگ سپورٹ۔ ان پٹ $0.0069/1M، جو OpenAI کے $2.50–15 سے بہت کم ہے۔ بغیر کارڈ کے فری ٹوکن سے پائپ لائن ٹیسٹ کریں۔

مزید جاننا چاہتے ہیں؟

دیگر حصوں کو دریافت کریں یا ابھی GNK کمانا شروع کریں۔

مفت ٹوکن حاصل کریں →