Abschnitte der Wissensbasis ▾

Navigation

▸ Hier starten Nach Rollen

Kategorien

Werkzeuge 37
Glossar 12

Werkzeuge

LlamaIndex + Gonka AI – RAG-Anwendungen für kleines Geld

LlamaIndex ist das führende Framework zum Aufbau von RAG-Anwendungen und KI-Agenten in Python (es gibt auch eine TypeScript-Version, LlamaIndex.TS). Es kümmert sich um das Laden von Dokumenten, das Chunking, die Indizierung, die Vektorsuche und das Zusammenstellen der Antworten – Sie beschreiben die Daten und LlamaIndex verwandelt sie in ein Frage-Antwort-System über jeder beliebigen LLM.

Es gibt nur ein Problem: die Kosten für die Inferenz. RAG ist von Natur aus ressourcenhungrig: Bei jeder Frage gehen eine Anfrage plus mehrere gefundene Kontextfragmente an das Modell, und für die Indizierung großer Sammlungen kommen Embeddings hinzu. Bei Produktionsvolumen sind das Tausende von Anfragen pro Tag. Bei OpenAI ($2.50–15 pro 1M Tokens) oder Anthropic ($3–15 pro 1M) wird selbst ein bescheidener Frage-Antwort-Service zu Zehntausenden von Dollar pro Monat.

LlamaIndex arbeitet nativ mit jedem OpenAI-kompatiblen Endpoint über die Klasse OpenAILike zusammen. Das bedeutet, dass sich das JoinGonka Gateway mit wenigen Zeilen verbinden lässt – ganz ohne benutzerdefinierte Provider oder Patches. Das Ergebnis: Dasselbe RAG-System funktioniert für $0.0069/1M Tokens bei der Eingabe (Ausgabe ×3) über das dezentrale Gonka-Netzwerk – hunderte bis tausende Male günstiger als Cloud-APIs.

Schnellstart: Verbindung über OpenAILike

JoinGonka API-Key: Registrieren Sie sich unter gate.joingonka.ai/register — wir geben zum Start 3M kostenlose Token — und erstellen Sie einen Key jg-xxx im Dashboard.

Installation:

pip install llama-index llama-index-llms-openai-like

Für eine beliebige OpenAI-kompatible API stellt LlamaIndex die Klasse OpenAILike aus dem Paket llama_index.llms.openai_like bereit. Minimales Beispiel für eine Anfrage an Gonka:

from llama_index.llms.openai_like import OpenAILike

llm = OpenAILike(
    api_base="https://gate.joingonka.ai/v1",
    api_key="jg-ihr-key",
    model="MiniMaxAI/MiniMax-M2.7",
    is_chat_model=True,            # Gonka ist ein Chat-Endpoint
    is_function_calling_model=True, # natives Tool Calling wird unterstützt
    context_window=200000,         # 200K bei Netzmodellen
    max_tokens=8192,               # Ausgabe-Limit über Gateway
)

response = llm.complete("Erkläre kurz, was RAG ist, in drei Sätzen.")
print(response)

Wichtig für OpenAILike: Geben Sie unbedingt is_chat_model=True an — sonst greift LlamaIndex auf den Completion-Endpoint zu, den wir nicht haben. is_function_calling_model=True aktiviert natives Tool Calling. Setzen Sie context_window entsprechend dem Modell, damit LlamaIndex den Kontext korrekt schneidet.

Beispiel: RAG-Pipeline mit Query Engine

Ein klassisches LlamaIndex-Szenario ist ein Index über Ihre Dokumente und Anfragen dazu über den query_engine. Die globale LLM wird einmal über Settings.llm festgelegt, danach nutzt die gesamte Pipeline Gonka automatisch.

from llama_index.core import (
    VectorStoreIndex,
    SimpleDirectoryReader,
    Settings,
)
from llama_index.llms.openai_like import OpenAILike
from llama_index.embeddings.huggingface import HuggingFaceEmbedding

# 1. LLM über Gonka (global einmalig)
Settings.llm = OpenAILike(
    api_base="https://gate.joingonka.ai/v1",
    api_key="jg-ihr-schluessel",
    model="MiniMaxAI/MiniMax-M2.7",
    is_chat_model=True,
    context_window=200000,
    max_tokens=8192,
)

# 2. Lokale Embeddings (kostenlos, ohne OpenAI)
Settings.embed_model = HuggingFaceEmbedding(
    model_name="BAAI/bge-small-en-v1.5"
)

# 3. Laden und Indizieren von Dokumenten aus dem Ordner ./data
documents = SimpleDirectoryReader("data").load_data()
index = VectorStoreIndex.from_documents(documents)

# 4. Anfrage an die Wissensdatenbank
query_engine = index.as_query_engine()
response = query_engine.query("Worum geht es in diesem Dokument?")
print(response)

Kritischer Hinweis zu Embeddings: Standardmäßig verwendet VectorStoreIndex OpenAI-Embeddings (text-embedding-ada-002) — dies sind separate kostenpflichtige Aufrufe an OpenAI und nicht an Gonka. Um OpenAI vollständig zu umgehen, setzen Sie ein lokales Embedding-Modell über Settings.embed_model (wie im Beispiel oben — HuggingFaceEmbedding, Paket pip install llama-index-embeddings-huggingface). Dann erfolgt die Generierung über Gonka und die Vektorisierung lokal und kostenlos.

Kosten: Eine RAG-Pipeline-Anfrage (Suche + Generierung) verbraucht ~2–5K LLM-Token. Über Gonka sind das Bruchteile eines Cents; über OpenAI/Anthropic ist es um 3–4 Größenordnungen teurer. Bei tausenden Anfragen täglich summiert sich der Unterschied auf zehntausende Dollar Ersparnis pro Monat.

Kostenvergleich der RAG-Last

Eine RAG-Anwendung ist kein einmaliger Chat, sondern ein ständiger Datenstrom von Anfragen: Jede Nutzerfrage zieht 2–5K LLM-Token nach sich (die Frage selbst plus die gefundenen Kontextfragmente). Wir berechnen die typischen Mengen und was diese bei verschiedenen Anbietern kosten. Gonka-Preise über JoinGonka Gateway: Input ~$0.0069/1M, Output ×3.

SzenarioLLM-TokenOpenAI / AnthropicJoinGonka Gonka
Eine Frage an die Wissensdatenbank~4K$0.01 — $0.06~$0.00004
Support-Chatbot (1K Anfragen/Tag)~4M/Tag$10 — $60 pro Tag~$0.038 pro Tag
Indizierung + Q&A über Korpus (1M Wörter)~5M$12 — $75~$0.048
Produktionsdienst, 50K Anfragen/Monat~200M/Monat$500 — $3,000 pro Monat~$1.92 pro Monat

Mit den kostenlosen 3M Token können Sie die ersten RAG-Pipeline-Anfragen durchführen, den Testkorpus indizieren und Tausende von Abfragen ausführen — ohne einen Cent auszugeben. Bei Produktionsmengen verwandelt das JoinGonka Gateway RAG von einem teuren Dienst in eine Kostenstelle, die kaum ins Gewicht fällt.

Agenten, Tool-Aufruf und Modellauswahl

LlamaIndex kann nicht nur auf Basis von Dokumenten antworten, sondern auch Agenten mit Werkzeugen erstellen. Alle drei Gonka-Modelle unterstützen natives Tool Calling — Agenten rufen Funktionen strukturiert auf, ohne Text-Parsing. Beispiel für einen Agenten mit Werkzeug:

import asyncio
from llama_index.core.agent.workflow import FunctionAgent
from llama_index.llms.openai_like import OpenAILike

llm = OpenAILike(
    api_base="https://gate.joingonka.ai/v1",
    api_key="jg-ihr-key",
    model="MiniMaxAI/MiniMax-M2.7",
    is_chat_model=True,
    is_function_calling_model=True,
    context_window=200000,
    max_tokens=8192,
)

def multiply(a: float, b: float) -> float:
    """Multipliziert zwei Zahlen."""
    return a * b

agent = FunctionAgent(
    tools=[multiply],
    llm=llm,
    system_prompt="Du bist ein hilfreicher Assistent. Verwende für Berechnungen Werkzeuge.",
)

async def main():
    result = await agent.run("Was ist 1234 multipliziert mit 5678?")
    print(result)

asyncio.run(main())

Modellwahl (Feld model und entsprechende Limits für context_window / max_tokens):

Modell (model)KontextMax. OutputWann nutzen
MiniMaxAI/MiniMax-M2.7200K8192Standard (wie im Beispiel): Tool Calling, Agenten, RAG
deepseek-ai/DeepSeek-V4-Flash-0731380K32768Zweitlängster Netzwerk-Kontext, längster Output, günstige große Prompts
zai-org/GLM-5.3-Flash390K8192Reasoning-Modell: komplexe Logik, längster Netzwerk-Kontext; Reasoning verbraucht einen Teil der max_tokens

Das Limit für max_tokens über das Gateway beträgt bis zu 8192 für MiniMax M2.7 und GLM-5.3 Flash, und bis zu 32768 für DeepSeek V4 Flash. Wenn max_tokens für eine Nicht-Streaming-Anfrage nicht festgelegt ist, werden standardmäßig bis zu 1500 Tokens zurückgegeben — geben Sie für RAG-Antworten und Agenten-Schritte den Wert explizit an.

TypeScript: Für LlamaIndex.TS gibt es einen analogen Weg — die Klasse OpenAI aus dem Paket @llamaindex/openai akzeptiert baseURL und apiKey (oder liest die Variablen OPENAI_BASE_URL / OPENAI_API_KEY), sodass dasselbe Gateway auch im Node.js-Stack angeschlossen werden kann. Wenn Sie AI-Anwendungen auch in Python-Frameworks bauen, werfen Sie auch einen Blick in den Leitfaden zu LangChain.

LlamaIndex + Gonka = production-ready RAG und Agenten für einen Bruchteil eines Cents. Anschluss über OpenAILike (is_chat_model=True), natives Tool Calling, lokale Embeddings — Input $0.0069/1M statt $2.50–15 bei OpenAI. Die Start-Token ermöglichen das Testen der Pipeline ohne Kreditkarte.

Möchten Sie mehr erfahren?

Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.

Kostenlose Token erhalten →