Abschnitte der Wissensbasis ▾
Navigation
▸ Hier starten Nach RollenKategorien
- Cursor + Gonka AI – günstige LLM zum Codieren
- Claude Code + Gonka AI – LLM für das Terminal
- OpenClaw + Gonka AI – erschwingliche KI-Agenten
- OpenCode: eigenes Modell im Terminal
- Continue.dev + Gonka AI – AI für VS Code/JetBrains
- Cline + Gonka AI – KI-Agent in VS Code
- Aider + Gonka AI – Paarprogrammierung mit KI
- LangChain + Gonka AI – KI-Anwendungen für wenige Cent
- n8n + Gonka AI – Automatisierung mit günstiger KI
- Open WebUI + Gonka AI – Ihr eigenes ChatGPT
- LibreChat + Gonka AI — Open-Source ChatGPT
- Hermes Agent + DeepSeek im Gonka-Netzwerk — autonomer Agent für ein paar Cent
- Kilo Code + Gonka AI – KI-Agent in VS Code
- Roo Code + Gonka AI – Autonomer KI-Agent in VS Code
- LlamaIndex + Gonka AI – RAG-Anwendungen für kleines Geld
- PydanticAI + Gonka – typisierte KI-Agenten für kleines Geld
- Vercel AI SDK + Gonka AI – KI-Anwendungen mit TypeScript für kleines Geld
- TanStack AI + Gonka – KI-Anwendungen mit TypeScript für kleines Geld
- API Schnellstart — curl, Python, TypeScript
- JoinGonka Gateway — vollständige Übersicht
- Management Keys – SaaS auf Gonka
- Die günstigste AI API: Anbietervergleich 2026
- Cursor Pro Request-Limit erreicht — Analyse und eine günstige Alternative
- Claude Code ist günstiger — Rechnungsanalyse und Wechsel
- Cline verbrennt Geld — warum der Agent so viel verbraucht
- OpenClaw wird teuer — warum der Agent Tokens verbrennt und wie man spart
- OpenRouter: Günstige Alternative — Vergleich mit JoinGonka Gateway
- Das beste AI-Modell für Coding im Jahr 2026: Vergleich und Preise
- Günstige Alternative zu GitHub Copilot ohne Limits
- Günstige Alternative zu Windsurf ohne Credits und Limits
- Die günstigste API für AI-Agenten im Jahr 2026
- ZCode: günstige GLM-Inferenz anstelle des GLM Coding Plan
- JetBrains IDE + JoinGonka Gateway — eigener Endpoint statt Credits
- GitHub Copilot BYOK — eigene Modelle statt Kontingent
- Zed + JoinGonka Gateway — günstiges Inference im Editor
- Pi + JoinGonka Gateway — Terminal-Agent mit günstiger Inference
- Codex CLI: eigener Schlüssel statt Abonnement
Werkzeuge
LlamaIndex + Gonka AI – RAG-Anwendungen für kleines Geld
LlamaIndex ist das führende Framework zum Aufbau von RAG-Anwendungen und KI-Agenten in Python (es gibt auch eine TypeScript-Version, LlamaIndex.TS). Es kümmert sich um das Laden von Dokumenten, das Chunking, die Indizierung, die Vektorsuche und das Zusammenstellen der Antworten – Sie beschreiben die Daten und LlamaIndex verwandelt sie in ein Frage-Antwort-System über jeder beliebigen LLM.
Es gibt nur ein Problem: die Kosten für die Inferenz. RAG ist von Natur aus ressourcenhungrig: Bei jeder Frage gehen eine Anfrage plus mehrere gefundene Kontextfragmente an das Modell, und für die Indizierung großer Sammlungen kommen Embeddings hinzu. Bei Produktionsvolumen sind das Tausende von Anfragen pro Tag. Bei OpenAI ($2.50–15 pro 1M Tokens) oder Anthropic ($3–15 pro 1M) wird selbst ein bescheidener Frage-Antwort-Service zu Zehntausenden von Dollar pro Monat.
LlamaIndex arbeitet nativ mit jedem OpenAI-kompatiblen Endpoint über die Klasse OpenAILike zusammen. Das bedeutet, dass sich das JoinGonka Gateway mit wenigen Zeilen verbinden lässt – ganz ohne benutzerdefinierte Provider oder Patches. Das Ergebnis: Dasselbe RAG-System funktioniert für $0.0069/1M Tokens bei der Eingabe (Ausgabe ×3) über das dezentrale Gonka-Netzwerk – hunderte bis tausende Male günstiger als Cloud-APIs.
Schnellstart: Verbindung über OpenAILike
JoinGonka API-Key: Registrieren Sie sich unter gate.joingonka.ai/register — wir geben zum Start 3M kostenlose Token — und erstellen Sie einen Key jg-xxx im Dashboard.
Installation:
pip install llama-index llama-index-llms-openai-likeFür eine beliebige OpenAI-kompatible API stellt LlamaIndex die Klasse OpenAILike aus dem Paket llama_index.llms.openai_like bereit. Minimales Beispiel für eine Anfrage an Gonka:
from llama_index.llms.openai_like import OpenAILike
llm = OpenAILike(
api_base="https://gate.joingonka.ai/v1",
api_key="jg-ihr-key",
model="MiniMaxAI/MiniMax-M2.7",
is_chat_model=True, # Gonka ist ein Chat-Endpoint
is_function_calling_model=True, # natives Tool Calling wird unterstützt
context_window=200000, # 200K bei Netzmodellen
max_tokens=8192, # Ausgabe-Limit über Gateway
)
response = llm.complete("Erkläre kurz, was RAG ist, in drei Sätzen.")
print(response)Wichtig für OpenAILike: Geben Sie unbedingt is_chat_model=True an — sonst greift LlamaIndex auf den Completion-Endpoint zu, den wir nicht haben. is_function_calling_model=True aktiviert natives Tool Calling. Setzen Sie context_window entsprechend dem Modell, damit LlamaIndex den Kontext korrekt schneidet.
Beispiel: RAG-Pipeline mit Query Engine
Ein klassisches LlamaIndex-Szenario ist ein Index über Ihre Dokumente und Anfragen dazu über den query_engine. Die globale LLM wird einmal über Settings.llm festgelegt, danach nutzt die gesamte Pipeline Gonka automatisch.
from llama_index.core import (
VectorStoreIndex,
SimpleDirectoryReader,
Settings,
)
from llama_index.llms.openai_like import OpenAILike
from llama_index.embeddings.huggingface import HuggingFaceEmbedding
# 1. LLM über Gonka (global einmalig)
Settings.llm = OpenAILike(
api_base="https://gate.joingonka.ai/v1",
api_key="jg-ihr-schluessel",
model="MiniMaxAI/MiniMax-M2.7",
is_chat_model=True,
context_window=200000,
max_tokens=8192,
)
# 2. Lokale Embeddings (kostenlos, ohne OpenAI)
Settings.embed_model = HuggingFaceEmbedding(
model_name="BAAI/bge-small-en-v1.5"
)
# 3. Laden und Indizieren von Dokumenten aus dem Ordner ./data
documents = SimpleDirectoryReader("data").load_data()
index = VectorStoreIndex.from_documents(documents)
# 4. Anfrage an die Wissensdatenbank
query_engine = index.as_query_engine()
response = query_engine.query("Worum geht es in diesem Dokument?")
print(response)Kritischer Hinweis zu Embeddings: Standardmäßig verwendet VectorStoreIndex OpenAI-Embeddings (text-embedding-ada-002) — dies sind separate kostenpflichtige Aufrufe an OpenAI und nicht an Gonka. Um OpenAI vollständig zu umgehen, setzen Sie ein lokales Embedding-Modell über Settings.embed_model (wie im Beispiel oben — HuggingFaceEmbedding, Paket pip install llama-index-embeddings-huggingface). Dann erfolgt die Generierung über Gonka und die Vektorisierung lokal und kostenlos.
Kosten: Eine RAG-Pipeline-Anfrage (Suche + Generierung) verbraucht ~2–5K LLM-Token. Über Gonka sind das Bruchteile eines Cents; über OpenAI/Anthropic ist es um 3–4 Größenordnungen teurer. Bei tausenden Anfragen täglich summiert sich der Unterschied auf zehntausende Dollar Ersparnis pro Monat.
Kostenvergleich der RAG-Last
Eine RAG-Anwendung ist kein einmaliger Chat, sondern ein ständiger Datenstrom von Anfragen: Jede Nutzerfrage zieht 2–5K LLM-Token nach sich (die Frage selbst plus die gefundenen Kontextfragmente). Wir berechnen die typischen Mengen und was diese bei verschiedenen Anbietern kosten. Gonka-Preise über JoinGonka Gateway: Input ~$0.0069/1M, Output ×3.
| Szenario | LLM-Token | OpenAI / Anthropic | JoinGonka Gonka |
|---|---|---|---|
| Eine Frage an die Wissensdatenbank | ~4K | $0.01 — $0.06 | ~$0.00004 |
| Support-Chatbot (1K Anfragen/Tag) | ~4M/Tag | $10 — $60 pro Tag | ~$0.038 pro Tag |
| Indizierung + Q&A über Korpus (1M Wörter) | ~5M | $12 — $75 | ~$0.048 |
| Produktionsdienst, 50K Anfragen/Monat | ~200M/Monat | $500 — $3,000 pro Monat | ~$1.92 pro Monat |
Mit den kostenlosen 3M Token können Sie die ersten RAG-Pipeline-Anfragen durchführen, den Testkorpus indizieren und Tausende von Abfragen ausführen — ohne einen Cent auszugeben. Bei Produktionsmengen verwandelt das JoinGonka Gateway RAG von einem teuren Dienst in eine Kostenstelle, die kaum ins Gewicht fällt.
Agenten, Tool-Aufruf und Modellauswahl
LlamaIndex kann nicht nur auf Basis von Dokumenten antworten, sondern auch Agenten mit Werkzeugen erstellen. Alle drei Gonka-Modelle unterstützen natives Tool Calling — Agenten rufen Funktionen strukturiert auf, ohne Text-Parsing. Beispiel für einen Agenten mit Werkzeug:
import asyncio
from llama_index.core.agent.workflow import FunctionAgent
from llama_index.llms.openai_like import OpenAILike
llm = OpenAILike(
api_base="https://gate.joingonka.ai/v1",
api_key="jg-ihr-key",
model="MiniMaxAI/MiniMax-M2.7",
is_chat_model=True,
is_function_calling_model=True,
context_window=200000,
max_tokens=8192,
)
def multiply(a: float, b: float) -> float:
"""Multipliziert zwei Zahlen."""
return a * b
agent = FunctionAgent(
tools=[multiply],
llm=llm,
system_prompt="Du bist ein hilfreicher Assistent. Verwende für Berechnungen Werkzeuge.",
)
async def main():
result = await agent.run("Was ist 1234 multipliziert mit 5678?")
print(result)
asyncio.run(main())Modellwahl (Feld model und entsprechende Limits für context_window / max_tokens):
Modell (model) | Kontext | Max. Output | Wann nutzen |
|---|---|---|---|
MiniMaxAI/MiniMax-M2.7 | 200K | 8192 | Standard (wie im Beispiel): Tool Calling, Agenten, RAG |
deepseek-ai/DeepSeek-V4-Flash-0731 | 380K | 32768 | Zweitlängster Netzwerk-Kontext, längster Output, günstige große Prompts |
zai-org/GLM-5.3-Flash | 390K | 8192 | Reasoning-Modell: komplexe Logik, längster Netzwerk-Kontext; Reasoning verbraucht einen Teil der max_tokens |
Das Limit für max_tokens über das Gateway beträgt bis zu 8192 für MiniMax M2.7 und GLM-5.3 Flash, und bis zu 32768 für DeepSeek V4 Flash. Wenn max_tokens für eine Nicht-Streaming-Anfrage nicht festgelegt ist, werden standardmäßig bis zu 1500 Tokens zurückgegeben — geben Sie für RAG-Antworten und Agenten-Schritte den Wert explizit an.
TypeScript: Für LlamaIndex.TS gibt es einen analogen Weg — die Klasse OpenAI aus dem Paket @llamaindex/openai akzeptiert baseURL und apiKey (oder liest die Variablen OPENAI_BASE_URL / OPENAI_API_KEY), sodass dasselbe Gateway auch im Node.js-Stack angeschlossen werden kann. Wenn Sie AI-Anwendungen auch in Python-Frameworks bauen, werfen Sie auch einen Blick in den Leitfaden zu LangChain.
Möchten Sie mehr erfahren?
Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.
Kostenlose Token erhalten →