Abschnitte der Wissensbasis ▾

Navigation

▸ Hier starten Nach Rollen

Kategorien

Werkzeuge 52
Glossar 12

Tools

Warp + JoinGonka Gateway — Terminal-Agent auf Ihrem eigenen Endpoint

Warp ist ein Terminal, das sich zu einer Entwicklungsumgebung für Agenten weiterentwickelt hat: Der integrierte Warp Agent liest Befehlsausgaben, bearbeitet Dateien, startet Builds und führt Aufgaben von der Anfrage bis zum Ergebnis aus. Standardmäßig arbeitet der Agent mit Modellen, die Warp selbst verkauft – gegen Tarif-Credits. Das Einbinden eines eigenen Inference-Endpoints war lange Zeit nur in kostenpflichtigen Tarifen und nur mit API-Schlüsseln von OpenAI, Anthropic oder Google möglich. Am 20. Mai 2026 hat Warp BYOK für den kostenlosen Tarif freigeschaltet und einen custom inference endpoint hinzugefügt – die Anbindung jedes Dienstes, der das OpenAI Chat Completions-Protokoll unterstützt.

Die zweite Methode ist genau das, was benötigt wird, um den Warp-Agenten über das JoinGonka Gateway laufen zu lassen: Das Gateway stellt die Modelle des dezentralen Gonka-Netzwerks über eine OpenAI-kompatible API bereit, die Inference wird zu den Echtzeitpreisen des Netzwerks bezahlt, und für Einzelentwickler sowie kleine Teams werden keine Warp-Credits verbraucht. Nach der Registrierung und Bestätigung Ihrer Adresse erhalten Sie 3M kostenlose Token – genug, um den Agenten bei Ihren Aufgaben zu testen, bevor Sie das erste Mal aufladen.

Nachfolgend erfahren Sie, was Sie vor dem Start benötigen, welche Werte Sie in das Warp-Formular eintragen müssen, wie Sie sicherstellen, dass die Anfragen über das Gateway laufen, welches Netzwerk-Modell Sie für Terminal-Aufgaben wählen sollten und was bei der Anfrageroute zu beachten ist: Diese ist bei Warp anders konfiguriert als bei den meisten anderen Tools.

Was Sie benötigen: Schlüssel, Warp-Tarif und eine öffentliche Adresse

JoinGonka-Schlüssel. Registrieren Sie sich am Gateway, öffnen Sie im Dashboard den Bereich „API-Keys“ und klicken Sie auf „Key erstellen“. Der Schlüssel beginnt mit jg- und wird nur einmal angezeigt – speichern Sie ihn sofort. Es ist sinnvoll, einen eigenen Schlüssel für Warp zu erstellen: So ist im Bereich „Nutzung“ der Verbrauch des Terminal-Agenten als separate Zeile sichtbar und vermischt sich nicht mit anderen Tools.

Warp-Tarif. Ein eigener Endpoint ist nicht nur in kostenpflichtigen Tarifen verfügbar – die Bedingungen hängen von der Teamgröße ab:

Wer bindet anIst ein eigener Endpoint verfügbar?Was passiert mit Warp-Credits?
Einzelentwickler oder Unternehmen bis 10 Personen (Tarife Free, Build, Max)Ja, in jedem dieser TarifeFür die Inference über einen eigenen Endpoint werden keine Credits abgebucht
Organisation mit mehr als 10 PersonenNur bei Business oder EnterpriseLokale Agenten-Starts verbrauchen platform credits – eine Gebühr für die Warp-Infrastruktur zu einem reduzierten Satz; die Inference selbst wird direkt beim Endpoint-Anbieter bezahlt

Öffentliche HTTPS-Adresse. Dies ist eine Anforderung von Warp, die man leicht übersieht: Anfragen an Ihren Endpoint werden nicht von der Anwendung auf Ihrem Rechner gesendet, sondern von den Warp-Servern. Daher muss die Adresse aus dem Internet erreichbar sein. localhost, 127.0.0.1 und private Netzwerkadressen werden vom Formular abgelehnt, und das Schema muss zwingend https:// sein. Das JoinGonka Gateway ist ein öffentlicher HTTPS-Dienst, daher werden Tunnel wie ngrok, die in der Warp-Dokumentation für lokale Modelle empfohlen werden, hier nicht benötigt.

Aktuelle Anwendungsversion. Der eigene Endpoint ist in stabilen Builds seit dem Release vom 20. Mai 2026 enthalten, die Auswahl des API-Schemas im Formular wurde mit dem Release vom 31. Juli 2026 hinzugefügt. Falls das Feld „API schema“ im Formular fehlt, aktualisieren Sie Warp.

Verbindung: Add custom endpoint Formular

Die gesamte Einrichtung erfolgt in der Benutzeroberfläche der App – Dateien müssen nicht manuell bearbeitet werden.

  1. Öffnen Sie Settings und geben Sie in der Suche inference endpoint ein – Warp springt zum Block mit den Anbieter-Schlüsseln und den eigenen Endpoints (er befindet sich auf der Einstellungsseite des Warp Agents).
  2. Klicken Sie auf Add custom endpoint – ein Formular öffnet sich.
  3. Füllen Sie die Felder mit den Werten aus der Tabelle und klicken Sie auf Add endpoint.
FormularfeldWas einzutragen istErklärung
API schemaOpenAI Chat CompletionsDas Standardschema: genau für dieses beschreibt die Warp-Dokumentation das Format der Adresse. In der Liste stehen auch OpenAI Responses und Anthropic Messages
Endpoint nameJoinGonkaBeliebiger Name – darunter ist der Endpoint in den Einstellungen sichtbar
Endpoint URLhttps://gate.joingonka.ai/v1Basisadresse inklusive /v1 – genau wie im Beispiel aus der Warp-Dokumentation
API keyjg-your-keyWird nur auf dem Gerät im systemeigenen Schlüsselspeicher abgelegt
Model namedeepseek-ai/DeepSeek-V4-Flash-0731Die exakte Modell-ID, wie sie das Gateway ausgibt
Model alias (optional)DeepSeek V4 FlashKurzname für den Modellumschalter

Die Schaltfläche + Add model fügt eine weitere Zeile hinzu. Legen Sie gleich alle Modelle des Netzwerks an, um später zwischen ihnen wechseln zu können, ohne in die Einstellungen zurückzukehren: deepseek-ai/DeepSeek-V4-Flash-0731, MiniMaxAI/MiniMax-M2.7 und zai-org/GLM-5.3-Flash. Die aktuelle Liste liefert immer GET https://gate.joingonka.ai/v1/models. Tragen Sie die IDs Zeichen für Zeichen ein: Das Formular prüft nur die Form der Adresse und ob alle Felder ausgefüllt sind, einen Testaufruf beim Speichern macht es nicht – ein Tippfehler im Modellnamen fällt also erst im Dialog mit dem Agenten auf.

Nach dem Speichern erscheinen die Modelle im Modellumschalter des Agenten. Falls als Standardmodell eines der Warp-Modelle eingestellt war, kann die App von sich aus vorschlagen, es zu wechseln – stimmen Sie zu und wählen Sie das Modell Ihres Endpoints. Ein wichtiges Detail: Die Optionen Auto im Umschalter laufen immer auf der Infrastruktur von Warp und verbrauchen dessen Credits, selbst wenn ein eigener Endpoint eingerichtet ist. Damit eine Anfrage an das Gateway geht, muss im Umschalter ein konkretes Modell aus Ihrer Liste ausgewählt sein.

Überprüfung: Werden die Anfragen über das Gateway geleitet?

Wählen Sie im Umschalter das Modell Ihres Endpoints und geben Sie dem Agenten eine kurze Aufgabe, zum Beispiel: „Zeige die fünf größten Dateien im aktuellen Verzeichnis und erkläre den Befehl.“ Der Agent soll einen Befehl vorschlagen, ihn nach Ihrer Freigabe ausführen und die Ausgabe kommentieren.

Öffnen Sie nun das Gateway-Panel, Bereich „Nutzung“. Im Block „Nach Schlüsseln“ erscheinen beim für Warp angelegten Schlüssel die Anfragen und der Zeitpunkt des letzten Zugriffs, im Block „Nach Modellen“ das gewählte Modell. Die Zähler steigen – das heißt, die Inference läuft über das JoinGonka Gateway und nicht über Warp-Credits. Warp seinerseits zeigt den Token-Verbrauch direkt im Dialog mit dem Agenten an – unter den kurzen Namen, die Sie im Feld alias vergeben haben.

Ist etwas schiefgelaufen, lässt sich die Ursache meist an der Antwort ablesen:

Was zu sehen istWas das bedeutetWas zu tun ist
401, Invalid API keyDas Gateway hat den Schlüssel nicht erkanntPrüfen Sie, ob der Schlüssel mit jg- beginnt, ohne Leerzeichen eingefügt und im Bereich „API-Schlüssel“ aktiv ist; legen Sie im Zweifel einen neuen an
404, Invalid URL (POST …)Der Pfad enthält ein überzähliges Segment; im Fehlertext zeigt das Gateway, wo genau die Anfrage angekommen istEs muss /v1/chat/completions herauskommen. Hat sich /v1 verdoppelt oder ist der vollständige Pfad in die Adresse geraten – bringen Sie die Endpoint URL auf die Form aus der Tabelle oben
405 Not Allowed oder eine HTML-Seite statt einer AntwortIn der Adresse fehlt /v1, die Anfrage ging an der API vorbeiErgänzen Sie /v1 am Ende der Adresse
429Das Modell ist überlastet: zur Stoßzeit ist die Kapazität eines bestimmten Modells im Netz manchmal vollständig ausgeschöpftWiederholen Sie es nach ein paar Sekunden oder wechseln Sie zu einem benachbarten Modell – dafür lohnt es sich, gleich alle anzulegen
Anfragen laufen durch, aber die Warp-Credits schmelzen dahinIm Umschalter ist Auto oder der Modell-Router von Warp gewählt, nicht das Modell des EndpointsWählen Sie ein konkretes Modell aus Ihrer Liste
Das Formular nimmt die Adresse nicht anWarp verlangt https:// und einen öffentlichen HostTragen Sie die Gateway-Adresse vollständig ein, beginnend mit https://
Das Modell „sieht“ das angehängte Bild nichtDie Modelle des Netzes sind Textmodelle: Das Gateway ersetzt das Bild durch eine TextmarkierungWechseln Sie für Aufgaben mit Screenshots zu einem Modell mit Vision, für Befehle und Code bleiben Sie beim Modell des Netzes
Das Modell des Endpoints fehlt beim Cloud-StartEin eigener Endpoint wird lokal gespeichert und gilt nicht für Cloud AgentsStarten Sie die Aufgabe mit einem lokalen Agenten

Die erste Antwort in einer Sitzung kann sich um einige Sekunden verzögern: Der Agent sendet einen großen System-Prompt mit der Beschreibung der Tools, und die Anfrage läuft zuerst über die Server von Warp und dann über einen Knoten des Netzes. Danach geht der Dialog schneller.

Welches Modell sollte für den Terminal-Agenten gewählt werden?

Der Preis für die Netzmodelle ist gleich, daher geht es bei der Auswahl um das Verhalten, nicht um das Budget. Der Terminal-Agent liest viel (Befehlsausgaben, Logs, Dateien) und ruft ständig Tools auf; alle Modelle in der Tabelle unterstützen natives Tool Calling.

ModellIdentifikatorKontext und AntwortWann in Warp nutzen
DeepSeek V4 Flashdeepseek-ai/DeepSeek-V4-Flash-0731380K, Antwort bis 32768 TokenStandardmodell für den Agenten: lange Sitzungen, große Logs und Diffs, Änderungen in mehreren Dateien. Kontext-Puffer und das größte Antwort-Limit im Netz
MiniMax M2.7MiniMaxAI/MiniMax-M2.7200K, Antwort bis 8192 TokenSchnelle Kurzaufgaben: Befehl finden, Fehler analysieren, Konfiguration anpassen
GLM-5.3 Flashzai-org/GLM-5.3-Flash390K, Antwort bis 8192 TokenReasoning-Modell: überlegt vor der Antwort. Komplexes Debugging, Migrationsplan, Analyse von unbekanntem Code; die Antwort kommt später und ein Teil des Antwort-Limits fließt in die Überlegungen

Praktisches Schema: DeepSeek V4 Flash — Hauptmodell, MiniMax M2.7 — für Kleinigkeiten, GLM-5.3 Flash — wenn die Aufgabe an der Logik und nicht am Volumen scheitert. Das Umschalten dauert eine Sekunde, da alle Modelle bereits im Endpoint hinterlegt sind und kurze Namen aus dem Alias-Feld Verwirrung bei langen Identifikatoren vermeiden. Mehr zum beliebtesten Modell finden Sie in der Übersicht zu DeepSeek V4 Flash.

Was das kostet

Der Token-Verbrauch beim Agenten im Terminal ist höher als beim Chat: Warp fügt jeder Anfrage Systemanweisungen, den Dialogkontext und die Tool-Beschreibungen hinzu, und eine Aufgabe besteht aus mehreren Schritten. Daher ist der Preis pro Token hier wichtiger als im gewöhnlichen Austausch.

Über das JoinGonka Gateway kosten Token $0.0069 pro Million bei der Eingabe und $0.021 pro Million bei der Ausgabe — der Preis ist für alle Netzmodelle gleich und wird auf dieser Seite aus einer Live-Quelle übernommen. Größenordnung der Preise für September 2026:

SzenarioVerbrauchÜber Gateway
Einzelaufgabe: Befehl und Analyse der Ausgabezehntausende TokenBruchteile eines Cents
Tag aktiver Arbeit mit dem Agenten3-7M Tokeneinige Cents
Monat täglicher Arbeit~150M Tokenetwa ein bis zwei Dollar

Zum Vergleich — drei Möglichkeiten, den Warp-Agenten zu bezahlen:

MethodeWer berechnet die InferenzWas schränkt ein
Warp-ModelleWarp, über Tarif-CreditsMonatlicher Kreditvorrat des Plans
BYOK: OpenAI, Anthropic oder Google SchlüsselModellanbieter gemäß eigener PreislistePreis pro Million Token beim Anbieter
Eigener Endpoint + JoinGonka GatewayGateway: nach Token, vom GuthabenNur das Guthaben: Verbrauch ist im Dashboard sichtbar, keine Quoten auf Anfragen

Warp selbst erhebt für Einzelpersonen und Teams bis zu 10 Personen keine Credits für die Arbeit über den eigenen Endpoint — Sie zahlen nur für die Token am Gateway. Das Guthaben wird im Dashboard aufgeladen, dort sind auch der Restbetrag sowie der Verbrauch nach Tagen und Modellen sichtbar.

Anfrageroute und Datenschutz: Was wichtig zu wissen ist

Bei den meisten Tools bedeutet ein eigener Endpoint: „Anfragen gehen direkt von meinem Rechner zum Provider“. Bei Warp ist das anders: Der ausführende Teil des Agenten läuft auf Warp-Servern, und ein eigener Endpoint ändert lediglich den Zieladressaten und den Schlüssel. Laut der Warp-Dokumentation sieht der Pfad der Anfrage so aus:

  1. Die App nimmt die Endpoint-Adresse und den Schlüssel aus dem geschützten Speicher des Geräts und sendet sie zusammen mit Ihrem Prompt an die Warp-Server.
  2. Der Agent auf der Warp-Seite baut die vollständige Anfrage zusammen — Systemanweisungen, Dialogkontext, Tools — und ruft Ihren Endpoint mit diesem Schlüssel auf.
  3. Die Antwort wird über dieselben Server als Stream an die App zurückgegeben.

Was bedeutet das in der Praxis:

  • Schlüssel. Er wird nur auf dem Gerät gespeichert. Er läuft bei jeder Anfrage über die Warp-Server, wird aber laut Warp dort nicht gespeichert: Er wird „on the fly“ verwendet und danach verworfen.
  • Prompts und Antworten. Diese werden über das Warp-Backend weitergeleitet. Warp gibt an, diese Inhalte nicht für das Training zu verwenden; Speicherung und Analysen unterliegen den Datenschutz- und Telemetrieeinstellungen Ihres Kontos. Die ZDR-Garantie, die für die Modelle von Warp selbst gilt, kann nicht auf Ihren eigenen Endpoint übertragen werden: Was der Provider speichert, bestimmt der Provider.
  • Gateway-Seite. Das JoinGonka Gateway speichert keine Dialoge: Prompts und Antworten verbleiben nicht auf dem Gateway, nachdem die Antwort erfolgt ist; im Dashboard sind nur Anfrage- und Token-Zähler sichtbar.
  • Was auf der Warp-Infrastruktur verbleibt. Die Optionen Auto, benutzerdefinierte Modell-Router, Codebase Context, Active AI-Vorschläge und Cloud-Agenten — darauf hat ein eigener Endpoint keinen Einfluss.

Wenn der Weg über fremde Server für Ihre Anforderungen nicht akzeptabel ist, nutzen Sie einen Agenten, der direkt von Ihrem Rechner aus auf den Endpoint zugreift — zum Beispiel Codex CLI oder jedes Tool aus dem API-Schnellstart. Warp selbst verspricht in der Ankündigung auch eine clientseitige Variante: ein leichtgewichtiges Agenten-Modul in Rust in einem Open-Source-Repository, das eine Verbindung zu lokalen Modellen ohne Routing über Warp-Server herstellt, sowie Unterstützung für das Agent Client Protocol. Seit der Version vom 2. September 2026 werden die Endpoint-Beschreibungen in einer Konfigurationsdatei gespeichert, die für die Anwendung und den Warp Agent CLI gemeinsam genutzt wird; die Schlüssel gelangen nicht in diese Datei und verbleiben im geschützten Speicher.

Warp verbindet sich über das Formular Add custom endpoint mit dem JoinGonka Gateway: OpenAI Chat Completions-Schema, Adresse https://gate.joingonka.ai/v1, jg-Schlüssel und Modell-IDs des Netzwerks. Für Einzelnutzer und Teams bis zu 10 Personen ist dies sogar im kostenlosen Tarif verfügbar, und Warp-Inference-Credits werden nicht verbraucht, sofern im Umschalter das Endpoint-Modell und nicht Auto ausgewählt ist. Das Hauptmerkmal von Warp ist die Route: Anfragen an den Endpoint werden von dessen Servern gesendet, daher muss die Adresse öffentlich sein und die Prompts durchlaufen das Warp-Backend transitiv. Für Terminal-Aufgaben nehmen Sie DeepSeek V4 Flash, für Kleinigkeiten MiniMax M2.7, für komplexe Logik GLM-5.3 Flash.

Möchten Sie mehr erfahren?

Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.

Schlüssel und kostenlose Token erhalten →