Abschnitte der Wissensbasis ▾
Navigation
▸ Hier starten Nach RollenKategorien
- Gonka Netzwerkarchitektur: Sprint, Transfer Agents, DiLoCo
- Entwickler: Wie man GNK verdient
- Eigenes Hosting: Schritt-für-Schritt-Anleitung
- GPU-Auswahl für Gonka: Hardware-Empfehlungen
- Qwen3-235B: Das Modell, das Gonka früher bediente
- Kimi K2.6: Ein Modell, das früher von Gonka betrieben wurde
- MiniMax M2.7: Gonka Netzwerkmodell
- DeepSeek V4 Flash: Modell im Gonka-Netzwerk mit 380K Kontext
- GLM-5.3 Flash: Z.ai Reasoning-Modell im Gonka-Netzwerk
Technologie
DeepSeek V4 Flash: Modell im Gonka-Netzwerk mit 380K Kontext
Im August 2026 erschien im Gonka-Netzwerk das dritte aktive Modell — DeepSeek V4 Flash. Den Governance-Vorschlag #94 zu seiner Aufnahme reichte das Team von kaitaku.ai ein, das in der Community für seine Optimierungen von ML-Knoten bekannt ist: Es führte Experimente durch, die die Kompatibilität des Modells mit Proof of Compute und der Netzwerkvalidierung bestätigten, und am 12. August wurde der Vorschlag per Abstimmung angenommen. Bereits am nächsten Tag bediente das Modell Anfragen.
Für Nutzer bedeutet das eine spürbare Erweiterung der Möglichkeiten: DeepSeek V4 Flash hat ein Kontextfenster von 380 000 Tokens — eines der längsten im Netzwerk (fast doppelt so groß wie bei MiniMax M2.7; nur GLM-5.3 Flash ist mit 390 000 etwas länger), integriertes Reasoning und vollwertiges Tool Calling. Schauen wir uns an, was das für ein Modell ist, wer es entwickelt hat, welche Eigenschaften es speziell im Gonka-Netzwerk hat, was die Benchmarks zeigen — und wann du es statt der beiden anderen Modelle des Netzwerks wählen solltest.
Was ist DeepSeek V4 Flash und wer steckt dahinter
DeepSeek ist ein chinesisches AI-Labor aus Hangzhou, das nach den Releases von V3 und R1 weltweite Bekanntheit erlangte: R1 zeigte Anfang 2025, dass ein Open-Source-Modell zu einem Bruchteil des Budgets zu geschlossenen Flaggschiffen aufschließen kann. Im April 2026 veröffentlichte DeepSeek die V4-Familie mit zwei Modellen: dem schweren V4 Pro und dem leichten V4 Flash. Beide sind offen (MIT-Lizenz) und basieren auf der MoE-Architektur.
V4 Flash umfasst 284 Milliarden Parameter, von denen für jeden Token etwa 13 Milliarden aktiviert werden. Diese Sparsity macht das Modell schnell und kostengünstig im Betrieb: Es benötigt deutlich weniger VRAM als "dichte" Giganten, und die Generierungsgeschwindigkeit ist höher.
Im Gonka-Netzwerk läuft die Version V4-Flash-0731 — ein re-post-trained Build vom 31. Juli 2026. Architektur und Größe blieben unverändert, aber die Qualität bei Agentenaufgaben ist sprunghaft angestiegen: Laut neun von DeepSeek veröffentlichten Agenten- und Coding-Benchmarks übertrifft der Build 0731 sogar deren eigenes Flaggschiff V4 Pro in der Preview-Version. Wichtiger Hinweis zur Transparenz: Ein Teil dieser Zahlen basiert auf Messungen von DeepSeek auf einem eigenen Teststand, der zum Zeitpunkt des Schreibens noch nicht öffentlich zugänglich ist, daher gibt es noch keine unabhängige Replikation. Zum Frontier geschlossener Modelle bleibt ein Abstand: Claude Opus 4.8 wird vom Build 0731 in keinem der neun Benchmarks übertroffen — aber es ist um Größenordnungen günstiger, und genau darin liegt der Kern: maximale Agenten-Qualität zu einem Bruchteil des Preises.
Eigenschaften von DeepSeek V4 Flash im Gonka-Netzwerk
Wie bei den anderen Modellen des Netzwerks ist es wichtig, zwischen den Eigenschaften des Modells „out of the box" und den Betriebsparametern einer konkreten Bereitstellung zu unterscheiden: Letztere ergeben sich aus der Konfiguration der vLLM-Inferenz auf den GPU-Hosts des Netzwerks. Die tatsächlichen Werte über unser Gateway:
- Kontextfenster: 380 000 Tokens — eines der längsten im Gonka-Netzwerk (nur GLM-5.3 Flash ist mit 390 000 größer). Wir haben es empirisch geprüft: Eine Anfrage mit 381 000 Input-Tokens wurde angenommen und in Sekundenschnelle verarbeitet. Die Architektur von V4 Flash selbst unterstützt Kontext bis zu 1 Million Tokens; die praktische Obergrenze im Netzwerk gibt die Konfiguration der Hosts vor (Inferenzfenster 400 000).
- Maximale Ausgabe: 32 768 Tokens pro Antwort — die höchste Obergrenze im Netzwerk: Bei MiniMax M2.7 und GLM-5.3 Flash ist sie viermal kleiner — 8 192; in beiden Fällen ist das die Konfiguration des Gateways, nicht das Limit des Modells.
- Reasoning und Tool Calling: Das Modell ist mit Parsern für Reasoning und Tool-Aufrufe bereitgestellt — agentische Szenarien (Cursor, Claude Code, LangChain) funktionieren out of the box; wir haben mehrstufige Tool-Szenarien über OpenAI- und Anthropic-kompatible Pfade getestet.
- VRAM-Anforderung des Hosts: etwa 280 GB — das leichteste Modell im Netzwerk (zum Vergleich: MiniMax M2.7 — 320 GB, GLM-5.3 Flash — 560 GB). Je niedriger die Hardware-Hürde, desto einfacher können Hosts das Modell bereitstellen — ein gutes Zeichen für seine Verfügbarkeit im Netzwerk.
Der Inferenzpreis im Gonka-Netzwerk hängt nicht von der Modellwahl ab: DeepSeek V4 Flash ist zum selben Tarif verfügbar wie MiniMax M2.7 und GLM-5.3 Flash — über das JoinGonka Gateway sind das $0.0069 pro Million Input- und $0.021 pro Million Output-Tokens. Zum Vergleich: Drittanbieter auf OpenRouter geben dasselbe Modell ab $0.06/$0.12 pro Million aus, und DeepSeek selbst hat V4 Flash 0731 bis September 2026 aus seiner API genommen — Anfragen an das Modell bedient dort bereits DeepSeek-V4.1-Flash für $0.30/$1.20 zu Spitzenzeiten. Die Ökonomie des Netzwerks ist ein eigenes Thema: Der Preis ergibt sich aus der Abrechnung für Rechenleistung, nicht aus der Preisliste eines Anbieters.
DeepSeek V4 Flash, MiniMax M2.7 und GLM-5.3 Flash — ein Vergleich
Das Netzwerk umfasst drei aktive Modelle — DeepSeek V4 Flash, MiniMax M2.7 und GLM-5.3 Flash (Kimi K2.6 wurde im September 2026 aus dem Netzwerk entfernt, und GLM-5.2, das lange im Register stand, wurde nie in den operativen Betrieb aufgenommen). Ein kurzer Vergleich:
| Parameter | DeepSeek V4 Flash | MiniMax M2.7 | GLM-5.3 Flash |
|---|---|---|---|
| Kontext im Netzwerk | 380.000 | 200.000 | 390.000 |
| Ausgabe pro Antwort | 32.768 | 8.192 | 8.192, inklusive Reasoning |
| Architektur | MoE 284B (~13B aktiv) | MoE + lineares Attention | MoE 320B (~18B aktiv), hybrides Attention |
| VRAM pro Node | 280 GB | 320 GB | 560 GB |
| Stärke | Langer Kontext, Reasoning, Geschwindigkeit | Tägliche Entwicklung, Stabilität | Komplexe Logik, Code-Analyse, "Denk-Aufgaben" |
| Preis über Gateway | gleich — $0.0069 Eingang / $0.021 Ausgang pro 1M | ||
Das praktische Ergebnis des gleichen Preises: Man kann das Modell rein nach der Aufgabe auswählen, ohne über das Budget nachzudenken. Wer große Prompts mit schnellen Antworten und die längste Ausgabe benötigt, wählt DeepSeek V4 Flash; für Aufgaben, die komplexe Logik erfordern (und den längsten Kontext des Netzwerks), eignet sich GLM-5.3 Flash; das solide Arbeitspferd für jeden Tag ist MiniMax M2.7.
Benchmarks V4-Flash-0731: Was der Build zeigt
Wichtigste veröffentlichte Ergebnisse des Builds 0731 (laut DeepSeek und unabhängigen Aggregatoren):
- SWE-bench Verified: 79,0% — Lösung realer GitHub-Aufgaben; ein Niveau, das noch vor einem Jahr nur geschlossenen Flaggschiffen vorbehalten war. Zum Vergleich: Kimi K2.6, das das Netzwerk zuvor bediente, lag bei 71,3%.
- GPQA Diamond: 88,1% — Fragen auf Doktorandenniveau in der Wissenschaft; der erweiterte Reasoning-Modus verbessert die Genauigkeit bei mehrstufigen Aufgaben.
- Terminal Bench 2.1: 82,7 — Arbeit im Terminal als Agent; die Flash-Preview-Version hatte 61,8, V4 Pro Preview lag bei 72,1.
- DeepSWE: 54,4 — ein neuer, strenger Benchmark von DeepSeek mit nahezu null falsch-positiven Ergebnissen; die Zahl stammt vom Anbieter, der Stand ist noch nicht veröffentlicht — daher unter Vorbehalt zu betrachten.
Der ehrliche Rahmen: In neun Agenten-Benchmarks übertrifft der Build 0731 das eigene V4 Pro Preview, aber nicht Claude Opus 4.8 — der Rückstand beträgt im Durchschnitt etwa 6 Punkte. Gleichzeitig ist das Modell beim Preis pro Token um zwei Größenordnungen günstiger als Opus, und über das Gonka-Netzwerk sogar ~9 Mal günstiger als das gleiche Modell bei Drittanbietern auf OpenRouter. Genau dieses Verhältnis von „Qualität nahe am Frontier-Modell zum Bruchteil des Preises“ macht es interessant: Detaillierte unabhängige Messungen finden Sie bei Artificial Analysis, Gewichte und Modellkarten auf Hugging Face.
So nutzen Sie DeepSeek V4 Flash über das JoinGonka Gateway
Das Modell ist über das JoinGonka Gateway über eine OpenAI- und Anthropic-kompatible API verfügbar. Modell-ID: deepseek-ai/DeepSeek-V4-Flash-0731.
Der schnellste Weg – ein Installer mit einem einzigen Befehl, der Ihr Tool (Claude Code, OpenClaw, Cline, opencode, Aider und andere) direkt auf dieses Modell einrichtet:
npx @joingonka/setup --model deepseekÜberall dort, wo der Installer die Konfiguration selbst schreibt (Claude Code, Codex CLI, OpenClaw, opencode, Kilo Code, Hermes, Pi und andere), ist DeepSeek V4 Flash standardmäßig und ohne Flag gesetzt. Das Flag wird benötigt, um ein bereits konfiguriertes Tool umzuschalten, und dort, wo der Installer Werte zum Einfügen ausgibt (Cursor, Cline, Aider). Die übrigen Modelle des Netzwerks werden genauso gewählt: --model minimax und --model glm.
Direkter API-Aufruf (OpenAI-Format):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-your-key" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Hello!"}]}'Bei der Registrierung erhalten Sie 3M kostenlose Token – mit einem Kontext von 380K können Sie das Modell sofort an echten großen Dokumenten und Codebasen testen. Schritt-für-Schritt-Beispiele in Python und TypeScript finden Sie im API Quickstart; ohne Registrierung können Sie es im kostenlosen Chat ausprobieren, indem Sie DeepSeek V4 Flash in der Modellliste auswählen.
Wann Sie DeepSeek V4 Flash wählen sollten — praktische Szenarien
Starke Einsatzszenarien für dieses Modell:
- Große Dokumente und Codebasen am Stück. 380.000 Tokens entsprechen rund 280.000 Wörtern: ein Jahresbericht, ein juristisches Dokumentenpaket oder ein mittleres Repository passen in eine einzige Anfrage – ohne Zerhacken in Häppchen und ohne Verlust der Zusammenhänge zwischen den Teilen.
- Lange Agenten-Sessions. Ein autonomer Agent, der Dateien liest, Tools aufruft und Verlauf ansammelt, stößt am schnellsten an die Kontextgrenze – ein Puffer von 380K Tokens bedeutet deutlich längere Sessions ohne Gedächtnis-Reset.
- RAG mit großen Auswahlen. Je mehr relevante Dokumente in den Kontext passen, desto geringer die Abhängigkeit von der Treffgenauigkeit der Suche.
- Reasoning-Aufgaben. Der Reasoning-Modus bringt Zuwächse bei Mathematik, Wissenschaft und mehrstufiger Logik – zum Preis eines gewöhnlichen Modells.
Wann ein anderes Modell des Netzwerks sinnvoller ist: Für Aufgaben, bei denen über verzwickte Logik nachgedacht werden muss, gibt es GLM-5.3 Flash – das Reasoning-Modell des Netzwerks (eine ausführliche Analyse der Modelle für die Entwicklung findest du im Artikel über die besten Modelle für Code), während MiniMax M2.7 ein bewährtes Arbeitstier für alltägliche Aufgaben bleibt. Dank des Einheitspreises kannst du frei experimentieren – der Modellwechsel ist eine einzige Zeile in der Anfrage.
Möchten Sie mehr erfahren?
Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.
DeepSeek V4 Flash über Gateway testen →