Abschnitte der Wissensbasis ▾
Navigation
▸ Hier starten Nach RollenKategorien
- Gonka Netzwerkarchitektur: Sprint, Transfer Agents, DiLoCo
- Entwickler: Wie man GNK verdient
- Eigenes Hosting: Schritt-für-Schritt-Anleitung
- GPU-Auswahl für Gonka: Hardware-Empfehlungen
- Qwen3-235B: Das Modell, das Gonka früher bediente
- Kimi K2.6: Das zweite Modell des Gonka-Netzwerks
- MiniMax M2.7: Gonka Netzwerkmodell
- DeepSeek V4 Flash: Modell im Gonka-Netzwerk mit 380K Kontext
Technologie
DeepSeek V4 Flash: Modell im Gonka-Netzwerk mit 380K Kontext
Im August 2026 erschien im Gonka-Netzwerk ein drittes aktives Modell: DeepSeek V4 Flash. Der Governance-Vorschlag #94 für dessen Integration wurde vom Team kaitaku.ai eingereicht, das in der Community für seine Optimierungen von ML-Nodes bekannt ist: Sie führten Experimente durch, die die Kompatibilität des Modells mit Proof of Compute und der Netzwerkvalidierung bestätigten, und am 12. August wurde der Vorschlag durch Abstimmung angenommen. Bereits am nächsten Tag bearbeitete das Modell Anfragen.
Für Nutzer ist dies eine spürbare Erweiterung der Möglichkeiten: DeepSeek V4 Flash hat das längste Kontextfenster im Netzwerk — 380.000 Token (fast doppelt so viel wie Kimi K2.6 und MiniMax M2.7), integriertes Reasoning und vollwertiges Tool Calling. Wir analysieren, was das für ein Modell ist, wer es entwickelt hat, welche Eigenschaften es im Gonka-Netzwerk hat, was die Benchmarks zeigen — und wann man es anstelle der anderen beiden Netzwerkmodelle wählen sollte.
Was ist DeepSeek V4 Flash und wer steckt dahinter
DeepSeek ist ein chinesisches AI-Labor aus Hangzhou, das nach den Releases von V3 und R1 weltweite Bekanntheit erlangte: R1 zeigte Anfang 2025, dass ein Open-Source-Modell zu einem Bruchteil des Budgets zu geschlossenen Flaggschiffen aufschließen kann. Im April 2026 veröffentlichte DeepSeek die V4-Familie mit zwei Modellen: dem schweren V4 Pro und dem leichten V4 Flash. Beide sind offen (MIT-Lizenz) und basieren auf der MoE-Architektur.
V4 Flash umfasst 284 Milliarden Parameter, von denen für jeden Token etwa 13 Milliarden aktiviert werden. Diese Sparsity macht das Modell schnell und kostengünstig im Betrieb: Es benötigt deutlich weniger VRAM als "dichte" Giganten, und die Generierungsgeschwindigkeit ist höher.
Im Gonka-Netzwerk läuft die Version V4-Flash-0731 — ein re-post-trained Build vom 31. Juli 2026. Architektur und Größe blieben unverändert, aber die Qualität bei Agentenaufgaben ist sprunghaft angestiegen: Laut neun von DeepSeek veröffentlichten Agenten- und Coding-Benchmarks übertrifft der Build 0731 sogar deren eigenes Flaggschiff V4 Pro in der Preview-Version. Wichtiger Hinweis zur Transparenz: Ein Teil dieser Zahlen basiert auf Messungen von DeepSeek auf einem eigenen Teststand, der zum Zeitpunkt des Schreibens noch nicht öffentlich zugänglich ist, daher gibt es noch keine unabhängige Replikation. Zum Frontier geschlossener Modelle bleibt ein Abstand: Claude Opus 4.8 wird vom Build 0731 in keinem der neun Benchmarks übertroffen — aber es ist um Größenordnungen günstiger, und genau darin liegt der Kern: maximale Agenten-Qualität zu einem Bruchteil des Preises.
Eigenschaften von DeepSeek V4 Flash im Gonka-Netzwerk
Wie bei anderen Modellen im Netzwerk ist es wichtig, zwischen den "Out-of-the-Box"-Eigenschaften des Modells und den Betriebsparametern des jeweiligen Deployments zu unterscheiden: Diese werden durch die vLLM-Inferenzkonfiguration auf den GPU-Hosts des Netzwerks bestimmt. Tatsächliche Werte über unser Gateway:
- Kontextfenster: 380.000 Token — das längste im Gonka-Netzwerk. Wir haben es empirisch überprüft: Eine Anfrage mit 381.000 Eingabe-Token wurde akzeptiert und in Dutzenden Sekunden verarbeitet. Die V4 Flash-Architektur selbst unterstützt Kontexte bis zu 1 Million Token; die praktische Obergrenze im Netzwerk wird durch die Host-Konfiguration vorgegeben (Inferenzfenster 400.000).
- Maximale Ausgabe: 8.192 Token pro Antwort — eine einheitliche Obergrenze für alle Netzwerkmodelle (Gateway-Konfiguration, kein Modell-Limit).
- Reasoning und Tool Calling: Das Modell ist mit Reasonern und Tool-Call-Parsern ausgestattet — Agentenszenarien (Cursor, Claude Code, LangChain) funktionieren sofort; wir haben mehrstufige Tool-Szenarien über OpenAI- und Anthropic-kompatible Pfade getestet.
- VRAM-Anforderung des Hosts: ca. 280 GB — das leichteste Modell im Netzwerk (zum Vergleich: MiniMax M2.7 — 320 GB, Kimi K2.6 — 720 GB). Je niedriger die Hardwareanforderung, desto einfacher können Hosts das Modell bereitstellen — das ist ein gutes Zeichen für seine Verfügbarkeit im Netzwerk.
Der Preis für die Inferenz im Gonka-Netzwerk hängt nicht von der Modellwahl ab: DeepSeek V4 Flash ist zum gleichen Satz verfügbar wie Kimi K2.6 und MiniMax M2.7 — über das JoinGonka Gateway sind dies $0.0032 pro Million Eingabe- und $0.0097 pro Million Ausgabetoken. Zur Orientierung: Die offizielle DeepSeek-API verkauft das gleiche Modell für $0.14/$0.28 pro Million, OpenRouter ab $0.08/$0.18. Die Netzwerkökonomie ist ein eigenes Thema: Der Preis wird durch die Berechnung der Rechenleistung bestimmt und nicht durch den Preis des Anbieters.
DeepSeek V4 Flash, Kimi K2.6 und MiniMax M2.7 — ein Vergleich
Jetzt gibt es drei aktive Modelle im Netzwerk (das vierte, GLM-5.2, ist registriert und wartet auf die Bereitstellung). Ein kurzer Vergleich:
| Parameter | DeepSeek V4 Flash | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|---|
| Kontext im Netzwerk | 380 000 | 200 000 | 200 000 |
| Ausgabe pro Antwort | 8 192 | 8 192 | 8 192 |
| Architektur | MoE 284B (~13B aktiv) | MoE ~1T Klasse | MoE |
| VRAM pro Node | 280 GB | 720 GB | 320 GB |
| Stärke | Langer Kontext, Reasoning, Geschwindigkeit | Agentenaufgaben, Code | Tägliche Entwicklung, Stabilität |
| Preis via Gateway | identisch — $0.0032 Eingang / $0.0097 Ausgang pro 1M | ||
Das praktische Resultat des identischen Preises: Sie können das Modell rein nach der Aufgabe auswählen, ohne über das Budget nachzudenken. Wenn Sie den längsten Kontext oder schnelle Antworten mit Reasoning benötigen — DeepSeek V4 Flash; maximale Agenten-Zuverlässigkeit bei komplexem Code — Kimi K2.6; das solide Arbeitspferd für jeden Tag — MiniMax M2.7.
Benchmarks V4-Flash-0731: Was der Build zeigt
Die wichtigsten veröffentlichten Ergebnisse für den Build 0731 (laut DeepSeek und unabhängigen Aggregatoren):
- SWE-bench Verified: 79,0% — Lösung realer GitHub-Aufgaben; ein Niveau, das noch vor einem Jahr nur geschlossenen Flaggschiffen zugänglich war. Zum Vergleich: Kimi K2.6 — 71,3%.
- GPQA Diamond: 88,1% — Fragen auf Promotionsniveau in der Wissenschaft; der erweiterte Reasoning-Modus erhöht die Genauigkeit bei mehrstufigen Aufgaben.
- Terminal Bench 2.1: 82,7 — Arbeiten im Terminal als Agent; die Preview-Version von Flash lag bei 61,8, V4 Pro Preview bei 72,1.
- DeepSWE: 54,4 — Ein neuer, strenger Benchmark von DeepSeek mit nahezu null False-Positive-Raten; der Wert stammt vom Anbieter, die Testumgebung wurde noch nicht veröffentlicht — daher mit Vorsicht zu genießen.
Faire Einordnung: In neun Agenten-Benchmarks übertrifft der Build 0731 das eigene V4 Pro Preview, aber nicht Claude Opus 4.8 — der Rückstand beträgt im Durchschnitt etwa 6 Punkte. Gleichzeitig ist das Modell beim Preis pro Token um zwei Größenordnungen günstiger als Opus und über das Gonka-Netzwerk noch Dutzende Male günstiger als die offizielle DeepSeek API. Genau dieses Verhältnis „Qualität nah am Frontier-Modell für einen Bruchteil des Preises“ macht es interessant: Detaillierte unabhängige Messungen finden Sie auf Artificial Analysis, Gewichte und die Modellkarte auf Hugging Face.
So nutzen Sie DeepSeek V4 Flash über das JoinGonka Gateway
Das Modell ist über das JoinGonka Gateway via OpenAI- und Anthropic-kompatibler API verfügbar. Modell-Identifikator: deepseek-ai/DeepSeek-V4-Flash-0731.
Der schnellste Weg ist das One-Command-Installationsskript, das Ihr Tool (Claude Code, OpenClaw, Cline, opencode, Aider und andere) sofort für dieses Modell konfiguriert:
npx @joingonka/setup --model deepseekDirekter API-Aufruf (OpenAI-Format):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-ihr-schluessel" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Hallo!"}]}'Bei der Registrierung erhalten Sie 10 000 000 kostenlose Token — mit 380K Kontext ist dies die Möglichkeit, das Modell sofort an echten großen Dokumenten und Codebasen zu testen. Schritt-für-Schritt-Beispiele für Python und TypeScript finden Sie in API Quickstart; zum Ausprobieren ohne Registrierung können Sie den kostenlosen Chat nutzen, indem Sie DeepSeek V4 Flash in der Modellliste auswählen.
Wann Sie DeepSeek V4 Flash wählen sollten — praktische Szenarien
Starke Szenarien für dieses Modell:
- Große Dokumente und gesamte Codebasen. 380 000 Token entsprechen etwa 280 000 Wörtern: Ein Jahresbericht, ein juristisches Dokumentenpaket oder ein durchschnittliches Repository passen in eine einzige Anfrage, ohne Zerstückelung und ohne Verlust der Zusammenhänge zwischen den Teilen.
- Lange Agentensitzungen. Ein autonomer Agent, der Dateien liest, Tools aufruft und die Historie ansammelt, stößt am schnellsten an die Kontextgrenze — ein Puffer von 380K Token bedeutet spürbar längere Sitzungen ohne Speicherverlust.
- RAG mit großen Stichproben. Je mehr relevante Dokumente in den Kontext passen, desto geringer ist die Abhängigkeit von der Suchgenauigkeit.
- Aufgaben mit Reasoning. Der Reasoning-Modus bringt einen Zuwachs bei Mathematik, Wissenschaft und mehrstufiger Logik — zum Preis eines normalen Modells.
Wann ist ein anderes Modell im Netzwerk sinnvoller: Für maximal zuverlässiges Agenten-Coding in komplexen Repositories bleibt Kimi K2.6 stark (detaillierte Analyse in unserem Artikel über die besten Modelle für Code), und MiniMax M2.7 bleibt das bewährte Arbeitspferd für alltägliche Aufgaben. Dank des einheitlichen Preises können Sie frei experimentieren — das Umschalten des Modells ist nur eine Zeile im Request.
Möchten Sie mehr erfahren?
Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.
DeepSeek V4 Flash über Gateway testen →