Abschnitte der Wissensbasis ▾

Technologie

Qwen3-235B: Das Modell, das Gonka früher bediente

Das Gonka-Netzwerk vermietet nicht nur GPUs – es bedient AI-Modelle für inference. Lange Zeit war das Haupt- und einzige Modell des Netzwerks Qwen3-235B-A22B-Instruct, entwickelt von Alibaba Cloud. Im Laufe der Zeit stellte das Netzwerk auf eine Multimodell-Architektur um und Qwen3-235B wurde aus dem Netzwerk entfernt: Heute bedient Gonka Kimi K2.6 von Moonshot AI und MiniMax M2.7. Wir untersuchen, was Qwen3-235B ist, welche Rolle es im Gonka-Netzwerk spielte und wodurch es ersetzt wurde – als bemerkenswertes Open-Source MoE-Modell bleibt es ein nützlicher Referenzpunkt.

Was ist Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 ist ein großes Sprachmodell (LLM) der Qwen3-Familie, das vom Qwen-Team bei Alibaba Cloud entwickelt wurde. Der vollständige Name bedeutet: Qwen3 – die dritte Generation der Serie, 235B – insgesamt 235 Milliarden Parameter, A22B – 22 Milliarden aktive Parameter pro Anfrage, Instruct – eine Version, die darauf trainiert ist, Anweisungen zu folgen, 2507 – Veröffentlichung vom Juli 2025, FP8 – 8-Bit-Quantisierung zur Speicheroptimierung.

Das entscheidende architektonische Merkmal ist MoE (Mixture of Experts). Im Gegensatz zu „dichten“ Modellen (GPT-5.5, Claude Sonnet 4.6), bei denen jedes Token alle Parameter durchläuft, aktiviert ein MoE-Modell für jede Anfrage nur eine Untermenge von „Experten“ – spezialisierte Blöcke des neuronalen Netzes. Im Fall von Qwen3-235B werden von 235 Milliarden Parametern für jedes Token nur 22 Milliarden aktiviert – weniger als 10%. Dies führt zu einer Qualitätsstufe, die mit Modellen mit über 200B Parametern vergleichbar ist, bei den Rechenkosten eines Modells mit 22B.

Praktisch bedeutet dies: Das Modell ist intelligenter, als man es von seiner Geschwindigkeit erwarten würde. Es verarbeitet Anfragen deutlich schneller als dichte Modelle vergleichbarer Qualität und benötigt dabei ein Vielfaches weniger VRAM für die Inferenz. Aus diesem Grund ist MoE die dominierende Architektur für die größten Modelle der Jahre 2025–2026 geworden.

Das Kontextfenster von Qwen3-235B beträgt 131.072 Tokens (~100.000 Wörter) – ausreichend für die Analyse ganzer Bücher, Codebasen oder langer juristischer Dokumente in einer einzigen Anfrage. Das Modell unterstützt 119 Sprachen, darunter Russisch, Englisch, Chinesisch, Arabisch, Hindi und Dutzende andere – was es zu einem der mehrsprachigsten Modelle auf dem Markt macht.

Eigenschaften und Benchmarks

Qwen3-235B konkurriert mit den größten geschlossenen und offenen Modellen. Hier ist ein Vergleich der wichtigsten Merkmale:

ModellParameterKontextMoEOpen SourcePreis (pro 1M Tokens)
Qwen3-235B (Alibaba)235B (22B aktiv)131KJaJa (Apache 2.0)$0.07+ (Hosting)
GPT-5.5 (OpenAI)~1.8T (geschätzt)128KJa (vermutet)Nein$5.00
Claude Sonnet 4.6 (Anthropic)Nicht veröffentlicht200KNein (vermutet)Nein$3.00
Llama 4 Maverick (Meta)400B (17B aktiv)1MJaJa (Llama License)$0.20+ (Hosting)
DeepSeek-R1 (DeepSeek)671B (37B aktiv)128KJaJa (MIT)$0.55

Qwen3-235B zeigt eine Qualität, die auf den meisten Benchmarks mit GPT-5.5 und Claude Sonnet 4.6 vergleichbar ist. Als Open-Weights MoE-Modell ist es jedoch um ein Vielfaches günstiger als proprietäre Alternativen: Die MoE-Architektur aktiviert nur einen Bruchteil der Parameter pro Anfrage, was die Rechenkosten drastisch senkt. Dasselbe Prinzip der günstigen, dezentralen Inference wendet das Gonka-Netzwerk heute auf seine aktuellen Modelle an — Kimi K2.6 und MiniMax M2.7, verfügbar über das JoinGonka Gateway für $0.003 pro 1M Tokens (tausendfach günstiger als GPT-5.5 und Claude).

In den Benchmarks MMLU-Pro, HumanEval, MATH-500 und GSM8K gehört das Modell zu den Top 3 der Open-Source-Modelle und steht bei mathematischen Schlussfolgerungen (Reasoning) nur hinter DeepSeek-R1 zurück. Bei der Code-Generierung, Übersetzung und Befolgung von Anweisungen übertrifft Qwen3-235B durchgehend Llama 4 Maverick und ist vergleichbar mit Claude Sonnet 4.6.

Wie Gonka Qwen3-235B nutzte

Als Qwen3-235B das Hauptmodell des Netzwerks war, lief es verteilt im Gonka-Netzwerk — über das DiLoCo-Protokoll, das für inference angepasst wurde. Das vollständige Modell im FP8-Format benötigt etwa 640 GB Videospeicher (VRAM), was auf einer einzelnen GPU unmöglich ist — selbst H100 80GB oder H200 141GB reichen nicht aus. Daher wurde das Modell in Schichten aufgeteilt (tensor parallelism + pipeline parallelism) und auf mehrere ML-Nodes verteilt.

In der Praxis lief Qwen3-235B auf einem Cluster aus 8–16 GPU-Nodes, jede mit mindestens 40 GB VRAM. Transfer Agents leiteten die Anfrage an den richtigen Cluster weiter, vLLM auf jeder Node verarbeitete seinen Teil des Modells, die Ergebnisse wurden aggregiert und an den Benutzer zurückgegeben. Der gesamte Prozess dauerte hunderte Millisekunden — der Benutzer spürte nicht, dass seine Anfrage von einem Dutzend GPUs an verschiedenen Orten weltweit verarbeitet wurde. Das gleiche Prinzip des verteilten inference nutzt das Netzwerk auch heute — jedoch für aktuelle Modelle.

Ein wichtiges technisches Detail: Gonka verwendet vLLM als Engine für serving. vLLM ist ein Open-Source-Projekt, das eine leistungsstarke Textgenerierung durch PagedAttention ermöglicht — einen Algorithmus, der die Nutzung des Videospeichers bei der parallelen Verarbeitung vieler Anfragen optimiert. Dies ermöglicht es dem Netzwerk, Tausende gleichzeitiger Benutzer ohne Qualitätsverlust zu bedienen.

Das Modell unterstützt natives tool calling — das Aufrufen von Funktionen und Tools direkt aus der Antwort des Modells. Diese Fähigkeit wurde in Gonka über PR #767 mit einem Schwellenwert von 0.958 für die Erkennung von Tool-Aufrufen hinzugefügt. Bei Qwen3-235B erlaubte dies Entwicklern den Bau von AI-Agenten, die mit externen APIs, Datenbanken und Tools interagieren — alles über eine einzige Anfrage. Die Unterstützung für tool calling ist auch in den aktuellen Netzwerkmodellen erhalten geblieben.

Das Gonka-Netzwerk umfasst mehr als 4 000 GPUs (H100, H200, A100, RTX 4090 und andere), vereint in über 120 ML-Nodes. Dies ist eines der größten verteilten GPU-Netzwerke für AI inference der Welt — und während diese Leistung früher auf Qwen3-235B gerichtet war, bedient sie heute die aktuellen Netzwerkmodelle, Kimi K2.6 und MiniMax M2.7.

Kann man Qwen3-235B jetzt noch ausprobieren

Kurze Antwort: Über das Gonka-Netzwerk – nein. Qwen3-235B wurde aus dem Netzwerk entfernt, daher kann es über die ID qwen3-235b-a22b nicht mehr über unser Gateway aufgerufen werden. Da das Modell jedoch offen ist (Apache 2.0), kann es weiterhin eigenständig ausgeführt oder über Drittanbieter für Open-Weights-Modelle bezogen werden — zum Beispiel OpenRouter (ca. $0.071/$0.100 pro 1M Tokens).

Wenn Sie jedoch nach der günstigen dezentralen Inference suchen, für die man Gonka wählt, ist diese weiterhin vorhanden; sie läuft jetzt einfach auf den aktuellen Netzwerkmodellen. Über das JoinGonka API Gateway stehen Kimi K2.6 und MiniMax M2.7 via OpenAI-kompatiblem API bereit: Jeder Code, der für OpenAI geschrieben wurde, funktioniert ohne Änderungen — Sie müssen lediglich URL, API-Key und Modellnamen ersetzen.

Beispiel für eine Anfrage an ein aktuelles Modell:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Erkläre die MoE-Architektur"}]
  }'

Kosten: $0.003 pro 1 Million Tokens — das ist 1.700 Mal günstiger als GPT-5.5 ($5.00/1M) und 1.000 Mal günstiger als Claude Sonnet 4.6 ($3.00/1M). Bei der Registrierung erhalten Sie 10 Millionen kostenlose Tokens zum Testen.

Das Gateway ist kompatibel mit populären Entwicklungstools: Der Quick Start beschreibt die Verbindung über Python, Node.js und curl. Zudem werden IDE-Integrationen — Cursor, Continue, Cline, Aider und Claude Code — sowie Frameworks für AI-Agenten wie LangChain, n8n, LibreChat und Open WebUI unterstützt.

Für den schnellen Start:

  1. Registrieren Sie sich auf gate.joingonka.ai (verbinden Sie ein Wallet oder erstellen Sie ein neues)
  2. Holen Sie sich den API-Key aus dem Dashboard
  3. Ersetzen Sie api.openai.com durch gate.joingonka.ai/api in Ihrem Code
  4. Geben Sie das aktuelle Netzwerkmodell an — moonshotai/Kimi-K2.6 oder MiniMaxAI/MiniMax-M2.7 (vollständige Liste unter dem Endpoint GET /v1/models)

Dezentrale Enterprise-Inference zum Hobby-Projekt-Preis bleibt bestehen — Qwen3-235B hat lediglich Platz für neuere Netzwerkmodelle gemacht. Dasselbe Preis-Leistungs-Verhältnis finden Sie nun mit Kimi K2.6 und MiniMax M2.7.

Qwen3-235B-A22B ist ein MoE-Modell mit 235 Milliarden Parametern (22 Milliarden aktiv) von Alibaba Cloud, das in der Anfangsphase das Hauptmodell des Gonka-Netzwerks für dezentrales AI inference war. Dank der MoE-Architektur bietet es eine Qualität auf dem Niveau führender proprietärer Modelle bei deutlich geringeren Rechenkosten. Inzwischen wurde Qwen3-235B aus dem Netzwerk entfernt: Die aktuellen Gonka-Modelle sind Kimi K2.6 und MiniMax M2.7, die über das JoinGonka Gateway via OpenAI-kompatibler API für $0.003/1M Token verfügbar sind. Qwen3-235B selbst bleibt Open Source (Apache 2.0) und ist auf Drittanbieter-Hosting-Plattformen für Open-Weights-Modelle verfügbar.

Möchten Sie mehr erfahren?

Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.

Aktuelle Gonka-Modelle ausprobieren →