Abschnitte der Wissensbasis ▾

Technologie

Qwen3-235B: Das Modell, das Gonka früher bediente

Das Gonka-Netzwerk vermietet nicht nur GPUs – es betreibt KI-Modelle für das Inference. Lange Zeit war das primäre und einzige Modell des Netzwerks Qwen3-235B-A22B-Instruct, entwickelt von Alibaba Cloud. Im Laufe der Zeit ist das Netzwerk auf eine Multimodell-Architektur umgestiegen, und Qwen3-235B wurde aus dem Netzwerk entfernt: Heute betreibt Gonka Kimi K2.6 von Moonshot AI, MiniMax M2.7 und DeepSeek V4 Flash. Wir schauen uns an, was Qwen3-235B ist, welche Rolle es im Gonka-Netzwerk spielte und wodurch es ersetzt wurde – als bemerkenswertes Open-Source-MoE-Modell bleibt es ein nützlicher Orientierungspunkt.

Was ist Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 ist ein großes Sprachmodell (LLM) der Qwen3-Familie, das vom Qwen-Team bei Alibaba Cloud entwickelt wurde. Der vollständige Name bedeutet: Qwen3 – die dritte Generation der Serie, 235B – insgesamt 235 Milliarden Parameter, A22B – 22 Milliarden aktive Parameter pro Anfrage, Instruct – eine Version, die darauf trainiert ist, Anweisungen zu folgen, 2507 – Veröffentlichung vom Juli 2025, FP8 – 8-Bit-Quantisierung zur Speicheroptimierung.

Das entscheidende architektonische Merkmal ist MoE (Mixture of Experts). Im Gegensatz zu „dichten“ Modellen (GPT-5.5, Claude Sonnet 4.6), bei denen jedes Token alle Parameter durchläuft, aktiviert ein MoE-Modell für jede Anfrage nur eine Untermenge von „Experten“ – spezialisierte Blöcke des neuronalen Netzes. Im Fall von Qwen3-235B werden von 235 Milliarden Parametern für jedes Token nur 22 Milliarden aktiviert – weniger als 10%. Dies führt zu einer Qualitätsstufe, die mit Modellen mit über 200B Parametern vergleichbar ist, bei den Rechenkosten eines Modells mit 22B.

Praktisch bedeutet dies: Das Modell ist intelligenter, als man es von seiner Geschwindigkeit erwarten würde. Es verarbeitet Anfragen deutlich schneller als dichte Modelle vergleichbarer Qualität und benötigt dabei ein Vielfaches weniger VRAM für die Inferenz. Aus diesem Grund ist MoE die dominierende Architektur für die größten Modelle der Jahre 2025–2026 geworden.

Das Kontextfenster von Qwen3-235B beträgt 131.072 Tokens (~100.000 Wörter) – ausreichend für die Analyse ganzer Bücher, Codebasen oder langer juristischer Dokumente in einer einzigen Anfrage. Das Modell unterstützt 119 Sprachen, darunter Russisch, Englisch, Chinesisch, Arabisch, Hindi und Dutzende andere – was es zu einem der mehrsprachigsten Modelle auf dem Markt macht.

Eigenschaften und Benchmarks

Qwen3-235B konkurriert mit den größten geschlossenen und offenen Modellen. Hier ist ein Vergleich der Hauptmerkmale:

ModellParameterKontextMoEOpen SourcePreis (pro 1M Token)
Qwen3-235B (Alibaba)235B (22B aktiv)131KJaJa (Apache 2.0)$0.07+ (Hosting)
GPT-5.5 (OpenAI)~1.8T (geschätzt)128KJa (vermutet)Nein$5.00
Claude Sonnet 4.6 (Anthropic)Nicht bekannt200KNein (vermutet)Nein$3.00
Llama 4 Maverick (Meta)400B (17B aktiv)1MJaJa (Llama License)$0.20+ (Hosting)
DeepSeek-R1 (DeepSeek)671B (37B aktiv)128KJaJa (MIT)$0.55

Qwen3-235B zeigt eine Qualitätsstufe, die in den meisten Benchmarks mit GPT-5.5 und Claude Sonnet 4.6 vergleichbar ist, während es als Open-Weights-MoE-Modell ein Vielfaches günstiger ist als proprietäre Äquivalente: Die MoE-Architektur aktiviert nur einen Teil der Parameter pro Anfrage und senkt die Rechenkosten drastisch. Dasselbe Prinzip des kostengünstigen dezentralen Inference wendet das Gonka-Netzwerk heute auf seine aktiven Modelle an — Kimi K2.6 und MiniMax M2.7, die über das JoinGonka Gateway zu $0.0047 pro 1M Token verfügbar sind (hundert- bis tausendmal günstiger als GPT-5.5 und Claude).

In den Benchmarks MMLU-Pro, HumanEval, MATH-500 und GSM8K gehört das Modell zu den Top 3 der Open-Source-Modelle und liegt bei mathematischen Schlussfolgerungen (reasoning) nur hinter DeepSeek-R1. Bei Aufgaben zur Code-Generierung, Übersetzung und Befolgung von Anweisungen übertrifft Qwen3-235B Llama 4 Maverick konstant und ist mit Claude Sonnet 4.6 vergleichbar.

Wie Gonka Qwen3-235B nutzte

Als Qwen3-235B das Hauptmodell des Netzwerks war, lief es im Gonka-Netzwerk verteilt – über das Protokoll DiLoCo, das für das Inference angepasst wurde. Das vollständige Modell im FP8-Format erfordert etwa 640 GB Videospeicher (VRAM), was auf einer einzelnen GPU unmöglich unterzubringen ist – selbst H100 80GB oder H200 141GB reichen nicht aus. Daher wurde das Modell schichtweise (tensor parallelism + pipeline parallelism) auf mehrere ML-Nodes aufgeteilt.

In der Praxis lief Qwen3-235B auf einem Cluster aus 8–16 GPU-Nodes, jede mit mindestens 40 GB VRAM. Transfer Agents leiteten die Anfrage an den richtigen Cluster weiter, vLLM auf jeder Node verarbeitete seinen Fragmentteil des Modells, die Ergebnisse wurden aggregiert und an den Benutzer zurückgegeben. Der gesamte Prozess dauerte hunderte Millisekunden – der Benutzer spürte nicht, dass seine Anfrage von einem Dutzend GPUs an verschiedenen Orten der Welt verarbeitet wurde. Dasselbe Prinzip des verteilten Inference wendet das Netzwerk auch heute noch an – bereits auf die aktuellen Modelle.

Ein wichtiger technischer Aspekt: Gonka verwendet vLLM als Serving-Engine. vLLM ist ein Open-Source-Projekt, das eine leistungsstarke Textgenerierung über PagedAttention ermöglicht – einen Algorithmus, der die Nutzung des Videospeichers bei der parallelen Verarbeitung mehrerer Anfragen optimiert. Dies ermöglicht es dem Netzwerk, Tausende gleichzeitiger Benutzer ohne Qualitätsverlust zu bedienen.

Das Modell unterstützt natives Tool Calling – den Aufruf von Funktionen und Werkzeugen direkt aus der Antwort des Modells. Diese Fähigkeit wurde in Gonka über PR #767 mit einem Schwellenwert von 0.958 für die Erkennung von Tool-Aufrufen hinzugefügt. Bei Qwen3-235B konnten Entwickler dadurch KI-Agenten bauen, die mit externen APIs, Datenbanken und Tools interagieren – alles über eine einzige Anfrage. Die Unterstützung für Tool Calling wurde auch in den aktuellen Modellen des Netzwerks beibehalten.

Das Gonka-Netzwerk umfasst über 4 000 GPUs (H100, H200, A100, RTX 4090 und andere), die in über 120 ML-Nodes vereint sind. Dies ist eines der größten verteilten GPU-Netzwerke für KI-Inference weltweit – und während diese Kapazität früher auf Qwen3-235B gerichtet war, bedient sie heute die aktuellen Modelle des Netzwerks – Kimi K2.6, MiniMax M2.7 und DeepSeek V4 Flash.

Kann man Qwen3-235B jetzt noch ausprobieren

Direkte Antwort: über das Gonka-Netzwerk — nicht mehr. Qwen3-235B wurde aus dem Netzwerk entfernt, daher kann sie über ihren Identifikator qwen3-235b-a22b nicht mehr über unser Gateway aufgerufen werden. Da das Modell offen ist (Apache 2.0), kann es weiterhin eigenständig ausgeführt oder über Drittanbieter von Open-Weights-Modellen angesprochen werden — zum Beispiel über OpenRouter (voraussichtlich $0.071/$0.100 pro 1M Tokens).

Wenn Sie jedoch genau die kostengünstige dezentralisierte Inference benötigen, für die man zu Gonka kommt, so ist diese weiterhin verfügbar; sie läuft jetzt lediglich auf den aktiven Modellen des Netzwerks. Über das JoinGonka API Gateway sind Kimi K2.6, MiniMax M2.7 und DeepSeek V4 Flash über eine OpenAI-kompatible API verfügbar: Jeder für OpenAI geschriebene Code funktioniert unverändert — es reicht aus, die URL, den API-Schlüssel und den Modellnamen zu ersetzen.

Beispiel für eine Anfrage an ein aktives Modell:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Erkläre die MoE-Architektur"}]
  }'

Kosten: $0.0047 pro 1 Million Tokens — das ist ~800-mal günstiger als GPT-5.5 ($5.00/1M) und ~500-mal günstiger als Claude Sonnet 4.6 ($3.00/1M). Bei der Registrierung erhalten Sie kostenlose 1.5M Tokens zum Testen.

Das Gateway ist mit gängigen Entwicklungstools kompatibel: Der Quick Start beschreibt die Verbindung über Python, Node.js und curl. Zudem werden IDE-Integrationen — Cursor, Continue, Cline, Aider und Claude Code — sowie Frameworks für AI-Agenten unterstützt: LangChain, n8n, LibreChat, Open WebUI.

Für den schnellen Start:

  1. Registrieren Sie sich auf gate.joingonka.ai (verbinden Sie ein Wallet oder erstellen Sie ein neues)
  2. Holen Sie sich Ihren API-Schlüssel im Dashboard
  3. Ersetzen Sie api.openai.com durch gate.joingonka.ai/api in Ihrem Code
  4. Geben Sie das aktuelle Modell des Netzwerks an — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 oder deepseek-ai/DeepSeek-V4-Flash-0731 (die vollständige Liste finden Sie im Endpunkt GET /v1/models)

Dezentralisierte Inference auf Enterprise-Niveau zum Preis eines Hobby-Projekts ist weiterhin verfügbar — Qwen3-235B hat lediglich Platz für neuere Modelle im Netzwerk gemacht. Die gleiche Kombination aus Preis und Qualität läuft jetzt auf Kimi K2.6, MiniMax M2.7 und DeepSeek V4 Flash.

Qwen3-235B-A22B — ein MoE-Modell mit 235 Milliarden Parametern (22 Milliarden aktiv) von Alibaba Cloud, das in der Anfangsphase das Hauptmodell des Gonka-Netzwerks für dezentrales AI inference war. Dank der MoE-Architektur bietet es Qualität auf dem Niveau führender proprietärer Modelle bei weitaus geringeren Rechenkosten. Qwen3-235B wurde mittlerweile aus dem Netzwerk entfernt: Die aktuellen Gonka-Modelle sind Kimi K2.6, MiniMax M2.7 und DeepSeek V4 Flash, die über das JoinGonka Gateway per OpenAI-kompatibler API für $0.0047/1M Token verfügbar sind. Qwen3-235B selbst bleibt Open Source (Apache 2.0) und ist auf Drittanbieter-Hostings für open-weights Modelle verfügbar.

Möchten Sie mehr erfahren?

Erkunden Sie andere Abschnitte oder beginnen Sie jetzt GNK zu verdienen.

Aktuelle Gonka-Modelle ausprobieren →