Sekcje bazy wiedzy ▾

Technologia

Qwen3-235B: model, który wcześniej obsługiwała Gonka

Sieć Gonka nie tylko wynajmuje GPU — ona obsługuje modele AI w celu inference. Przez długi czas głównym i jedynym modelem sieci był Qwen3-235B-A22B-Instruct, opracowany przez Alibaba Cloud. Z czasem sieć przeszła na architekturę multimodelową, a Qwen3-235B została wycofana z sieci: dzisiaj Gonka obsługuje Kimi K2.6 od Moonshot AI, MiniMax M2.7 oraz DeepSeek V4 Flash. Przyjrzyjmy się, czym jest Qwen3-235B, jaką rolę odegrała w sieci Gonka i czym została zastąpiona — jako znaczący model open-source MoE pozostaje użytecznym punktem odniesienia.

Co to jest Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 to duży model językowy (LLM) z rodziny Qwen3, opracowany przez zespół Qwen w Alibaba Cloud. Pełna nazwa oznacza: Qwen3 — trzecia generacja serii, 235B — 235 miliardów całkowitych parametrów, A22B — 22 miliardy aktywnych parametrów na każde zapytanie, Instruct — wersja przeszkolona do wykonywania instrukcji, 2507 — wydanie z lipca 2025, FP8 — 8-bitowa kwantyzacja dla optymalizacji pamięci.

Kluczową cechą architektoniczną jest MoE (Mixture of Experts). W przeciwieństwie do modeli „gęstych” (GPT-5.5, Claude Sonnet 4.6), gdzie każdy token przechodzi przez wszystkie parametry, model MoE aktywuje tylko podzbiór „ekspertów” — wyspecjalizowanych bloków sieci neuronowej — na każde zapytanie. W przypadku Qwen3-235B z 235 miliardów parametrów, na każdy token aktywowanych jest tylko 22 miliardy — mniej niż 10%. Zapewnia to jakość na poziomie modeli z ponad 200B parametrami przy kosztach obliczeniowych modelu z 22B.

Praktycznie oznacza to: model jest inteligentniejszy, niż można by oczekiwać od jego szybkości. Przetwarza zapytania znacznie szybciej niż modele gęste o porównywalnej jakości, jednocześnie wymagając znacznie mniej VRAM do wnioskowania. Dlatego MoE stało się dominującą architekturą dla największych modeli w latach 2025–2026.

Okno kontekstowe Qwen3-235B wynosi 131 072 tokeny (~100 000 słów) — to wystarczająco dużo, by analizować całe książki, bazy kodu lub długie dokumenty prawne w jednym zapytaniu. Model obsługuje 119 języków, w tym rosyjski, angielski, chiński, arabski, hindi i dziesiątki innych — co czyni go jednym z najbardziej wielojęzycznych modeli na rynku.

Charakterystyka i benchmarki

Qwen3-235B konkuruje z największymi zamkniętymi i otwartymi modelami. Oto porównanie kluczowych cech:

ModelParametryKontekstMoEOpen SourceCena (za 1M tokenów)
Qwen3-235B (Alibaba)235B (22B aktywnych)131KTakTak (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (szacunek)128KTak (domniemywane)Nie$5.00
Claude Sonnet 4.6 (Anthropic)Nieujawnione200KNie (domniemywane)Nie$3.00
Llama 4 Maverick (Meta)400B (17B aktywnych)1MTakTak (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B aktywnych)128KTakTak (MIT)$0.55

Qwen3-235B wykazuje jakość porównywalną z GPT-5.5 i Claude Sonnet 4.6 w większości benchmarków, przy czym jako model open-weights MoE jest wielokrotnie tańszy od odpowiedników własnościowych: architektura MoE aktywuje tylko część parametrów na żądanie i drastycznie obniża koszty obliczeniowe. Tę samą zasadę taniego zdecentralizowanego inference sieć Gonka stosuje dziś do swoich obecnych modeli — Kimi K2.6 i MiniMax M2.7, dostępnych przez JoinGonka Gateway za $0.0047 za 1M tokenów (setki—tysiące razy taniej niż GPT-5.5 i Claude).

W benchmarkach MMLU-Pro, HumanEval, MATH-500 oraz GSM8K model plasuje się w pierwszej trójce modeli open-source, ustępując jedynie DeepSeek-R1 w zadaniach wnioskowania matematycznego (reasoning). W zadaniach generowania kodu, tłumaczenia i podążania za instrukcjami Qwen3-235B stabilnie wyprzedza Llama 4 Maverick i jest porównywalny z Claude Sonnet 4.6.

Jak Gonka wykorzystywała Qwen3-235B

Gdy Qwen3-235B była głównym modelem sieci, działała w sieci Gonka w sposób rozproszony — poprzez protokół DiLoCo, zaadaptowany do inference. Pełny model w formacie FP8 wymaga około 640 GB pamięci wideo (VRAM), czego nie da się zmieścić na jednym GPU — nawet H100 80GB lub H200 141GB to za mało. Dlatego model był dzielony warstwowo (tensor parallelism + pipeline parallelism) pomiędzy wieloma ML-nodami.

W praktyce Qwen3-235B działała na klastrze składającym się z 8–16 nodów GPU, każdy z minimum 40 GB VRAM. Transfer Agents kierowały zapytanie do odpowiedniego klastra, vLLM na każdym nodzie przetwarzał swój fragment modelu, wyniki były agregowane i zwracane użytkownikowi. Cały proces zajmował setki milisekund — użytkownik nie odczuwał, że jego zapytanie jest przetwarzane przez dziesięć GPU w różnych punktach planety. Tę samą zasadę rozproszonego inference sieć stosuje również obecnie — do działających modeli.

Ważny szczegół techniczny: Gonka wykorzystuje vLLM jako silnik do serving. vLLM to projekt open-source, który zapewnia wydajne generowanie tekstu poprzez PagedAttention — algorytm optymalizujący wykorzystanie pamięci wideo przy równoległym przetwarzaniu wielu zapytań. Pozwala to sieci obsługiwać tysiące jednoczesnych użytkowników bez spadku jakości.

Model wspiera natywny tool calling — wywoływanie funkcji i narzędzi bezpośrednio z odpowiedzi modelu. Ta możliwość została dodana do Gonka poprzez PR #767 z progiem 0.958 dla definicji wywołań narzędzi. W Qwen3-235B pozwalało to programistom budować agentów AI, którzy wchodzą w interakcję z zewnętrznymi API, bazami danych i narzędziami — wszystko w ramach jednego zapytania. Wsparcie dla tool calling zostało zachowane w działających modelach sieci.

Sieć Gonka liczy ponad 4 000 GPU (H100, H200, A100, RTX 4090 i inne), połączonych w 120+ ML-nodów. Jest to jedna z największych rozproszonych sieci GPU do AI inference na świecie — i jeśli wcześniej ta moc była skierowana na Qwen3-235B, to dzisiaj obsługuje ona bieżące modele sieci — Kimi K2.6, MiniMax M2.7 oraz DeepSeek V4 Flash.

Czy można teraz wypróbować Qwen3-235B

Krótka odpowiedź: przez sieć Gonka — już nie. Qwen3-235B została wycofana z sieci, więc nie można już wywołać jej za pomocą identyfikatora qwen3-235b-a22b przez nasz Gateway. Ponieważ model jest otwarty (Apache 2.0), wciąż można uruchomić go samodzielnie lub skorzystać z zewnętrznych hostingów modeli open-weights — na przykład przez OpenRouter (orientacyjnie $0.071/$0.100 za 1M tokenów).

Jeśli potrzebujesz tego samego taniego, zdecentralizowanego inference, dla którego przychodzi się do Gonka — on nigdzie nie zniknął, po prostu teraz działa na aktywnych modelach sieci. Przez JoinGonka API Gateway dostępne są Kimi K2.6, MiniMax M2.7 oraz DeepSeek V4 Flash za pośrednictwem API kompatybilnego z OpenAI: każdy kod napisany dla OpenAI działa bez zmian — wystarczy zmienić URL, klucz API oraz nazwę modelu.

Przykład zapytania do aktywnego modelu:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Wyjaśnij architekturę MoE"}]
  }'

Koszt: $0.0047 za 1 milion tokenów — to około 800 razy taniej niż GPT-5.5 ($5.00/1M) i około 500 razy taniej niż Claude Sonnet 4.6 ($3.00/1M). Przy rejestracji otrzymujesz darmowe 1.5M tokenów do testów.

Gateway jest kompatybilny z popularnymi narzędziami programistycznymi: Quick Start opisuje podłączenie przez Python, Node.js i curl. Obsługiwane są również integracje IDE — Cursor, Continue, Cline, Aider oraz Claude Code — a także frameworki dla agentów AI: LangChain, n8n, LibreChat, Open WebUI.

Aby szybko zacząć:

  1. Zarejestruj się na gate.joingonka.ai (podłącz portfel lub stwórz nowy)
  2. Uzyskaj klucz API w Dashboard
  3. Zamień api.openai.com na gate.joingonka.ai/api w swoim kodzie
  4. Wskaż aktualny model sieci — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 lub deepseek-ai/DeepSeek-V4-Flash-0731 (pełna lista znajduje się w endpoint GET /v1/models)

Zdecentralizowany inference klasy enterprise w cenie hobbystycznego projektu nie zniknął — Qwen3-235B jedynie ustąpiła miejsca nowszym modelom sieci. To samo połączenie ceny i jakości działa teraz na Kimi K2.6, MiniMax M2.7 oraz DeepSeek V4 Flash.

Qwen3-235B-A22B to model MoE z 235 miliardami parametrów (22 miliardy aktywnych) od Alibaba Cloud, który na wczesnym etapie był głównym modelem sieci Gonka dla zdecentralizowanego AI inference. Dzięki architekturze MoE zapewnia jakość na poziomie czołowych modeli własnościowych przy wielokrotnie niższych kosztach obliczeniowych. Obecnie Qwen3-235B został wycofany z sieci: aktualne modele Gonka to Kimi K2.6, MiniMax M2.7 oraz DeepSeek V4 Flash, dostępne przez JoinGonka Gateway za pomocą API kompatybilnego z OpenAI za $0.0047/1M tokenów. Sam Qwen3-235B pozostaje otwarty (Apache 2.0) i dostępny na zewnętrznych hostingach modeli open-weights.

Chcesz wiedzieć więcej?

Zapoznaj się z innymi sekcjami lub zacznij zarabiać GNK już teraz.

Wypróbuj aktualne modele Gonka →