Sekcje bazy wiedzy ▾

Technologia

Qwen3-235B: model, który wcześniej obsługiwała Gonka

Sieć Gonka nie tylko wynajmuje GPU — obsługuje modele AI dla celów inference. Przez długi czas głównym i jedynym modelem sieci był Qwen3-235B-A22B-Instruct, opracowany przez Alibaba Cloud. Z czasem sieć przeszła na architekturę wielomodelową, a Qwen3-235B został wycofany z sieci: obecnie Gonka obsługuje Kimi K2.6 od Moonshot AI oraz MiniMax M2.7. Przeanalizujmy, czym jest Qwen3-235B, jaką rolę odegrał w sieci Gonka i czym został zastąpiony — jako wybitny open-source model MoE pozostaje użytecznym punktem odniesienia.

Co to jest Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 to duży model językowy (LLM) z rodziny Qwen3, opracowany przez zespół Qwen w Alibaba Cloud. Pełna nazwa oznacza: Qwen3 — trzecia generacja serii, 235B — 235 miliardów całkowitych parametrów, A22B — 22 miliardy aktywnych parametrów na każde zapytanie, Instruct — wersja przeszkolona do wykonywania instrukcji, 2507 — wydanie z lipca 2025, FP8 — 8-bitowa kwantyzacja dla optymalizacji pamięci.

Kluczową cechą architektoniczną jest MoE (Mixture of Experts). W przeciwieństwie do modeli „gęstych” (GPT-5.5, Claude Sonnet 4.6), gdzie każdy token przechodzi przez wszystkie parametry, model MoE aktywuje tylko podzbiór „ekspertów” — wyspecjalizowanych bloków sieci neuronowej — na każde zapytanie. W przypadku Qwen3-235B z 235 miliardów parametrów, na każdy token aktywowanych jest tylko 22 miliardy — mniej niż 10%. Zapewnia to jakość na poziomie modeli z ponad 200B parametrami przy kosztach obliczeniowych modelu z 22B.

Praktycznie oznacza to: model jest inteligentniejszy, niż można by oczekiwać od jego szybkości. Przetwarza zapytania znacznie szybciej niż modele gęste o porównywalnej jakości, jednocześnie wymagając znacznie mniej VRAM do wnioskowania. Dlatego MoE stało się dominującą architekturą dla największych modeli w latach 2025–2026.

Okno kontekstowe Qwen3-235B wynosi 131 072 tokeny (~100 000 słów) — to wystarczająco dużo, by analizować całe książki, bazy kodu lub długie dokumenty prawne w jednym zapytaniu. Model obsługuje 119 języków, w tym rosyjski, angielski, chiński, arabski, hindi i dziesiątki innych — co czyni go jednym z najbardziej wielojęzycznych modeli na rynku.

Charakterystyka i benchmarki

Qwen3-235B rywalizuje z największymi zamkniętymi i otwartymi modelami. Oto porównanie kluczowych parametrów:

ModelParametryKontekstMoEOpen SourceCena (za 1M tokenów)
Qwen3-235B (Alibaba)235B (22B aktywnych)131KTakTak (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (szacunek)128KTak (szacowane)Nie$5.00
Claude Sonnet 4.6 (Anthropic)Nieujawnione200KNie (szacowane)Nie$3.00
Llama 4 Maverick (Meta)400B (17B aktywnych)1MTakTak (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B aktywnych)128KTakTak (MIT)$0.55

Qwen3-235B demonstruje poziom jakości porównywalny z GPT-5.5 i Claude Sonnet 4.6 w większości benchmarków, przy czym jako model open-weights MoE kosztuje wielokrotnie mniej niż proporcjonalne odpowiedniki: architektura MoE aktywuje tylko część parametrów na zapytanie, co drastycznie obniża koszty obliczeniowe. Tę samą zasadę taniego zdecentralizowanego inference sieć Gonka stosuje dzisiaj do swoich działających modeli — Kimi K2.6 i MiniMax M2.7, dostępnych przez JoinGonka Gateway za $0.003 za 1M tokenów (tysiące razy taniej niż GPT-5.5 i Claude).

W benchmarkach MMLU-Pro, HumanEval, MATH-500 oraz GSM8K model znajduje się w pierwszej trójce najlepszych modeli open-source, ustępując jedynie DeepSeek-R1 w zadaniach rozumowania (reasoning). W zadaniach generowania kodu, tłumaczenia i podążania za instrukcjami Qwen3-235B stale wyprzedza Llama 4 Maverick i jest porównywalna z Claude Sonnet 4.6.

Jak Gonka wykorzystywała Qwen3-235B

Kiedy Qwen3-235B była głównym modelem sieci, działała w sieci Gonka w sposób rozproszony — poprzez protokół DiLoCo, dostosowany do inference. Pełny model w formacie FP8 wymaga około 640 GB pamięci wideo (VRAM), co jest niemożliwe do zmieszczenia na jednym GPU — nawet H100 80GB czy H200 141GB nie wystarczają. Dlatego model był dzielony na warstwy (tensor parallelism + pipeline parallelism) między kilkoma ML-node.

W praktyce Qwen3-235B działała na klastrze składającym się z 8–16 nodów GPU, z których każdy posiadał minimum 40 GB VRAM. Transfer Agents kierowały zapytania do odpowiedniego klastra, vLLM na każdym nodzie przetwarzał swój fragment modelu, a wyniki były agregowane i zwracane użytkownikowi. Cały proces zajmował setki milisekund — użytkownik nie odczuwał, że jego zapytanie było przetwarzane przez dziesiątki GPU w różnych punktach planety. Tę samą zasadę rozproszonego inference sieć stosuje do dziś — teraz już dla aktualnych modeli.

Ważny szczegół techniczny: Gonka wykorzystuje vLLM jako silnik do serving. vLLM to projekt open-source, który zapewnia wydajną generację tekstu poprzez PagedAttention — algorytm optymalizujący wykorzystanie VRAM podczas równoległego przetwarzania wielu zapytań. Pozwala to sieci obsługiwać tysiące jednoczesnych użytkowników bez spadku jakości.

Model obsługuje natywny tool calling — wywoływanie funkcji i narzędzi bezpośrednio z odpowiedzi modelu. Funkcja ta została dodana do Gonka poprzez PR #767 z progiem 0.958 dla wykrywania wywołań narzędzi. W przypadku Qwen3-235B pozwalało to programistom budować AI-agenty, które wchodzą w interakcję z zewnętrznymi API, bazami danych i narzędziami — wszystko w ramach jednego zapytania. Wsparcie dla tool calling zostało zachowane w aktualnych modelach sieci.

Sieć Gonka liczy ponad 4 000 GPU (H100, H200, A100, RTX 4090 i inne), połączonych w 120+ ML-node. Jest to jedna z największych rozproszonych sieci GPU do AI inference na świecie — i jeśli wcześniej ta moc była skierowana na Qwen3-235B, to dzisiaj obsługuje ona aktualne modele sieci, Kimi K2.6 oraz MiniMax M2.7.

Czy można teraz wypróbować Qwen3-235B

Bezpośrednia odpowiedź: przez sieć Gonka — już nie. Model Qwen3-235B został wycofany z sieci, więc nie można go wywołać po identyfikatorze qwen3-235b-a22b przez nasz Gateway. Ponieważ model jest otwarty (Apache 2.0), nadal można go uruchomić samodzielnie lub skorzystać z zewnętrznych hostingów modeli open-weights — na przykład przez OpenRouter (szacunkowo $0.071/$0.100 za 1M tokenów).

Jeśli jednak potrzebujesz tego taniego zdecentralizowanego inference, dla którego ludzie wybierają Gonka — on nigdzie nie zniknął, po prostu działa teraz na aktywnych modelach sieci. Przez JoinGonka API Gateway dostępne są Kimi K2.6 i MiniMax M2.7 z API kompatybilnym z OpenAI: każdy kod napisany dla OpenAI działa bez zmian — wystarczy zamienić URL, klucz API oraz nazwę modelu.

Przykład zapytania do aktywnego modelu:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Wyjaśnij architekturę MoE"}]
  }'

Koszt: $0.003 za 1 milion tokenów — to 1700 razy taniej niż GPT-5.5 ($5.00/1M) i 1000 razy taniej niż Claude Sonnet 4.6 ($3.00/1M). Przy rejestracji otrzymujesz darmowe 10 milionów tokenów na testy.

Gateway jest kompatybilny z popularnymi narzędziami programistycznymi: Quick Start opisuje podłączenie przez Python, Node.js i curl. Wspierane są również integracje IDE — Cursor, Continue, Cline, Aider i Claude Code — oraz frameworki dla agentów AI: LangChain, n8n, LibreChat, Open WebUI.

Aby szybko zacząć:

  1. Zarejestruj się na gate.joingonka.ai (podłącz portfel lub stwórz nowy)
  2. Uzyskaj klucz API w Dashboard
  3. Zamień api.openai.com na gate.joingonka.ai/api w swoim kodzie
  4. Wskaż aktualny model sieci — moonshotai/Kimi-K2.6 lub MiniMaxAI/MiniMax-M2.7 (pełna lista — w endpoint GET /v1/models)

Zdecentralizowany inference klasy enterprise w cenie hobbystycznego projektu nie zniknął — Qwen3-235B jedynie ustąpił miejsca nowszym modelom sieci. Ta sama relacja ceny do jakości działa teraz dla Kimi K2.6 i MiniMax M2.7.

Qwen3-235B-A22B — model MoE z 235 miliardami parametrów (22 miliardy aktywnych) od Alibaba Cloud, który na wczesnym etapie był głównym modelem sieci Gonka dla zdecentralizowanego AI inference. Dzięki architekturze MoE zapewnia jakość poziomu topowych modeli własnościowych przy wielokrotnie niższych kosztach obliczeniowych. Obecnie Qwen3-235B został wycofany z sieci: aktualnymi modelami Gonka są Kimi K2.6 i MiniMax M2.7, dostępne przez JoinGonka Gateway za pośrednictwem zgodnego z OpenAI API za $0.003/1M tokenów. Sam Qwen3-235B pozostaje otwarty (Apache 2.0) i jest dostępny w zewnętrznych hostingach modeli open-weights.

Chcesz wiedzieć więcej?

Zapoznaj się z innymi sekcjami lub zacznij zarabiać GNK już teraz.

Wypróbuj aktualne modele Gonka →