Sekcje bazy wiedzy ▾
Technologia
Qwen3-235B: model, który wcześniej obsługiwała Gonka
Co to jest Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 to duży model językowy (LLM) z rodziny Qwen3, opracowany przez zespół Qwen w Alibaba Cloud. Pełna nazwa oznacza: Qwen3 — trzecia generacja serii, 235B — 235 miliardów całkowitych parametrów, A22B — 22 miliardy aktywnych parametrów na każde zapytanie, Instruct — wersja przeszkolona do wykonywania instrukcji, 2507 — wydanie z lipca 2025, FP8 — 8-bitowa kwantyzacja dla optymalizacji pamięci.
Kluczową cechą architektoniczną jest MoE (Mixture of Experts). W przeciwieństwie do modeli „gęstych” (GPT-5.5, Claude Sonnet 4.6), gdzie każdy token przechodzi przez wszystkie parametry, model MoE aktywuje tylko podzbiór „ekspertów” — wyspecjalizowanych bloków sieci neuronowej — na każde zapytanie. W przypadku Qwen3-235B z 235 miliardów parametrów, na każdy token aktywowanych jest tylko 22 miliardy — mniej niż 10%. Zapewnia to jakość na poziomie modeli z ponad 200B parametrami przy kosztach obliczeniowych modelu z 22B.
Praktycznie oznacza to: model jest inteligentniejszy, niż można by oczekiwać od jego szybkości. Przetwarza zapytania znacznie szybciej niż modele gęste o porównywalnej jakości, jednocześnie wymagając znacznie mniej VRAM do wnioskowania. Dlatego MoE stało się dominującą architekturą dla największych modeli w latach 2025–2026.
Okno kontekstowe Qwen3-235B wynosi 131 072 tokeny (~100 000 słów) — to wystarczająco dużo, by analizować całe książki, bazy kodu lub długie dokumenty prawne w jednym zapytaniu. Model obsługuje 119 języków, w tym rosyjski, angielski, chiński, arabski, hindi i dziesiątki innych — co czyni go jednym z najbardziej wielojęzycznych modeli na rynku.
Charakterystyka i benchmarki
Qwen3-235B rywalizuje z największymi zamkniętymi i otwartymi modelami. Oto porównanie kluczowych parametrów:
| Model | Parametry | Kontekst | MoE | Open Source | Cena (za 1M tokenów) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B aktywnych) | 131K | Tak | Tak (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (szacunek) | 128K | Tak (szacowane) | Nie | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Nieujawnione | 200K | Nie (szacowane) | Nie | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B aktywnych) | 1M | Tak | Tak (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B aktywnych) | 128K | Tak | Tak (MIT) | $0.55 |
Qwen3-235B demonstruje poziom jakości porównywalny z GPT-5.5 i Claude Sonnet 4.6 w większości benchmarków, przy czym jako model open-weights MoE kosztuje wielokrotnie mniej niż proporcjonalne odpowiedniki: architektura MoE aktywuje tylko część parametrów na zapytanie, co drastycznie obniża koszty obliczeniowe. Tę samą zasadę taniego zdecentralizowanego inference sieć Gonka stosuje dzisiaj do swoich działających modeli — Kimi K2.6 i MiniMax M2.7, dostępnych przez JoinGonka Gateway za $0.003 za 1M tokenów (tysiące razy taniej niż GPT-5.5 i Claude).
W benchmarkach MMLU-Pro, HumanEval, MATH-500 oraz GSM8K model znajduje się w pierwszej trójce najlepszych modeli open-source, ustępując jedynie DeepSeek-R1 w zadaniach rozumowania (reasoning). W zadaniach generowania kodu, tłumaczenia i podążania za instrukcjami Qwen3-235B stale wyprzedza Llama 4 Maverick i jest porównywalna z Claude Sonnet 4.6.
Jak Gonka wykorzystywała Qwen3-235B
Kiedy Qwen3-235B była głównym modelem sieci, działała w sieci Gonka w sposób rozproszony — poprzez protokół DiLoCo, dostosowany do inference. Pełny model w formacie FP8 wymaga około 640 GB pamięci wideo (VRAM), co jest niemożliwe do zmieszczenia na jednym GPU — nawet H100 80GB czy H200 141GB nie wystarczają. Dlatego model był dzielony na warstwy (tensor parallelism + pipeline parallelism) między kilkoma ML-node.
W praktyce Qwen3-235B działała na klastrze składającym się z 8–16 nodów GPU, z których każdy posiadał minimum 40 GB VRAM. Transfer Agents kierowały zapytania do odpowiedniego klastra, vLLM na każdym nodzie przetwarzał swój fragment modelu, a wyniki były agregowane i zwracane użytkownikowi. Cały proces zajmował setki milisekund — użytkownik nie odczuwał, że jego zapytanie było przetwarzane przez dziesiątki GPU w różnych punktach planety. Tę samą zasadę rozproszonego inference sieć stosuje do dziś — teraz już dla aktualnych modeli.
Ważny szczegół techniczny: Gonka wykorzystuje vLLM jako silnik do serving. vLLM to projekt open-source, który zapewnia wydajną generację tekstu poprzez PagedAttention — algorytm optymalizujący wykorzystanie VRAM podczas równoległego przetwarzania wielu zapytań. Pozwala to sieci obsługiwać tysiące jednoczesnych użytkowników bez spadku jakości.
Model obsługuje natywny tool calling — wywoływanie funkcji i narzędzi bezpośrednio z odpowiedzi modelu. Funkcja ta została dodana do Gonka poprzez PR #767 z progiem 0.958 dla wykrywania wywołań narzędzi. W przypadku Qwen3-235B pozwalało to programistom budować AI-agenty, które wchodzą w interakcję z zewnętrznymi API, bazami danych i narzędziami — wszystko w ramach jednego zapytania. Wsparcie dla tool calling zostało zachowane w aktualnych modelach sieci.
Sieć Gonka liczy ponad 4 000 GPU (H100, H200, A100, RTX 4090 i inne), połączonych w 120+ ML-node. Jest to jedna z największych rozproszonych sieci GPU do AI inference na świecie — i jeśli wcześniej ta moc była skierowana na Qwen3-235B, to dzisiaj obsługuje ona aktualne modele sieci, Kimi K2.6 oraz MiniMax M2.7.
Czy można teraz wypróbować Qwen3-235B
Bezpośrednia odpowiedź: przez sieć Gonka — już nie. Model Qwen3-235B został wycofany z sieci, więc nie można go wywołać po identyfikatorze qwen3-235b-a22b przez nasz Gateway. Ponieważ model jest otwarty (Apache 2.0), nadal można go uruchomić samodzielnie lub skorzystać z zewnętrznych hostingów modeli open-weights — na przykład przez OpenRouter (szacunkowo $0.071/$0.100 za 1M tokenów).
Jeśli jednak potrzebujesz tego taniego zdecentralizowanego inference, dla którego ludzie wybierają Gonka — on nigdzie nie zniknął, po prostu działa teraz na aktywnych modelach sieci. Przez JoinGonka API Gateway dostępne są Kimi K2.6 i MiniMax M2.7 z API kompatybilnym z OpenAI: każdy kod napisany dla OpenAI działa bez zmian — wystarczy zamienić URL, klucz API oraz nazwę modelu.
Przykład zapytania do aktywnego modelu:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Wyjaśnij architekturę MoE"}]
}'Koszt: $0.003 za 1 milion tokenów — to 1700 razy taniej niż GPT-5.5 ($5.00/1M) i 1000 razy taniej niż Claude Sonnet 4.6 ($3.00/1M). Przy rejestracji otrzymujesz darmowe 10 milionów tokenów na testy.
Gateway jest kompatybilny z popularnymi narzędziami programistycznymi: Quick Start opisuje podłączenie przez Python, Node.js i curl. Wspierane są również integracje IDE — Cursor, Continue, Cline, Aider i Claude Code — oraz frameworki dla agentów AI: LangChain, n8n, LibreChat, Open WebUI.
Aby szybko zacząć:
- Zarejestruj się na gate.joingonka.ai (podłącz portfel lub stwórz nowy)
- Uzyskaj klucz API w Dashboard
- Zamień
api.openai.comnagate.joingonka.ai/apiw swoim kodzie - Wskaż aktualny model sieci —
moonshotai/Kimi-K2.6lubMiniMaxAI/MiniMax-M2.7(pełna lista — w endpointGET /v1/models)
Zdecentralizowany inference klasy enterprise w cenie hobbystycznego projektu nie zniknął — Qwen3-235B jedynie ustąpił miejsca nowszym modelom sieci. Ta sama relacja ceny do jakości działa teraz dla Kimi K2.6 i MiniMax M2.7.
Chcesz wiedzieć więcej?
Zapoznaj się z innymi sekcjami lub zacznij zarabiać GNK już teraz.
Wypróbuj aktualne modele Gonka →