Розділи бази знань ▾
Навігація
▸ Почніть тут За ролямиКатегорії
- Архітектура мережі Gonka: Sprint, Transfer Agents, DiLoCo
- Розробникам: як заробити GNK
- Власний хостинг: покроковий посібник
- Вибір GPU для Gonka: рекомендації щодо обладнання
- Qwen3-235B: модель, яку раніше обслуговувала Gonka
- Kimi K2.6: друга модель мережі Gonka
- MiniMax M2.7: модель мережі Gonka
- DeepSeek V4 Flash: модель мережі Gonka з контекстом 380K
Технологія
Qwen3-235B: модель, яку раніше обслуговувала Gonka
Що таке Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 — це велика мовна модель (LLM) сімейства Qwen3, розроблена командою Qwen в Alibaba Cloud. Повна назва розшифровується так: Qwen3 — третє покоління серії, 235B — 235 мільярдів параметрів загалом, A22B — 22 мільярди активних параметрів на кожен запит, Instruct — версія, навчена дотримуватися інструкцій, 2507 — реліз липня 2025, FP8 — 8-бітна квантизація для оптимізації пам'яті.
Ключова архітектурна особливість — MoE (Mixture of Experts). На відміну від «щільних» моделей (GPT-5.5, Claude Sonnet 4.6), де кожен токен проходить через усі параметри, MoE-модель активує на кожен запит лише підмножину «експертів» — спеціалізованих блоків нейромережі. У випадку Qwen3-235B з 235 мільярдів параметрів на кожен токен активується лише 22 мільярди — менше 10%. Це дає якість рівня моделей з 200B+ параметрами при обчислювальних витратах моделі на 22B.
Практично це означає: модель розумніша, ніж можна очікувати від її швидкості. Вона обробляє запити значно швидше щільних моделей порівнянної якості, при цьому вимагаючи в рази менше VRAM на inference. Саме тому MoE стала домінуючою архітектурою для найбільших моделей 2025—2026 років.
Контекстне вікно Qwen3-235B становить 131 072 токени (~100 000 слів) — цього достатньо для аналізу цілих книг, кодових баз або довгих юридичних документів за один запит. Модель підтримує 119 мов, включаючи російську, англійську, китайську, арабську, хінді та десятки інших — що робить її однією з найбільш багатомовних моделей на ринку.
Характеристики та бенчмарки
Qwen3-235B конкурує з найбільшими закритими та відкритими моделями. Ось порівняння ключових характеристик:
| Модель | Параметри | Контекст | MoE | Open Source | Ціна (за 1M токенів) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B активних) | 131K | Так | Так (Apache 2.0) | $0.07+ (хостинг) |
| GPT-5.5 (OpenAI) | ~1.8T (оцінка) | 128K | Так (передбачається) | Ні | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Не розкрито | 200K | Ні (передбачається) | Ні | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B активних) | 1M | Так | Так (Llama License) | $0.20+ (хостинг) |
| DeepSeek-R1 (DeepSeek) | 671B (37B активних) | 128K | Так | Так (MIT) | $0.55 |
Qwen3-235B демонструє рівень якості, зіставний з GPT-5.5 та Claude Sonnet 4.6 на більшості бенчмарків, при цьому як open-weights MoE-модель вона коштує в рази дешевше пропрієтарних аналогів: MoE-архітектура активує лише частину параметрів на запит і різко знижує обчислювальні витрати. Той самий принцип дешевого децентралізованого inference мережа Gonka застосовує сьогодні до своїх діючих моделей — Kimi K2.6 та MiniMax M2.7, доступних через JoinGonka Gateway за $0.0047 за 1M токенів (у сотні—тисячі разів дешевше GPT-5.5 та Claude).
На бенчмарках MMLU-Pro, HumanEval, MATH-500 та GSM8K модель входить до трійки найкращих open-source моделей, поступаючись лише DeepSeek-R1 у задачах математичних міркувань (reasoning). У задачах генерації коду, перекладу та дотримання інструкцій Qwen3-235B стабільно випереджає Llama 4 Maverick і є зіставною з Claude Sonnet 4.6.
Як Gonka використовувала Qwen3-235B
Коли Qwen3-235B була основною моделлю мережі, вона працювала в мережі Gonka розподілено — через протокол DiLoCo, адаптований для inference. Повна модель у форматі FP8 потребує близько 640 ГБ відеопам'яті (VRAM), що неможливо вмістити на одному GPU — навіть H100 80GB або H200 141GB недостатньо. Тому модель розділялася за шарами (tensor parallelism + pipeline parallelism) між кількома ML-нодами.
На практиці Qwen3-235B працювала на кластері з 8—16 GPU-нод, кожна з мінімум 40 ГБ VRAM. Transfer Agents маршрутизували запит до потрібного кластера, vLLM на кожній ноді обробляв свій фрагмент моделі, результати агрегувалися і поверталися користувачеві. Весь процес займав сотні мілісекунд — користувач не відчував, що його запит оброблений десятком GPU в різних точках планети. Той самий принцип розподіленого inference мережа застосовує і зараз — вже до чинних моделей.
Важлива технічна деталь: Gonka використовує vLLM як рушій для serving. vLLM — проєкт із відкритим вихідним кодом, який забезпечує високопродуктивну генерацію тексту через PagedAttention — алгоритм, що оптимізує використання відеопам'яті при паралельній обробці безлічі запитів. Це дозволяє мережі обслуговувати тисячі одночасних користувачів без деградації якості.
Модель підтримує нативний tool calling — виклик функцій та інструментів безпосередньо з відповіді моделі. Ця можливість була додана в Gonka через PR #767 з порогом 0.958 для визначення викликів інструментів. На Qwen3-235B це дозволяло розробникам будувати AI-агентів, які взаємодіють із зовнішніми API, базами даних та інструментами — все через єдиний запит. Підтримка tool calling збереглася і в чинних моделях мережі.
Мережа Gonka налічує понад 4 000 GPU (H100, H200, A100, RTX 4090 та інші), об'єднаних у 120+ ML-нод. Це одна з найбільших розподілених GPU-мереж для AI inference у світі — і якщо раніше ця потужність була спрямована на Qwen3-235B, то сьогодні вона обслуговує чинні моделі мережі — Kimi K2.6, MiniMax M2.7 та DeepSeek V4 Flash.
Чи можна спробувати Qwen3-235B зараз
Пряма відповідь: через мережу Gonka — вже ні. Qwen3-235B виведено з мережі, тому викликати її за ідентифікатором qwen3-235b-a22b через наш Gateway більше неможливо. Оскільки модель відкрита (Apache 2.0), її все ще можна запустити самостійно або звернутися до неї через сторонні хостинги open-weights моделей — наприклад, через OpenRouter (орієнтовно $0.071/$0.100 за 1M токенів).
Якщо ж вам потрібен той самий дешевий децентралізований inference, заради якого приходять у Gonka, — він нікуди не зник, просто тепер працює на діючих моделях мережі. Через JoinGonka API Gateway доступні Kimi K2.6, MiniMax M2.7 та DeepSeek V4 Flash за OpenAI-сумісним API: будь-який код, написаний для OpenAI, працює без змін — достатньо замінити URL, API-ключ та ім'я моделі.
Приклад запиту до діючої моделі:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Объясни MoE-архитектуру"}]
}'Вартість: $0.0047 за 1 мільйон токенів — це в ~800 разів дешевше GPT-5.5 ($5.00/1M) і в ~500 разів дешевше Claude Sonnet 4.6 ($3.00/1M). При реєстрації ви отримуєте безкоштовні 1.5M токенів для тестування.
Gateway сумісний з популярними інструментами розробки: Quick Start описує підключення через Python, Node.js та curl. Також підтримуються IDE-інтеграції — Cursor, Continue, Cline, Aider та Claude Code — і фреймворки для AI-агентів: LangChain, n8n, LibreChat, Open WebUI.
Для швидкого старту:
- Зареєструйтеся на gate.joingonka.ai (підключіть гаманець або створіть новий)
- Отримайте API-ключ у Dashboard
- Замініть
api.openai.comнаgate.joingonka.ai/apiу вашому коді - Вкажіть актуальну модель мережі —
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7абоdeepseek-ai/DeepSeek-V4-Flash-0731(повний список — в endpointGET /v1/models)
Децентралізований inference рівня enterprise за ціною хобі-проєкту нікуди не зник — Qwen3-235B лише поступилася місцем новішим моделям мережі. Та ж зв'язка ціни та якості тепер працює на Kimi K2.6, MiniMax M2.7 та DeepSeek V4 Flash.
Бажаєте дізнатися більше?
Вивчіть інші розділи або почніть заробляти GNK прямо зараз.
Спробувати актуальні моделі Gonka →