Розділи бази знань ▾
Технологія
Qwen3-235B: модель, яку раніше обслуговувала Gonka
Що таке Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 — це велика мовна модель (LLM) сімейства Qwen3, розроблена командою Qwen в Alibaba Cloud. Повна назва розшифровується так: Qwen3 — третє покоління серії, 235B — 235 мільярдів параметрів загалом, A22B — 22 мільярди активних параметрів на кожен запит, Instruct — версія, навчена дотримуватися інструкцій, 2507 — реліз липня 2025, FP8 — 8-бітна квантизація для оптимізації пам'яті.
Ключова архітектурна особливість — MoE (Mixture of Experts). На відміну від «щільних» моделей (GPT-5.5, Claude Sonnet 4.6), де кожен токен проходить через усі параметри, MoE-модель активує на кожен запит лише підмножину «експертів» — спеціалізованих блоків нейромережі. У випадку Qwen3-235B з 235 мільярдів параметрів на кожен токен активується лише 22 мільярди — менше 10%. Це дає якість рівня моделей з 200B+ параметрами при обчислювальних витратах моделі на 22B.
Практично це означає: модель розумніша, ніж можна очікувати від її швидкості. Вона обробляє запити значно швидше щільних моделей порівнянної якості, при цьому вимагаючи в рази менше VRAM на inference. Саме тому MoE стала домінуючою архітектурою для найбільших моделей 2025—2026 років.
Контекстне вікно Qwen3-235B становить 131 072 токени (~100 000 слів) — цього достатньо для аналізу цілих книг, кодових баз або довгих юридичних документів за один запит. Модель підтримує 119 мов, включаючи російську, англійську, китайську, арабську, хінді та десятки інших — що робить її однією з найбільш багатомовних моделей на ринку.
Характеристики та бенчмарки
Qwen3-235B конкурує з найбільшими закритими та відкритими моделями. Ось порівняння ключових характеристик:
| Модель | Параметри | Контекст | MoE | Open Source | Ціна (за 1M токенів) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B активних) | 131K | Так | Так (Apache 2.0) | $0.07+ (хостинг) |
| GPT-5.5 (OpenAI) | ~1.8T (оцінка) | 128K | Так (передбачувано) | Ні | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Не розкрито | 200K | Ні (передбачувано) | Ні | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B активних) | 1M | Так | Так (Llama License) | $0.20+ (хостинг) |
| DeepSeek-R1 (DeepSeek) | 671B (37B активних) | 128K | Так | Так (MIT) | $0.55 |
Qwen3-235B демонструє рівень якості, порівнянний з GPT-5.5 та Claude Sonnet 4.6 у більшості бенчмарків, при цьому як open-weights MoE-модель вона обходиться значно дешевше за пропрієтарні аналоги: MoE-архітектура активує лише частину параметрів на запит і різко знижує обчислювальні витрати. Той самий принцип дешевого децентралізованого inference мережа Gonka застосовує сьогодні до своїх діючих моделей — Kimi K2.6 та MiniMax M2.7, доступних через JoinGonka Gateway по $0.003 за 1M токенів (у тисячі разів дешевше за GPT-5.5 та Claude).
На бенчмарках MMLU-Pro, HumanEval, MATH-500 та GSM8K модель входить у трійку найкращих open-source моделей, поступаючись лише DeepSeek-R1 у задачах математичних міркувань (reasoning). У задачах генерації коду, перекладу та дотримання інструкцій Qwen3-235B стабільно випереджає Llama 4 Maverick та порівнянна з Claude Sonnet 4.6.
Як Gonka використовувала Qwen3-235B
Коли Qwen3-235B була основною моделлю мережі, вона працювала в мережі Gonka розподілено — через протокол DiLoCo, адаптований для inference. Повна модель у форматі FP8 потребує близько 640 ГБ відеопам'яті (VRAM), що неможливо вмістити на одному GPU — навіть H100 80GB або H200 141GB недостатньо. Тому модель розділялася за шарами (tensor parallelism + pipeline parallelism) між кількома ML-нодами.
На практиці Qwen3-235B працювала на кластері з 8—16 GPU-нод, кожна з мінімум 40 ГБ VRAM. Transfer Agents маршрутизували запит до потрібного кластера, vLLM на кожній ноді обробляв свій фрагмент моделі, результати агрегувалися і поверталися користувачеві. Весь процес займав сотні мілісекунд — користувач не відчував, що його запит оброблений десятком GPU в різних точках планети. Той самий принцип розподіленого inference мережа застосовує і зараз — вже до діючих моделей.
Важлива технічна деталь: Gonka використовує vLLM як рушій для serving. vLLM — проект з відкритим вихідним кодом, який забезпечує високопродуктивну генерацію тексту через PagedAttention — алгоритм, що оптимізує використання відеопам'яті при паралельній обробці безлічі запитів. Це дозволяє мережі обслуговувати тисячі одночасних користувачів без деградації якості.
Модель підтримує нативний tool calling — виклик функцій та інструментів безпосередньо з відповіді моделі. Ця можливість була додана в Gonka через PR #767 з порогом 0.958 для визначення викликів інструментів. На Qwen3-235B це дозволяло розробникам будувати AI-агентів, які взаємодіють із зовнішніми API, базами даних та інструментами — все через єдиний запит. Підтримка tool calling збереглася і в діючих моделях мережі.
Мережа Gonka налічує понад 4 000 GPU (H100, H200, A100, RTX 4090 та інші), об'єднаних у 120+ ML-нод. Це одна з найбільших розподілених GPU-мереж для AI inference у світі — і якщо раніше ця потужність була спрямована на Qwen3-235B, то сьогодні вона обслуговує діючі моделі мережі, Kimi K2.6 та MiniMax M2.7.
Чи можна спробувати Qwen3-235B зараз
Пряма відповідь: через мережу Gonka — вже ні. Qwen3-235B виведено з мережі, тому викликати її за ідентифікатором qwen3-235b-a22b через наш Gateway більше не можна. Оскільки модель відкрита (Apache 2.0), її як і раніше можна запустити самостійно або звернутися до неї через сторонні хостинги open-weights моделей — наприклад, через OpenRouter (орієнтовно $0.071/$0.100 за 1M токенів).
Якщо ж вам потрібен той самий дешевий децентралізований inference, заради якого приходять у Gonka, — він нікуди не зник, просто тепер працює на діючих моделях мережі. Через JoinGonka API Gateway доступні Kimi K2.6 та MiniMax M2.7 через OpenAI-сумісний API: будь-який код, написаний для OpenAI, працює без змін — достатньо замінити URL, API-ключ та ім'я моделі.
Приклад запиту до діючої моделі:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Поясни MoE-архітектуру"}]
}'Вартість: $0.003 за 1 мільйон токенів — це у 1 700 разів дешевше за GPT-5.5 ($5.00/1M) та у 1 000 разів дешевше за Claude Sonnet 4.6 ($3.00/1M). При реєстрації ви отримуєте безкоштовні 10 мільйонів токенів для тестування.
Gateway сумісний з популярними інструментами розробки: Quick Start описує підключення через Python, Node.js та curl. Також підтримуються IDE-інтеграції — Cursor, Continue, Cline, Aider та Claude Code — і фреймворки для AI-агентів: LangChain, n8n, LibreChat, Open WebUI.
Для швидкого старту:
- Зареєструйтеся на gate.joingonka.ai (підключіть гаманець або створіть новий)
- Отримайте API-ключ у Dashboard
- Замініть
api.openai.comнаgate.joingonka.ai/apiу вашому коді - Вкажіть актуальну модель мережі —
moonshotai/Kimi-K2.6абоMiniMaxAI/MiniMax-M2.7(повний список — в endpointGET /v1/models)
Децентралізований inference рівня enterprise за ціною хобі-проекту нікуди не зник — Qwen3-235B лише поступилася місцем новішим моделям мережі. Та ж сама зв'язка ціни та якості тепер працює на Kimi K2.6 та MiniMax M2.7.
Бажаєте дізнатися більше?
Вивчіть інші розділи або почніть заробляти GNK прямо зараз.
Спробувати актуальні моделі Gonka →