Розділи бази знань ▾

Технологія

Qwen3-235B: модель, яку раніше обслуговувала Gonka

Мережа Gonka не просто здає GPU в оренду — вона обслуговує AI-моделі для inference. Довгий час основною та єдиною моделлю мережі була Qwen3-235B-A22B-Instruct, розроблена Alibaba Cloud. З часом мережа перейшла на мультимодельну архітектуру, а Qwen3-235B вивели з мережі: сьогодні Gonka обслуговує Kimi K2.6 від Moonshot AI та MiniMax M2.7. Розберемося, що являє собою Qwen3-235B, яку роль вона відіграла в мережі Gonka і чим її замінили — як помітна open-source MoE-модель вона залишається корисним орієнтиром.

Що таке Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 — це велика мовна модель (LLM) сімейства Qwen3, розроблена командою Qwen в Alibaba Cloud. Повна назва розшифровується так: Qwen3 — третє покоління серії, 235B — 235 мільярдів параметрів загалом, A22B — 22 мільярди активних параметрів на кожен запит, Instruct — версія, навчена дотримуватися інструкцій, 2507 — реліз липня 2025, FP8 — 8-бітна квантизація для оптимізації пам'яті.

Ключова архітектурна особливість — MoE (Mixture of Experts). На відміну від «щільних» моделей (GPT-5.5, Claude Sonnet 4.6), де кожен токен проходить через усі параметри, MoE-модель активує на кожен запит лише підмножину «експертів» — спеціалізованих блоків нейромережі. У випадку Qwen3-235B з 235 мільярдів параметрів на кожен токен активується лише 22 мільярди — менше 10%. Це дає якість рівня моделей з 200B+ параметрами при обчислювальних витратах моделі на 22B.

Практично це означає: модель розумніша, ніж можна очікувати від її швидкості. Вона обробляє запити значно швидше щільних моделей порівнянної якості, при цьому вимагаючи в рази менше VRAM на inference. Саме тому MoE стала домінуючою архітектурою для найбільших моделей 2025—2026 років.

Контекстне вікно Qwen3-235B становить 131 072 токени (~100 000 слів) — цього достатньо для аналізу цілих книг, кодових баз або довгих юридичних документів за один запит. Модель підтримує 119 мов, включаючи російську, англійську, китайську, арабську, хінді та десятки інших — що робить її однією з найбільш багатомовних моделей на ринку.

Характеристики та бенчмарки

Qwen3-235B конкурує з найбільшими закритими та відкритими моделями. Ось порівняння ключових характеристик:

МодельПараметриКонтекстMoEOpen SourceЦіна (за 1M токенів)
Qwen3-235B (Alibaba)235B (22B активних)131KТакТак (Apache 2.0)$0.07+ (хостинг)
GPT-5.5 (OpenAI)~1.8T (оцінка)128KТак (передбачувано)Ні$5.00
Claude Sonnet 4.6 (Anthropic)Не розкрито200KНі (передбачувано)Ні$3.00
Llama 4 Maverick (Meta)400B (17B активних)1MТакТак (Llama License)$0.20+ (хостинг)
DeepSeek-R1 (DeepSeek)671B (37B активних)128KТакТак (MIT)$0.55

Qwen3-235B демонструє рівень якості, порівнянний з GPT-5.5 та Claude Sonnet 4.6 у більшості бенчмарків, при цьому як open-weights MoE-модель вона обходиться значно дешевше за пропрієтарні аналоги: MoE-архітектура активує лише частину параметрів на запит і різко знижує обчислювальні витрати. Той самий принцип дешевого децентралізованого inference мережа Gonka застосовує сьогодні до своїх діючих моделей — Kimi K2.6 та MiniMax M2.7, доступних через JoinGonka Gateway по $0.003 за 1M токенів (у тисячі разів дешевше за GPT-5.5 та Claude).

На бенчмарках MMLU-Pro, HumanEval, MATH-500 та GSM8K модель входить у трійку найкращих open-source моделей, поступаючись лише DeepSeek-R1 у задачах математичних міркувань (reasoning). У задачах генерації коду, перекладу та дотримання інструкцій Qwen3-235B стабільно випереджає Llama 4 Maverick та порівнянна з Claude Sonnet 4.6.

Як Gonka використовувала Qwen3-235B

Коли Qwen3-235B була основною моделлю мережі, вона працювала в мережі Gonka розподілено — через протокол DiLoCo, адаптований для inference. Повна модель у форматі FP8 потребує близько 640 ГБ відеопам'яті (VRAM), що неможливо вмістити на одному GPU — навіть H100 80GB або H200 141GB недостатньо. Тому модель розділялася за шарами (tensor parallelism + pipeline parallelism) між кількома ML-нодами.

На практиці Qwen3-235B працювала на кластері з 8—16 GPU-нод, кожна з мінімум 40 ГБ VRAM. Transfer Agents маршрутизували запит до потрібного кластера, vLLM на кожній ноді обробляв свій фрагмент моделі, результати агрегувалися і поверталися користувачеві. Весь процес займав сотні мілісекунд — користувач не відчував, що його запит оброблений десятком GPU в різних точках планети. Той самий принцип розподіленого inference мережа застосовує і зараз — вже до діючих моделей.

Важлива технічна деталь: Gonka використовує vLLM як рушій для serving. vLLM — проект з відкритим вихідним кодом, який забезпечує високопродуктивну генерацію тексту через PagedAttention — алгоритм, що оптимізує використання відеопам'яті при паралельній обробці безлічі запитів. Це дозволяє мережі обслуговувати тисячі одночасних користувачів без деградації якості.

Модель підтримує нативний tool calling — виклик функцій та інструментів безпосередньо з відповіді моделі. Ця можливість була додана в Gonka через PR #767 з порогом 0.958 для визначення викликів інструментів. На Qwen3-235B це дозволяло розробникам будувати AI-агентів, які взаємодіють із зовнішніми API, базами даних та інструментами — все через єдиний запит. Підтримка tool calling збереглася і в діючих моделях мережі.

Мережа Gonka налічує понад 4 000 GPU (H100, H200, A100, RTX 4090 та інші), об'єднаних у 120+ ML-нод. Це одна з найбільших розподілених GPU-мереж для AI inference у світі — і якщо раніше ця потужність була спрямована на Qwen3-235B, то сьогодні вона обслуговує діючі моделі мережі, Kimi K2.6 та MiniMax M2.7.

Чи можна спробувати Qwen3-235B зараз

Пряма відповідь: через мережу Gonka — вже ні. Qwen3-235B виведено з мережі, тому викликати її за ідентифікатором qwen3-235b-a22b через наш Gateway більше не можна. Оскільки модель відкрита (Apache 2.0), її як і раніше можна запустити самостійно або звернутися до неї через сторонні хостинги open-weights моделей — наприклад, через OpenRouter (орієнтовно $0.071/$0.100 за 1M токенів).

Якщо ж вам потрібен той самий дешевий децентралізований inference, заради якого приходять у Gonka, — він нікуди не зник, просто тепер працює на діючих моделях мережі. Через JoinGonka API Gateway доступні Kimi K2.6 та MiniMax M2.7 через OpenAI-сумісний API: будь-який код, написаний для OpenAI, працює без змін — достатньо замінити URL, API-ключ та ім'я моделі.

Приклад запиту до діючої моделі:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Поясни MoE-архітектуру"}]
  }'

Вартість: $0.003 за 1 мільйон токенів — це у 1 700 разів дешевше за GPT-5.5 ($5.00/1M) та у 1 000 разів дешевше за Claude Sonnet 4.6 ($3.00/1M). При реєстрації ви отримуєте безкоштовні 10 мільйонів токенів для тестування.

Gateway сумісний з популярними інструментами розробки: Quick Start описує підключення через Python, Node.js та curl. Також підтримуються IDE-інтеграції — Cursor, Continue, Cline, Aider та Claude Code — і фреймворки для AI-агентів: LangChain, n8n, LibreChat, Open WebUI.

Для швидкого старту:

  1. Зареєструйтеся на gate.joingonka.ai (підключіть гаманець або створіть новий)
  2. Отримайте API-ключ у Dashboard
  3. Замініть api.openai.com на gate.joingonka.ai/api у вашому коді
  4. Вкажіть актуальну модель мережі — moonshotai/Kimi-K2.6 або MiniMaxAI/MiniMax-M2.7 (повний список — в endpoint GET /v1/models)

Децентралізований inference рівня enterprise за ціною хобі-проекту нікуди не зник — Qwen3-235B лише поступилася місцем новішим моделям мережі. Та ж сама зв'язка ціни та якості тепер працює на Kimi K2.6 та MiniMax M2.7.

Qwen3-235B-A22B — MoE-модель із 235 мільярдами параметрів (22 мільярди активних) від Alibaba Cloud, яка на ранньому етапі була основною моделлю мережі Gonka для децентралізованого AI inference. Завдяки MoE-архітектурі вона забезпечує якість рівня топових пропрієтарних моделей при кратно меншій обчислювальній вартості. Зараз Qwen3-235B виведена з мережі: актуальні моделі Gonka — Kimi K2.6 та MiniMax M2.7, доступні через JoinGonka Gateway за OpenAI-сумісним API за $0.003/1M токенів. Сама Qwen3-235B залишається відкритою (Apache 2.0) і доступна на сторонніх хостингах open-weights моделей.

Бажаєте дізнатися більше?

Вивчіть інші розділи або почніть заробляти GNK прямо зараз.

Спробувати актуальні моделі Gonka →