Разделы базы знаний ▾
Технология
Qwen3-235B: модель, которую ранее обслуживала Gonka
Что такое Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 — это большая языковая модель (LLM) семейства Qwen3, разработанная командой Qwen в Alibaba Cloud. Полное название расшифровывается так: Qwen3 — третье поколение серии, 235B — 235 миллиардов параметров всего, A22B — 22 миллиарда активных параметров на каждый запрос, Instruct — версия, обученная следовать инструкциям, 2507 — релиз июля 2025, FP8 — 8-битная квантизация для оптимизации памяти.
Ключевая архитектурная особенность — MoE (Mixture of Experts). В отличие от «плотных» моделей (GPT-5.5, Claude Sonnet 4.6), где каждый токен проходит через все параметры, MoE-модель активирует на каждый запрос только подмножество «экспертов» — специализированных блоков нейросети. В случае Qwen3-235B из 235 миллиардов параметров на каждый токен активируется лишь 22 миллиарда — менее 10%. Это даёт качество уровня моделей с 200B+ параметрами при вычислительных затратах модели на 22B.
Практически это означает: модель умнее, чем можно ожидать от её скорости. Она обрабатывает запросы значительно быстрее плотных моделей сопоставимого качества, при этом требуя в разы меньше VRAM на inference. Именно поэтому MoE стала доминирующей архитектурой для крупнейших моделей 2025—2026 годов.
Контекстное окно Qwen3-235B составляет 131 072 токена (~100 000 слов) — этого достаточно для анализа целых книг, кодовых баз или длинных юридических документов за один запрос. Модель поддерживает 119 языков, включая русский, английский, китайский, арабский, хинди и десятки других — что делает её одной из наиболее мультиязычных моделей на рынке.
Характеристики и бенчмарки
Qwen3-235B конкурирует с крупнейшими закрытыми и открытыми моделями. Вот сравнение ключевых характеристик:
| Модель | Параметры | Контекст | MoE | Open Source | Цена (за 1M токенов) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B активных) | 131K | Да | Да (Apache 2.0) | $0.07+ (хостинг) |
| GPT-5.5 (OpenAI) | ~1.8T (оценка) | 128K | Да (предполагается) | Нет | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Не раскрыто | 200K | Нет (предполагается) | Нет | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B активных) | 1M | Да | Да (Llama License) | $0.20+ (хостинг) |
| DeepSeek-R1 (DeepSeek) | 671B (37B активных) | 128K | Да | Да (MIT) | $0.55 |
Qwen3-235B демонстрирует уровень качества, сопоставимый с GPT-5.5 и Claude Sonnet 4.6 на большинстве бенчмарков, при этом как open-weights MoE-модель она обходится кратно дешевле проприетарных аналогов: MoE-архитектура активирует лишь часть параметров на запрос и резко снижает вычислительные затраты. Тот же принцип дешёвого децентрализованного inference сеть Gonka применяет сегодня к своим действующим моделям — Kimi K2.6 и MiniMax M2.7, доступным через JoinGonka Gateway по $0.003 за 1M токенов (в тысячи раз дешевле GPT-5.5 и Claude).
На бенчмарках MMLU-Pro, HumanEval, MATH-500 и GSM8K модель входит в тройку лучших open-source моделей, уступая лишь DeepSeek-R1 в задачах математических рассуждений (reasoning). В задачах генерации кода, перевода и следования инструкциям Qwen3-235B стабильно опережает Llama 4 Maverick и сопоставима с Claude Sonnet 4.6.
Как Gonka использовала Qwen3-235B
Когда Qwen3-235B была основной моделью сети, она работала в сети Gonka распределённо — через протокол DiLoCo, адаптированный для inference. Полная модель в формате FP8 требует около 640 ГБ видеопамяти (VRAM), что невозможно уместить на одном GPU — даже H100 80GB или H200 141GB недостаточно. Поэтому модель разделялась по слоям (tensor parallelism + pipeline parallelism) между несколькими ML-нодами.
На практике Qwen3-235B работала на кластере из 8—16 GPU-нод, каждая с минимум 40 ГБ VRAM. Transfer Agents маршрутизировали запрос к нужному кластеру, vLLM на каждой ноде обрабатывал свой фрагмент модели, результаты агрегировались и возвращались пользователю. Весь процесс занимал сотни миллисекунд — пользователь не ощущал, что его запрос обработан десятком GPU в разных точках планеты. Тот же принцип распределённого inference сеть применяет и сейчас — уже к действующим моделям.
Важная техническая деталь: Gonka использует vLLM в качестве движка для serving. vLLM — проект с открытым исходным кодом, который обеспечивает высокопроизводительную генерацию текста через PagedAttention — алгоритм, оптимизирующий использование видеопамяти при параллельной обработке множества запросов. Это позволяет сети обслуживать тысячи одновременных пользователей без деградации качества.
Модель поддерживает нативный tool calling — вызов функций и инструментов напрямую из ответа модели. Эта возможность была добавлена в Gonka через PR #767 с порогом 0.958 для определения вызовов инструментов. На Qwen3-235B это позволяло разработчикам строить AI-агентов, которые взаимодействуют с внешними API, базами данных и инструментами — всё через единый запрос. Поддержка tool calling сохранилась и в действующих моделях сети.
Сеть Gonka насчитывает более 4 000 GPU (H100, H200, A100, RTX 4090 и другие), объединённых в 120+ ML-нод. Это одна из крупнейших распределённых GPU-сетей для AI inference в мире — и если раньше эта мощность была направлена на Qwen3-235B, то сегодня она обслуживает действующие модели сети, Kimi K2.6 и MiniMax M2.7.
Можно ли попробовать Qwen3-235B сейчас
Прямой ответ: через сеть Gonka — уже нет. Qwen3-235B выведена из сети, поэтому вызвать её по идентификатору qwen3-235b-a22b через наш Gateway больше нельзя. Поскольку модель открыта (Apache 2.0), её по-прежнему можно запустить самостоятельно или обратиться к ней через сторонние хостинги open-weights моделей — например, через OpenRouter (ориентировочно $0.071/$0.100 за 1M токенов).
Если же вам нужен тот самый дешёвый децентрализованный inference, ради которого приходят в Gonka, — он никуда не делся, просто теперь работает на действующих моделях сети. Через JoinGonka API Gateway доступны Kimi K2.6 и MiniMax M2.7 по OpenAI-совместимому API: любой код, написанный для OpenAI, работает без изменений — достаточно заменить URL, API-ключ и имя модели.
Пример запроса к действующей модели:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Объясни MoE-архитектуру"}]
}'Стоимость: $0.003 за 1 миллион токенов — это в 1 700 раз дешевле GPT-5.5 ($5.00/1M) и в 1 000 раз дешевле Claude Sonnet 4.6 ($3.00/1M). При регистрации вы получаете бесплатные 10 миллионов токенов для тестирования.
Gateway совместим с популярными инструментами разработки: Quick Start описывает подключение через Python, Node.js и curl. Также поддерживаются IDE-интеграции — Cursor, Continue, Cline, Aider и Claude Code — и фреймворки для AI-агентов: LangChain, n8n, LibreChat, Open WebUI.
Для быстрого старта:
- Зарегистрируйтесь на gate.joingonka.ai (подключите кошелёк или создайте новый)
- Получите API-ключ в Dashboard
- Замените
api.openai.comнаgate.joingonka.ai/apiв вашем коде - Укажите актуальную модель сети —
moonshotai/Kimi-K2.6илиMiniMaxAI/MiniMax-M2.7(полный список — в endpointGET /v1/models)
Децентрализованный inference уровня enterprise по цене хобби-проекта никуда не делся — Qwen3-235B лишь уступила место более новым моделям сети. Та же связка цены и качества теперь работает на Kimi K2.6 и MiniMax M2.7.
Хотите узнать больше?
Изучите другие разделы или начните зарабатывать GNK прямо сейчас.
Попробовать актуальные модели Gonka →