Разделы базы знаний ▾

Технология

Qwen3-235B: модель, которую ранее обслуживала Gonka

Сеть Gonka не просто сдаёт GPU в аренду — она обслуживает AI-модели для inference. Долгое время основной и единственной моделью сети была Qwen3-235B-A22B-Instruct, разработанная Alibaba Cloud. Со временем сеть перешла на мультимодельную архитектуру, а Qwen3-235B вывели из сети: сегодня Gonka обслуживает Kimi K2.6 от Moonshot AI и MiniMax M2.7. Разберём, что представляет собой Qwen3-235B, какую роль она сыграла в сети Gonka и чем её заменили — как заметная open-source MoE-модель она остаётся полезным ориентиром.

Что такое Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 — это большая языковая модель (LLM) семейства Qwen3, разработанная командой Qwen в Alibaba Cloud. Полное название расшифровывается так: Qwen3 — третье поколение серии, 235B — 235 миллиардов параметров всего, A22B — 22 миллиарда активных параметров на каждый запрос, Instruct — версия, обученная следовать инструкциям, 2507 — релиз июля 2025, FP8 — 8-битная квантизация для оптимизации памяти.

Ключевая архитектурная особенность — MoE (Mixture of Experts). В отличие от «плотных» моделей (GPT-5.5, Claude Sonnet 4.6), где каждый токен проходит через все параметры, MoE-модель активирует на каждый запрос только подмножество «экспертов» — специализированных блоков нейросети. В случае Qwen3-235B из 235 миллиардов параметров на каждый токен активируется лишь 22 миллиарда — менее 10%. Это даёт качество уровня моделей с 200B+ параметрами при вычислительных затратах модели на 22B.

Практически это означает: модель умнее, чем можно ожидать от её скорости. Она обрабатывает запросы значительно быстрее плотных моделей сопоставимого качества, при этом требуя в разы меньше VRAM на inference. Именно поэтому MoE стала доминирующей архитектурой для крупнейших моделей 2025—2026 годов.

Контекстное окно Qwen3-235B составляет 131 072 токена (~100 000 слов) — этого достаточно для анализа целых книг, кодовых баз или длинных юридических документов за один запрос. Модель поддерживает 119 языков, включая русский, английский, китайский, арабский, хинди и десятки других — что делает её одной из наиболее мультиязычных моделей на рынке.

Характеристики и бенчмарки

Qwen3-235B конкурирует с крупнейшими закрытыми и открытыми моделями. Вот сравнение ключевых характеристик:

МодельПараметрыКонтекстMoEOpen SourceЦена (за 1M токенов)
Qwen3-235B (Alibaba)235B (22B активных)131KДаДа (Apache 2.0)$0.07+ (хостинг)
GPT-5.5 (OpenAI)~1.8T (оценка)128KДа (предполагается)Нет$5.00
Claude Sonnet 4.6 (Anthropic)Не раскрыто200KНет (предполагается)Нет$3.00
Llama 4 Maverick (Meta)400B (17B активных)1MДаДа (Llama License)$0.20+ (хостинг)
DeepSeek-R1 (DeepSeek)671B (37B активных)128KДаДа (MIT)$0.55

Qwen3-235B демонстрирует уровень качества, сопоставимый с GPT-5.5 и Claude Sonnet 4.6 на большинстве бенчмарков, при этом как open-weights MoE-модель она обходится кратно дешевле проприетарных аналогов: MoE-архитектура активирует лишь часть параметров на запрос и резко снижает вычислительные затраты. Тот же принцип дешёвого децентрализованного inference сеть Gonka применяет сегодня к своим действующим моделям — Kimi K2.6 и MiniMax M2.7, доступным через JoinGonka Gateway по $0.003 за 1M токенов (в тысячи раз дешевле GPT-5.5 и Claude).

На бенчмарках MMLU-Pro, HumanEval, MATH-500 и GSM8K модель входит в тройку лучших open-source моделей, уступая лишь DeepSeek-R1 в задачах математических рассуждений (reasoning). В задачах генерации кода, перевода и следования инструкциям Qwen3-235B стабильно опережает Llama 4 Maverick и сопоставима с Claude Sonnet 4.6.

Как Gonka использовала Qwen3-235B

Когда Qwen3-235B была основной моделью сети, она работала в сети Gonka распределённо — через протокол DiLoCo, адаптированный для inference. Полная модель в формате FP8 требует около 640 ГБ видеопамяти (VRAM), что невозможно уместить на одном GPU — даже H100 80GB или H200 141GB недостаточно. Поэтому модель разделялась по слоям (tensor parallelism + pipeline parallelism) между несколькими ML-нодами.

На практике Qwen3-235B работала на кластере из 8—16 GPU-нод, каждая с минимум 40 ГБ VRAM. Transfer Agents маршрутизировали запрос к нужному кластеру, vLLM на каждой ноде обрабатывал свой фрагмент модели, результаты агрегировались и возвращались пользователю. Весь процесс занимал сотни миллисекунд — пользователь не ощущал, что его запрос обработан десятком GPU в разных точках планеты. Тот же принцип распределённого inference сеть применяет и сейчас — уже к действующим моделям.

Важная техническая деталь: Gonka использует vLLM в качестве движка для serving. vLLM — проект с открытым исходным кодом, который обеспечивает высокопроизводительную генерацию текста через PagedAttention — алгоритм, оптимизирующий использование видеопамяти при параллельной обработке множества запросов. Это позволяет сети обслуживать тысячи одновременных пользователей без деградации качества.

Модель поддерживает нативный tool calling — вызов функций и инструментов напрямую из ответа модели. Эта возможность была добавлена в Gonka через PR #767 с порогом 0.958 для определения вызовов инструментов. На Qwen3-235B это позволяло разработчикам строить AI-агентов, которые взаимодействуют с внешними API, базами данных и инструментами — всё через единый запрос. Поддержка tool calling сохранилась и в действующих моделях сети.

Сеть Gonka насчитывает более 4 000 GPU (H100, H200, A100, RTX 4090 и другие), объединённых в 120+ ML-нод. Это одна из крупнейших распределённых GPU-сетей для AI inference в мире — и если раньше эта мощность была направлена на Qwen3-235B, то сегодня она обслуживает действующие модели сети, Kimi K2.6 и MiniMax M2.7.

Можно ли попробовать Qwen3-235B сейчас

Прямой ответ: через сеть Gonka — уже нет. Qwen3-235B выведена из сети, поэтому вызвать её по идентификатору qwen3-235b-a22b через наш Gateway больше нельзя. Поскольку модель открыта (Apache 2.0), её по-прежнему можно запустить самостоятельно или обратиться к ней через сторонние хостинги open-weights моделей — например, через OpenRouter (ориентировочно $0.071/$0.100 за 1M токенов).

Если же вам нужен тот самый дешёвый децентрализованный inference, ради которого приходят в Gonka, — он никуда не делся, просто теперь работает на действующих моделях сети. Через JoinGonka API Gateway доступны Kimi K2.6 и MiniMax M2.7 по OpenAI-совместимому API: любой код, написанный для OpenAI, работает без изменений — достаточно заменить URL, API-ключ и имя модели.

Пример запроса к действующей модели:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Объясни MoE-архитектуру"}]
  }'

Стоимость: $0.003 за 1 миллион токенов — это в 1 700 раз дешевле GPT-5.5 ($5.00/1M) и в 1 000 раз дешевле Claude Sonnet 4.6 ($3.00/1M). При регистрации вы получаете бесплатные 10 миллионов токенов для тестирования.

Gateway совместим с популярными инструментами разработки: Quick Start описывает подключение через Python, Node.js и curl. Также поддерживаются IDE-интеграции — Cursor, Continue, Cline, Aider и Claude Code — и фреймворки для AI-агентов: LangChain, n8n, LibreChat, Open WebUI.

Для быстрого старта:

  1. Зарегистрируйтесь на gate.joingonka.ai (подключите кошелёк или создайте новый)
  2. Получите API-ключ в Dashboard
  3. Замените api.openai.com на gate.joingonka.ai/api в вашем коде
  4. Укажите актуальную модель сети — moonshotai/Kimi-K2.6 или MiniMaxAI/MiniMax-M2.7 (полный список — в endpoint GET /v1/models)

Децентрализованный inference уровня enterprise по цене хобби-проекта никуда не делся — Qwen3-235B лишь уступила место более новым моделям сети. Та же связка цены и качества теперь работает на Kimi K2.6 и MiniMax M2.7.

Qwen3-235B-A22B — MoE-модель с 235 миллиардами параметров (22 миллиарда активных) от Alibaba Cloud, которая на раннем этапе была основной моделью сети Gonka для децентрализованного AI inference. Благодаря MoE-архитектуре она обеспечивает качество уровня топовых проприетарных моделей при кратно меньшей вычислительной стоимости. Сейчас Qwen3-235B выведена из сети: актуальные модели Gonka — Kimi K2.6 и MiniMax M2.7, доступные через JoinGonka Gateway по OpenAI-совместимому API за $0.003/1M токенов. Сама Qwen3-235B остаётся открытой (Apache 2.0) и доступна на сторонних хостингах open-weights моделей.

Хотите узнать больше?

Изучите другие разделы или начните зарабатывать GNK прямо сейчас.

Попробовать актуальные модели Gonka →