知識ベースのセクション ▾
技術
Qwen3-235B: かつてGonkaが運用していたモデル
Qwen3-235Bとは
Qwen3-235B-A22B-Instruct-2507-FP8は、QwenチームがAlibaba Cloudで開発したQwen3ファミリーの大規模言語モデル(LLM)です。完全な名前は次のように解釈されます: Qwen3 — 第3世代シリーズ、235B — 全体で2350億パラメータ、A22B — 各リクエストで220億アクティブパラメータ、Instruct — 指示に従うように学習されたバージョン、2507 — 2025年7月リリース、FP8 — メモリ最適化のための8ビット量子化です。
主要なアーキテクチャの特徴はMoE(Mixture of Experts)です。密なモデル(GPT-5.5、Claude Sonnet 4.6)がすべてのパラメータを介して各トークンを処理するのとは異なり、MoEモデルは各リクエストに対して「エキスパート」のサブセット、つまり特殊なニューラルネットワークブロックのみをアクティブ化します。Qwen3-235Bの場合、2350億パラメータのうち、各トークンに対して220億、つまり10%未満しかアクティブ化されません。これにより、22Bモデルの計算コストで200B+パラメータを持つモデルレベルの品質が得られます。
実質的には、これはモデルがその速度からは予期できないほど賢いことを意味します。同等の品質の密なモデルよりもはるかに速くリクエストを処理し、推論に必要なVRAMは数分の1です。だからこそ、MoEは2025〜2026年最大のモデルにとって支配的なアーキテクチャとなったのです。
Qwen3-235Bのコンテキストウィンドウは131,072トークン(約10万語)で、これは1回のクエリで本全体、コードベース、または長い法的文書を分析するのに十分です。このモデルは、ロシア語、英語、中国語、アラビア語、ヒンディー語など、119言語をサポートしており、市場で最も多言語対応のモデルの1つとなっています。
特徴とベンチマーク
Qwen3-235Bは、大規模なクローズドモデルおよびオープンモデルと競合します。主な特性の比較は以下の通りです:
| モデル | パラメータ | コンテキスト | MoE | Open Source | 料金 (100万トークンあたり) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B アクティブ) | 131K | はい | はい (Apache 2.0) | $0.07+ (ホスティング) |
| GPT-5.5 (OpenAI) | ~1.8T (推定) | 128K | はい (想定) | いいえ | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | 非公開 | 200K | いいえ (想定) | いいえ | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B アクティブ) | 1M | はい | はい (Llama License) | $0.20+ (ホスティング) |
| DeepSeek-R1 (DeepSeek) | 671B (37B アクティブ) | 128K | はい | はい (MIT) | $0.55 |
Qwen3-235Bは、ほとんどのベンチマークにおいてGPT-5.5やClaude Sonnet 4.6に匹敵する品質レベルを示しています。open-weightsのMoEモデルとして、プロプライエタリな代替品よりも大幅に低コストです。MoEアーキテクチャはリクエストごとにパラメータの一部のみをアクティブ化し、計算コストを大幅に削減します。Gonkaネットワークは同様の安価な分散型inferenceの原則を現在のモデル — Kimi K2.6およびMiniMax M2.7 — に適用しており、これらはJoinGonka Gatewayを通じて100万トークンあたり$0.003(GPT-5.5やClaudeより数千倍安価)で利用可能です。
MMLU-Pro、HumanEval、MATH-500、GSM8Kの各ベンチマークで、Qwen3-235Bはオープンソースモデルのトップ3に入り、数学的推論(reasoning)のタスクではDeepSeek-R1に次ぐ性能を誇ります。コード生成、翻訳、手順順守のタスクでは、Llama 4 Maverickを安定して上回り、Claude Sonnet 4.6と同等の性能を発揮します。
GonkaがQwen3-235Bをどのように活用していたか
Qwen3-235B がネットワークの主要モデルだった当時、それは Gonka ネットワーク 上で、推論用に最適化された DiLoCo プロトコルを通じて分散動作していました。FP8フォーマットのフルモデルを実行するには約640 GBのビデオメモリ (VRAM) が必要であり、単一のGPU(H100 80GBやH200 141GBでさえも)に収めることは不可能です。そのため、モデルは複数のMLノード間でレイヤーごとに分割(テンソル並列 + パイプライン並列)されていました。
実運用では、Qwen3-235B はそれぞれ最低40 GBのVRAMを搭載した8〜16基のGPUノードのクラスターで動作していました。Transfer Agents がリクエストを適切なクラスターへルーティングし、各ノード上の vLLM がモデルの断片を処理し、結果が集約されてユーザーに返されました。プロセス全体は数百ミリ秒で完了し、ユーザーは自分のリクエストが地球上の離れた場所にある多数のGPUによって処理されていることを感じさせません。この分散推論の原則は、現在もネットワークの稼働中のモデルに適用されています。
重要な技術的詳細:Gonka はサービングエンジンとして vLLM を使用しています。vLLM はオープンソースのプロジェクトで、PagedAttention(多数のリクエストを並列処理する際にビデオメモリの使用を最適化するアルゴリズム)を通じて高性能なテキスト生成を実現します。これにより、ネットワークは品質を低下させることなく何千人もの同時ユーザーにサービスを提供できます。
このモデルはネイティブツールコーリング(モデルの回答から直接関数やツールを呼び出す機能)をサポートしています。この機能はPR #767を通じて Gonka に追加され、ツール呼び出し判定の閾値は0.958に設定されました。Qwen3-235B では、開発者はこれにより外部APIやデータベース、ツールと対話するAIエージェントを、単一のリクエストで構築することができました。Tool callingのサポートは、現在のネットワークモデルにも維持されています。
Gonka ネットワークは、120以上のMLノードに統合された4,000基以上のGPU(H100, H200, A100, RTX 4090など)を擁しています。これは世界最大規模のAI推論用分散GPUネットワークの一つであり、以前はこの処理能力が Qwen3-235B に向けられていましたが、現在はネットワークの現行モデルである Kimi K2.6 および MiniMax M2.7 を処理しています。
今から Qwen3-235B を試すことはできますか
直接の答え:Gonkaネットワーク経由では、すでに対応していません。Qwen3-235Bはネットワークから削除されたため、Gatewayを通じて識別子qwen3-235b-a22bで呼び出すことはできません。モデルはオープン(Apache 2.0)であるため、引き続き自前で実行するか、OpenRouterなどのサードパーティ製open-weightsホスティングサービス(100トークンあたり推定$0.071/$0.100)を通じて呼び出すことができます。
もしGonkaが提供する安価な分散型inferenceを求めているのであれば、引き続き現在のネットワークモデルで利用可能です。JoinGonka API Gatewayを通じてKimi K2.6とMiniMax M2.7をOpenAI互換APIで利用できます。OpenAI向けに書かれたコードは、URL、APIキー、モデル名を変更するだけでそのまま動作します。
現在のモデルに対するリクエスト例:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoEアーキテクチャを説明して"}]
}'料金:100万トークンあたり$0.003 — これはGPT-5.5 ($5.00/1M) の1,700分の1、Claude Sonnet 4.6 ($3.00/1M) の1,000分の1の価格です。登録時にテスト用の無料1,000万トークンを取得できます。
Gatewayは、人気の開発ツールと互換性があります。Quick Startでは、Python、Node.js、curlを使用した接続方法を説明しています。また、IDE統合(Cursor、Continue、Cline、Aider、Claude Code)やAIエージェントフレームワーク(LangChain、n8n、LibreChat、Open WebUI)もサポートされています。
クイックスタートの手順:
- gate.joingonka.aiに登録(ウォレット接続または新規作成)
- ダッシュボードでAPIキーを取得
- コード内の
api.openai.comをgate.joingonka.ai/apiに置換 - 最新のネットワークモデルを指定 —
moonshotai/Kimi-K2.6またはMiniMaxAI/MiniMax-M2.7(全リストはGET /v1/modelsエンドポイントを参照)
ホビープロジェクト並みの価格でエンタープライズレベルの分散型inferenceを提供するサービス自体に変わりはありません。Qwen3-235Bは、より新しいネットワークモデルにバトンを渡しただけです。同様の価格と品質の組み合わせは、現在Kimi K2.6およびMiniMax M2.7上で機能しています。