技術
Qwen3-235B: かつてGonkaが運用していたモデル
Qwen3-235Bとは
Qwen3-235B-A22B-Instruct-2507-FP8は、QwenチームがAlibaba Cloudで開発したQwen3ファミリーの大規模言語モデル(LLM)です。完全な名前は次のように解釈されます: Qwen3 — 第3世代シリーズ、235B — 全体で2350億パラメータ、A22B — 各リクエストで220億アクティブパラメータ、Instruct — 指示に従うように学習されたバージョン、2507 — 2025年7月リリース、FP8 — メモリ最適化のための8ビット量子化です。
主要なアーキテクチャの特徴はMoE(Mixture of Experts)です。密なモデル(GPT-5.5、Claude Sonnet 4.6)がすべてのパラメータを介して各トークンを処理するのとは異なり、MoEモデルは各リクエストに対して「エキスパート」のサブセット、つまり特殊なニューラルネットワークブロックのみをアクティブ化します。Qwen3-235Bの場合、2350億パラメータのうち、各トークンに対して220億、つまり10%未満しかアクティブ化されません。これにより、22Bモデルの計算コストで200B+パラメータを持つモデルレベルの品質が得られます。
実質的には、これはモデルがその速度からは予期できないほど賢いことを意味します。同等の品質の密なモデルよりもはるかに速くリクエストを処理し、推論に必要なVRAMは数分の1です。だからこそ、MoEは2025〜2026年最大のモデルにとって支配的なアーキテクチャとなったのです。
Qwen3-235Bのコンテキストウィンドウは131,072トークン(約10万語)で、これは1回のクエリで本全体、コードベース、または長い法的文書を分析するのに十分です。このモデルは、ロシア語、英語、中国語、アラビア語、ヒンディー語など、119言語をサポートしており、市場で最も多言語対応のモデルの1つとなっています。
特徴とベンチマーク
Qwen3-235Bは、主要なクローズドおよびオープンモデルと競合する性能を持っています。主な特性の比較は以下の通りです:
| モデル | パラメータ | コンテキスト | MoE | Open Source | 価格 (1Mトークンあたり) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22Bアクティブ) | 131K | あり | あり (Apache 2.0) | $0.07+ (ホスティング) |
| GPT-5.5 (OpenAI) | ~1.8T (推定) | 128K | あり (想定) | なし | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | 非公開 | 200K | なし (想定) | なし | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17Bアクティブ) | 1M | あり | あり (Llama License) | $0.20+ (ホスティング) |
| DeepSeek-R1 (DeepSeek) | 671B (37Bアクティブ) | 128K | あり | あり (MIT) | $0.55 |
Qwen3-235Bは、ほとんどのベンチマークにおいてGPT-5.5やClaude Sonnet 4.6に匹敵する品質レベルを示しています。オープンウェイトのMoEモデルとして、MoEアーキテクチャがリクエストごとに一部のパラメータのみをアクティブ化し計算コストを劇的に削減するため、プロプライエタリな代替品よりも大幅に安価です。Gonkaネットワークは、この安価な分散inferenceの原理を、現在利用可能なKimi K2.6やMiniMax M2.7モデルにも適用しており、JoinGonka Gatewayを通じて1Mトークンあたり$0.0047(GPT-5.5やClaudeと比較して数百〜数千倍の安さ)で提供しています。
MMLU-Pro、HumanEval、MATH-500、GSM8Kのベンチマークでは、数学的推論(reasoning)タスクでDeepSeek-R1に次ぐトップ3のオープンソースモデルに含まれます。コード生成、翻訳、指示追従のタスクでは、Qwen3-235Bは一貫してLlama 4 Maverickを上回り、Claude Sonnet 4.6と同等の性能を示しています。
GonkaがQwen3-235Bをどのように活用していたか
Qwen3-235Bがネットワークの主要モデルであった当時、それはGonkaネットワーク上で、推論向けに最適化されたDiLoCoプロトコルを通じて分散実行されていました。FP8フォーマットのフルモデルには約640GBのビデオメモリ(VRAM)が必要であり、単一のGPU(H100 80GBやH200 141GBであっても)では収まりません。そのため、モデルは複数のMLノード間で層ごとに分割(テンソル並列 + パイプライン並列)されていました。
実際には、Qwen3-235Bはそれぞれ最低40GBのVRAMを備えた8〜16個のGPUノードのクラスターで動作していました。Transfer Agentsがリクエストを適切なクラスターにルーティングし、各ノードのvLLMがモデルのフラグメントを処理し、結果が集約されてユーザーに返されます。このプロセス全体は数百ミリ秒で完了し、ユーザーは世界各地の十数台のGPUによって処理されていることを意識する必要はありません。この分散推論の原理は、現在運用中のモデルでも適用されています。
重要な技術的詳細として、GonkaはサービングエンジンとしてvLLMを使用しています。vLLMはオープンソースのプロジェクトであり、PagedAttentionを通じて高性能なテキスト生成を実現します。これは、複数のリクエストを並列処理する際にビデオメモリの使用を最適化するアルゴリズムです。これにより、ネットワークは品質を低下させることなく、数千人の同時ユーザーにサービスを提供できます。
本モデルはネイティブなツール呼び出し(tool calling)をサポートしており、モデルの回答から直接関数やツールを呼び出すことができます。この機能はPR #767を通じてGonkaに追加され、ツール呼び出しを識別するためのしきい値は0.958に設定されました。Qwen3-235Bでは、これにより開発者は外部API、データベース、ツールとやり取りするAIエージェントを単一のリクエストで構築できました。ツール呼び出しのサポートは、現在のネットワークモデルでも引き継がれています。
Gonkaネットワークは、120以上のMLノードに統合された4,000基以上のGPU(H100, H200, A100, RTX 4090など)を擁しています。これは世界最大級のAI推論用分散GPUネットワークであり、かつてはこのパワーがQwen3-235Bに充てられていましたが、現在はネットワークの現行モデルであるKimi K2.6、MiniMax M2.7、DeepSeek V4 Flashの提供に使用されています。
今から Qwen3-235B を試すことはできますか
直接的な回答:Gonkaネットワークを通じては、既に対応していません。Qwen3-235Bはネットワークから削除されたため、ID qwen3-235b-a22b を介して当社のGatewayで呼び出すことはできなくなりました。このモデルはオープン(Apache 2.0)であるため、独自に実行するか、OpenRouterなどのサードパーティのopen-weightsモデルホスティングを通じてアクセスすることは可能です(目安として1Mトークンあたり$0.071/$0.100)。
もしGonkaに期待されている安価な分散型inferenceが必要であれば、それは現在もネットワーク上で稼働中のモデルで利用可能です。JoinGonka API Gatewayを通じて、Kimi K2.6、MiniMax M2.7、およびDeepSeek V4 FlashをOpenAI互換APIとして利用できます。OpenAI用に書かれたコードはそのまま機能します。URL、APIキー、モデル名を変更するだけです。
稼働中のモデルへのリクエスト例:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoEアーキテクチャについて説明して"}]
}'コスト:100万トークンあたり$0.0047。これはGPT-5.5 ($5.00/1M) より約800倍、Claude Sonnet 4.6 ($3.00/1M) より約500倍安価です。登録時に、テスト用の無料トークン1.5Mが付与されます。
Gatewayは一般的な開発ツールと互換性があります。Quick Startには、Python、Node.js、curlを通じた接続方法が記載されています。また、Cursor、Continue、Cline、Aider、Claude CodeなどのIDE統合や、LangChain、n8n、LibreChat、Open WebUIといったAIエージェントフレームワークもサポートされています。
クイックスタートの手順:
- gate.joingonka.aiに登録する(ウォレットを接続、または新規作成)
- DashboardでAPIキーを取得する
- コード内の
api.openai.comをgate.joingonka.ai/apiに書き換える - ネットワークの最新モデルを指定する —
moonshotai/Kimi-K2.6、MiniMaxAI/MiniMax-M2.7、またはdeepseek-ai/DeepSeek-V4-Flash-0731(全リストはGET /v1/modelsエンドポイントで確認可能)
ホビープロジェクト並みの価格でエンタープライズレベルの分散型inferenceを提供するサービスは継続しており、Qwen3-235Bは単にネットワークの新しいモデルにその座を譲った形です。同じコストパフォーマンスが、現在は Kimi K2.6、MiniMax M2.7、DeepSeek V4 Flashで実現されています。