知识库章节 ▾

技术

Qwen3-235B:Gonka 曾支持的模型

Gonka 网络不仅仅提供 GPU 租赁,还为 AI 模型推理提供服务。长期以来,网络中主要且唯一的模型是 Alibaba Cloud 开发的 Qwen3-235B-A22B-Instruct。随着时间的推移,网络已转向多模型架构,Qwen3-235B 已从网络中下线:目前 Gonka 为 Moonshot AI 的 Kimi K2.6MiniMax M2.7 以及 DeepSeek V4 Flash 提供服务。让我们解析一下 Qwen3-235B 是什么、它在 Gonka 网络中扮演的角色以及替代它的模型 — 作为一个显著的开源 MoE 模型,它仍然是一个有用的基准参考。

什么是Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 是阿里巴巴云 Qwen 团队开发的 Qwen3 系列大型语言模型 (LLM)。全名解读如下:Qwen3 — 第三代系列,235B — 共 2350 亿个参数,A22B — 每个请求有 220 亿个活动参数,Instruct — 经过指令训练的版本,2507 — 2025 年 7 月发布,FP8 — 用于内存优化的 8 位量化。

关键的架构特征是 MoE (Mixture of Experts)。与“密集”模型(GPT-5.5、Claude Sonnet 4.6)不同,后者每个 token 都经过所有参数,MoE 模型对每个请求仅激活一部分“专家”—— 专门的神经网络块。以 Qwen3-235B 为例,在 2350 亿个参数中,每个 token 仅激活 220 亿个 —— 不到 10%。这在计算成本相当于 22B 模型的情况下,提供了 200B+ 参数模型的质量水平。

实际上,这意味着:该模型比根据其速度预期要智能得多。它处理请求的速度明显快于质量相当的密集模型,同时推理所需的 VRAM 少得多。这就是为什么 MoE 成为 2025-2026 年最大模型的主导架构。

Qwen3-235B 的上下文窗口为 131,072 个 token(约 100,000 个单词)—— 足以在单个请求中分析整本书、代码库或长篇法律文档。该模型支持 119 种语言,包括俄语、英语、中文、阿拉伯语、印地语和数十种其他语言——使其成为市场上最多语言的模型之一。

特点和基准测试

Qwen3-235B 可与各大闭源及开源模型竞争。以下是关键特性对比:

模型参数量上下文MoE开源价格 (每 1M token)
Qwen3-235B (Alibaba)235B (22B 激活)131K是 (Apache 2.0)$0.07+ (托管)
GPT-5.5 (OpenAI)~1.8T (估计)128K是 (推测)$5.00
Claude Sonnet 4.6 (Anthropic)未披露200K否 (推测)$3.00
Llama 4 Maverick (Meta)400B (17B 激活)1M是 (Llama License)$0.20+ (托管)
DeepSeek-R1 (DeepSeek)671B (37B 激活)128K是 (MIT)$0.55

Qwen3-235B 在大多数基准测试中展现出媲美 GPT-5.5 和 Claude Sonnet 4.6 的质量水平。作为一款开源权重的 MoE 模型,其成本远低于专有替代品:MoE 架构在每次请求时仅激活部分参数,从而大幅降低计算成本。Gonka 网络目前将其低成本去中心化 inference 原则应用于其现有的模型 — Kimi K2.6MiniMax M2.7,用户可通过 JoinGonka Gateway 以每 1M token $0.0047 的价格调用(比 GPT-5.5 和 Claude 便宜数百至数千倍)。

在 MMLU-Pro、HumanEval、MATH-500 和 GSM8K 基准测试中,该模型跻身顶级开源模型前三名,仅在数学推理任务中略逊于 DeepSeek-R1。在代码生成、翻译和指令遵循任务中,Qwen3-235B 始终领先于 Llama 4 Maverick,并与 Claude Sonnet 4.6 不相上下。

Gonka 如何使用 Qwen3-235B

当 Qwen3-235B 是网络的主力模型时,它在 Gonka 网络中通过专门适配推理的 DiLoCo 协议以分布式方式运行。完整 FP8 格式的模型需要约 640 GB 显存VRAM),这在单张 GPU 上是不可能容纳的 — 即使是 H100 80GB 或 H200 141GB 也不够。因此,模型被按层拆分(张量并行 + 流水线并行)并在多个 MLNode 之间运行。

在实践中,Qwen3-235B 运行在由 8—16 个 GPU 节点组成的集群上,每个节点至少具备 40 GB VRAM。Transfer Agents 将请求路由到所需的集群,每个节点上的 vLLM 处理其模型片段,结果被汇总并返回给用户。整个过程仅需数百毫秒 — 用户不会感觉到他们的请求是由地球上不同地点的十几个 GPU 处理的。网络今天将相同的分布式推理原则应用于当前的活跃模型。

一个重要的技术细节是:Gonka 使用 vLLM 作为服务引擎。vLLM 是一个开源项目,通过 PagedAttention(一种在处理多个并发请求时优化显存使用的算法)提供高性能文本生成。这使得网络能够为数千名并发用户提供服务而不会降低质量。

该模型支持 原生 tool calling — 即直接从模型响应中调用函数和工具。这一能力通过 PR #767 添加到 Gonka 中,并设置了 0.958 的阈值用于判断工具调用。在 Qwen3-235B 上,这允许开发者构建 AI Agent,通过单一请求与外部 API、数据库和工具进行交互。Tool calling 支持已在网络的当前模型中得到保留。

Gonka 网络拥有超过 4,000 个 GPU(H100、H200、A100、RTX 4090 等),集成在 120 多个 MLNode 中。它是全球最大的分布式 AI 推理 GPU 网络之一 — 如果说以前这些算力用于 Qwen3-235B,那么今天它为网络当前的模型服务 — Kimi K2.6MiniMax M2.7 和 DeepSeek V4 Flash。

现在还可以尝试 Qwen3-235B 吗

直接回答:通过 Gonka 网络已经不行了。Qwen3-235B 已从网络中下架,因此无法再通过我们的 Gateway 使用 qwen3-235b-a22b 标识符调用它。由于该模型是开放权重模型(Apache 2.0),您仍然可以自行运行它,或者通过第三方开放权重模型托管商访问——例如通过 OpenRouter(约 $0.071/$0.100 每 1M token)。

如果您需要的是吸引用户来到 Gonka 的那种廉价去中心化 inference,它并没有消失,只是现在运行在当前的网络模型上。通过 JoinGonka API Gateway,您可以使用兼容 OpenAI API 的 Kimi K2.6MiniMax M2.7 和 DeepSeek V4 Flash:任何为 OpenAI 编写的代码都可以直接使用,无需更改——只需替换 URL、API Key 和模型名称即可。

调用活动模型的请求示例:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "解释 MoE 架构"}]
  }'

成本:$0.0047 每 100 万 token —— 这比 GPT-5.5 ($5.00/1M) 便宜约 800 倍,比 Claude Sonnet 4.6 ($3.00/1M) 便宜约 500 倍。注册后,您将获得免费的 1.5M token 用于测试。

该 Gateway 兼容主流开发工具:Quick Start 介绍了如何通过 Python、Node.js 和 curl 进行连接。同时支持 IDE 集成(Cursor、Continue、Cline、Aider 和 Claude Code)以及 AI Agent 框架:LangChain、n8n、LibreChat、Open WebUI。

快速开始:

  1. 注册 gate.joingonka.ai(连接钱包或创建新钱包)
  2. 在 Dashboard 中获取 API Key
  3. 在您的代码中将 api.openai.com 替换为 gate.joingonka.ai/api
  4. 指定当前可用的网络模型 — moonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7deepseek-ai/DeepSeek-V4-Flash-0731(完整列表请查看 GET /v1/models 端点)

企业级去中心化 inference 依然保持着业余项目级别的价格,Qwen3-235B 只是让位于更新的网络模型。现在,相同的性价比优势在 Kimi K2.6MiniMax M2.7 和 DeepSeek V4 Flash 上同样适用。

Qwen3-235B-A22B 是来自阿里云的 2350 亿参数(220 亿激活参数)MoE 模型,在早期阶段曾是 Gonka 网络去中心化 AI 推理的核心模型。得益于其 MoE 架构,它以极低的计算成本提供了媲美顶级闭源模型的性能。目前 Qwen3-235B 已从网络中下架:Gonka 现行的模型为 Kimi K2.6、MiniMax M2.7 和 DeepSeek V4 Flash,均可通过 JoinGonka Gateway 以 OpenAI 兼容 API 使用,价格为 $0.0047/1M token。Qwen3-235B 本身保持开源(Apache 2.0),并可在第三方开源权重模型托管服务上获取。

想了解更多?

探索其他章节或立即开始赚取 GNK。

尝试目前的 Gonka 模型 →