知识库章节 ▾

技术

Qwen3-235B:Gonka 曾支持的模型

Gonka 网络不仅是租赁 GPU,它还为 AI 模型提供 inference 服务。长期以来,网络中首要且唯一的模型是由 Alibaba Cloud 开发的 Qwen3-235B-A22B-Instruct。随着时间的推移,网络转型为多模型架构,Qwen3-235B 随之从网络中下架:目前 Gonka 支持 Moonshot AI 的 Kimi K2.6 以及 MiniMax M2.7。让我们分析一下 Qwen3-235B 是什么,它在 Gonka 网络中扮演的角色,以及它被什么所取代——作为一款优秀的开源 MoE 模型,它依然是一个有价值的参考指标。

什么是Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 是阿里巴巴云 Qwen 团队开发的 Qwen3 系列大型语言模型 (LLM)。全名解读如下:Qwen3 — 第三代系列,235B — 共 2350 亿个参数,A22B — 每个请求有 220 亿个活动参数,Instruct — 经过指令训练的版本,2507 — 2025 年 7 月发布,FP8 — 用于内存优化的 8 位量化。

关键的架构特征是 MoE (Mixture of Experts)。与“密集”模型(GPT-5.5、Claude Sonnet 4.6)不同,后者每个 token 都经过所有参数,MoE 模型对每个请求仅激活一部分“专家”—— 专门的神经网络块。以 Qwen3-235B 为例,在 2350 亿个参数中,每个 token 仅激活 220 亿个 —— 不到 10%。这在计算成本相当于 22B 模型的情况下,提供了 200B+ 参数模型的质量水平。

实际上,这意味着:该模型比根据其速度预期要智能得多。它处理请求的速度明显快于质量相当的密集模型,同时推理所需的 VRAM 少得多。这就是为什么 MoE 成为 2025-2026 年最大模型的主导架构。

Qwen3-235B 的上下文窗口为 131,072 个 token(约 100,000 个单词)—— 足以在单个请求中分析整本书、代码库或长篇法律文档。该模型支持 119 种语言,包括俄语、英语、中文、阿拉伯语、印地语和数十种其他语言——使其成为市场上最多语言的模型之一。

特点和基准测试

Qwen3-235B 能够与各大闭源及开源模型竞争。以下是关键特性对比:

模型参数量上下文MoE开源价格 (每 100 万 token)
Qwen3-235B (Alibaba)2350 亿 (220 亿活跃)131K是 (Apache 2.0)$0.07+ (托管)
GPT-5.5 (OpenAI)~1.8 万亿 (预估)128K是 (推测)$5.00
Claude Sonnet 4.6 (Anthropic)未公开200K否 (推测)$3.00
Llama 4 Maverick (Meta)4000 亿 (170 亿活跃)1M是 (Llama License)$0.20+ (托管)
DeepSeek-R1 (DeepSeek)6710 亿 (370 亿活跃)128K是 (MIT)$0.55

Qwen3-235B 在大多数基准测试中展现出与 GPT-5.5 和 Claude Sonnet 4.6 相当的质量水平。作为一款开源权重 MoE 模型,其成本远低于闭源同类产品:MoE 架构在每次请求时仅激活部分参数,大幅降低了计算成本。Gonka 网络目前正将这种廉价去中心化推理机制应用于其现有模型 — Kimi K2.6MiniMax M2.7,用户可通过 JoinGonka Gateway 以每 100 万 token $0.003 的价格调用(比 GPT-5.5 和 Claude 便宜数千倍)。

在 MMLU-Pro、HumanEval、MATH-500 和 GSM8K 基准测试中,该模型位列开源模型前三名,仅在数学推理任务上稍逊于 DeepSeek-R1。在代码生成、翻译和指令遵循任务中,Qwen3-235B 稳定领先于 Llama 4 Maverick,且与 Claude Sonnet 4.6 水平相当。

Gonka 如何使用 Qwen3-235B

当 Qwen3-235B 还是网络的主模型时,它是通过针对推理优化的 DiLoCo 协议在 Gonka 网络上进行分布式运行的。FP8 格式的完整模型需要约 640 GB 显存VRAM),单张 GPU 无法容纳——即使是 H100 80GB 或 H200 141GB 也不够。因此,模型通过多台 ML-node 进行了层级拆分(张量并行 + 流水线并行)。

实际应用中,Qwen3-235B 运行在 8-16 个 GPU 节点组成的集群上,每个节点至少具备 40 GB 显存。Transfer Agents 将请求路由到相应的集群,每台节点上的 vLLM 处理其负责的模型片段,汇总结果后返回给用户。整个过程仅需数百毫秒——用户不会感觉到请求是在全球各地的十余个 GPU 上处理的。网络目前将同样的分布式推理原则应用于现有模型。

重要的技术细节:Gonka 使用 vLLM 作为服务引擎。vLLM 是一个开源项目,通过 PagedAttention(一种在处理并发请求时优化显存使用的算法)提供高性能文本生成。这使得网络能够为数千名并发用户提供服务,且不会降低质量。

该模型支持原生 tool calling——直接从模型回复中调用函数和工具。这一功能通过 PR #767 添加到 Gonka 中,工具调用检测阈值为 0.958。在 Qwen3-235B 上,这允许开发者构建能够与外部 API、数据库和工具交互的 AI 智能体——所有操作都在单次请求内完成。工具调用支持在当前网络模型中得以保留。

Gonka 网络拥有超过 4,000 张 GPU(H100, H200, A100, RTX 4090 等),集成在 120 多个 ML-node 中。这是全球最大的 AI 推理分布式 GPU 网络之一——如果说之前此算力集中于 Qwen3-235B,那么今天它正在为网络的现有模型 Kimi K2.6MiniMax M2.7 提供支持。

现在还可以尝试 Qwen3-235B 吗

直接回答:通过 Gonka 网络已经无法调用了。Qwen3-235B 已从网络中下架,因此不能再通过我们的 Gateway 使用 qwen3-235b-a22b 标识符进行调用。鉴于该模型是开源的 (Apache 2.0),您仍然可以自行运行或通过第三方开源权重模型托管服务(如 OpenRouter,预估价格约 $0.071/$0.100 每 100 万 token)进行访问。

如果您需要的是 Gonka 引以为傲的低成本去中心化推理,它并未消失,只是目前切换到了现有的网络模型上。通过 JoinGonka API Gateway,您可以使用符合 OpenAI 标准的 API 获取 Kimi K2.6MiniMax M2.7:任何为 OpenAI 编写的代码都无需更改即可使用 — 只需替换 URL、API 密钥和模型名称即可。

当前模型请求示例:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "解释下 MoE 架构"}]
  }'

价格:每 100 万 token 仅需 $0.003 — 这比 GPT-5.5 ($5.00/1M) 便宜 1700 倍,比 Claude Sonnet 4.6 ($3.00/1M) 便宜 1000 倍。注册即赠送 1000 万 token 供您测试。

Gateway 兼容各类热门开发工具:快速入门文档介绍了如何通过 Python、Node.js 和 curl 连接。此外还支持 IDE 集成 — Cursor、Continue、Cline、Aider、Claude Code 以及 AI 代理框架:LangChain、n8n、LibreChat、Open WebUI。

快速开始步骤:

  1. gate.joingonka.ai 注册(连接您的钱包或创建新钱包)
  2. 在仪表盘获取 API 密钥
  3. 将代码中的 api.openai.com 替换为 gate.joingonka.ai/api
  4. 指定当前网络模型 — moonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7(完整列表请见 GET /v1/models 端点)

达到企业级的去中心化推理且仅需业余项目的成本,这一使命从未改变 — Qwen3-235B 只是完成了历史使命,让位于更新的网络模型。现在,Kimi K2.6MiniMax M2.7 成就了同样卓越的价格与性能表现。

Qwen3-235B-A22B 是来自阿里云的 2350 亿参数(220 亿激活参数)MoE 模型,曾在早期阶段作为 Gonka 网络去中心化 AI inference 的主力模型。得益于 MoE 架构,它以显著降低的计算成本提供了顶级私有模型级别的质量。目前,Qwen3-235B 已从网络中下线:现在的 Gonka 主流模型是 Kimi K2.6 和 MiniMax M2.7,可通过 JoinGonka Gateway 以 OpenAI 兼容 API 访问,价格为每百万 token 0.003 美元。Qwen3-235B 本身保持开源(Apache 2.0),可在第三方 open-weights 托管服务上使用。

想了解更多?

探索其他章节或立即开始赚取 GNK。

尝试目前的 Gonka 模型 →