知识库章节 ▾
技术
Qwen3-235B:Gonka 曾支持的模型
什么是Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 是阿里巴巴云 Qwen 团队开发的 Qwen3 系列大型语言模型 (LLM)。全名解读如下:Qwen3 — 第三代系列,235B — 共 2350 亿个参数,A22B — 每个请求有 220 亿个活动参数,Instruct — 经过指令训练的版本,2507 — 2025 年 7 月发布,FP8 — 用于内存优化的 8 位量化。
关键的架构特征是 MoE (Mixture of Experts)。与“密集”模型(GPT-5.5、Claude Sonnet 4.6)不同,后者每个 token 都经过所有参数,MoE 模型对每个请求仅激活一部分“专家”—— 专门的神经网络块。以 Qwen3-235B 为例,在 2350 亿个参数中,每个 token 仅激活 220 亿个 —— 不到 10%。这在计算成本相当于 22B 模型的情况下,提供了 200B+ 参数模型的质量水平。
实际上,这意味着:该模型比根据其速度预期要智能得多。它处理请求的速度明显快于质量相当的密集模型,同时推理所需的 VRAM 少得多。这就是为什么 MoE 成为 2025-2026 年最大模型的主导架构。
Qwen3-235B 的上下文窗口为 131,072 个 token(约 100,000 个单词)—— 足以在单个请求中分析整本书、代码库或长篇法律文档。该模型支持 119 种语言,包括俄语、英语、中文、阿拉伯语、印地语和数十种其他语言——使其成为市场上最多语言的模型之一。
特点和基准测试
Qwen3-235B 可与各大闭源及开源模型竞争。以下是关键特性对比:
| 模型 | 参数量 | 上下文 | MoE | 开源 | 价格 (每 1M token) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B 激活) | 131K | 是 | 是 (Apache 2.0) | $0.07+ (托管) |
| GPT-5.5 (OpenAI) | ~1.8T (估计) | 128K | 是 (推测) | 否 | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | 未披露 | 200K | 否 (推测) | 否 | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B 激活) | 1M | 是 | 是 (Llama License) | $0.20+ (托管) |
| DeepSeek-R1 (DeepSeek) | 671B (37B 激活) | 128K | 是 | 是 (MIT) | $0.55 |
Qwen3-235B 在大多数基准测试中展现出媲美 GPT-5.5 和 Claude Sonnet 4.6 的质量水平。作为一款开源权重的 MoE 模型,其成本远低于专有替代品:MoE 架构在每次请求时仅激活部分参数,从而大幅降低计算成本。Gonka 网络目前将其低成本去中心化 inference 原则应用于其现有的模型 — Kimi K2.6 和 MiniMax M2.7,用户可通过 JoinGonka Gateway 以每 1M token $0.0047 的价格调用(比 GPT-5.5 和 Claude 便宜数百至数千倍)。
在 MMLU-Pro、HumanEval、MATH-500 和 GSM8K 基准测试中,该模型跻身顶级开源模型前三名,仅在数学推理任务中略逊于 DeepSeek-R1。在代码生成、翻译和指令遵循任务中,Qwen3-235B 始终领先于 Llama 4 Maverick,并与 Claude Sonnet 4.6 不相上下。
Gonka 如何使用 Qwen3-235B
当 Qwen3-235B 是网络的主力模型时,它在 Gonka 网络中通过专门适配推理的 DiLoCo 协议以分布式方式运行。完整 FP8 格式的模型需要约 640 GB 显存(VRAM),这在单张 GPU 上是不可能容纳的 — 即使是 H100 80GB 或 H200 141GB 也不够。因此,模型被按层拆分(张量并行 + 流水线并行)并在多个 MLNode 之间运行。
在实践中,Qwen3-235B 运行在由 8—16 个 GPU 节点组成的集群上,每个节点至少具备 40 GB VRAM。Transfer Agents 将请求路由到所需的集群,每个节点上的 vLLM 处理其模型片段,结果被汇总并返回给用户。整个过程仅需数百毫秒 — 用户不会感觉到他们的请求是由地球上不同地点的十几个 GPU 处理的。网络今天将相同的分布式推理原则应用于当前的活跃模型。
一个重要的技术细节是:Gonka 使用 vLLM 作为服务引擎。vLLM 是一个开源项目,通过 PagedAttention(一种在处理多个并发请求时优化显存使用的算法)提供高性能文本生成。这使得网络能够为数千名并发用户提供服务而不会降低质量。
该模型支持 原生 tool calling — 即直接从模型响应中调用函数和工具。这一能力通过 PR #767 添加到 Gonka 中,并设置了 0.958 的阈值用于判断工具调用。在 Qwen3-235B 上,这允许开发者构建 AI Agent,通过单一请求与外部 API、数据库和工具进行交互。Tool calling 支持已在网络的当前模型中得到保留。
Gonka 网络拥有超过 4,000 个 GPU(H100、H200、A100、RTX 4090 等),集成在 120 多个 MLNode 中。它是全球最大的分布式 AI 推理 GPU 网络之一 — 如果说以前这些算力用于 Qwen3-235B,那么今天它为网络当前的模型服务 — Kimi K2.6、MiniMax M2.7 和 DeepSeek V4 Flash。
现在还可以尝试 Qwen3-235B 吗
直接回答:通过 Gonka 网络已经不行了。Qwen3-235B 已从网络中下架,因此无法再通过我们的 Gateway 使用 qwen3-235b-a22b 标识符调用它。由于该模型是开放权重模型(Apache 2.0),您仍然可以自行运行它,或者通过第三方开放权重模型托管商访问——例如通过 OpenRouter(约 $0.071/$0.100 每 1M token)。
如果您需要的是吸引用户来到 Gonka 的那种廉价去中心化 inference,它并没有消失,只是现在运行在当前的网络模型上。通过 JoinGonka API Gateway,您可以使用兼容 OpenAI API 的 Kimi K2.6、MiniMax M2.7 和 DeepSeek V4 Flash:任何为 OpenAI 编写的代码都可以直接使用,无需更改——只需替换 URL、API Key 和模型名称即可。
调用活动模型的请求示例:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "解释 MoE 架构"}]
}'成本:$0.0047 每 100 万 token —— 这比 GPT-5.5 ($5.00/1M) 便宜约 800 倍,比 Claude Sonnet 4.6 ($3.00/1M) 便宜约 500 倍。注册后,您将获得免费的 1.5M token 用于测试。
该 Gateway 兼容主流开发工具:Quick Start 介绍了如何通过 Python、Node.js 和 curl 进行连接。同时支持 IDE 集成(Cursor、Continue、Cline、Aider 和 Claude Code)以及 AI Agent 框架:LangChain、n8n、LibreChat、Open WebUI。
快速开始:
- 注册 gate.joingonka.ai(连接钱包或创建新钱包)
- 在 Dashboard 中获取 API Key
- 在您的代码中将
api.openai.com替换为gate.joingonka.ai/api - 指定当前可用的网络模型 —
moonshotai/Kimi-K2.6、MiniMaxAI/MiniMax-M2.7或deepseek-ai/DeepSeek-V4-Flash-0731(完整列表请查看GET /v1/models端点)
企业级去中心化 inference 依然保持着业余项目级别的价格,Qwen3-235B 只是让位于更新的网络模型。现在,相同的性价比优势在 Kimi K2.6、MiniMax M2.7 和 DeepSeek V4 Flash 上同样适用。