知识库章节 ▾
技术
Qwen3-235B:Gonka 曾支持的模型
什么是Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 是阿里巴巴云 Qwen 团队开发的 Qwen3 系列大型语言模型 (LLM)。全名解读如下:Qwen3 — 第三代系列,235B — 共 2350 亿个参数,A22B — 每个请求有 220 亿个活动参数,Instruct — 经过指令训练的版本,2507 — 2025 年 7 月发布,FP8 — 用于内存优化的 8 位量化。
关键的架构特征是 MoE (Mixture of Experts)。与“密集”模型(GPT-5.5、Claude Sonnet 4.6)不同,后者每个 token 都经过所有参数,MoE 模型对每个请求仅激活一部分“专家”—— 专门的神经网络块。以 Qwen3-235B 为例,在 2350 亿个参数中,每个 token 仅激活 220 亿个 —— 不到 10%。这在计算成本相当于 22B 模型的情况下,提供了 200B+ 参数模型的质量水平。
实际上,这意味着:该模型比根据其速度预期要智能得多。它处理请求的速度明显快于质量相当的密集模型,同时推理所需的 VRAM 少得多。这就是为什么 MoE 成为 2025-2026 年最大模型的主导架构。
Qwen3-235B 的上下文窗口为 131,072 个 token(约 100,000 个单词)—— 足以在单个请求中分析整本书、代码库或长篇法律文档。该模型支持 119 种语言,包括俄语、英语、中文、阿拉伯语、印地语和数十种其他语言——使其成为市场上最多语言的模型之一。
特点和基准测试
Qwen3-235B 能够与各大闭源及开源模型竞争。以下是关键特性对比:
| 模型 | 参数量 | 上下文 | MoE | 开源 | 价格 (每 100 万 token) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 2350 亿 (220 亿活跃) | 131K | 是 | 是 (Apache 2.0) | $0.07+ (托管) |
| GPT-5.5 (OpenAI) | ~1.8 万亿 (预估) | 128K | 是 (推测) | 否 | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | 未公开 | 200K | 否 (推测) | 否 | $3.00 |
| Llama 4 Maverick (Meta) | 4000 亿 (170 亿活跃) | 1M | 是 | 是 (Llama License) | $0.20+ (托管) |
| DeepSeek-R1 (DeepSeek) | 6710 亿 (370 亿活跃) | 128K | 是 | 是 (MIT) | $0.55 |
Qwen3-235B 在大多数基准测试中展现出与 GPT-5.5 和 Claude Sonnet 4.6 相当的质量水平。作为一款开源权重 MoE 模型,其成本远低于闭源同类产品:MoE 架构在每次请求时仅激活部分参数,大幅降低了计算成本。Gonka 网络目前正将这种廉价去中心化推理机制应用于其现有模型 — Kimi K2.6 和 MiniMax M2.7,用户可通过 JoinGonka Gateway 以每 100 万 token $0.003 的价格调用(比 GPT-5.5 和 Claude 便宜数千倍)。
在 MMLU-Pro、HumanEval、MATH-500 和 GSM8K 基准测试中,该模型位列开源模型前三名,仅在数学推理任务上稍逊于 DeepSeek-R1。在代码生成、翻译和指令遵循任务中,Qwen3-235B 稳定领先于 Llama 4 Maverick,且与 Claude Sonnet 4.6 水平相当。
Gonka 如何使用 Qwen3-235B
当 Qwen3-235B 还是网络的主模型时,它是通过针对推理优化的 DiLoCo 协议在 Gonka 网络上进行分布式运行的。FP8 格式的完整模型需要约 640 GB 显存(VRAM),单张 GPU 无法容纳——即使是 H100 80GB 或 H200 141GB 也不够。因此,模型通过多台 ML-node 进行了层级拆分(张量并行 + 流水线并行)。
实际应用中,Qwen3-235B 运行在 8-16 个 GPU 节点组成的集群上,每个节点至少具备 40 GB 显存。Transfer Agents 将请求路由到相应的集群,每台节点上的 vLLM 处理其负责的模型片段,汇总结果后返回给用户。整个过程仅需数百毫秒——用户不会感觉到请求是在全球各地的十余个 GPU 上处理的。网络目前将同样的分布式推理原则应用于现有模型。
重要的技术细节:Gonka 使用 vLLM 作为服务引擎。vLLM 是一个开源项目,通过 PagedAttention(一种在处理并发请求时优化显存使用的算法)提供高性能文本生成。这使得网络能够为数千名并发用户提供服务,且不会降低质量。
该模型支持原生 tool calling——直接从模型回复中调用函数和工具。这一功能通过 PR #767 添加到 Gonka 中,工具调用检测阈值为 0.958。在 Qwen3-235B 上,这允许开发者构建能够与外部 API、数据库和工具交互的 AI 智能体——所有操作都在单次请求内完成。工具调用支持在当前网络模型中得以保留。
Gonka 网络拥有超过 4,000 张 GPU(H100, H200, A100, RTX 4090 等),集成在 120 多个 ML-node 中。这是全球最大的 AI 推理分布式 GPU 网络之一——如果说之前此算力集中于 Qwen3-235B,那么今天它正在为网络的现有模型 Kimi K2.6 和 MiniMax M2.7 提供支持。
现在还可以尝试 Qwen3-235B 吗
直接回答:通过 Gonka 网络已经无法调用了。Qwen3-235B 已从网络中下架,因此不能再通过我们的 Gateway 使用 qwen3-235b-a22b 标识符进行调用。鉴于该模型是开源的 (Apache 2.0),您仍然可以自行运行或通过第三方开源权重模型托管服务(如 OpenRouter,预估价格约 $0.071/$0.100 每 100 万 token)进行访问。
如果您需要的是 Gonka 引以为傲的低成本去中心化推理,它并未消失,只是目前切换到了现有的网络模型上。通过 JoinGonka API Gateway,您可以使用符合 OpenAI 标准的 API 获取 Kimi K2.6 和 MiniMax M2.7:任何为 OpenAI 编写的代码都无需更改即可使用 — 只需替换 URL、API 密钥和模型名称即可。
当前模型请求示例:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "解释下 MoE 架构"}]
}'价格:每 100 万 token 仅需 $0.003 — 这比 GPT-5.5 ($5.00/1M) 便宜 1700 倍,比 Claude Sonnet 4.6 ($3.00/1M) 便宜 1000 倍。注册即赠送 1000 万 token 供您测试。
Gateway 兼容各类热门开发工具:快速入门文档介绍了如何通过 Python、Node.js 和 curl 连接。此外还支持 IDE 集成 — Cursor、Continue、Cline、Aider、Claude Code 以及 AI 代理框架:LangChain、n8n、LibreChat、Open WebUI。
快速开始步骤:
- 在 gate.joingonka.ai 注册(连接您的钱包或创建新钱包)
- 在仪表盘获取 API 密钥
- 将代码中的
api.openai.com替换为gate.joingonka.ai/api - 指定当前网络模型 —
moonshotai/Kimi-K2.6或MiniMaxAI/MiniMax-M2.7(完整列表请见GET /v1/models端点)
达到企业级的去中心化推理且仅需业余项目的成本,这一使命从未改变 — Qwen3-235B 只是完成了历史使命,让位于更新的网络模型。现在,Kimi K2.6 和 MiniMax M2.7 成就了同样卓越的价格与性能表现。