Seções da Base de Conhecimento ▾
Navegação
▸ Comece aqui Por funçõesCategorias
- Arquitetura da Rede Gonka: Sprint, Agentes de Transferência, DiLoCo
- Desenvolvedores: Como Ganhar GNK
- Auto-hospedagem: Guia passo a passo
- Escolha da GPU para Gonka: recomendações de hardware
- Qwen3-235B: o modelo que a Gonka atendia anteriormente
- Kimi K2.6: o segundo modelo da rede Gonka
- MiniMax M2.7: modelo da rede Gonka
Tecnologia
Qwen3-235B: o modelo que a Gonka atendia anteriormente
O que é Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 — é uma Large Language Model (LLM) da família Qwen3, desenvolvida pela equipe Qwen na Alibaba Cloud. O nome completo se desdobra assim: Qwen3 — terceira geração da série, 235B — 235 bilhões de parâmetros no total, A22B — 22 bilhões de parâmetros ativos por solicitação, Instruct — versão treinada para seguir instruções, 2507 — lançamento em julho de 2025, FP8 — quantização de 8 bits para otimização de memória.
A característica arquitetônica principal é MoE (Mixture of Experts). Ao contrário dos modelos “densos” (GPT-5.5, Claude Sonnet 4.6), onde cada token passa por todos os parâmetros, o modelo MoE ativa para cada solicitação apenas um subconjunto de “especialistas” — blocos especializados da rede neural. No caso do Qwen3-235B, dos 235 bilhões de parâmetros, apenas 22 bilhões são ativados por token — menos de 10%. Isso confere uma qualidade de nível de modelos com 200B+ parâmetros, com custos computacionais de um modelo de 22B.
Na prática, isso significa: o modelo é mais inteligente do que se poderia esperar de sua velocidade. Ele processa solicitações significativamente mais rápido que modelos densos de qualidade comparável, exigindo muito menos VRAM para inferência. É por isso que o MoE se tornou a arquitetura dominante para os maiores modelos de 2025-2026.
A janela de contexto do Qwen3-235B é de 131.072 tokens (~100.000 palavras) — suficiente para analisar livros inteiros, bases de código ou longos documentos jurídicos em uma única solicitação. O modelo suporta 119 idiomas, incluindo russo, inglês, chinês, árabe, hindi e dezenas de outros — o que o torna um dos modelos mais multilíngues do mercado.
Características e benchmarks
O Qwen3-235B compete com os maiores modelos fechados e abertos. Aqui está uma comparação das características principais:
| Modelo | Parâmetros | Contexto | MoE | Open Source | Preço (por 1M de tokens) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B ativos) | 131K | Sim | Sim (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (estimativa) | 128K | Sim (presumido) | Não | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Não revelado | 200K | Não (presumido) | Não | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B ativos) | 1M | Sim | Sim (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B ativos) | 128K | Sim | Sim (MIT) | $0.55 |
O Qwen3-235B demonstra um nível de qualidade comparável ao GPT-5.5 e Claude Sonnet 4.6 na maioria dos benchmarks, e como um modelo MoE de pesos abertos, é várias vezes mais barato do que as alternativas proprietárias: a arquitetura MoE ativa apenas uma parte dos parâmetros por consulta, reduzindo drasticamente os custos computacionais. A rede Gonka aplica hoje esse mesmo princípio de inferência descentralizada barata aos seus modelos atuais — Kimi K2.6 e MiniMax M2.7, disponíveis através do JoinGonka Gateway por $0.003 por 1M de tokens (milhares de vezes mais barato que GPT-5.5 e Claude).
Nos benchmarks MMLU-Pro, HumanEval, MATH-500 e GSM8K, o modelo está entre os três melhores open-source, perdendo apenas para o DeepSeek-R1 em tarefas de raciocínio matemático (reasoning). Em tarefas de geração de código, tradução e seguimento de instruções, o Qwen3-235B supera consistentemente o Llama 4 Maverick e é comparável ao Claude Sonnet 4.6.
Como a Gonka utilizava o Qwen3-235B
Quando o Qwen3-235B era o modelo principal da rede, ele operava na rede Gonka de forma distribuída — através do protocolo DiLoCo, adaptado para inference. O modelo completo no formato FP8 exige cerca de 640 GB de VRAM (VRAM), o que é impossível de acomodar em uma única GPU — nem mesmo uma H100 de 80 GB ou uma H200 de 141 GB são suficientes. Portanto, o modelo era dividido em camadas (tensor parallelism + pipeline parallelism) entre vários ML-nodos.
Na prática, o Qwen3-235B funcionava em um cluster de 8 a 16 GPU-nodos, cada um com pelo menos 40 GB de VRAM. Os Transfer Agents roteavam a solicitação para o cluster adequado, o vLLM em cada nó processava seu fragmento do modelo, e os resultados eram agregados e retornados ao usuário. Todo o processo levava centenas de milissegundos — o usuário não percebia que sua solicitação estava sendo processada por uma dúzia de GPUs em diferentes pontos do planeta. A rede ainda aplica o mesmo princípio de inference distribuída atualmente com os modelos ativos.
Um detalhe técnico importante: a Gonka utiliza o vLLM como motor para o serving. O vLLM é um projeto de código aberto que fornece geração de texto de alto desempenho via PagedAttention — um algoritmo que otimiza o uso da memória de vídeo durante o processamento paralelo de múltiplas solicitações. Isso permite que a rede atenda milhares de usuários simultâneos sem degradação de qualidade.
O modelo suporta tool calling nativo — a chamada de funções e ferramentas diretamente da resposta do modelo. Essa capacidade foi adicionada à Gonka através do PR #767 com um limite de 0.958 para detecção de chamadas de ferramentas. No Qwen3-235B, isso permitia aos desenvolvedores criar agentes de IA que interagem com APIs externas, bancos de dados e ferramentas — tudo através de uma única solicitação. O suporte a tool calling foi mantido nos modelos ativos da rede.
A rede Gonka conta com mais de 4 000 GPUs (H100, H200, A100, RTX 4090 e outras), integradas em mais de 120 ML-nodos. É uma das maiores redes de GPU distribuídas para AI inference no mundo — e se antes essa capacidade era direcionada ao Qwen3-235B, hoje ela atende aos modelos ativos da rede, Kimi K2.6 e MiniMax M2.7.
É possível experimentar o Qwen3-235B agora?
Resposta curta: através da rede Gonka — já não. O Qwen3-235B foi removido da rede, portanto, não é mais possível invocá-lo pelo identificador qwen3-235b-a22b através do nosso Gateway. Como o modelo é aberto (Apache 2.0), você ainda pode executá-lo por conta própria ou acessá-lo através de provedores terceiros de modelos de pesos abertos — por exemplo, através do OpenRouter (estimado em $0.071/$0.100 por 1M de tokens).
Se você procura a inferência descentralizada barata pela qual a Gonka é conhecida, ela continua disponível, funcionando agora com os modelos ativos da rede. Através do JoinGonka API Gateway estão disponíveis o Kimi K2.6 e o MiniMax M2.7 via API compatível com OpenAI: qualquer código escrito para OpenAI funciona sem alterações — basta substituir a URL, a API-key e o nome do modelo.
Exemplo de solicitação para um modelo ativo:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Explique a arquitetura MoE"}]
}'Custo: $0.003 por 1 milhão de tokens — isso é 1.700 vezes mais barato que o GPT-5.5 ($5.00/1M) e 1.000 vezes mais barato que o Claude Sonnet 4.6 ($3.00/1M). Ao se registrar, você recebe 10 milhões de tokens gratuitos para testar.
O Gateway é compatível com ferramentas de desenvolvimento populares: o Quick Start descreve a conexão via Python, Node.js e curl. Também são suportadas integrações de IDE — Cursor, Continue, Cline, Aider e Claude Code — e frameworks para agentes de IA: LangChain, n8n, LibreChat, Open WebUI.
Para um início rápido:
- Cadastre-se em gate.joingonka.ai (conecte a carteira ou crie uma nova)
- Obtenha uma API-key no Dashboard
- Substitua
api.openai.comporgate.joingonka.ai/apino seu código - Especifique o modelo atual da rede —
moonshotai/Kimi-K2.6ouMiniMaxAI/MiniMax-M2.7(lista completa no endpointGET /v1/models)
A inferência descentralizada de nível enterprise a preço de projeto hobby continua disponível — o Qwen3-235B apenas cedeu o lugar a modelos mais novos da rede. A mesma relação qualidade-preço agora funciona para o Kimi K2.6 e o MiniMax M2.7.
Quer saber mais?
Explore outras seções ou comece a ganhar GNK agora mesmo.
Experimentar os modelos atuais da Gonka →