Seções da Base de Conhecimento ▾

Tecnologia

Qwen3-235B: o modelo que a Gonka atendia anteriormente

A rede Gonka não aluga apenas GPU; ela fornece serviços de modelos de IA para inferência. Por muito tempo, o modelo principal e único da rede foi o Qwen3-235B-A22B-Instruct, desenvolvido pela Alibaba Cloud. Com o tempo, a rede migrou para uma arquitetura multimodelo e o Qwen3-235B foi removido da rede: hoje, a Gonka atende o Kimi K2.6 da Moonshot AI, o MiniMax M2.7 e o DeepSeek V4 Flash. Vamos analisar o que é o Qwen3-235B, qual papel ele desempenhou na rede Gonka e por que foi substituído; como um notável modelo MoE de código aberto, ele continua sendo uma referência útil.

O que é Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 — é uma Large Language Model (LLM) da família Qwen3, desenvolvida pela equipe Qwen na Alibaba Cloud. O nome completo se desdobra assim: Qwen3 — terceira geração da série, 235B — 235 bilhões de parâmetros no total, A22B — 22 bilhões de parâmetros ativos por solicitação, Instruct — versão treinada para seguir instruções, 2507 — lançamento em julho de 2025, FP8 — quantização de 8 bits para otimização de memória.

A característica arquitetônica principal é MoE (Mixture of Experts). Ao contrário dos modelos “densos” (GPT-5.5, Claude Sonnet 4.6), onde cada token passa por todos os parâmetros, o modelo MoE ativa para cada solicitação apenas um subconjunto de “especialistas” — blocos especializados da rede neural. No caso do Qwen3-235B, dos 235 bilhões de parâmetros, apenas 22 bilhões são ativados por token — menos de 10%. Isso confere uma qualidade de nível de modelos com 200B+ parâmetros, com custos computacionais de um modelo de 22B.

Na prática, isso significa: o modelo é mais inteligente do que se poderia esperar de sua velocidade. Ele processa solicitações significativamente mais rápido que modelos densos de qualidade comparável, exigindo muito menos VRAM para inferência. É por isso que o MoE se tornou a arquitetura dominante para os maiores modelos de 2025-2026.

A janela de contexto do Qwen3-235B é de 131.072 tokens (~100.000 palavras) — suficiente para analisar livros inteiros, bases de código ou longos documentos jurídicos em uma única solicitação. O modelo suporta 119 idiomas, incluindo russo, inglês, chinês, árabe, hindi e dezenas de outros — o que o torna um dos modelos mais multilíngues do mercado.

Características e benchmarks

O Qwen3-235B compete com os maiores modelos fechados e abertos. Aqui está uma comparação das características principais:

ModeloParâmetrosContextoMoEOpen SourcePreço (por 1M de tokens)
Qwen3-235B (Alibaba)235B (22B ativos)131KSimSim (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (estimado)128KSim (presumido)Não$5.00
Claude Sonnet 4.6 (Anthropic)Não revelado200KNão (presumido)Não$3.00
Llama 4 Maverick (Meta)400B (17B ativos)1MSimSim (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B ativos)128KSimSim (MIT)$0.55

O Qwen3-235B demonstra um nível de qualidade comparável ao GPT-5.5 e Claude Sonnet 4.6 na maioria dos benchmarks, e, como um modelo MoE open-weights, é drasticamente mais barato que os equivalentes proprietários: a arquitetura MoE ativa apenas uma parte dos parâmetros por solicitação e reduz drasticamente os custos computacionais. Esse mesmo princípio de inference descentralizado e barato é o que a rede Gonka aplica hoje aos seus modelos atuais — Kimi K2.6 e MiniMax M2.7, disponíveis através do JoinGonka Gateway por $0.0047 por 1M de tokens (centenas a milhares de vezes mais barato que GPT-5.5 e Claude).

Nos benchmarks MMLU-Pro, HumanEval, MATH-500 e GSM8K, o modelo está entre os três melhores modelos open-source, perdendo apenas para o DeepSeek-R1 em tarefas de raciocínio matemático (reasoning). Em tarefas de geração de código, tradução e seguimento de instruções, o Qwen3-235B supera consistentemente o Llama 4 Maverick e é comparável ao Claude Sonnet 4.6.

Como a Gonka utilizava o Qwen3-235B

Quando o Qwen3-235B era o modelo principal da rede, ele operava na rede Gonka de forma distribuída, através do protocolo DiLoCo, adaptado para inferência. O modelo completo em formato FP8 requer cerca de 640 GB de memória de vídeo (VRAM), o que é impossível de acomodar em uma única GPU — nem mesmo uma H100 80GB ou uma H200 141GB são suficientes. Portanto, o modelo era dividido por camadas (paralelismo de tensores + paralelismo de pipeline) entre vários ML-nodes.

Na prática, o Qwen3-235B funcionava em um cluster de 8 a 16 GPU-nodes, cada um com pelo menos 40 GB de VRAM. Os Transfer Agents roteavam a solicitação para o cluster correto, o vLLM em cada nó processava seu fragmento do modelo, e os resultados eram agregados e retornados ao usuário. Todo o processo levava centenas de milissegundos — o usuário não percebia que sua solicitação estava sendo processada por uma dezena de GPUs em diferentes pontos do planeta. A rede aplica o mesmo princípio de inferência distribuída atualmente aos modelos em uso.

Um detalhe técnico importante: a Gonka utiliza o vLLM como motor de serviço. O vLLM é um projeto de código aberto que fornece geração de texto de alto desempenho via PagedAttention — um algoritmo que otimiza o uso da memória de vídeo ao processar múltiplas solicitações em paralelo. Isso permite que a rede atenda milhares de usuários simultâneos sem degradação da qualidade.

O modelo suporta tool calling nativo — invocação de funções e ferramentas diretamente da resposta do modelo. Essa funcionalidade foi adicionada à Gonka através do PR #767 com um limite de 0.958 para a detecção de chamadas de ferramentas. No Qwen3-235B, isso permitia aos desenvolvedores criar agentes de IA que interagem com APIs externas, bancos de dados e ferramentas — tudo através de uma única solicitação. O suporte ao tool calling foi mantido nos modelos atuais da rede.

A rede Gonka conta com mais de 4 000 GPUs (H100, H200, A100, RTX 4090 e outros), combinados em mais de 120 ML-nodes. É uma das maiores redes de GPU distribuídas para inferência de IA no mundo — e se antes esse poder era direcionado ao Qwen3-235B, hoje ele serve aos modelos ativos da rede — Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash.

É possível experimentar o Qwen3-235B agora?

Resposta direta: através da rede Gonka, já não. O Qwen3-235B foi removido da rede, portanto já não é possível invocá-lo pelo identificador qwen3-235b-a22b através do nosso Gateway. Como o modelo é aberto (Apache 2.0), ainda é possível executá-lo por conta própria ou aceder a ele através de serviços de hospedagem de terceiros para modelos open-weights, como o OpenRouter (aproximadamente $0.071/$0.100 por 1M de tokens).

Se procura aquele inference descentralizado de baixo custo pelo qual as pessoas escolhem a Gonka, ele continua lá; apenas funciona agora com os modelos ativos da rede. Através do JoinGonka API Gateway estão disponíveis o Kimi K2.6, o MiniMax M2.7 e o DeepSeek V4 Flash via API compatível com OpenAI: qualquer código escrito para OpenAI funciona sem alterações — basta substituir a URL, a API-key e o nome do modelo.

Exemplo de solicitação para um modelo ativo:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Explica a arquitetura MoE"}]
  }'

Custo: $0.0047 por 1 milhão de tokens — isto é ~800 vezes mais barato que o GPT-5.5 ($5.00/1M) e ~500 vezes mais barato que o Claude Sonnet 4.6 ($3.00/1M). Ao registar-se, recebe 1.5M de tokens gratuitos para testes.

O Gateway é compatível com ferramentas de desenvolvimento populares: o Quick Start descreve a conexão via Python, Node.js e curl. Também são suportadas integrações com IDE (Cursor, Continue, Cline, Aider e Claude Code) e frameworks para agentes de IA (LangChain, n8n, LibreChat, Open WebUI).

Para começar rapidamente:

  1. Registe-se em gate.joingonka.ai (conecte a sua carteira ou crie uma nova)
  2. Obtenha a sua API-key no Dashboard
  3. Substitua api.openai.com por gate.joingonka.ai/api no seu código
  4. Especifique o modelo de rede atual — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 ou deepseek-ai/DeepSeek-V4-Flash-0731 (lista completa no endpoint GET /v1/models)

O inference descentralizado de nível enterprise a preço de projeto hobby não desapareceu; o Qwen3-235B apenas cedeu lugar a modelos de rede mais recentes. A mesma combinação de preço e qualidade funciona agora no Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash.

Qwen3-235B-A22B — um modelo MoE com 235 bilhões de parâmetros (22 bilhões ativos) da Alibaba Cloud, que em seu estágio inicial foi o modelo principal da rede Gonka para inferência de IA descentralizada. Graças à sua arquitetura MoE, ele oferece qualidade de nível dos principais modelos proprietários com um custo computacional drasticamente menor. Atualmente, o Qwen3-235B foi removido da rede: os modelos atuais da Gonka são Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash, disponíveis através do JoinGonka Gateway via API compatível com OpenAI por $0.0047/1M de tokens. O Qwen3-235B em si permanece aberto (Apache 2.0) e está disponível em provedores de modelos open-weights de terceiros.

Quer saber mais?

Explore outras seções ou comece a ganhar GNK agora mesmo.

Experimentar os modelos atuais da Gonka →