Seções da Base de Conhecimento ▾
Navegação
▸ Comece aqui Por funçõesCategorias
- Arquitetura da Rede Gonka: Sprint, Agentes de Transferência, DiLoCo
- Desenvolvedores: Como Ganhar GNK
- Auto-hospedagem: Guia passo a passo
- Escolha da GPU para Gonka: recomendações de hardware
- Qwen3-235B: o modelo que a Gonka atendia anteriormente
- Kimi K2.6: modelo anteriormente mantido pela Gonka
- MiniMax M2.7: modelo da rede Gonka
- DeepSeek V4 Flash: modelo da rede Gonka com contexto de 380K
- GLM-5.3 Flash: modelo de raciocínio Z.ai na rede Gonka
Tecnologia
Kimi K2.6: modelo anteriormente mantido pela Gonka
Durante muito tempo, a rede Gonka operou com um único modelo — o Qwen3-235B da Alibaba Cloud. Em maio de 2026, isso mudou: foi lançado o suporte para vários modelos através do mecanismo DevShards, e o primeiro foi o Kimi K2.6 da empresa chinesa Moonshot AI. Mais tarde, adicionaram-se o MiniMax M2.7 e o DeepSeek V4 Flash, e o Qwen3-235B foi removido da rede. Em setembro de 2026, chegou a vez do Kimi K2.6: os hosts deixaram de suportar o modelo e a proposta de governança #101 selou definitivamente a sua saída — sendo substituído na rede pelo GLM-5.3 Flash. Hoje, a Gonka mantém três modelos: MiniMax M2.7, DeepSeek V4 Flash e GLM-5.3 Flash. Analisamos o que é o Kimi K2.6, como ele diferia do MiniMax M2.7, como a Gonka implementou tecnicamente a multimodelo, por que o modelo saiu da rede e o que escolher no seu lugar agora.
O que é Kimi K2.6 da Moonshot AI
Kimi K2.6 é um grande modelo de linguagem (LLM) da série Kimi, desenvolvido pela empresa de Pequim Moonshot AI. A Moonshot AI é um dos principais laboratórios de IA da China, fundada em 2023 por uma equipe de pesquisadores liderada por Yang Zhilin. A empresa captou investimento da Alibaba, da Tencent e de outros grandes investidores, e entrou na lista dos «tigres da IA chinesa» — empresas que ditam o ritmo do desenvolvimento da IA na Ásia.
A série Kimi é conhecida desde 2024. As primeiras versões (K1, K1.5) chamaram atenção de imediato pela janela de contexto excepcionalmente longa — até 200 000 tokens em uma única requisição, o que, no momento do lançamento, era um recorde entre os modelos de acesso público. Um contexto longo significa a possibilidade prática de analisar, em uma única requisição, um livro inteiro, uma base de código de tamanho médio ou um conjunto de documentos jurídicos. Na época do lançamento do Kimi, essa característica era uma poderosa vantagem competitiva.
A versão K2 surgiu em 2025 e trouxe um salto arquitetônico fundamental — a migração para MoE (Mixture of Experts). Essa mesma arquitetura está na base do Qwen3-235B e do DeepSeek-R1 — e se tornou o padrão de fato para os maiores modelos de 2025—2026. O MoE permite ter centenas de bilhões de parâmetros «no total», mas ativar apenas um subconjunto a cada requisição (normalmente 5—10%), o que reduz radicalmente o custo computacional da inferência com qualidade comparável.
O K2.6 é a iteração mais recente da série K2 no momento em que este artigo foi escrito. Pelas declarações públicas da Moonshot AI, nesta versão foram aprimoradas as capacidades do modelo em reasoning (raciocínio lógico), geração de código e chamada nativa de ferramentas (tool calling). Enquanto o modelo era servido pela rede Gonka, ele estava disponível sob o identificador moonshotai/Kimi-K2.6; agora o gateway não aceita mais esse identificador — a lista atualizada de modelos é sempre retornada por GET /v1/models.
Comparação entre Kimi K2.6 e MiniMax M2.7
Ambos os modelos representam desenvolvimentos emblemáticos dos maiores laboratórios de IA da China; enquanto ambos foram mantidos pela rede, estavam disponíveis através de uma interface unificada compatível com OpenAI, o JoinGonka Gateway — hoje, deste par, apenas o MiniMax M2.7 está disponível através do gateway. Ao mesmo tempo, eles possuem forças e legados diferentes, o que torna a escolha entre eles não uma questão de «qual é melhor», mas de «qual se adequa à tarefa».
| Característica | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|
| Fabricante | Moonshot AI (Pequim) | MiniMax (Xangai) |
| Ano de fundação da empresa | 2023 | 2021 |
| Arquitetura | MoE | MoE + atenção linear |
| Janela de contexto | 200 000 tokens | 200 000 tokens |
| Força | Reasoning, contexto longo, code generation | Contexto longo, atenção efetiva (linear) |
| Preço via JoinGonka | — (modelo retirado da rede) | $0.0069 por 1M de tokens |
| Identificador API | moonshotai/Kimi-K2.6 | MiniMaxAI/MiniMax-M2.7 |
| Status na rede Gonka | Mantido de maio a setembro de 2026, retirado (proposal #101) | Modelo ativo (desde maio de 2026, atualização v0.2.13) |
Nos benchmarks de reasoning (MATH-500, GSM8K, AIME), a série Kimi K2 historicamente mostra resultados no grupo superior de modelos open-weights, competindo com o DeepSeek-R1 e modelos do tipo o1. Em tarefas de geração de código (HumanEval, MBPP), ambos os modelos permanecem em níveis próximos. A força do MiniMax M2.7 é a atenção efetiva (linear) para sequências muito longas, enquanto o Kimi é conhecido por seu forte reasoning e pelo longo contexto da série Kimi.
Uma ressalva importante sobre os benchmarks em 2026: a diferença entre os principais modelos em testes públicos diminuiu para alguns pontos percentuais, e essa diferença muitas vezes acaba dentro da margem de erro estatístico dos próprios benchmarks. Para o trabalho prático, o que importa não é «quem está 2% acima no MMLU», mas a natureza das tarefas: que contexto você fornece ao modelo, quão complexas são as cadeias lógicas, se é necessário um longo histórico de diálogo, quais idiomas são usados. Portanto, a tabela acima não classifica os modelos — ela ajuda a entender rapidamente para qual perfil de tarefas cada um está otimizado.
Para uma escolha prática hoje: o nicho do Kimi K2.6 — contexto longo (análise de grandes documentos, leitura de base de código extensa, longos diálogos com manutenção de histórico) e tarefas complexas de reasoning — está coberto na composição atual da rede por dois modelos. Pelos raciocínios, é responsável o GLM-5.3 Flash: ele pensa antes de responder, e é exatamente ele que deve ser escolhido para lógicas confusas; ele também tem o maior contexto da rede (390K). Para grandes prompts sem raciocínio e longas sessões de agentes — DeepSeek V4 Flash (380K, o segundo maior contexto). Se a prioridade é o processamento de sequências de entrada muito longas e dados de streaming com resposta rápida — MiniMax M2.7 com sua atenção efetiva. Uma boa estratégia em produção não mudou — manter vários modelos da rede em seu código: a troca rápida através do parâmetro model permite alternar entre eles dependendo da tarefa sem alterar a arquitetura do aplicativo.
DevShards: como Gonka lançou o segundo modelo
Até a primavera de 2026, toda a rede Gonka atendia exatamente um modelo: o Qwen3-235B. Do ponto de vista da arquitetura, era uma decisão coerente: a inferência distribuída via DiLoCo exige que todos os participantes da rede mantenham o mesmo modelo na memória de vídeo, caso contrário é impossível garantir que qualquer nó consiga processar qualquer requisição. O Qwen3-235B completo em formato FP8 ocupa cerca de 640 GB de VRAM, o que por si só já é um compromisso enorme para cada ML-node.
Para migrar para uma rede multimodelo, era necessário um mecanismo que permitisse manter vários modelos ao mesmo tempo sem exigir que cada host executasse todos eles. Esse mecanismo são os DevShards: shards separados da rede, cada um especializado em um modelo. Os nós dentro de um mesmo shard trabalham sobre o mesmo modelo, e o roteador da rede encaminha a requisição para o shard com o modelo desejado.
A ideia não veio do nada: foi formalizada na Gonka Improvement Proposal #800 «Multi-Model PoC», levada à votação da comunidade na primavera de 2026. A proposta recebeu o apoio dos participantes e validadores da rede e foi implementada entre abril e maio de 2026. O Kimi K2.6 foi o primeiro modelo lançado em um DevShard próprio, ou seja, na prática, uma implementação de teste da nova abordagem. A experiência foi um sucesso: logo depois dela, surgiram em seus próprios shards o MiniMax M2.7, o DeepSeek V4 Flash e o GLM-5.3 Flash, cada um com seu próprio conjunto de hosts e sua própria economia. O mesmo mecanismo também funciona ao contrário: um modelo que os hosts deixam de suportar é retirado da rede por votação; foi exatamente assim que o próprio Kimi K2.6 saiu em setembro de 2026.
O que isso significa para usuários e desenvolvedores:
- Uma única API, vários modelos. Pelo JoinGonka Gateway não é preciso trocar o endpoint nem as chaves: basta indicar outro
modelno corpo da requisição. O formato compatível com a OpenAI é totalmente preservado. - O preço é o mesmo. Enquanto o Kimi K2.6 esteve em operação, ele foi cobrado pela mesma tarifa do MiniMax M2.7; a tarifa única da rede se mantém também para os modelos atuais — $0.0069 por 1M de tokens pelo Gateway. O preço único é uma decisão consciente para simplificar a migração dos usuários entre modelos.
- A estabilidade depende da carga do shard. Na fase inicial, o shard de um modelo novo tem menos hosts, por isso, com a concentração de requisições, o modelo pode retornar temporariamente
429 too many concurrent requests. É uma fase normal para um modelo novo: conforme o interesse cresce, os hosts vão se conectando ao shard dele e os limites aumentam. O contrário também vale: se os hosts saem do shard, o modelo perde capacidade; foi exatamente assim que terminou a história do Kimi K2.6 na rede. - O tool calling é diferente em cada modelo. No Kimi K2.6, no início na rede Gonka, foram registrados pequenos problemas com a seleção automática de ferramentas (
tool_choice: "auto"), depois resolvidos com uma atualização dos nós. A lição continua válida para qualquer modelo da rede: o formato de chamada de ferramentas é uma propriedade de cada modelo específico em cada nó específico, por isso, para cenários críticos em produção, teste com antecedência o comportamento do modelo escolhido com as suas requisições.
O que o substituiu e o que escolher agora
Resposta direta: o Kimi K2.6 não está mais disponível pela rede Gonka. Os hosts pararam de atendê-lo no início de setembro de 2026, e a proposta de governance #101 removeu o modelo da lista de modelos da rede de vez — o gateway vai rejeitar qualquer requisição com model: "moonshotai/Kimi-K2.6". Como os pesos do modelo são abertos, você ainda pode obtê-lo em hostings externos de modelos open-weights (por exemplo, via OpenRouter) ou fazer o deploy por conta própria.
Mas se o que você quer é aquele inference descentralizado e muitas vezes mais barato pelo qual as pessoas vêm para a Gonka, ele não foi a lugar nenhum — só agora roda nos modelos ativos da rede. Pelo JoinGonka API Gateway, com API compatível com OpenAI e Anthropic, há três modelos disponíveis, e cada um cobre uma parte do que se valorizava no Kimi:
- GLM-5.3 Flash (
zai-org/GLM-5.3-Flash) — o modelo de reasoning da Z.ai: raciocina antes de responder, então é ele que você deve escolher para lógica complexa, análise de código e tarefas de «pensar»; além disso, tem o contexto mais longo da rede (390K). O raciocínio entra no limite de resposta — definamax_tokenscom folga e ative o stream. - DeepSeek V4 Flash (
deepseek-ai/DeepSeek-V4-Flash-0731) — um dos contextos mais longos da rede (380K), a saída mais longa e um agentic coding forte: repositórios grandes, cadeias longas de chamadas de ferramentas. - MiniMax M2.7 (
MiniMaxAI/MiniMax-M2.7) — o modelo padrão do gateway: respostas rápidas e consistentes em tarefas do dia a dia, documentos longos e processamento em streaming.
Migrar do Kimi K2.6 é trocar uma única linha. Qualquer código escrito para a OpenAI funciona sem alterações: basta trocar a URL, a API key e o nome do modelo.
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMaxAI/MiniMax-M2.7",
"messages": [{"role": "user", "content": "Explain the difference between MoE and dense models"}]
}'Nas ferramentas de desenvolvimento a regra é a mesma: onde quer que na configuração estivesse moonshotai/Kimi-K2.6, coloque o identificador de um dos modelos ativos. No Cursor é o campo Custom Model; no Claude Code, a variável de ambiente ANTHROPIC_MODEL ou a flag --model; no OpenClaw, Cline e Continue.dev, o nome do modelo na config do provedor; no LangChain e no n8n, o parâmetro model na inicialização do cliente. O instalador npx @joingonka/setup grava o gateway e o modelo atual na config da ferramenta com um único comando. A lista de modelos disponíveis está sempre atualizada no endpoint GET /v1/models — dá para puxá-la dinamicamente na UI do seu app, para que a saída ou a chegada de um modelo na rede não quebre o seu produto.
Dá para testar sem cadastro no chat gratuito da página /try — lá estão disponíveis os modelos ativos da rede. Ao se cadastrar no JoinGonka Gateway, você ganha 3M tokens grátis para testar qualquer modelo da rede — o suficiente para rodar suas tarefas em cada um dos três e escolher a substituição com consciência.
O que a história do Kimi K2.6 mostrou para a rede Gonka: o mecanismo DevShards funcionou nos dois sentidos. Permitiu adicionar modelos sem parar a rede — depois do Kimi vieram MiniMax M2.7, DeepSeek V4 Flash e GLM-5.3 Flash — e também permitiu remover sem dor um modelo que os hosts deixaram de manter. Uma rede presa a um único modelo é fundamentalmente frágil; uma rede capaz de mudar sua composição por votação evolui de forma suave e contínua. Para o desenvolvedor, disso segue uma regra simples: não «escolher um modelo para sempre», mas manter o nome do modelo na configuração e checar a lista ao vivo.
Quer saber mais?
Explore outras seções ou comece a ganhar GNK agora mesmo.
Experimentar os modelos atuais da Gonka →