Seções da Base de Conhecimento ▾
Navegação
▸ Comece aqui Por funçõesCategorias
- Arquitetura da Rede Gonka: Sprint, Agentes de Transferência, DiLoCo
- Desenvolvedores: Como Ganhar GNK
- Auto-hospedagem: Guia passo a passo
- Escolha da GPU para Gonka: recomendações de hardware
- Qwen3-235B: o modelo que a Gonka atendia anteriormente
- Kimi K2.6: o segundo modelo da rede Gonka
- MiniMax M2.7: modelo da rede Gonka
- DeepSeek V4 Flash: modelo da rede Gonka com contexto de 380K
Tecnologia
Kimi K2.6: o segundo modelo da rede Gonka
Durante muito tempo, a rede Gonka funcionou com um único modelo — o Qwen3-235B da Alibaba Cloud. Em maio de 2026, isso mudou: foi lançado o suporte para múltiplos modelos através do mecanismo DevShards, e a primeira novidade foi o Kimi K2.6 da empresa chinesa Moonshot AI. Mais tarde, adicionou-se o MiniMax M2.7, e o Qwen3-235B foi removido da rede com o tempo — hoje, a Gonka atende a três modelos: Kimi K2.6, MiniMax M2.7 e DeepSeek V4 Flash. Vamos analisar o que é este modelo, como ele se diferencia do MiniMax M2.7, como a Gonka implementou tecnicamente a capacidade multimodelo e como experimentá-lo através do nosso API Gateway.
O que é Kimi K2.6 da Moonshot AI
Kimi K2.6 é um grande modelo de linguagem (LLM) da série Kimi, desenvolvido pela empresa sediada em Pequim Moonshot AI. Moonshot AI é um dos principais laboratórios de IA da China, fundado em 2023 por uma equipe de pesquisadores liderada por Yang Zhilin. A empresa atraiu financiamento da Alibaba, Tencent e outros grandes investidores e foi incluída na lista dos "tigres de IA chineses" — empresas que ditam o ritmo do desenvolvimento da IA na Ásia.
A série Kimi é conhecida desde 2024. As primeiras versões (K1, K1.5) chamaram imediatamente a atenção pela sua janela de contexto excepcionalmente longa — até 200.000 tokens em uma única solicitação, o que no momento do lançamento era um recorde para modelos disponíveis publicamente. Um contexto longo significa a possibilidade prática de analisar um livro inteiro, uma base de código de tamanho médio ou uma coleção de documentos legais em uma única solicitação. No momento do lançamento do Kimi, essa característica era uma forte vantagem competitiva.
A versão K2 apareceu em 2025 e trouxe um salto arquitetônico fundamental: a transição para MoE (Mixture of Experts). Essa mesma arquitetura é a base de Qwen3-235B e DeepSeek-R1 — tornando-se o padrão de fato para os maiores modelos de 2025-2026. MoE permite ter centenas de bilhões de parâmetros "no total", mas ativar apenas um subconjunto (geralmente 5 a 10%) em cada solicitação, o que reduz radicalmente o custo computacional da inferência com qualidade comparável.
K2.6 é a mais recente iteração da série K2 no momento da redação deste artigo. Das declarações públicas da Moonshot AI, depreende-se que nesta versão foram aprimoradas as capacidades do modelo em raciocínio (raciocínio lógico), geração de código e chamada nativa de ferramentas (tool calling). Na rede Gonka, o modelo é identificado como moonshotai/Kimi-K2.6 — este é o nome que deve ser passado no campo model da requisição da API.
Comparação entre Kimi K2.6 e MiniMax M2.7
Ambos os modelos representam desenvolvimentos emblemáticos dos maiores laboratórios de IA da China e ambos estão disponíveis através da interface única compatível com OpenAI JoinGonka Gateway. No entanto, eles têm diferentes pontos fortes e diferentes legados, o que torna a escolha entre eles não uma questão de «qual é o melhor», mas sim uma questão de «qual se adequa à tarefa».
| Característica | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|
| Fabricante | Moonshot AI (Pequim) | MiniMax (Xangai) |
| Ano de fundação da empresa | 2023 | 2021 |
| Arquitetura | MoE | MoE + attention linear |
| Janela de contexto | 200 000 tokens | 200 000 tokens |
| Ponto forte | Reasoning, contexto longo, code generation | Contexto longo, attention eficiente (linear) |
| Preço via JoinGonka | $0.0047 por 1M de tokens | $0.0047 por 1M de tokens |
| Identificador de API | moonshotai/Kimi-K2.6 | MiniMaxAI/MiniMax-M2.7 |
| Status na rede Gonka | Lançado via DevShards (maio de 2026) | Lançado via atualização v0.2.13 (maio de 2026) |
Nos benchmarks de reasoning (MATH-500, GSM8K, AIME), a série Kimi K2 mostra historicamente resultados no grupo superior de modelos open-weights, competindo com modelos DeepSeek-R1 e o1-style. Em tarefas de geração de código (HumanEval, MBPP), ambos os modelos mantêm-se em níveis próximos. O ponto forte do MiniMax M2.7 é o attention eficiente (linear) para sequências muito longas, enquanto o Kimi é conhecido pelo forte reasoning e pelo contexto longo da série Kimi.
Um aviso importante sobre benchmarks em 2026: a lacuna entre os principais modelos em testes públicos diminuiu para alguns pontos percentuais, e essa diferença muitas vezes está dentro da margem de erro estatístico dos próprios benchmarks. Para o trabalho prático, o que importa não é «quem está 2% acima no MMLU», mas a natureza das tarefas: que contexto você está fornecendo ao modelo, quão complexas são as cadeias lógicas, se é necessário um longo histórico de diálogo, quais idiomas são usados. Portanto, a tabela acima não classifica os modelos — ela ajuda a entender rapidamente para qual perfil de tarefas cada um deles está otimizado.
Para uma escolha prática: se a tarefa exige um contexto longo (análise de grandes documentos, leitura de uma base de código volumosa, diálogos longos preservando o histórico) ou tarefas complexas de reasoning, deve-se começar com o Kimi K2.6. Se a prioridade é o processamento de sequências de entrada muito longas e dados em streaming, vale a pena testar o MiniMax M2.7 com seu attention eficiente. Uma boa estratégia em produção é ter ambos os modelos no seu código: a troca rápida através do parâmetro model permite alternar entre eles dependendo da tarefa sem alterar a arquitetura da aplicação.
DevShards: como Gonka lançou o segundo modelo
Até a primavera de 2026, toda a rede Gonka atendia exatamente um modelo — o Qwen3-235B. Do ponto de vista da arquitetura, esta foi uma decisão sensata: o distributed inference via DiLoCo exige que todos os participantes da rede mantenham o mesmo modelo na VRAM, caso contrário, é impossível garantir que qualquer nó possa processar qualquer solicitação. O Qwen3-235B completo no formato FP8 ocupa cerca de 640 GB de VRAM, o que já é por si só um enorme compromisso para cada MLNode.
Para a transição para uma rede multimodelo, era necessário um mecanismo que permitisse manter vários modelos simultaneamente, sem exigir que cada host executasse todos eles. Esse mecanismo são os DevShards — shards separados da rede, cada um especializado em um modelo. Os nós dentro de um único shard trabalham no mesmo modelo, e o roteador da rede direciona a solicitação para o shard com o modelo correto.
A ideia não surgiu do nada — ela foi formalizada na Gonka Improvement Proposal #800 «Multi-Model PoC», submetida à votação da comunidade na primavera de 2026. A proposta recebeu o apoio dos participantes e validadores da rede e foi implementada em abril-maio de 2026. O Kimi K2.6 tornou-se o primeiro modelo executado em um DevShard separado, ou seja, de fato, uma implementação de teste da nova abordagem. Se a experiência for bem-sucedida, nada impede o lançamento de um terceiro, quarto modelo e assim por diante — cada um em seu próprio shard, com seu próprio conjunto de hosts, sua própria economia e sua própria roadmap.
O que isso significa para usuários e desenvolvedores:
- Uma API — vários modelos. Através do JoinGonka Gateway, não é necessário alterar o endpoint ou as chaves: basta especificar outro
modelno corpo da solicitação. O formato compatível com OpenAI é totalmente mantido. - O preço é o mesmo. Atualmente, o Kimi K2.6 na rede é tarifado na mesma taxa que o MiniMax M2.7 — $0.0047 por 1M de tokens através do Gateway. No futuro, os preços podem variar conforme o modelo, mas um preço único no lançamento é uma decisão consciente para simplificar a migração dos usuários.
- A estabilidade depende da carga do shard. No estágio inicial, o shard de um novo modelo tem menos hosts, portanto, com a concentração de solicitações, o modelo pode retornar temporariamente
429 too many concurrent requests. Esta é uma fase normal para um novo modelo — à medida que o interesse cresce, os hosts se conectarão ao seu shard e os limites aumentarão. - Tool calling — em processo de ajuste. No momento da redação deste artigo, o Kimi K2.6 na rede Gonka apresenta pequenos problemas com a seleção automática de ferramentas (
tool_choice: "auto"). A equipe Gonka está trabalhando para adequar o comportamento ao padrão OpenAI; para cenários críticos em produção com tool calling, teste previamente o comportamento do modelo com suas solicitações.
Como experimentar Kimi K2.6 através da Gonka
O caminho mais direto é através do JoinGonka API Gateway. O Gateway fornece uma API compatível com OpenAI, o que significa que o mesmo código que funciona com GPT, Claude ou outros modelos começará a funcionar com Kimi após alterar o valor do campo model no corpo da solicitação.
Exemplo mínimo via curl:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [
{"role": "user", "content": "Explique a diferença entre MoE e modelos dense"}
]
}'A mesma solicitação com Python através da biblioteca openai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://gate.joingonka.ai/v1",
)
response = client.chat.completions.create(
model="moonshotai/Kimi-K2.6",
messages=[{"role": "user", "content": "Olá, Kimi"}],
)
print(response.choices[0].message.content)Streaming (Server-Sent Events) — para interfaces interativas e chats onde você deseja mostrar a resposta à medida que ela é gerada:
stream = client.chat.completions.create(
model="moonshotai/Kimi-K2.6",
messages=[{"role": "user", "content": "Escreva um ensaio sobre MoE"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)O custo de Kimi K2.6 é o mesmo: $0.0047 por 1 milhão de tokens, uma taxa fixa da rede. Isso é aproximadamente 800 vezes mais barato que GPT-5.5 e cerca de 500 vezes mais barato que Claude Sonnet 4.6. Ao se registrar no JoinGonka Gateway, você recebe 1.5M de tokens gratuitos para testar qualquer modelo da rede — isso é suficiente para experimentar o modelo sem um cartão ou para dezenas de milhares de solicitações normais.
Compatibilidade com ferramentas de desenvolvimento: tudo o que funciona com a API da OpenAI também funciona com Kimi através do Gateway. No nível do modelo, basta alterar o parâmetro model:
- Cursor: nas configurações de Custom Model, especifique
moonshotai/Kimi-K2.6 - Claude Code: variável de ambiente
ANTHROPIC_MODELou flag--model - OpenClaw, Cline, Continue.dev: na configuração de CustomChatModel, altere o nome do modelo
- LangChain, n8n: parâmetro
modelna inicialização do cliente - Open WebUI, LibreChat: o modelo aparece na lista suspensa após adicionar Gonka como provedor personalizado
A lista de modelos disponíveis está sempre atualizada no endpoint GET /v1/models da sua instância de Gateway — de lá é prático puxá-la dinamicamente para a UI da sua aplicação para que os usuários vejam a lista completa e possam escolher o modelo eles mesmos.
O chat de demonstração na página /try no momento da publicação utiliza um dos modelos ativos da rede — o seletor multimodelos no widget está no roadmap. Para experimentar o Kimi agora, use a Gateway API: os 1.5M tokens gratuitos são suficientes para testar o modelo sem um cartão. Se a resposta for 429 too many concurrent requests — esta é uma fase normal para um novo modelo nos primeiros estágios de crescimento da rede Gonka. Simplesmente repita a solicitação após alguns segundos ou aguarde um momento de menor carga.
O que vem a seguir para a rede Gonka: o sucesso do DevShards para Kimi abre caminho para outros modelos. Nas discussões da comunidade, mencionam-se DeepSeek-V3/R1, Llama 4 e modelos especializados para código. Cada novo modelo é um novo shard, novos hosts, novas possibilidades para os usuários e uma nova fonte de receita para os provedores de GPU. A arquitetura multimodelos também é estrategicamente importante: uma rede vinculada a um único modelo é fundamentalmente frágil (o lançamento de uma nova versão é uma crise de migração), enquanto uma rede capaz de manter vários modelos simultaneamente evolui de forma suave e contínua.
O mesmo Kimi K2.6 via OpenRouter custa $0.684/$3.42 por 1M, contra $0.0047 no JoinGonka (centenas de vezes mais caro).
Quer saber mais?
Explore outras seções ou comece a ganhar GNK agora mesmo.
Experimentar Kimi K2.6 via Gateway →