Seções da Base de Conhecimento ▾

Tecnologia

DeepSeek V4 Flash: modelo da rede Gonka com contexto de 380K

Em agosto de 2026, surgiu na rede Gonka um terceiro modelo em operação — o DeepSeek V4 Flash. A proposta de governança #94 para adicioná-lo foi apresentada pela equipe da kaitaku.ai, conhecida na comunidade pelas otimizações de nodos ML: eles rodaram experimentos que confirmaram a compatibilidade do modelo com o Proof of Compute e a validação da rede, e em 12 de agosto a proposta foi aprovada em votação. No dia seguinte, o modelo já estava atendendo requisições.

Para os usuários, isso amplia bastante as possibilidades: o DeepSeek V4 Flash tem janela de contexto de 380 000 tokens — uma das mais longas da rede (quase o dobro da do MiniMax M2.7; só o GLM-5.3 Flash é um pouco maior, com 390 000), reasoning integrado e tool calling completo. Vamos ver que modelo é esse, quem o criou, quais são suas características dentro da rede Gonka, o que os benchmarks mostram — e quando vale a pena escolhê-lo em vez dos outros dois modelos da rede.

O que é o DeepSeek V4 Flash e quem está por trás dele

DeepSeek é um laboratório de IA chinês de Hangzhou que obteve reconhecimento mundial após os lançamentos do V3 e R1: foi o R1, no início de 2025, que mostrou que um modelo aberto poderia alcançar os líderes fechados por uma fração do orçamento. Em abril de 2026, a DeepSeek lançou a família V4 com dois modelos: o pesado V4 Pro e o leve V4 Flash. Ambos são abertos (licença MIT) e ambos são construídos sobre a arquitetura MoE.

O V4 Flash possui 284 bilhões de parâmetros, dos quais cerca de 13 bilhões são ativados por token. Essa dispersão torna o modelo rápido e barato de manter: ele exige significativamente menos VRAM do que os gigantes "densos", e a velocidade de geração é superior.

Na rede Gonka funciona a versão V4-Flash-0731 — uma compilação re-treinada (re-post-training) de 31 de julho de 2026. A arquitetura e o tamanho não mudaram, mas a qualidade em tarefas de agentes aumentou drasticamente: de acordo com nove benchmarks de agentes e codificação publicados pela DeepSeek, a versão 0731 supera até mesmo o seu próprio carro-chefe V4 Pro na versão preview. Uma ressalva importante para ser justo: parte desses números são medições da própria DeepSeek em seu ambiente de teste, que ainda não foi lançado publicamente, portanto, ainda não há replicação independente. A lacuna com a fronteira dos modelos fechados persiste: o Claude Opus 4.8 não é superado pela versão 0731 em nenhum dos nove benchmarks — mas custa muito menos, e essa é sua essência: máxima qualidade de agente por uma fração do preço.

Características do DeepSeek V4 Flash na rede Gonka

Como acontece com outros modelos da rede, é importante distinguir as características do modelo «de fábrica» dos parâmetros operacionais de um deployment específico: eles são definidos pela configuração de inferência vLLM nos hosts de GPU da rede. Estes são os valores reais através do nosso Gateway:

  • Janela de contexto: 380 000 tokens — uma das mais longas da rede Gonka (só o GLM-5.3 Flash é maior, com 390 000). Verificamos isso na prática: uma requisição com 381 000 tokens de entrada foi aceita e processada em dezenas de segundos. A própria arquitetura do V4 Flash suporta contexto de até 1 milhão de tokens; o teto prático na rede é definido pela configuração dos hosts (janela de inferência de 400 000).
  • Saída máxima: 32 768 tokens por resposta — o maior teto da rede: no MiniMax M2.7 e no GLM-5.3 Flash ele é quatro vezes menor — 8 192; nos dois casos, é configuração do gateway, não limite do modelo.
  • Reasoning e tool calling: o modelo está implantado com parsers de raciocínio e de chamadas de ferramentas — cenários agênticos (Cursor, Claude Code, LangChain) funcionam de fábrica; rodamos cenários de tool calling em várias etapas pelas rotas compatíveis com OpenAI e Anthropic.
  • Requisito de VRAM do host: cerca de 280 GB — o modelo mais leve da rede (para comparar: MiniMax M2.7 — 320 GB, GLM-5.3 Flash — 560 GB). Quanto menor o requisito de hardware, mais fácil fica para os hosts implantarem o modelo — um bom sinal para a disponibilidade dele na rede.

O preço da inferência na rede Gonka não depende do modelo escolhido: o DeepSeek V4 Flash está disponível pela mesma tarifa do MiniMax M2.7 e do GLM-5.3 Flash — pelo JoinGonka Gateway, são $0.0069 por milhão de tokens de entrada e $0.021 por milhão de tokens de saída. Para referência: provedores terceiros no OpenRouter entregam o mesmo modelo a partir de $0.06/$0.12 por milhão, e o próprio DeepSeek tirou o V4 Flash 0731 da sua API por volta de setembro de 2026 — agora quem atende essas requisições é o DeepSeek-V4.1-Flash, a $0.30/$1.20 nos horários de pico. A economia da rede é um assunto à parte: o preço é definido pelo pagamento pelo trabalho computacional, não pela tabela do fornecedor.

DeepSeek V4 Flash, MiniMax M2.7 e GLM-5.3 Flash — comparação

Existem três modelos ativos na rede — DeepSeek V4 Flash, MiniMax M2.7 e GLM-5.3 Flash (o Kimi K2.6 foi removido da rede em setembro de 2026, e o GLM-5.2, que por muito tempo figurou no registro, nunca chegou a entrar em operação). Uma breve comparação:

ParâmetroDeepSeek V4 FlashMiniMax M2.7GLM-5.3 Flash
Contexto na rede380 000200 000390 000
Saída por resposta32 7688 1928 192, incluindo raciocínio
ArquiteturaMoE 284B (~13B ativos)MoE + atenção linearMoE 320B (~18B ativos), atenção híbrida
VRAM por nó280 GB320 GB560 GB
Ponto forteContexto longo, raciocínio, velocidadeDesenvolvimento diário, estabilidadeLógica complexa, análise de código, tarefas de «pensar»
Preço via Gatewayidêntico — $0.0069 entrada / $0.021 saída por 1M

A consequência prática do preço idêntico é que você pode escolher o modelo puramente pela tarefa, sem pensar no orçamento. Precisa de prompts grandes com respostas rápidas e a saída mais longa possível — DeepSeek V4 Flash; tarefas que exigem pensar sobre uma lógica complexa (e o contexto mais longo da rede) — GLM-5.3 Flash; um cavalo de batalha confiável para o dia a dia — MiniMax M2.7.

Benchmarks V4-Flash-0731: o que a compilação mostra

Resultados-chave publicados da build 0731 (segundo a DeepSeek e agregadores independentes):

  • SWE-bench Verified: 79,0% — resolução de tarefas reais do GitHub; nível que há um ano estava disponível apenas para modelos proprietários de ponta. Para comparação: o Kimi K2.6, que a rede atendia anteriormente, tem 71,3%.
  • GPQA Diamond: 88,1% — questões de nível de pós-graduação em ciência; o modo de raciocínio estendido aumenta a precisão em tarefas de várias etapas.
  • Terminal Bench 2.1: 82,7 — trabalho em terminal por agente; a versão de preview Flash tinha 61,8, e o V4 Pro Preview tinha 72,1.
  • DeepSWE: 54,4 — novo benchmark rigoroso da DeepSeek com taxa quase nula de falsos positivos; o número é do fornecedor, o benchmark ainda não foi publicado — trate com essa ressalva.

Quadro honesto: em nove benchmarks de agentes, a build 0731 supera o seu próprio V4 Pro Preview, mas não o Claude Opus 4.8 — o atraso é de cerca de 6 pontos em média. Ao mesmo tempo, em preço por token, o modelo é dois pedidos de magnitude mais barato que o Opus, e através da rede Gonka é ~9 vezes mais barato que o mesmo modelo em provedores terceiros no OpenRouter. É precisamente essa relação de "qualidade próxima da fronteira por uma fração do preço" que o torna interessante: medições independentes detalhadas podem ser vistas convenientemente em Artificial Analysis, e os pesos e o cartão do modelo em Hugging Face.

Como usar o DeepSeek V4 Flash através do JoinGonka Gateway

O modelo está disponível pelo JoinGonka Gateway com API compatível com OpenAI e Anthropic. Identificador do modelo: deepseek-ai/DeepSeek-V4-Flash-0731.

O jeito mais rápido é o instalador de um único comando, que configura sua ferramenta (Claude Code, OpenClaw, Cline, opencode, Aider e outras) direto com esse modelo:

npx @joingonka/setup --model deepseek

Onde o instalador escreve o config sozinho (Claude Code, Codex CLI, OpenClaw, opencode, Kilo Code, Hermes, Pi e outros), o DeepSeek V4 Flash fica como padrão e sem flag. A flag é necessária para trocar uma ferramenta já configurada e onde o instalador imprime valores para colar (Cursor, Cline, Aider). Os demais modelos da rede são escolhidos do mesmo jeito: --model minimax e --model glm.

Chamada direta à API (formato OpenAI):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-your-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Hello!"}]}'

Ao se cadastrar, você ganha 3M tokens grátis — com contexto de 380K, é a chance de testar o modelo na hora com documentos grandes e bases de código reais. Exemplos passo a passo em Python e TypeScript no API Quickstart; dá para experimentar sem cadastro no chat gratuito, escolhendo o DeepSeek V4 Flash na lista de modelos.

Quando escolher o DeepSeek V4 Flash — cenários práticos

Cenários em que este modelo se destaca:

  • Documentos grandes e bases de código inteiras. 380 000 tokens equivalem a cerca de 280 000 palavras: um relatório anual, um pacote de documentos jurídicos ou um repositório de tamanho médio cabem em uma única requisição, sem dividir em pedaços nem perder as conexões entre as partes.
  • Sessões de agente longas. Um agente autônomo que lê arquivos, chama ferramentas e acumula histórico é o primeiro a esbarrar no contexto: uma folga de 380K tokens significa sessões bem mais longas sem reiniciar a memória.
  • RAG com seleções grandes. Quanto mais documentos relevantes cabem no contexto, menor é a dependência da precisão da busca.
  • Tarefas de raciocínio. O modo reasoning traz ganhos em matemática, ciência e lógica de várias etapas, pelo preço de um modelo comum.

Quando vale mais a pena outro modelo da rede: para tarefas que exigem pensar sobre lógica complicada, há o GLM-5.3 Flash, o modelo de reasoning da rede (uma análise detalhada de modelos para desenvolvimento está no artigo sobre os melhores modelos para código), enquanto o MiniMax M2.7 continua sendo um cavalo de batalha comprovado para as tarefas do dia a dia. Com o preço único, você pode experimentar à vontade: trocar de modelo é uma única linha na requisição.

DeepSeek V4 Flash 0731 — Modelo MoE da DeepSeek (284B parâmetros, ~13B ativos, licença MIT), adicionado à rede Gonka pela proposta de governança #94 da equipe kaitaku.ai e ativo desde 13 de agosto de 2026. A principal diferença é o contexto de 380.000 tokens (verificado por solicitação real em 381K; na rede, apenas o GLM-5.3 Flash tem um maior, com 390.000) e o maior teto de resposta, 32.768 tokens, além de raciocínio e tool calling. SWE-bench Verified 79,0%, GPQA Diamond 88,1% — próximo à fronteira a um preço dois pedidos de magnitude mais baixo que modelos proprietários de ponta; através do JoinGonka Gateway — na mesma taxa do MiniMax M2.7 e GLM-5.3 Flash, ~9 vezes mais barato que o mesmo modelo no OpenRouter. Identificador: deepseek-ai/DeepSeek-V4-Flash-0731; início rápido — npx @joingonka/setup --model deepseek.

Quer saber mais?

Explore outras seções ou comece a ganhar GNK agora mesmo.

Experimentar o DeepSeek V4 Flash via Gateway →