Secciones de la base de conocimientos ▾

Tecnología

DeepSeek V4 Flash: modelo de la red Gonka con contexto de 380K

En agosto de 2026 apareció en la red Gonka un tercer modelo operativo — DeepSeek V4 Flash. La propuesta de gobernanza #94 para añadirlo la presentó el equipo de kaitaku.ai, conocido en la comunidad por sus optimizaciones de nodos ML: realizaron experimentos que confirmaron la compatibilidad del modelo con Proof of Compute y la validación de la red, y el 12 de agosto la propuesta fue aprobada por votación. Al día siguiente, el modelo ya atendía consultas.

Para los usuarios, esto supone una ampliación notable de capacidades: DeepSeek V4 Flash tiene una ventana de contexto de 380 000 tokens — una de las más largas de la red (casi el doble que la de MiniMax M2.7; solo GLM-5.3 Flash la supera ligeramente, con 390 000), reasoning integrado y tool calling completo. Veamos qué modelo es, quién lo creó, qué características tiene dentro de la red Gonka, qué muestran los benchmarks — y cuándo conviene elegirlo en lugar de los otros dos modelos de la red.

Qué es DeepSeek V4 Flash y quién está detrás

DeepSeek es un laboratorio de IA chino con sede en Hangzhou que obtuvo reconocimiento mundial tras los lanzamientos de V3 y R1: fue R1, a principios de 2025, el que demostró que un modelo abierto podía alcanzar a los líderes cerrados por una fracción de su presupuesto. En abril de 2026, DeepSeek lanzó la familia V4 compuesta por dos modelos: el pesado V4 Pro y el ligero V4 Flash. Ambos son abiertos (licencia MIT) y ambos están construidos sobre una arquitectura MoE.

V4 Flash cuenta con 284 mil millones de parámetros, de los cuales se activan unos 13 mil millones por token. Esta dispersión hace que el modelo sea rápido y económico de mantener: requiere significativamente menos VRAM que los gigantes "densos" y su velocidad de generación es superior.

En la red Gonka funciona la versión V4-Flash-0731, una compilación re-entrenada (re-post-training) del 31 de julio de 2026. La arquitectura y el tamaño no cambiaron, pero la calidad en tareas de agentes aumentó drásticamente: según nueve benchmarks de agentes y codificación publicados por DeepSeek, la compilación 0731 supera incluso a su propio modelo insignia, V4 Pro, en su versión preliminar. Una aclaración importante para ser justos: parte de estas cifras son mediciones de la propia DeepSeek en su entorno de prueba, el cual aún no se ha lanzado públicamente, por lo que todavía no hay replicación independiente. La brecha con la frontera de los modelos cerrados persiste: Claude Opus 4.8 no es superado por la compilación 0731 en ninguno de los nueve benchmarks, pero cuesta muchísimo menos, y esa es precisamente su esencia: calidad máxima de agente por una fracción del precio.

Características de DeepSeek V4 Flash en la red Gonka

Como con otros modelos de la red, conviene distinguir entre las características del modelo «de fábrica» y los parámetros operativos de un despliegue concreto: los define la configuración de inferencia vLLM en los hosts GPU de la red. Estos son los valores reales a través de nuestro Gateway:

  • Ventana de contexto: 380 000 tokens — una de las más largas de la red Gonka (solo la supera GLM-5.3 Flash, con 390 000). Lo comprobamos empíricamente: una consulta con 381 000 tokens de entrada fue aceptada y procesada en decenas de segundos. La propia arquitectura de V4 Flash admite contextos de hasta 1 millón de tokens; el techo práctico en la red lo marca la configuración de los hosts (ventana de inferencia de 400 000).
  • Salida máxima: 32 768 tokens por respuesta — el techo más alto de la red: MiniMax M2.7 y GLM-5.3 Flash tienen cuatro veces menos, 8 192; en ambos casos es la configuración del gateway, no un límite del modelo.
  • Reasoning y tool calling: el modelo está desplegado con parsers de razonamiento y de llamadas a herramientas — los escenarios agénticos (Cursor, Claude Code, LangChain) funcionan de fábrica; probamos escenarios de tool calling de varios pasos por las rutas compatibles con OpenAI y Anthropic.
  • Requisito de VRAM del host: unos 280 GB — el modelo más ligero de la red (para comparar: MiniMax M2.7 — 320 GB, GLM-5.3 Flash — 560 GB). Cuanto más bajo el umbral de hardware, más fácil les resulta a los hosts desplegar el modelo — buena señal para su disponibilidad en la red.

El precio de la inferencia en la red Gonka no depende de qué modelo elijas: DeepSeek V4 Flash está disponible a la misma tarifa que MiniMax M2.7 y GLM-5.3 Flash — a través de JoinGonka Gateway son $0.0069 por millón de tokens de entrada y $0.021 por millón de tokens de salida. Como referencia: los proveedores externos en OpenRouter ofrecen ese mismo modelo desde $0.06/$0.12 por millón, y el propio DeepSeek retiró V4 Flash 0731 de su API hacia septiembre de 2026 — ya es DeepSeek-V4.1-Flash quien atiende esas consultas, a $0.30/$1.20 en horas punta. La economía de la red es otro tema: el precio lo determina el pago por trabajo computacional, no el tarifario del proveedor.

DeepSeek V4 Flash, MiniMax M2.7 y GLM-5.3 Flash: comparación

Hay tres modelos activos en la red: DeepSeek V4 Flash, MiniMax M2.7 y GLM-5.3 Flash (Kimi K2.6 fue retirado de la red en septiembre de 2026, y GLM-5.2, que figuró durante mucho tiempo en el registro, nunca entró en servicio operativo). Una breve comparación:

ParámetroDeepSeek V4 FlashMiniMax M2.7GLM-5.3 Flash
Contexto en red380 000200 000390 000
Salida por respuesta32 7688 1928 192, razonamiento incluido
ArquitecturaMoE 284B (~13B activos)MoE + atención linealMoE 320B (~18B activos), atención híbrida
VRAM por nodo280 GB320 GB560 GB
Punto fuerteContexto largo, razonamiento, velocidadDesarrollo diario, estabilidadLógica compleja, análisis de código, tareas de «pensamiento»
Precio vía Gatewayidéntico — $0.0069 entrada / $0.021 salida por 1M

La consecuencia práctica del precio idéntico es que se puede elegir el modelo basándose puramente en la tarea, sin pensar en el presupuesto. Si necesita prompts largos con respuestas rápidas y la salida más extensa, elija DeepSeek V4 Flash; para tareas que requieren pensar en una lógica compleja (y el contexto más largo de la red), utilice GLM-5.3 Flash; para el caballo de batalla diario, MiniMax M2.7.

Benchmarks V4-Flash-0731: qué muestra la compilación

Resultados clave publicados de la compilación 0731 (según DeepSeek y agregadores independientes):

  • SWE-bench Verified: 79,0% — solución de tareas reales de GitHub; un nivel que hace solo un año solo estaba disponible para modelos insignia cerrados. Como comparación: Kimi K2.6, que la red servía anteriormente, tiene un 71,3%.
  • GPQA Diamond: 88,1% — preguntas de nivel de posgrado en ciencia; el modo de razonamiento extendido añade precisión en tareas de varios pasos.
  • Terminal Bench 2.1: 82,7 — trabajo en terminal mediante agente; la versión de vista previa Flash tenía 61,8, y V4 Pro Preview tenía 72,1.
  • DeepSWE: 54,4 — nuevo benchmark estricto de DeepSeek con una tasa de falsos positivos casi nula; la cifra es del proveedor, el entorno aún no se ha publicado, así que tómese con esa reserva.

Marco honesto: en nueve benchmarks de agentes, la compilación 0731 supera a su propia V4 Pro Preview, pero no a Claude Opus 4.8; el rezago es de unos 6 puntos en promedio. Al mismo tiempo, en precio por token, el modelo es dos órdenes de magnitud más barato que Opus, y a través de la red Gonka es ~9 veces más barato que el mismo modelo en proveedores externos en OpenRouter. Es precisamente esta relación de "calidad cercana a la frontera por una fracción del precio" lo que lo hace interesante: las mediciones independientes detalladas se pueden ver convenientemente en Artificial Analysis, y los pesos y la tarjeta del modelo en Hugging Face.

Cómo utilizar DeepSeek V4 Flash a través de JoinGonka Gateway

El modelo está disponible a través de JoinGonka Gateway con API compatible con OpenAI y Anthropic. Identificador del modelo: deepseek-ai/DeepSeek-V4-Flash-0731.

La forma más rápida es el instalador de un solo comando, que configura tu herramienta (Claude Code, OpenClaw, Cline, opencode, Aider y otras) directamente con este modelo:

npx @joingonka/setup --model deepseek

Donde el instalador escribe el config por sí mismo (Claude Code, Codex CLI, OpenClaw, opencode, Kilo Code, Hermes, Pi y otros), DeepSeek V4 Flash está por defecto y sin flag. El flag hace falta para cambiar una herramienta ya configurada y donde el instalador imprime valores para pegar (Cursor, Cline, Aider). Los demás modelos de la red se eligen igual: --model minimax y --model glm.

Llamada directa a la API (formato OpenAI):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-your-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Hello!"}]}'

Al registrarte recibes 3M tokens gratis: con un contexto de 380K, es la oportunidad de probar el modelo de inmediato con documentos grandes y bases de código reales. Ejemplos paso a paso en Python y TypeScript en API Quickstart; puedes probarlo sin registrarte en el chat gratuito, seleccionando DeepSeek V4 Flash en la lista de modelos.

Cuándo elegir DeepSeek V4 Flash — escenarios prácticos

Escenarios en los que este modelo destaca:

  • Documentos grandes y bases de código completas. 380 000 tokens son del orden de 280 000 palabras: un informe anual, un paquete de documentos legales o un repositorio de tamaño medio caben en una sola solicitud, sin trocearlos ni perder las conexiones entre las partes.
  • Sesiones de agente largas. Un agente autónomo que lee archivos, llama a herramientas y acumula historial es lo primero que choca con el contexto: un margen de 380K tokens significa sesiones notablemente más largas sin reiniciar la memoria.
  • RAG con selecciones grandes. Cuantos más documentos relevantes caben en el contexto, menor es la dependencia de la precisión de la búsqueda.
  • Tareas de razonamiento. El modo reasoning aporta mejoras en matemáticas, ciencia y lógica de varios pasos, al precio de un modelo normal.

Cuándo conviene otro modelo de la red: para tareas que exigen pensar sobre lógica enrevesada está GLM-5.3 Flash, el modelo de reasoning de la red (un análisis detallado de modelos para desarrollo está en el artículo sobre los mejores modelos para código), mientras que MiniMax M2.7 sigue siendo un caballo de batalla probado para las tareas del día a día. Gracias al precio único, puedes experimentar con total libertad: cambiar de modelo es una sola línea en la solicitud.

DeepSeek V4 Flash 0731 — Modelo MoE de DeepSeek (284B parámetros, ~13B activos, licencia MIT), añadido a la red Gonka mediante la propuesta de gobernanza #94 del equipo de kaitaku.ai y activo desde el 13 de agosto de 2026. La diferencia principal es el contexto de 380 000 tokens (verificado con una solicitud real de 381K; en la red, solo el GLM-5.3 Flash tiene uno más largo, con 390 000) y el techo de respuesta más grande, 32 768 tokens, además de razonamiento y tool calling. SWE-bench Verified 79,0%, GPQA Diamond 88,1% — cerca de la frontera a un precio dos órdenes de magnitud más bajo que los modelos insignia cerrados; a través de JoinGonka Gateway — a la misma tarifa que MiniMax M2.7 y GLM-5.3 Flash, ~9 veces más barato que el mismo modelo en OpenRouter. Identificador: deepseek-ai/DeepSeek-V4-Flash-0731; inicio rápido — npx @joingonka/setup --model deepseek.

¿Quieres saber más?

Explora otras secciones o empieza a ganar GNK ahora mismo.

Probar DeepSeek V4 Flash a través de Gateway →