Secciones de la base de conocimientos ▾

Tecnología

DeepSeek V4 Flash: modelo de la red Gonka con contexto de 380K

En agosto de 2026, el tercer modelo activo, DeepSeek V4 Flash, apareció en la red Gonka. La propuesta de gobernanza #94 para su adición fue presentada por el equipo de kaitaku.ai, conocido en la comunidad por sus optimizaciones de ML-nodes: realizaron experimentos que confirmaron la compatibilidad del modelo con Proof of Compute y la validación de la red, y el 12 de agosto la propuesta fue aprobada por votación. Al día siguiente, el modelo ya estaba procesando solicitudes.

Para los usuarios, esto representa una expansión notable de capacidades: DeepSeek V4 Flash tiene la ventana de contexto más larga de la red (380 000 tokens) (casi el doble que Kimi K2.6 y MiniMax M2.7), reasoning integrado y tool calling completo. Analicemos qué es este modelo, quién lo creó, cuáles son sus características específicas en la red Gonka, qué muestran los benchmarks y cuándo elegirlo en lugar de los otros dos modelos de la red.

Qué es DeepSeek V4 Flash y quién está detrás

DeepSeek es un laboratorio de IA chino con sede en Hangzhou que obtuvo reconocimiento mundial tras los lanzamientos de V3 y R1: fue R1, a principios de 2025, el que demostró que un modelo abierto podía alcanzar a los líderes cerrados por una fracción de su presupuesto. En abril de 2026, DeepSeek lanzó la familia V4 compuesta por dos modelos: el pesado V4 Pro y el ligero V4 Flash. Ambos son abiertos (licencia MIT) y ambos están construidos sobre una arquitectura MoE.

V4 Flash cuenta con 284 mil millones de parámetros, de los cuales se activan unos 13 mil millones por token. Esta dispersión hace que el modelo sea rápido y económico de mantener: requiere significativamente menos VRAM que los gigantes "densos" y su velocidad de generación es superior.

En la red Gonka funciona la versión V4-Flash-0731, una compilación re-entrenada (re-post-training) del 31 de julio de 2026. La arquitectura y el tamaño no cambiaron, pero la calidad en tareas de agentes aumentó drásticamente: según nueve benchmarks de agentes y codificación publicados por DeepSeek, la compilación 0731 supera incluso a su propio modelo insignia, V4 Pro, en su versión preliminar. Una aclaración importante para ser justos: parte de estas cifras son mediciones de la propia DeepSeek en su entorno de prueba, el cual aún no se ha lanzado públicamente, por lo que todavía no hay replicación independiente. La brecha con la frontera de los modelos cerrados persiste: Claude Opus 4.8 no es superado por la compilación 0731 en ninguno de los nueve benchmarks, pero cuesta muchísimo menos, y esa es precisamente su esencia: calidad máxima de agente por una fracción del precio.

Características de DeepSeek V4 Flash en la red Gonka

Al igual que con otros modelos de la red, es importante distinguir entre las características del modelo "de fábrica" y los parámetros operativos de una implementación específica: estos son definidos por la configuración de inferencia vLLM en los hosts GPU de la red. Valores reales a través de nuestro Gateway:

  • Ventana de contexto: 380 000 tokens, la más larga en la red Gonka. Lo hemos verificado empíricamente: una solicitud con 381 000 tokens de entrada fue aceptada y procesada en decenas de segundos. La arquitectura V4 Flash en sí misma admite contextos de hasta 1 millón de tokens; el techo práctico en la red está determinado por la configuración de los hosts (ventana de inferencia de 400 000).
  • Salida máxima: 8 192 tokens por respuesta, un límite único para todos los modelos de la red (configuración de la puerta de enlace, no un límite del modelo).
  • Reasoning y tool calling: el modelo se despliega con parsers de razonamiento y llamadas a herramientas; los escenarios de agentes (Cursor, Claude Code, LangChain) funcionan de inmediato; ejecutamos escenarios de herramientas de varios pasos a través de rutas compatibles con OpenAI y Anthropic.
  • Requisito de VRAM del host: alrededor de 280 GB, el modelo más ligero de la red (para comparar: MiniMax M2.7, 320 GB; Kimi K2.6, 720 GB). Cuanto más bajo sea el requisito de hardware, más fácil será para los hosts desplegar el modelo, lo cual es una buena señal para su disponibilidad en la red.

El precio de la inferencia en la red Gonka no depende de la elección del modelo: DeepSeek V4 Flash está disponible a la misma tarifa que Kimi K2.6 y MiniMax M2.7. A través de JoinGonka Gateway, esto es $0.0032 por millón de tokens de entrada y $0.0097 por millón de tokens de salida. Como referencia: la API oficial de DeepSeek vende el mismo modelo a $0.14/$0.28 por millón, y OpenRouter, desde $0.08/$0.18. La economía de la red es un tema aparte: el precio se determina mediante el cálculo del trabajo computacional, no por el precio del proveedor.

Comparación: DeepSeek V4 Flash, Kimi K2.6 y MiniMax M2.7

Actualmente hay tres modelos operativos en la red (un cuarto, GLM-5.2, ya está registrado y esperando despliegue). Comparación breve:

ParámetroDeepSeek V4 FlashKimi K2.6MiniMax M2.7
Contexto en red380 000200 000200 000
Salida por respuesta8 1928 1928 192
ArquitecturaMoE 284B (~13B activos)MoE clase ~1TMoE
VRAM por nodo280 GB720 GB320 GB
FortalezaContexto largo, reasoning, velocidadTareas de agentes, códigoDesarrollo diario, estabilidad
Precio vía Gatewayel mismo — $0.0032 entrada / $0.0097 salida por 1M

Consecuencia práctica del mismo precio: puede elegir el modelo puramente según la tarea, sin pensar en el presupuesto. Si necesita el contexto más largo o respuestas rápidas con razonamiento — DeepSeek V4 Flash; máxima fiabilidad de agente en código complejo — Kimi K2.6; un caballo de batalla constante para el día a día — MiniMax M2.7.

Benchmarks V4-Flash-0731: qué muestra la compilación

Resultados clave publicados de la compilación 0731 (según datos de DeepSeek y agregadores independientes):

  • SWE-bench Verified: 79,0% — resolución de tareas de GitHub reales; un nivel que hace solo un año solo estaba disponible para flagships cerrados. Para comparar: Kimi K2.6 — 71,3%.
  • GPQA Diamond: 88,1% — preguntas de nivel de posgrado científico; el modo de razonamiento extendido añade precisión en tareas de múltiples pasos.
  • Terminal Bench 2.1: 82,7 — trabajo en terminal mediante agente; la versión preview de Flash tenía 61,8, y la V4 Pro Preview — 72,1.
  • DeepSWE: 54,4 — nuevo benchmark estricto de DeepSeek con un nivel casi nulo de falsos positivos; la cifra es del proveedor, el entorno aún no se ha publicado — tómese con esa reserva.

Marco honesto: en nueve benchmarks de agentes, la compilación 0731 supera a su propio V4 Pro Preview, pero no a Claude Opus 4.8 — el retraso es de aproximadamente 6 puntos en promedio. Al mismo tiempo, por precio por token, el modelo es dos órdenes de magnitud más barato que Opus, y a través de la red Gonka — decenas de veces más barato que la API oficial de DeepSeek. Precisamente esta relación de «calidad cercana al frontier por una fracción del precio» es lo que lo hace interesante: puede ver mediciones independientes detalladas en Artificial Analysis, y los pesos y la tarjeta del modelo en Hugging Face.

Cómo utilizar DeepSeek V4 Flash a través de JoinGonka Gateway

El modelo está disponible a través de JoinGonka Gateway mediante una API compatible con OpenAI y Anthropic. Identificador del modelo: deepseek-ai/DeepSeek-V4-Flash-0731.

La forma más rápida — un instalador de un solo comando, que configurará su herramienta (Claude Code, OpenClaw, Cline, opencode, Aider y otros) directamente para este modelo:

npx @joingonka/setup --model deepseek

Llamada directa a la API (formato OpenAI):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-su-clave" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"¡Hola!"}]}'

Al registrarse, obtiene 10 000 000 tokens gratuitos — con un contexto de 380K es la oportunidad de probar el modelo inmediatamente en documentos reales grandes y bases de código. Ejemplos paso a paso en Python y TypeScript — en API Quickstart; puede probar sin registro en el chat gratuito, seleccionando DeepSeek V4 Flash en la lista de modelos.

Cuándo elegir DeepSeek V4 Flash — escenarios prácticos

Escenarios fuertes para este modelo:

  • Documentos grandes y bases de código completas. 380 000 tokens — son alrededor de 280 000 palabras: un informe anual, un paquete de documentos legales o un repositorio promedio caben en una sola consulta, sin cortar en piezas y sin perder conexiones entre partes.
  • Sesiones de agentes largas. Un agente autónomo que lee archivos, llama a herramientas y acumula historial, alcanza el límite del contexto más rápido que nadie — una reserva de 380K tokens significa sesiones notablemente más largas sin borrar la memoria.
  • RAG con muestras grandes. Cuantos más documentos relevantes quepan en el contexto, menor será la dependencia de la precisión de la búsqueda.
  • Tareas con razonamiento. El modo reasoning da un incremento en matemáticas, ciencia y lógica de múltiples pasos — al precio de un modelo normal.

Cuándo es más razonable otro modelo de la red: para una codificación de agente lo más fiable posible en repositorios complejos, Kimi K2.6 sigue siendo fuerte (análisis detallado — en el artículo sobre los mejores modelos para código), y MiniMax M2.7 sigue siendo un caballo de batalla probado para tareas cotidianas. Gracias al precio unificado, puede experimentar libremente — cambiar el modelo es una sola línea en la consulta.

DeepSeek V4 Flash 0731 — MoE-modelo de DeepSeek (284B parámetros, ~13B activos, licencia MIT), añadido a la red Gonka mediante la propuesta de gobernanza #94 del equipo kaitaku.ai y activo desde el 13 de agosto de 2026. Su característica principal es el contexto más largo de la red: 380 000 tokens (verificado con una solicitud real de 381K), además de reasoning y tool calling. SWE-bench Verified 79,0%, GPQA Diamond 88,1% — muy cerca de la frontera tecnológica a un precio dos órdenes de magnitud inferior al de los modelos cerrados líderes; a través de JoinGonka Gateway — a la misma tarifa que Kimi K2.6 y MiniMax M2.7, decenas de veces más barato que el API oficial de DeepSeek. Identificador: deepseek-ai/DeepSeek-V4-Flash-0731; inicio rápido — npx @joingonka/setup --model deepseek.

¿Quieres saber más?

Explora otras secciones o empieza a ganar GNK ahora mismo.

Probar DeepSeek V4 Flash a través de Gateway →