Secciones de la base de conocimientos ▾

Tecnología

MiniMax M2.7: modelo de la red Gonka

En la primavera de 2026, la red Gonka pasó de ser de modelo único a multimodelo. Primero se añadió Kimi K2.6 al emblemático Qwen3-235B, y a finales de mayo de 2026, MiniMax M2.7 del laboratorio chino MiniMax. Posteriormente, Qwen3-235B fue retirado de la red, y hoy Gonka opera con tres modelos simultáneamente: Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash.

Analicemos qué es MiniMax M2.7, quién está detrás de su desarrollo, cuáles son sus características específicas dentro de la red Gonka, en qué se diferencia del segundo modelo activo de la red —Kimi K2.6— y cómo acceder a él a través de nuestro API Gateway mediante el protocolo compatible con OpenAI.

Qué es MiniMax M2.7 y quién está detrás del modelo

MiniMax M2.7 es un modelo de lenguaje grande (LLM) de la empresa MiniMax, con sede en Shanghái. MiniMax fue fundada en 2021 por un equipo de investigadores dirigido por Yan Junjie (anteriormente en SenseTime) y rápidamente se convirtió en uno de los principales laboratorios de IA de China. La compañía atrajo financiación de Alibaba, Tencent y HongShan, el mismo círculo de inversores estratégicos que respalda a otros "tigres de la IA chinos", incluido Moonshot AI, el desarrollador de Kimi K2.6.

Más allá de los modelos de lenguaje puros, MiniMax es conocida por sus productos de consumo: los asistentes de chat Talkie y Hailuo, y uno de los generadores de video más destacados de la industria. Pero para la red Gonka, la línea de modelos de texto de la serie M, sucesores de los modelos abab anteriores, es particularmente importante.

La principal característica arquitectónica de la serie M es su enfoque en un mecanismo de atención eficiente. Mientras que los modelos grandes anteriores utilizaban la atención cuadrática clásica (el coste computacional crece proporcionalmente al cuadrado de la longitud del contexto), MiniMax fue una de las primeras en lanzar una atención lineal híbrida de código abierto. Esto permite procesar secuencias muy largas sin un crecimiento explosivo del coste computacional, una característica histórica de la línea. Al igual que Qwen3-235B y Kimi K2.6, el modelo se basa en la arquitectura MoE (Mixture of Experts): cientos de miles de millones de parámetros "en papel", pero solo una pequeña parte de ellos se activa para cada consulta, lo que reduce drásticamente el coste de inferencia.

En la red Gonka, el modelo se identifica como MiniMaxAI/MiniMax-M2.7; esta es la cadena que debe pasarse en el campo model de la solicitud de API. La versión M2.7 es la última iteración de la serie M en el momento de la publicación de este artículo.

Características de MiniMax M2.7 en la red Gonka

Es importante distinguir entre las características del modelo "out-of-the-box" y las características con las que se despliega en una red específica. Cuando el modelo funciona en la red descentralizada Gonka, sus parámetros operativos están definidos por la configuración del vLLM-inferenced en el lado de los hosts GPU, y no solo por la arquitectura del modelo. Estos son los valores reales que devuelve nuestro Gateway:

  • Ventana de contexto: 200 000 tokens (alrededor de 150 000 palabras). Esta es la configuración de subnet en la red Gonka. La arquitectura de MiniMax admite un contexto sustancialmente más largo, pero el límite práctico en cada momento está determinado por la configuración de inferenced en los hosts.
  • Salida máxima: 8 192 tokens por respuesta. Esta cifra se midió empíricamente mediante una solicitud con generación larga forzada, que alcanzó el límite (finish_reason: length). Actualmente, este límite es el mismo para todos los modelos de la red: hasta 8 192 tokens. Esto no es un límite del modelo en sí, sino una configuración del subnet vLLM.
  • Requisito de VRAM del host: aproximadamente 320 GB de VRAM por nodo. Este es un requisito típico para un modelo MoE grande en cuantización FP8: los mismos 320 GB son necesarios para Kimi K2.6. En la práctica, esto significa varias GPU clase H100/H200 combinadas en un solo nodo.

El precio del inferenced en la red Gonka no depende de la elección del modelo y se determina por parámetros de red: a través de JoinGonka Gateway, MiniMax M2.7 está disponible a la misma tarifa que Kimi K2.6. Este precio unificado es consecuencia de que la red se basa en un cálculo único de costo por trabajo computacional, no en la lista de precios de un proveedor específico.

MiniMax M2.7 y Kimi K2.6: comparación de modelos Gonka

Un usuario de la red Gonka puede elegir entre dos modelos insignia, y ambos están disponibles a través de una interfaz única compatible con OpenAI: JoinGonka Gateway. La comparación a continuación ayuda a entender no cuál es "mejor", sino para qué perfil de tareas está optimizado cada uno.

CaracterísticaMiniMax M2.7Kimi K2.6
FabricanteMiniMax (Shanghái)Moonshot AI (Pekín)
ArquitecturaMoE + atención linealMoE
Contexto en Gonka200 000 tokens200 000 tokens
Salida máx.8 192 tokens8 192 tokens
Fortaleza históricaContexto largo, atención eficienteRazonamiento, contexto largo
Identificador APIMiniMaxAI/MiniMax-M2.7moonshotai/Kimi-K2.6
Estado en la redLanzado mediante actualización v0.2.13 (mayo 2026)Lanzado mediante DevShards (mayo 2026)

Una salvedad importante sobre los benchmarks en 2026: la brecha entre los principales modelos de open-weights en las pruebas públicas se ha reducido a unidades porcentuales, y esta diferencia a menudo se sitúa dentro del margen de error estadístico de los propios benchmarks. Para el trabajo práctico, lo que importa no es la posición absoluta en el ranking MMLU, sino la naturaleza de la tarea: longitud del contexto, complejidad de las cadenas lógicas, idioma necesario y disponibilidad de tool calling.

Orientación práctica: para tareas con documentos muy largos y procesamiento en streaming de grandes volúmenes de texto, tiene sentido probar MiniMax M2.7: la atención eficiente de su serie está históricamente adaptada a tales escenarios. Para tareas de razonamiento con lógica compleja y contexto largo, vale la pena comparar las respuestas con Kimi K2.6. La mejor estrategia en producción es mantener ambos modelos en el código y alternar entre ellos con un único parámetro model sin cambiar la arquitectura de la aplicación.

Cómo Gonka lanzó MiniMax M2.7: actualización v0.2.13

La incorporación de MiniMax M2.7 no es una «carga de archivos al servidor», sino el resultado de una actualización de red que pasó por una votación on-chain. El soporte para el modelo se incluyó en la versión del protocolo v0.2.13, aprobada mediante la propuesta proposal #54: fue aceptada el 21 de mayo de 2026 (con cerca del 63% de los votos a favor) y activada en una altura de bloque determinada. Es el mismo mecanismo de governance a través del cual la red adopta cualquier cambio significativo, desde tarifas hasta nuevos modelos.

La multimodalidad para una red descentralizada es un paso fundamental. Una red ligada a un solo modelo es intrínsecamente frágil: la aparición de una nueva versión del modelo se convierte en una crisis de migración, y cualquier fallo del modelo único colapsa todo el servicio. Una red capaz de mantener varios modelos simultáneamente evoluciona suavemente: los nuevos modelos se añaden como «carriles» adicionales, los antiguos continúan funcionando y los GPU-host eligen qué servir. Técnicamente, cada modelo vive en su propio shard de la red; este mismo mecanismo (DevShards) se utilizó anteriormente para lanzar Kimi K2.6.

Un matiz importante de las etapas iniciales: puede haber un desfase entre que «el modelo aparece en la lista de la red» y «el modelo está abierto para todos los clientes». Al principio, la inferencia de MiniMax M2.7 en modo broker solo estaba disponible para claves privilegiadas y devolvía un error para las solicitudes normales, una fase normal de pruebas. A finales de mayo de 2026, se abrió el acceso público y el modelo quedó disponible para todos los clientes de Gateway. Más información sobre cómo funciona la red y por qué los modelos se lanzan de esta manera en el artículo sobre la arquitectura de red de Gonka.

El mismo MiniMax M2.7 a través de OpenRouter cuesta $0.279/$1.20 por 1M, frente a $0.0047/$0.014 de JoinGonka.

Cómo usar MiniMax M2.7 a través de JoinGonka Gateway

La forma más directa es a través de JoinGonka API Gateway. Dado que Gateway proporciona una API compatible con OpenAI, el mismo código que funciona con GPT, Claude o Kimi comenzará a funcionar con MiniMax después de cambiar el valor del campo model.

Ejemplo mínimo usando curl:

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMaxAI/MiniMax-M2.7",
    "messages": [
      {"role": "user", "content": "Explica brevemente qué es el attention lineal"}
    ]
  }'

La misma solicitud en Python usando la librería openai:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://gate.joingonka.ai/v1",
)

response = client.chat.completions.create(
    model="MiniMaxAI/MiniMax-M2.7",
    messages=[{"role": "user", "content": "Hola, MiniMax"}],
)
print(response.choices[0].message.content)

Streaming (Server-Sent Events) — para interfaces interactivas donde la respuesta se muestra a medida que se genera:

stream = client.chat.completions.create(
    model="MiniMaxAI/MiniMax-M2.7",
    messages=[{"role": "user", "content": "Escribe un ensayo corto sobre contexto largo"}],
    stream=True,
)
for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)

Al registrarte en JoinGonka Gateway, obtienes 1.5M de tokens gratis para probar cualquier modelo de la red; esto es suficiente para comparar los tres modelos de la red en tus propias tareas.

Compatibilidad con herramientas de desarrollo: todo lo que funciona con OpenAI API también funciona con MiniMax a través de Gateway. Basta con cambiar el parámetro model:

La lista actualizada de modelos siempre está disponible en el endpoint GET /v1/models; es conveniente obtenerla dinámicamente desde allí para que la UI de tu aplicación muestre siempre el conjunto actualizado. Si la respuesta es 429 too many concurrent requests, es una fase normal para un modelo nuevo en la etapa inicial de crecimiento de la red: vuelve a intentar la solicitud después de unos segundos.

Cuándo elegir MiniMax M2.7 — escenarios prácticos

Tener tres modelos en una sola red es valioso porque puedes elegir diferentes herramientas para diferentes tareas sin cambiar de proveedor ni el código de integración. Aquí tienes escenarios donde tiene sentido comenzar a probar con MiniMax M2.7.

Análisis de documentos largos. Si la tarea es el resumen de contratos, el análisis de documentación técnica o el procesamiento de grandes textos legales o financieros, el attention eficiente de la serie M está históricamente diseñado para mantener un contexto largo sin un aumento brusco en el costo. Envía el documento completo en una sola solicitud y pídele al modelo que trabaje con todo el volumen a la vez, no por partes.

RAG y trabajo con bases de conocimiento. En escenarios de retrieval-augmented, donde se mezclan decenas de fragmentos de una base vectorial en el contexto, la capacidad del modelo para retener muchos trozos de texto heterogéneos influye directamente en la calidad de la respuesta. Este es un nicho natural para modelos con contexto largo.

Procesamiento de transcripciones y registros. Transcripciones de llamadas, largos diálogos de soporte, logs de flujo: tareas donde el volumen de entrada es grande pero la respuesta suele ser corta. Aquí el límite de salida de 8 192 tokens no interfiere: entra mucho, y sale un resumen o hechos extraídos.

Cuándo elegir otro modelo. Actualmente, todos los modelos de la red entregan hasta 8 192 tokens en una sola respuesta, por lo que si tu aplicación necesita una respuesta muy larga en una sola solicitud (un documento generado grande, un fragmento de código voluminoso), considera este límite total en tu arquitectura y divide la generación en partes. Para tareas con razonamientos complejos de varios pasos, vale la pena comparar las respuestas con Kimi K2.6. Consejo universal: ejecuta el mismo conjunto de tus solicitudes reales a través de ambos modelos y compara los resultados; los 1.5M de tokens gratuitos al registrarte serán suficientes para la primera prueba comparativa.

Técnicamente, cambiar entre modelos es solo modificar una línea en el campo model. Por lo tanto, una arquitectura de aplicación inteligente en la red Gonka no "elige un modelo para siempre", sino que permite enrutar las solicitudes entre Kimi K2.6 y MiniMax M2.7 dependiendo del tipo de tarea; el inference económico hace que dicha enrutación sea rentable.

MiniMax M2.7 — un modelo MoE del laboratorio de Shanghái MiniMax, añadido a la red Gonka en mayo de 2026 junto con Kimi K2.6 (la compatibilidad se incluyó en la actualización del protocolo v0.2.13, propuesta #54); hacia finales de mayo, el inference público se abrió para todos. En la red Gonka, el modelo funciona con un contexto de 200 000 tokens y un límite de salida de 8 192 tokens por nodo con ~320 GB de VRAM. A través de JoinGonka Gateway está disponible mediante una API compatible con OpenAI; el identificador del modelo es MiniMaxAI/MiniMax-M2.7. La serie M es históricamente fuerte en atención eficiente y contexto largo.

¿Quieres saber más?

Explora otras secciones o empieza a ganar GNK ahora mismo.

Probar MiniMax M2.7 vía Gateway →