Secciones de la base de conocimientos ▾
Navegación
▸ Empiece aquí Por rolesCategorías
- Arquitectura de red de Gonka: Sprint, Agentes de Transferencia, DiLoCo
- Desarrolladores: Cómo ganar GNK
- Autoalojamiento: Guía paso a paso
- Elección de GPU para Gonka: recomendaciones de hardware
- Qwen3-235B: el modelo que Gonka servía anteriormente
- Kimi K2.6: el segundo modelo de la red Gonka
- MiniMax M2.7: modelo de la red Gonka
- DeepSeek V4 Flash: modelo de la red Gonka con contexto de 380K
Tecnología
Kimi K2.6: el segundo modelo de la red Gonka
Durante mucho tiempo, la red Gonka funcionó con un solo modelo: Qwen3-235B de Alibaba Cloud. En mayo de 2026 esto cambió: se lanzó el soporte para múltiples modelos a través del mecanismo DevShards, y el primero en llegar fue Kimi K2.6 de la empresa china Moonshot AI. Más tarde se añadió MiniMax M2.7, y Qwen3-235B fue retirado de la red con el tiempo. Hoy, Gonka ofrece tres modelos: Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash. Analicemos qué es este modelo, en qué se diferencia de MiniMax M2.7, cómo Gonka implementó técnicamente la capacidad multimodelo y cómo probarlo a través de nuestro API Gateway.
Qué es Kimi K2.6 de Moonshot AI
Kimi K2.6 es un gran modelo de lenguaje (LLM) de la serie Kimi, desarrollado por la empresa con sede en Pekín Moonshot AI. Moonshot AI es uno de los principales laboratorios de IA de China, fundado en 2023 por un equipo de investigadores dirigido por Yang Zhilin. La empresa ha atraído financiación de Alibaba, Tencent y otros grandes inversores, y ha sido incluida en la lista de los "tigres de IA chinos": empresas que marcan el ritmo del desarrollo de la IA en Asia.
La serie Kimi es conocida desde 2024. Las primeras versiones (K1, K1.5) llamaron inmediatamente la atención por su ventana de contexto excepcionalmente larga, de hasta 200.000 tokens en una sola solicitud, que en el momento de su lanzamiento era un récord para los modelos disponibles públicamente. Un contexto largo significa la posibilidad práctica de analizar un libro entero, una base de código de tamaño medio o una colección de documentos legales en una sola solicitud. En el momento del lanzamiento de Kimi, esta característica era una fuerte ventaja competitiva.
La versión K2 apareció en 2025 y trajo consigo un salto arquitectónico fundamental: la transición a MoE (Mixture of Experts). Esta misma arquitectura es la base de Qwen3-235B y DeepSeek-R1, convirtiéndose en el estándar de facto para los modelos más grandes de 2025-2026. MoE permite tener cientos de miles de millones de parámetros "en total", pero activar solo un subconjunto (normalmente del 5 al 10%) en cada solicitud, lo que reduce radicalmente el costo computacional de la inferencia con una calidad comparable.
K2.6 es la última iteración de la serie K2 en el momento de escribir este artículo. Según las declaraciones públicas de Moonshot AI, esta versión mejora las capacidades del modelo en razonamiento (razonamiento lógico), generación de código y llamada a herramientas nativas (tool calling). En la red Gonka, el modelo se identifica como moonshotai/Kimi-K2.6 — este es el nombre que debe pasarse en el campo model de la solicitud API.
Comparación entre Kimi K2.6 y MiniMax M2.7
Ambos modelos representan desarrollos emblemáticos de los laboratorios de IA más grandes de China y ambos están disponibles a través de la interfaz única compatible con OpenAI JoinGonka Gateway. Sin embargo, tienen diferentes fortalezas y diferentes legados, lo que hace que elegir entre ellos no sea una cuestión de «cuál es mejor», sino una cuestión de «cuál se adapta a la tarea».
| Característica | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|
| Fabricante | Moonshot AI (Pekín) | MiniMax (Shanghái) |
| Año de fundación de la empresa | 2023 | 2021 |
| Arquitectura | MoE | MoE + attention lineal |
| Ventana de contexto | 200 000 tokens | 200 000 tokens |
| Fortaleza | Reasoning, contexto largo, code generation | Contexto largo, attention eficiente (lineal) |
| Precio a través de JoinGonka | $0.0047 por 1M de tokens | $0.0047 por 1M de tokens |
| Identificador de API | moonshotai/Kimi-K2.6 | MiniMaxAI/MiniMax-M2.7 |
| Estado en la red Gonka | Lanzado a través de DevShards (mayo 2026) | Lanzado a través de actualización v0.2.13 (mayo 2026) |
En los benchmarks de reasoning (MATH-500, GSM8K, AIME), la serie Kimi K2 muestra históricamente resultados en el grupo superior de modelos open-weights, compitiendo con modelos DeepSeek-R1 y o1-style. En tareas de generación de código (HumanEval, MBPP), ambos modelos se mantienen en niveles cercanos. La fortaleza de MiniMax M2.7 es el attention eficiente (lineal) para secuencias muy largas, mientras que Kimi es conocida por un fuerte reasoning y el contexto largo de la serie Kimi.
Una advertencia importante sobre los benchmarks en 2026: la brecha entre los mejores modelos en pruebas públicas se ha reducido a unos pocos puntos porcentuales, y esta diferencia a menudo se encuentra dentro del margen de error estadístico de los propios benchmarks. Para el trabajo práctico, lo que importa no es «quién está un 2% por encima en MMLU», sino la naturaleza de las tareas: qué contexto le proporciona al modelo, qué tan complejas son las cadenas lógicas, si se necesita un historial de diálogo largo, qué idiomas se utilizan. Por lo tanto, la tabla anterior no clasifica los modelos, sino que ayuda a comprender rápidamente para qué perfil de tareas está optimizado cada uno.
Para una elección práctica: si la tarea requiere un contexto largo (análisis de grandes documentos, lectura de una base de código voluminosa, diálogos largos conservando el historial) o tareas de reasoning complejas, se debe comenzar con Kimi K2.6. Si la prioridad es el procesamiento de secuencias de entrada muy largas y datos en streaming, vale la pena probar MiniMax M2.7 con su attention eficiente. Una buena estrategia en producción es tener ambos modelos en su código: el cambio rápido a través del parámetro model permite alternar entre ellos dependiendo de la tarea sin cambiar la arquitectura de la aplicación.
DevShards: cómo Gonka lanzó el segundo modelo
Hasta la primavera de 2026, toda la red Gonka prestaba servicio a una sola modelo: Qwen3-235B. Desde el punto de vista de la arquitectura, esta fue una decisión sensata: el distributed inference a través de DiLoCo requiere que todos los participantes de la red mantengan el mismo modelo en la VRAM, de lo contrario, es imposible garantizar que cualquier nodo pueda procesar cualquier solicitud. La Qwen3-235B completa en formato FP8 ocupa alrededor de 640 GB de VRAM, lo que ya de por sí es un compromiso enorme para cada MLNode.
Para realizar la transición a una red multimodelo, se necesitaba un mecanismo que permitiera mantener varios modelos simultáneamente, pero que no exigiera a cada host ejecutarlos todos. Ese mecanismo son los DevShards: shards separados de la red, cada uno de los cuales se especializa en un modelo. Los nodos dentro de un mismo shard trabajan con el mismo modelo, y el enrutador de la red dirige la solicitud al shard que contiene el modelo requerido.
La idea no surgió de la nada: fue formalizada en la Gonka Improvement Proposal #800 «Multi-Model PoC», sometida a votación de la comunidad en la primavera de 2026. La propuesta recibió el apoyo de los participantes y validadores de la red y fue implementada entre abril y mayo de 2026. Kimi K2.6 se convirtió en el primer modelo ejecutado en un DevShard independiente, es decir, básicamente una implementación de prueba del nuevo enfoque. Si la experiencia resulta exitosa, nada impide lanzar un tercero, cuarto, etc., cada uno en su propio shard, con su propio conjunto de hosts, su propia economía y su propia roadmap.
Qué significa esto para usuarios y desarrolladores:
- Un API — varios modelos. A través de JoinGonka Gateway no es necesario cambiar el endpoint ni las claves: basta con especificar otro
modelen el cuerpo de la solicitud. El formato compatible con OpenAI se mantiene íntegramente. - El precio es el mismo. Actualmente, Kimi K2.6 en la red se tarifa a la misma tasa que MiniMax M2.7: $0.0047 por 1M de tokens a través del Gateway. En el futuro, los precios pueden variar según el modelo, pero un precio único al inicio es una decisión consciente para simplificar la migración de los usuarios.
- La estabilidad depende de la carga del shard. En la etapa inicial, el shard de un nuevo modelo tiene menos hosts, por lo que, al concentrarse las solicitudes, el modelo puede devolver temporalmente
429 too many concurrent requests. Esta es una fase normal para un nuevo modelo: a medida que crezca el interés, los hosts se conectarán a su shard y los límites aumentarán. - Tool calling — en proceso de perfeccionamiento. Al momento de escribir este artículo, Kimi K2.6 en la red Gonka presenta pequeños problemas con la selección automática de herramientas (
tool_choice: "auto"). El equipo de Gonka está trabajando para ajustar el comportamiento al estándar OpenAI; para escenarios críticos en producción con tool calling, pruebe de antemano el comportamiento del modelo con sus solicitudes.
Cómo probar Kimi K2.6 a través de Gonka
La forma más directa es a través del JoinGonka API Gateway. El Gateway proporciona una API compatible con OpenAI, lo que significa que el mismo código que funciona con GPT, Claude u otros modelos empezará a funcionar con Kimi tras cambiar el valor del campo model en el cuerpo de la solicitud.
Ejemplo mínimo mediante curl:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [
{"role": "user", "content": "Explica la diferencia entre MoE y modelos dense"}
]
}'La misma solicitud con Python a través de la librería openai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://gate.joingonka.ai/v1",
)
response = client.chat.completions.create(
model="moonshotai/Kimi-K2.6",
messages=[{"role": "user", "content": "Hola, Kimi"}],
)
print(response.choices[0].message.content)Streaming (Server-Sent Events) — para interfaces interactivas y chats donde se desea mostrar la respuesta a medida que se genera:
stream = client.chat.completions.create(
model="moonshotai/Kimi-K2.6",
messages=[{"role": "user", "content": "Escribe un ensayo sobre MoE"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)El coste de Kimi K2.6 es el mismo: $0.0047 por 1 millón de tokens, una tarifa plana de la red. Esto es aproximadamente 800 veces más barato que GPT-5.5 y unas 500 veces más barato que Claude Sonnet 4.6. Al registrarte en JoinGonka Gateway, obtienes 1.5M de tokens gratuitos para probar cualquier modelo de la red; esto es suficiente para probar el modelo sin necesidad de tarjeta o para realizar decenas de miles de solicitudes normales.
Compatibilidad con herramientas de desarrollo: todo lo que funciona con la API de OpenAI, funciona también con Kimi a través del Gateway. A nivel de modelo, basta con cambiar el parámetro model:
- Cursor: en la configuración de Custom Model, especifica
moonshotai/Kimi-K2.6 - Claude Code: variable de entorno
ANTHROPIC_MODELo el flag--model - OpenClaw, Cline, Continue.dev: en la configuración de CustomChatModel, cambia el nombre del modelo
- LangChain, n8n: parámetro
modelen la inicialización del cliente - Open WebUI, LibreChat: el modelo aparece en la lista desplegable tras añadir Gonka como proveedor personalizado
La lista de modelos disponibles siempre está actualizada en el endpoint GET /v1/models de tu instancia Gateway; desde allí es práctico obtenerla dinámicamente en la UI de tu aplicación para que los usuarios vean la lista completa y puedan elegir el modelo ellos mismos.
El chat de demostración en la página /try en el momento de la publicación utiliza uno de los modelos activos de la red; el selector multi-modelo en el widget se encuentra en el roadmap. Para probar Kimi ahora mismo, utiliza la Gateway API: los 1.5M tokens gratuitos son suficientes para probar el modelo sin tarjeta. Si recibes la respuesta 429 too many concurrent requests, es una fase normal para un modelo nuevo en las primeras etapas de crecimiento de la red Gonka. Simplemente repite la solicitud después de unos segundos o espera a un momento de menor carga.
Qué sigue para la red Gonka: el éxito de DevShards para Kimi abre el camino a otros modelos. En las discusiones de la comunidad se mencionan DeepSeek-V3/R1, Llama 4 y modelos especializados en código. Cada nuevo modelo es un nuevo shard, nuevos hosts, nuevas posibilidades para los usuarios y una nueva fuente de ingresos para los proveedores de GPU. La arquitectura multi-modelo también es estratégica: una red vinculada a un solo modelo es fundamentalmente frágil (el lanzamiento de una nueva versión supone una crisis de migración), mientras que una red capaz de mantener varios modelos simultáneamente evoluciona de forma suave y continua.
La misma Kimi K2.6 a través de OpenRouter cuesta $0.684/$3.42 por 1M, frente a $0.0047 en JoinGonka (cientos de veces más caro).
¿Quieres saber más?
Explora otras secciones o empieza a ganar GNK ahora mismo.
Probar Kimi K2.6 a través del Gateway →