Secciones de la base de conocimientos ▾
Navegación
▸ Empiece aquí Por rolesCategorías
- Arquitectura de red de Gonka: Sprint, Agentes de Transferencia, DiLoCo
- Desarrolladores: Cómo ganar GNK
- Autoalojamiento: Guía paso a paso
- Elección de GPU para Gonka: recomendaciones de hardware
- Qwen3-235B: el modelo que Gonka servía anteriormente
- Kimi K2.6: el segundo modelo de la red Gonka
- MiniMax M2.7: modelo de la red Gonka
- DeepSeek V4 Flash: modelo de la red Gonka con contexto de 380K
Tecnología
Qwen3-235B: el modelo que Gonka servía anteriormente
¿Qué es Qwen3-235B?
Qwen3-235B-A22B-Instruct-2507-FP8 es un gran modelo de lenguaje (LLM) de la familia Qwen3, desarrollado por el equipo de Qwen en Alibaba Cloud. El nombre completo se desglosa así: Qwen3 — tercera generación de la serie, 235B — 235 mil millones de parámetros en total, A22B — 22 mil millones de parámetros activos por cada solicitud, Instruct — versión entrenada para seguir instrucciones, 2507 — lanzamiento de julio de 2025, FP8 — cuantificación de 8 bits para optimización de memoria.
La característica arquitectónica clave es MoE (Mixture of Experts). A diferencia de los modelos “densos” (GPT-5.5, Claude Sonnet 4.6), donde cada token pasa por todos los parámetros, un modelo MoE activa para cada solicitud solo un subconjunto de “expertos” — bloques especializados de la red neuronal. En el caso de Qwen3-235B, de los 235 mil millones de parámetros, solo 22 mil millones se activan por cada token — menos del 10%. Esto proporciona una calidad de nivel de modelos de 200B+ parámetros con costos computacionales de un modelo de 22B.
Prácticamente, esto significa: el modelo es más inteligente de lo que cabría esperar de su velocidad. Procesa solicitudes significativamente más rápido que los modelos densos de calidad comparable, mientras que requiere mucho menos VRAM para la inferencia. Por eso MoE se ha convertido en la arquitectura dominante para los modelos más grandes de 2025-2026.
La ventana de contexto de Qwen3-235B es de 131.072 tokens (~100.000 palabras), lo que es suficiente para analizar libros enteros, bases de código o documentos legales extensos en una sola solicitud. El modelo es compatible con 119 idiomas, incluidos ruso, inglés, chino, árabe, hindi y decenas de otros, lo que lo convierte en uno de los modelos multilingües más versátiles del mercado.
Características y puntos de referencia
Qwen3-235B compite con los modelos cerrados y abiertos más grandes. Aquí tienes una comparación de las características clave:
| Modelo | Parámetros | Contexto | MoE | Open Source | Precio (por 1M de tokens) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B activos) | 131K | Sí | Sí (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (estimado) | 128K | Sí (presunto) | No | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | No revelado | 200K | No (presunto) | No | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B activos) | 1M | Sí | Sí (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B activos) | 128K | Sí | Sí (MIT) | $0.55 |
Qwen3-235B demuestra un nivel de calidad comparable a GPT-5.5 y Claude Sonnet 4.6 en la mayoría de benchmarks, mientras que, como modelo MoE open-weights, es significativamente más barato que los análogos propietarios: la arquitectura MoE activa solo una parte de los parámetros por solicitud y reduce drásticamente los costes computacionales. Ese mismo principio de inference descentralizado y barato es el que la red Gonka aplica hoy a sus modelos actuales — Kimi K2.6 y MiniMax M2.7, disponibles a través de JoinGonka Gateway por $0.0047 por 1M de tokens (cientos a miles de veces más barato que GPT-5.5 y Claude).
En los benchmarks MMLU-Pro, HumanEval, MATH-500 y GSM8K, el modelo se sitúa entre los tres mejores modelos open-source, cediendo solo ante DeepSeek-R1 en tareas de razonamiento matemático (reasoning). En tareas de generación de código, traducción y seguimiento de instrucciones, Qwen3-235B supera constantemente a Llama 4 Maverick y es comparable a Claude Sonnet 4.6.
Cómo Gonka utilizaba Qwen3-235B
Cuando Qwen3-235B era el modelo principal de la red, operaba en la red Gonka de forma distribuida, mediante el protocolo DiLoCo, adaptado para inferencia. El modelo completo en formato FP8 requiere cerca de 640 GB de memoria de video (VRAM), lo cual es imposible de alojar en una sola GPU; incluso una H100 80GB o una H200 141GB no son suficientes. Por lo tanto, el modelo se dividía por capas (paralelismo de tensores + paralelismo de tuberías) entre múltiples ML-nodes.
En la práctica, Qwen3-235B funcionaba en un clúster de 8 a 16 GPU-nodes, cada uno con al menos 40 GB de VRAM. Los Transfer Agents enrutaban la solicitud al clúster correspondiente, vLLM en cada nodo procesaba su fragmento del modelo, y los resultados se agregaban y devolvían al usuario. Todo el proceso tomaba cientos de milisegundos; el usuario no sentía que su solicitud fuera procesada por una decena de GPU en diferentes puntos del planeta. La red aplica el mismo principio de inferencia distribuida actualmente a los modelos en uso.
Un detalle técnico importante: Gonka utiliza vLLM como motor de servicio. vLLM es un proyecto de código abierto que proporciona una generación de texto de alto rendimiento mediante PagedAttention, un algoritmo que optimiza el uso de la memoria de video al procesar múltiples solicitudes en paralelo. Esto permite que la red atienda a miles de usuarios simultáneos sin degradación de la calidad.
El modelo admite tool calling nativo, es decir, la invocación de funciones y herramientas directamente desde la respuesta del modelo. Esta capacidad se añadió a Gonka mediante el PR #767 con un umbral de 0.958 para la detección de llamadas a herramientas. En Qwen3-235B, esto permitía a los desarrolladores crear agentes de IA que interactúan con API externas, bases de datos y herramientas, todo a través de una única solicitud. La compatibilidad con tool calling se mantiene en los modelos actuales de la red.
La red Gonka cuenta con más de 4 000 GPU (H100, H200, A100, RTX 4090 y otros), combinados en más de 120 ML-nodes. Es una de las redes de GPU distribuidas para inferencia de IA más grandes del mundo; y aunque antes esta potencia estaba dirigida a Qwen3-235B, hoy en día sirve a los modelos activos de la red: Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash.
¿Es posible probar Qwen3-235B ahora?
Respuesta directa: a través de la red Gonka, ya no. Qwen3-235B ha sido retirada de la red, por lo que ya no es posible invocarla mediante el identificador qwen3-235b-a22b a través de nuestro Gateway. Dado que el modelo es abierto (Apache 2.0), todavía puede ejecutarlo usted mismo o acceder a él a través de servicios de alojamiento de terceros para modelos open-weights, como OpenRouter (aproximadamente $0.071/$0.100 por 1M de tokens).
Si lo que busca es ese inference descentralizado de bajo coste por el que la gente elige Gonka, sigue ahí; simplemente ahora funciona con los modelos activos de la red. A través de JoinGonka API Gateway están disponibles Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash mediante una API compatible con OpenAI: cualquier código escrito para OpenAI funciona sin cambios; basta con sustituir la URL, la API-key y el nombre del modelo.
Ejemplo de solicitud a un modelo activo:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Explica la arquitectura MoE"}]
}'Coste: $0.0047 por 1 millón de tokens — esto es ~800 veces más barato que GPT-5.5 ($5.00/1M) y ~500 veces más barato que Claude Sonnet 4.6 ($3.00/1M). Al registrarse, recibe 1.5M de tokens gratis para pruebas.
El Gateway es compatible con herramientas de desarrollo populares: Quick Start describe la conexión mediante Python, Node.js y curl. También son compatibles las integraciones con IDE (Cursor, Continue, Cline, Aider y Claude Code) y frameworks para agentes de IA (LangChain, n8n, LibreChat, Open WebUI).
Para comenzar rápidamente:
- Regístrese en gate.joingonka.ai (conecte su billetera o cree una nueva)
- Obtenga su API-key en el Dashboard
- Sustituya
api.openai.comporgate.joingonka.ai/apien su código - Especifique el modelo de red actual:
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7odeepseek-ai/DeepSeek-V4-Flash-0731(lista completa en el endpointGET /v1/models)
El inference descentralizado de nivel enterprise a precio de proyecto hobby sigue existiendo; Qwen3-235B solo ha dejado paso a modelos de red más recientes. La misma combinación de precio y calidad ahora funciona en Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash.
¿Quieres saber más?
Explora otras secciones o empieza a ganar GNK ahora mismo.
Probar los modelos actuales de Gonka →