Secciones de la base de conocimientos ▾
Navegación
▸ Empiece aquí Por rolesCategorías
- Arquitectura de red de Gonka: Sprint, Agentes de Transferencia, DiLoCo
- Desarrolladores: Cómo ganar GNK
- Autoalojamiento: Guía paso a paso
- Elección de GPU para Gonka: recomendaciones de hardware
- Qwen3-235B: el modelo que Gonka servía anteriormente
- Kimi K2.6: el segundo modelo de la red Gonka
- MiniMax M2.7: modelo de la red Gonka
Tecnología
Qwen3-235B: el modelo que Gonka servía anteriormente
¿Qué es Qwen3-235B?
Qwen3-235B-A22B-Instruct-2507-FP8 es un gran modelo de lenguaje (LLM) de la familia Qwen3, desarrollado por el equipo de Qwen en Alibaba Cloud. El nombre completo se desglosa así: Qwen3 — tercera generación de la serie, 235B — 235 mil millones de parámetros en total, A22B — 22 mil millones de parámetros activos por cada solicitud, Instruct — versión entrenada para seguir instrucciones, 2507 — lanzamiento de julio de 2025, FP8 — cuantificación de 8 bits para optimización de memoria.
La característica arquitectónica clave es MoE (Mixture of Experts). A diferencia de los modelos “densos” (GPT-5.5, Claude Sonnet 4.6), donde cada token pasa por todos los parámetros, un modelo MoE activa para cada solicitud solo un subconjunto de “expertos” — bloques especializados de la red neuronal. En el caso de Qwen3-235B, de los 235 mil millones de parámetros, solo 22 mil millones se activan por cada token — menos del 10%. Esto proporciona una calidad de nivel de modelos de 200B+ parámetros con costos computacionales de un modelo de 22B.
Prácticamente, esto significa: el modelo es más inteligente de lo que cabría esperar de su velocidad. Procesa solicitudes significativamente más rápido que los modelos densos de calidad comparable, mientras que requiere mucho menos VRAM para la inferencia. Por eso MoE se ha convertido en la arquitectura dominante para los modelos más grandes de 2025-2026.
La ventana de contexto de Qwen3-235B es de 131.072 tokens (~100.000 palabras), lo que es suficiente para analizar libros enteros, bases de código o documentos legales extensos en una sola solicitud. El modelo es compatible con 119 idiomas, incluidos ruso, inglés, chino, árabe, hindi y decenas de otros, lo que lo convierte en uno de los modelos multilingües más versátiles del mercado.
Características y puntos de referencia
Qwen3-235B compite con los modelos cerrados y abiertos más importantes. Aquí una comparación de sus características clave:
| Modelo | Parámetros | Contexto | MoE | Open Source | Precio (por 1M de tokens) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B activos) | 131K | Sí | Sí (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (estimado) | 128K | Sí (supuesto) | No | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | No revelado | 200K | No (supuesto) | No | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B activos) | 1M | Sí | Sí (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B activos) | 128K | Sí | Sí (MIT) | $0.55 |
Qwen3-235B demuestra un nivel de calidad comparable a GPT-5.5 y Claude Sonnet 4.6 en la mayoría de benchmarks; siendo un modelo MoE de pesos abiertos, resulta significativamente más barato que sus alternativas propietarias: la arquitectura MoE activa solo una parte de los parámetros por consulta, reduciendo drásticamente los costos computacionales. La red Gonka aplica hoy este mismo principio de inferencia descentralizada económica a sus modelos actuales — Kimi K2.6 y MiniMax M2.7, disponibles a través de JoinGonka Gateway por $0.003 por 1M de tokens (miles de veces más barato que GPT-5.5 y Claude).
En benchmarks como MMLU-Pro, HumanEval, MATH-500 y GSM8K, el modelo se sitúa entre los tres mejores modelos open-source, superado solo por DeepSeek-R1 en tareas de razonamiento matemático (reasoning). En tareas de generación de código, traducción y seguimiento de instrucciones, Qwen3-235B supera consistentemente a Llama 4 Maverick y es comparable a Claude Sonnet 4.6.
Cómo Gonka utilizaba Qwen3-235B
Cuando Qwen3-235B era el modelo principal de la red, operaba en la red Gonka de forma distribuida, a través del protocolo DiLoCo, adaptado para inference. El modelo completo en formato FP8 requiere alrededor de 640 GB de VRAM (VRAM), lo cual es imposible de alojar en una sola GPU: incluso una H100 de 80 GB o una H200 de 141 GB son insuficientes. Por lo tanto, el modelo se dividía por capas (tensor parallelism + pipeline parallelism) entre varias ML-nodos.
En la práctica, Qwen3-235B funcionaba en un clúster de 8 a 16 GPU-nodos, cada uno con al menos 40 GB de VRAM. Los Transfer Agents enrutaban la solicitud al clúster adecuado, vLLM en cada nodo procesaba su fragmento del modelo, y los resultados se agregaban y devolvían al usuario. Todo el proceso tomaba cientos de milisegundos; el usuario no sentía que su solicitud era procesada por una docena de GPU en distintos puntos del planeta. La red aplica el mismo principio de inference distribuida actualmente con los modelos activos.
Un detalle técnico importante: Gonka utiliza vLLM como motor para el serving. vLLM es un proyecto de código abierto que proporciona una generación de texto de alto rendimiento a través de PagedAttention, un algoritmo que optimiza el uso de la memoria de video durante el procesamiento paralelo de múltiples solicitudes. Esto permite a la red atender a miles de usuarios simultáneos sin degradación de la calidad.
El modelo admite tool calling nativo, la invocación de funciones y herramientas directamente desde la respuesta del modelo. Esta capacidad se añadió a Gonka a través del PR #767 con un umbral de 0.958 para la detección de invocaciones de herramientas. En Qwen3-235B, esto permitía a los desarrolladores construir agentes de IA que interactuaban con API externas, bases de datos y herramientas, todo mediante una única solicitud. El soporte para tool calling se ha mantenido en los modelos vigentes de la red.
La red Gonka cuenta con más de 4 000 GPU (H100, H200, A100, RTX 4090 y otras), integradas en más de 120 ML-nodos. Es una de las redes de GPU distribuidas para AI inference más grandes del mundo; si antes esta potencia estaba dirigida a Qwen3-235B, hoy sirve a los modelos activos de la red: Kimi K2.6 y MiniMax M2.7.
¿Es posible probar Qwen3-235B ahora?
Respuesta corta: a través de la red Gonka — ya no. Qwen3-235B ha sido retirada de la red, por lo que ya no es posible invocarla mediante el identificador qwen3-235b-a22b a través de nuestro Gateway. Dado que el modelo es abierto (Apache 2.0), todavía puede ejecutarlo usted mismo o acceder a él a través de hostings de modelos de pesos abiertos de terceros — por ejemplo, a través de OpenRouter (estimado en $0.071/$0.100 por 1M de tokens).
Si lo que busca es esa inferencia descentralizada económica por la que la gente elige Gonka, sigue ahí, simplemente funciona ahora con los modelos activos de la red. A través de JoinGonka API Gateway están disponibles Kimi K2.6 y MiniMax M2.7 mediante una API compatible con OpenAI: cualquier código escrito para OpenAI funciona sin cambios — solo debe sustituir la URL, la API-key y el nombre del modelo.
Ejemplo de solicitud a un modelo activo:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Explica la arquitectura MoE"}]
}'Costo: $0.003 por 1 millón de tokens — esto es 1,700 veces más barato que GPT-5.5 ($5.00/1M) y 1,000 veces más barato que Claude Sonnet 4.6 ($3.00/1M). Al registrarse, recibe 10 millones de tokens gratuitos para realizar pruebas.
La Gateway es compatible con herramientas de desarrollo populares: Quick Start describe la conexión mediante Python, Node.js y curl. También se admiten integraciones de IDE — Cursor, Continue, Cline, Aider y Claude Code — y frameworks para agentes de IA: LangChain, n8n, LibreChat, Open WebUI.
Para comenzar rápidamente:
- Regístrese en gate.joingonka.ai (conecte su billetera o cree una nueva)
- Obtenga una API-key en el Dashboard
- Reemplace
api.openai.comporgate.joingonka.ai/apien su código - Especifique el modelo actual de la red —
moonshotai/Kimi-K2.6oMiniMaxAI/MiniMax-M2.7(lista completa en el endpointGET /v1/models)
La inferencia descentralizada de nivel enterprise a precio de hobby no ha desaparecido — Qwen3-235B solo ha dejado su lugar a modelos más nuevos de la red. Esa misma relación de precio-calidad funciona ahora con Kimi K2.6 y MiniMax M2.7.
¿Quieres saber más?
Explora otras secciones o empieza a ganar GNK ahora mismo.
Probar los modelos actuales de Gonka →