Secciones de la base de conocimientos ▾

Tecnología

Qwen3-235B: el modelo que Gonka servía anteriormente

La red Gonka no solo alquila GPU; presta servicios de modelos de IA para inferencia. Durante mucho tiempo, el modelo principal y único de la red fue Qwen3-235B-A22B-Instruct, desarrollado por Alibaba Cloud. Con el tiempo, la red pasó a una arquitectura multimodelo y Qwen3-235B fue retirada de la red: hoy en día, Gonka sirve a Kimi K2.6 de Moonshot AI, MiniMax M2.7 y DeepSeek V4 Flash. Analicemos qué es Qwen3-235B, qué papel desempeñó en la red Gonka y por qué fue sustituido; como modelo MoE de código abierto notable, sigue siendo una referencia útil.

¿Qué es Qwen3-235B?

Qwen3-235B-A22B-Instruct-2507-FP8 es un gran modelo de lenguaje (LLM) de la familia Qwen3, desarrollado por el equipo de Qwen en Alibaba Cloud. El nombre completo se desglosa así: Qwen3 — tercera generación de la serie, 235B — 235 mil millones de parámetros en total, A22B — 22 mil millones de parámetros activos por cada solicitud, Instruct — versión entrenada para seguir instrucciones, 2507 — lanzamiento de julio de 2025, FP8 — cuantificación de 8 bits para optimización de memoria.

La característica arquitectónica clave es MoE (Mixture of Experts). A diferencia de los modelos “densos” (GPT-5.5, Claude Sonnet 4.6), donde cada token pasa por todos los parámetros, un modelo MoE activa para cada solicitud solo un subconjunto de “expertos” — bloques especializados de la red neuronal. En el caso de Qwen3-235B, de los 235 mil millones de parámetros, solo 22 mil millones se activan por cada token — menos del 10%. Esto proporciona una calidad de nivel de modelos de 200B+ parámetros con costos computacionales de un modelo de 22B.

Prácticamente, esto significa: el modelo es más inteligente de lo que cabría esperar de su velocidad. Procesa solicitudes significativamente más rápido que los modelos densos de calidad comparable, mientras que requiere mucho menos VRAM para la inferencia. Por eso MoE se ha convertido en la arquitectura dominante para los modelos más grandes de 2025-2026.

La ventana de contexto de Qwen3-235B es de 131.072 tokens (~100.000 palabras), lo que es suficiente para analizar libros enteros, bases de código o documentos legales extensos en una sola solicitud. El modelo es compatible con 119 idiomas, incluidos ruso, inglés, chino, árabe, hindi y decenas de otros, lo que lo convierte en uno de los modelos multilingües más versátiles del mercado.

Características y puntos de referencia

Qwen3-235B compite con los modelos cerrados y abiertos más grandes. Aquí tienes una comparación de las características clave:

ModeloParámetrosContextoMoEOpen SourcePrecio (por 1M de tokens)
Qwen3-235B (Alibaba)235B (22B activos)131KSí (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (estimado)128KSí (presunto)No$5.00
Claude Sonnet 4.6 (Anthropic)No revelado200KNo (presunto)No$3.00
Llama 4 Maverick (Meta)400B (17B activos)1MSí (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B activos)128KSí (MIT)$0.55

Qwen3-235B demuestra un nivel de calidad comparable a GPT-5.5 y Claude Sonnet 4.6 en la mayoría de benchmarks, mientras que, como modelo MoE open-weights, es significativamente más barato que los análogos propietarios: la arquitectura MoE activa solo una parte de los parámetros por solicitud y reduce drásticamente los costes computacionales. Ese mismo principio de inference descentralizado y barato es el que la red Gonka aplica hoy a sus modelos actuales — Kimi K2.6 y MiniMax M2.7, disponibles a través de JoinGonka Gateway por $0.0047 por 1M de tokens (cientos a miles de veces más barato que GPT-5.5 y Claude).

En los benchmarks MMLU-Pro, HumanEval, MATH-500 y GSM8K, el modelo se sitúa entre los tres mejores modelos open-source, cediendo solo ante DeepSeek-R1 en tareas de razonamiento matemático (reasoning). En tareas de generación de código, traducción y seguimiento de instrucciones, Qwen3-235B supera constantemente a Llama 4 Maverick y es comparable a Claude Sonnet 4.6.

Cómo Gonka utilizaba Qwen3-235B

Cuando Qwen3-235B era el modelo principal de la red, operaba en la red Gonka de forma distribuida, mediante el protocolo DiLoCo, adaptado para inferencia. El modelo completo en formato FP8 requiere cerca de 640 GB de memoria de video (VRAM), lo cual es imposible de alojar en una sola GPU; incluso una H100 80GB o una H200 141GB no son suficientes. Por lo tanto, el modelo se dividía por capas (paralelismo de tensores + paralelismo de tuberías) entre múltiples ML-nodes.

En la práctica, Qwen3-235B funcionaba en un clúster de 8 a 16 GPU-nodes, cada uno con al menos 40 GB de VRAM. Los Transfer Agents enrutaban la solicitud al clúster correspondiente, vLLM en cada nodo procesaba su fragmento del modelo, y los resultados se agregaban y devolvían al usuario. Todo el proceso tomaba cientos de milisegundos; el usuario no sentía que su solicitud fuera procesada por una decena de GPU en diferentes puntos del planeta. La red aplica el mismo principio de inferencia distribuida actualmente a los modelos en uso.

Un detalle técnico importante: Gonka utiliza vLLM como motor de servicio. vLLM es un proyecto de código abierto que proporciona una generación de texto de alto rendimiento mediante PagedAttention, un algoritmo que optimiza el uso de la memoria de video al procesar múltiples solicitudes en paralelo. Esto permite que la red atienda a miles de usuarios simultáneos sin degradación de la calidad.

El modelo admite tool calling nativo, es decir, la invocación de funciones y herramientas directamente desde la respuesta del modelo. Esta capacidad se añadió a Gonka mediante el PR #767 con un umbral de 0.958 para la detección de llamadas a herramientas. En Qwen3-235B, esto permitía a los desarrolladores crear agentes de IA que interactúan con API externas, bases de datos y herramientas, todo a través de una única solicitud. La compatibilidad con tool calling se mantiene en los modelos actuales de la red.

La red Gonka cuenta con más de 4 000 GPU (H100, H200, A100, RTX 4090 y otros), combinados en más de 120 ML-nodes. Es una de las redes de GPU distribuidas para inferencia de IA más grandes del mundo; y aunque antes esta potencia estaba dirigida a Qwen3-235B, hoy en día sirve a los modelos activos de la red: Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash.

¿Es posible probar Qwen3-235B ahora?

Respuesta directa: a través de la red Gonka, ya no. Qwen3-235B ha sido retirada de la red, por lo que ya no es posible invocarla mediante el identificador qwen3-235b-a22b a través de nuestro Gateway. Dado que el modelo es abierto (Apache 2.0), todavía puede ejecutarlo usted mismo o acceder a él a través de servicios de alojamiento de terceros para modelos open-weights, como OpenRouter (aproximadamente $0.071/$0.100 por 1M de tokens).

Si lo que busca es ese inference descentralizado de bajo coste por el que la gente elige Gonka, sigue ahí; simplemente ahora funciona con los modelos activos de la red. A través de JoinGonka API Gateway están disponibles Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash mediante una API compatible con OpenAI: cualquier código escrito para OpenAI funciona sin cambios; basta con sustituir la URL, la API-key y el nombre del modelo.

Ejemplo de solicitud a un modelo activo:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Explica la arquitectura MoE"}]
  }'

Coste: $0.0047 por 1 millón de tokens — esto es ~800 veces más barato que GPT-5.5 ($5.00/1M) y ~500 veces más barato que Claude Sonnet 4.6 ($3.00/1M). Al registrarse, recibe 1.5M de tokens gratis para pruebas.

El Gateway es compatible con herramientas de desarrollo populares: Quick Start describe la conexión mediante Python, Node.js y curl. También son compatibles las integraciones con IDE (Cursor, Continue, Cline, Aider y Claude Code) y frameworks para agentes de IA (LangChain, n8n, LibreChat, Open WebUI).

Para comenzar rápidamente:

  1. Regístrese en gate.joingonka.ai (conecte su billetera o cree una nueva)
  2. Obtenga su API-key en el Dashboard
  3. Sustituya api.openai.com por gate.joingonka.ai/api en su código
  4. Especifique el modelo de red actual: moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 o deepseek-ai/DeepSeek-V4-Flash-0731 (lista completa en el endpoint GET /v1/models)

El inference descentralizado de nivel enterprise a precio de proyecto hobby sigue existiendo; Qwen3-235B solo ha dejado paso a modelos de red más recientes. La misma combinación de precio y calidad ahora funciona en Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash.

Qwen3-235B-A22B — un modelo MoE con 235 mil millones de parámetros (22 mil millones activos) de Alibaba Cloud, que fue el modelo principal de la red Gonka en su etapa inicial para inferencia de IA descentralizada. Gracias a su arquitectura MoE, ofrece una calidad al nivel de los mejores modelos propietarios con un coste computacional significativamente menor. Actualmente, Qwen3-235B ha sido retirado de la red: los modelos actuales de Gonka son Kimi K2.6, MiniMax M2.7 y DeepSeek V4 Flash, disponibles a través de JoinGonka Gateway mediante una API compatible con OpenAI por $0.0047/1M de tokens. Qwen3-235B sigue siendo de código abierto (Apache 2.0) y está disponible en proveedores externos de modelos open-weights.

¿Quieres saber más?

Explora otras secciones o empieza a ganar GNK ahora mismo.

Probar los modelos actuales de Gonka →