Bilgi Tabanı Bölümleri ▾

Teknoloji

Qwen3-235B: Daha önce Gonka'nın sunduğu model

Gonka ağı sadece GPU kiralamakla kalmaz — inference için AI modellerine hizmet verir. Uzun süre ağın ana ve tek modeli, Alibaba Cloud tarafından geliştirilen Qwen3-235B-A22B-Instruct idi. Zamanla ağ çoklu model mimarisine geçiş yaptı ve Qwen3-235B ağdan çıkarıldı: bugün Gonka, Moonshot AI'dan Kimi K2.6 ve MiniMax M2.7 modellerine hizmet vermektedir. Qwen3-235B'nin ne olduğunu, Gonka ağında nasıl bir rol oynadığını ve yerine neyin geçtiğini inceleyeceğiz — önemli bir açık kaynak MoE modeli olarak faydalı bir referans olmaya devam ediyor.

Qwen3-235B nedir

Qwen3-235B-A22B-Instruct-2507-FP8, Alibaba Cloud'daki Qwen ekibi tarafından geliştirilen Qwen3 ailesinin büyük bir dil modelidir (LLM). Tam adı şöyle açıklanır: Qwen3 — serinin üçüncü nesli, 235B — toplam 235 milyar parametre, A22B — her istekte 22 milyar aktif parametre, Instruct — talimatları takip etmek üzere eğitilmiş sürüm, 2507 — Temmuz 2025 sürümü, FP8 — bellek optimizasyonu için 8 bit nicemleme.

Temel mimari özellik – MoE (Mixture of Experts). Her token'ın tüm parametrelerden geçtiği “yoğun” modellerin (GPT-5.5, Claude Sonnet 4.6) aksine, MoE modeli her istek için yalnızca bir dizi “uzmanı” – sinir ağının özel bloklarını – etkinleştirir. Qwen3-235B durumunda, 235 milyar parametreden her token için yalnızca 22 milyar etkinleştirilir – %10'dan az. Bu, 22B'lik bir modelin hesaplama maliyetleriyle 200B+ parametreli modellere eşit kalite sağlar.

Pratikte bu, modelin hızından beklenenden daha akıllı olduğu anlamına gelir. Benzer kalitedeki yoğun modellerden önemli ölçüde daha hızlı istekleri işlerken, çıkarım için çok daha az VRAM gerektirir. MoE'nin 2025-2026 yıllarının en büyük modelleri için baskın mimari haline gelmesinin nedeni budur.

Qwen3-235B'nin bağlam penceresi 131.072 token'dır (yaklaşık 100.000 kelime) – bu, tek bir istekte bütün kitapları, kod tabanlarını veya uzun hukuki belgeleri analiz etmek için yeterlidir. Model, Rusça, İngilizce, Çince, Arapça, Hintçe ve onlarca diğerleri dahil 119 dili destekler – bu da onu piyasadaki en çok dilli modellerden biri yapar.

Özellikler ve Benchmarklar

Qwen3-235B, en büyük kapalı ve açık modellerle rekabet ediyor. İşte temel özelliklerin karşılaştırması:

ModelParametrelerBağlamMoEOpen SourceFiyat (1M token başına)
Qwen3-235B (Alibaba)235B (22B aktif)131KEvetEvet (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (tahmini)128KEvet (tahmini)Hayır$5.00
Claude Sonnet 4.6 (Anthropic)Açıklanmadı200KHayır (tahmini)Hayır$3.00
Llama 4 Maverick (Meta)400B (17B aktif)1MEvetEvet (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B aktif)128KEvetEvet (MIT)$0.55

Qwen3-235B, çoğu benchmarkta GPT-5.5 ve Claude Sonnet 4.6 ile karşılaştırılabilir bir kalite düzeyi sergiliyor; bir açık ağırlıklı (open-weights) MoE modeli olarak tescilli emsallerinden kat kat daha ucuza mal oluyor: MoE mimarisi, sorgu başına sadece parametrelerin bir kısmını etkinleştirerek işlem maliyetlerini ciddi oranda düşürüyor. Gonka ağı aynı ucuz merkeziyetsiz inference prensibini bugün aktif modelleri olan Kimi K2.6 ve MiniMax M2.7'ye de uygulamaktadır; JoinGonka Gateway üzerinden 1M token başına $0.003 ile (GPT-5.5 ve Claude'dan binlerce kat daha ucuz) erişilebilmektedir.

MMLU-Pro, HumanEval, MATH-500 ve GSM8K benchmarklarında, model en iyi 3 açık kaynaklı model arasında yer alıyor ve matematiksel muhakeme (reasoning) görevlerinde sadece DeepSeek-R1'in gerisinde kalıyor. Kod üretimi, çeviri ve talimat takip görevlerinde Qwen3-235B istikrarlı bir şekilde Llama 4 Maverick'in önünde ve Claude Sonnet 4.6 ile benzer seviyededir.

Gonka Qwen3-235B'yi nasıl kullandı

Qwen3-235B, ağın ana modeli iken Gonka ağı içinde, inference için uyarlanmış DiLoCo protokolü aracılığıyla dağıtık bir şekilde çalışıyordu. FP8 formatındaki tam model, yaklaşık 640 GB video belleği (VRAM) gerektirir ki bu, tek bir GPU'ya sığdırılması imkansızdır; hatta H100 80GB veya H200 141GB bile yeterli değildir. Bu nedenle model, birden fazla ML-node arasında katmanlara (tensor parallelism + pipeline parallelism) bölünmüştür.

Pratikte Qwen3-235B, her biri en az 40 GB VRAM'e sahip 8-16 GPU-node'luk bir kümede çalışıyordu. Transfer Agent'lar isteği doğru kümeye yönlendiriyor, her bir node'daki vLLM modelin kendi bölümünü işliyor, sonuçlar birleştiriliyor ve kullanıcıya geri döndürülüyordu. Tüm süreç yüzlerce milisaniye sürüyordu; kullanıcı, isteğinin dünyanın farklı noktalarındaki düzinelerce GPU tarafından işlendiğini fark etmiyordu. Ağ, aynı dağıtık inference prensibini şu anda aktif modeller için de uyguluyor.

Önemli bir teknik detay: Gonka, serving motoru olarak vLLM kullanır. vLLM, birçok isteğin paralel işlenmesi sırasında video belleği kullanımını optimize eden PagedAttention algoritması aracılığıyla yüksek performanslı metin üretimi sağlayan açık kaynaklı bir projedir. Bu, ağın kalite kaybı olmadan binlerce eşzamanlı kullanıcıya hizmet vermesini sağlar.

Model, yerel tool calling özelliğini destekler; yani modelin yanıtından doğrudan fonksiyon ve araç çağrımı yapabilir. Bu yetenek, Gonka'ya araç çağrılarını tanımlamak için 0.958 eşik değeri ile PR #767 aracılığıyla eklenmiştir. Qwen3-235B üzerinde bu, geliştiricilerin dış API'ler, veritabanları ve araçlarla tek bir istek üzerinden etkileşime giren AI-ajanlar oluşturmasına olanak tanıyordu. Tool calling desteği, ağın mevcut modellerinde de korunmuştur.

Gonka ağı, 120'den fazla ML-node'da birleştirilmiş 4 000'den fazla GPU (H100, H200, A100, RTX 4090 ve diğerleri) içerir. Bu, AI inference için dünyanın en büyük dağıtık GPU ağlarından biridir ve bu güç eskiden Qwen3-235B'ye odaklanmışken, bugün ağın mevcut modelleri olan Kimi K2.6 ve MiniMax M2.7'ye hizmet vermektedir.

Qwen3-235B'yi şimdi denemek mümkün mü

Net cevap: Gonka ağı üzerinden artık hayır. Qwen3-235B ağdan kaldırıldı, bu nedenle qwen3-235b-a22b tanımlayıcısı ile Gateway üzerinden çağırmanız artık mümkün değil. Model açık (Apache 2.0) olduğu için yine de kendi başınıza çalıştırabilir veya üçüncü taraf open-weights model hosting servislerine (örneğin OpenRouter: yaklaşık 1M token başına $0.071/$0.100) başvurabilirsiniz.

Eğer Gonka'ya gelmenizi sağlayan o ucuz merkeziyetsiz inference'ı arıyorsanız, o hâlâ yerinde duruyor, sadece artık ağın mevcut modelleri üzerinde çalışıyor. JoinGonka API Gateway üzerinden Kimi K2.6 ve MiniMax M2.7 modellerine OpenAI uyumlu API ile erişebilirsiniz: OpenAI için yazılmış herhangi bir kod değişiklik yapmadan çalışır; sadece URL'yi, API anahtarını (API key) ve model adını değiştirmeniz yeterlidir.

Mevcut bir modele sorgu örneği:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "MoE mimarisini açıkla"}]
  }'

Maliyet: 1 milyon token başına $0.003 — bu, GPT-5.5'ten ($5.00/1M) 1.700 kat ve Claude Sonnet 4.6'dan ($3.00/1M) 1.000 kat daha ucuzdur. Kayıt olduğunuzda test etmeniz için 10 milyon ücretsiz token alırsınız.

Gateway popüler geliştirme araçlarıyla uyumludur: Quick Start, Python, Node.js ve curl üzerinden bağlantıyı açıklar. Ayrıca IDE entegrasyonları — Cursor, Continue, Cline, Aider ve Claude Code — ve AI ajanları için frameworkler (LangChain, n8n, LibreChat, Open WebUI) desteklenmektedir.

Hızlı başlangıç için:

  1. gate.joingonka.ai adresinde kaydolun (cüzdanınızı bağlayın veya yeni bir tane oluşturun)
  2. Dashboard'dan API anahtarınızı alın
  3. Kodunuzda api.openai.com yerine gate.joingonka.ai/api yazın
  4. Güncel ağ modelini belirtin — moonshotai/Kimi-K2.6 veya MiniMaxAI/MiniMax-M2.7 (tam liste GET /v1/models endpoint'inde mevcuttur)

Enterprise seviyesinde merkeziyetsiz inference, hobi projesi fiyatına — Qwen3-235B sadece yerini ağın daha yeni modellerine bıraktı. Aynı fiyat-kalite dengesi şimdi Kimi K2.6 ve MiniMax M2.7 ile çalışıyor.

Qwen3-235B-A22B, Alibaba Cloud tarafından geliştirilen, 235 milyar parametreli (22 milyar aktif) ve merkeziyetsiz AI inference için Gonka ağının erken aşamalarında ana model olarak kullanılan bir MoE modelidir. MoE mimarisi sayesinde, çok daha düşük bilişim maliyetiyle önde gelen tescilli modeller seviyesinde kalite sağlar. Şu anda Qwen3-235B ağdan çıkarılmıştır: Mevcut Gonka modelleri, JoinGonka Gateway üzerinden OpenAI uyumlu API ile 1M token başına $0.003 maliyetle erişilebilen Kimi K2.6 ve MiniMax M2.7'dir. Qwen3-235B'nin kendisi açık kaynaklı (Apache 2.0) kalmaya devam etmekte ve open-weights modellerini barındıran üçüncü taraf platformlarda mevcuttur.

Daha fazla bilgi edinmek ister misiniz?

Diğer bölümleri keşfedin veya şimdi GNK kazanmaya başlayın.

Güncel Gonka modellerini deneyin →