Bilgi Tabanı Bölümleri ▾

Teknoloji

Qwen3-235B: Daha önce Gonka'nın sunduğu model

Gonka ağı sadece GPU kiralamakla kalmaz, aynı zamanda çıkarım (inference) için yapay zeka modellerine hizmet verir. Uzun süre ağın temel ve tek modeli, Alibaba Cloud tarafından geliştirilen Qwen3-235B-A22B-Instruct idi. Zamanla ağ çok modelli bir mimariye geçti ve Qwen3-235B ağdan çıkarıldı: bugün Gonka, Moonshot AI'dan Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash hizmetleri sunmaktadır. Qwen3-235B'nin ne olduğunu, Gonka ağında nasıl bir rol oynadığını ve yerine nelerin geçtiğini inceleyelim; önemli bir açık kaynaklı MoE modeli olarak yararlı bir referans noktası olmaya devam ediyor.

Qwen3-235B nedir

Qwen3-235B-A22B-Instruct-2507-FP8, Alibaba Cloud'daki Qwen ekibi tarafından geliştirilen Qwen3 ailesinin büyük bir dil modelidir (LLM). Tam adı şöyle açıklanır: Qwen3 — serinin üçüncü nesli, 235B — toplam 235 milyar parametre, A22B — her istekte 22 milyar aktif parametre, Instruct — talimatları takip etmek üzere eğitilmiş sürüm, 2507 — Temmuz 2025 sürümü, FP8 — bellek optimizasyonu için 8 bit nicemleme.

Temel mimari özellik – MoE (Mixture of Experts). Her token'ın tüm parametrelerden geçtiği “yoğun” modellerin (GPT-5.5, Claude Sonnet 4.6) aksine, MoE modeli her istek için yalnızca bir dizi “uzmanı” – sinir ağının özel bloklarını – etkinleştirir. Qwen3-235B durumunda, 235 milyar parametreden her token için yalnızca 22 milyar etkinleştirilir – %10'dan az. Bu, 22B'lik bir modelin hesaplama maliyetleriyle 200B+ parametreli modellere eşit kalite sağlar.

Pratikte bu, modelin hızından beklenenden daha akıllı olduğu anlamına gelir. Benzer kalitedeki yoğun modellerden önemli ölçüde daha hızlı istekleri işlerken, çıkarım için çok daha az VRAM gerektirir. MoE'nin 2025-2026 yıllarının en büyük modelleri için baskın mimari haline gelmesinin nedeni budur.

Qwen3-235B'nin bağlam penceresi 131.072 token'dır (yaklaşık 100.000 kelime) – bu, tek bir istekte bütün kitapları, kod tabanlarını veya uzun hukuki belgeleri analiz etmek için yeterlidir. Model, Rusça, İngilizce, Çince, Arapça, Hintçe ve onlarca diğerleri dahil 119 dili destekler – bu da onu piyasadaki en çok dilli modellerden biri yapar.

Özellikler ve Benchmarklar

Qwen3-235B, en büyük kapalı ve açık modellerle rekabet eder. İşte temel özelliklerin karşılaştırması:

ModelParametrelerBağlamMoEOpen SourceFiyat (1M token için)
Qwen3-235B (Alibaba)235B (22B aktif)131KEvetEvet (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (tahmini)128KEvet (varsayılan)Yok$5.00
Claude Sonnet 4.6 (Anthropic)Açıklanmadı200KYok (varsayılan)Yok$3.00
Llama 4 Maverick (Meta)400B (17B aktif)1MEvetEvet (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B aktif)128KEvetEvet (MIT)$0.55

Qwen3-235B, çoğu benchmark'ta GPT-5.5 ve Claude Sonnet 4.6 ile kıyaslanabilir bir kalite seviyesi sergilerken, open-weights MoE modeli olarak tescilli emsallerinden kat kat daha ucuza mal olur: MoE mimarisi, istek başına parametrelerin sadece bir kısmını etkinleştirerek hesaplama maliyetlerini ciddi oranda düşürür. Gonka ağı, bugün aktif modelleri olan Kimi K2.6 ve MiniMax M2.7 modelleri için de aynı ucuz merkeziyetsiz inference prensibini uygulamaktadır; bu modeller JoinGonka Gateway üzerinden 1M token başına $0.0047 fiyatla (GPT-5.5 ve Claude'dan yüzlerce-binlerce kat daha ucuz) erişilebilirdir.

MMLU-Pro, HumanEval, MATH-500 ve GSM8K benchmark'larında model, matematiksel akıl yürütme (reasoning) görevlerinde sadece DeepSeek-R1'in gerisinde kalarak en iyi 3 açık kaynak modelden biri olmuştur. Kod oluşturma, çeviri ve talimatları izleme görevlerinde Qwen3-235B, Llama 4 Maverick'i sürekli olarak geride bırakmakta ve Claude Sonnet 4.6 ile kıyaslanabilir düzeydedir.

Gonka Qwen3-235B'yi nasıl kullandı

Qwen3-235B ağın ana modeli olduğunda, Gonka ağında dağıtık bir şekilde çalışıyordu; çıkarım için uyarlanmış DiLoCo protokolü aracılığıyla. FP8 formatındaki tam model yaklaşık 640 GB video belleği (VRAM) gerektirir ki bu tek bir GPU'ya sığdırılamaz; H100 80GB veya H200 141GB bile yeterli değildir. Bu nedenle model, birkaç ML-node arasında katmanlara ayrılmıştı (tensor parallelism + pipeline parallelism).

Pratikte Qwen3-235B, her biri en az 40 GB VRAM'e sahip 8-16 GPU-node kümesi üzerinde çalışıyordu. Transfer Agent'lar isteği ilgili kümeye yönlendiriyor, her node'daki vLLM modelin kendi parçasını işliyor, sonuçlar toplanıyor ve kullanıcıya dönüyordu. Tüm süreç yüzlerce milisaniye sürüyordu; kullanıcı, isteğinin dünyanın farklı noktalarındaki düzinelerce GPU tarafından işlendiğini hissetmiyordu. Ağ, dağıtık çıkarımın aynı prensibini bugün aktif modeller için de uygulamaya devam ediyor.

Önemli bir teknik detay: Gonka, sunum motoru olarak vLLM kullanır. vLLM, çok sayıda isteğin paralel işlenmesi sırasında video belleği kullanımını optimize eden bir algoritma olan PagedAttention aracılığıyla yüksek performanslı metin üretimi sağlayan açık kaynaklı bir projedir. Bu, ağın binlerce eşzamanlı kullanıcıya kalite kaybı olmadan hizmet vermesini sağlar.

Model, yerel tool calling özelliğini destekler; yani fonksiyon ve araçların doğrudan modelin yanıtından çağrılmasıdır. Bu yetenek, Gonka'ya PR #767 aracılığıyla, araç çağrılarını tanımlamak için 0.958 eşiğiyle eklenmişti. Qwen3-235B üzerinde bu, geliştiricilerin harici API'ler, veritabanları ve araçlarla etkileşime giren AI ajanları oluşturmasına olanak tanıyordu. Tool calling desteği, ağın mevcut modellerinde de korunmuştur.

Gonka ağı, 120'den fazla ML-node'da birleştirilmiş 4 000'den fazla GPU (H100, H200, A100, RTX 4090 ve diğerleri) içermektedir. Bu, AI çıkarımı için dünyanın en büyük dağıtık GPU ağlarından biridir ve eskiden bu güç Qwen3-235B'ye odaklanmışken, bugün ağın aktif modelleri olan Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash'a hizmet vermektedir.

Qwen3-235B'yi şimdi denemek mümkün mü

Doğrudan cevap: Gonka ağı üzerinden — artık hayır. Qwen3-235B ağdan çıkarıldığı için artık qwen3-235b-a22b tanımlayıcısı ile Gateway'imiz üzerinden çağrılamaz. Model açık kaynaklı olduğu için (Apache 2.0), yine de bağımsız olarak çalıştırabilir veya üçüncü taraf open-weights model barındırma hizmetleri üzerinden erişebilirsiniz — örneğin OpenRouter (tahmini 1M token başına $0.071/$0.100).

Eğer aradığınız şey, Gonka'ya gelme sebebiniz olan o ucuz merkeziyetsiz inference ise, o hala yerinde duruyor; sadece artık ağın mevcut modelleri üzerinde çalışıyor. JoinGonka API Gateway üzerinden Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash'a OpenAI uyumlu API ile erişilebilir: OpenAI için yazılmış herhangi bir kod, URL, API anahtarı ve model adını değiştirerek hiçbir değişiklik yapmadan çalışır.

Aktif bir modele örnek istek:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "MoE mimarisini açıkla"}]
  }'

Maliyet: $0.0047, 1 milyon token başına — bu, GPT-5.5'ten ($5.00/1M) ~800 kat, Claude Sonnet 4.6'dan ($3.00/1M) ise ~500 kat daha ucuzdur. Kayıt olduğunuzda test için ücretsiz 1.5M token alırsınız.

Gateway popüler geliştirme araçlarıyla uyumludur: Quick Start, Python, Node.js ve curl üzerinden bağlantıyı açıklar. Ayrıca IDE entegrasyonları — Cursor, Continue, Cline, Aider ve Claude Code — ve AI ajanları için frameworkler desteklenmektedir: LangChain, n8n, LibreChat, Open WebUI.

Hızlı başlangıç için:

  1. gate.joingonka.ai adresine kaydolun (cüzdanınızı bağlayın veya yeni bir tane oluşturun)
  2. Dashboard'dan API anahtarınızı alın
  3. Kodunuzdaki api.openai.com kısmını gate.joingonka.ai/api ile değiştirin
  4. Ağın güncel modelini belirtin — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7 veya deepseek-ai/DeepSeek-V4-Flash-0731 (tam liste için GET /v1/models endpoint'ine bakın)

Hobi projesi fiyatına kurumsal seviyede merkeziyetsiz inference hala yerli yerinde — Qwen3-235B sadece yerini ağın daha yeni modellerine bıraktı. Aynı fiyat-performans dengesi artık Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash üzerinde çalışıyor.

Qwen3-235B-A22B — Alibaba Cloud tarafından geliştirilen, 235 milyar parametreye (22 milyarı aktif) sahip bir MoE modelidir ve ilk aşamada merkeziyetsiz AI inference için Gonka ağının ana modeliydi. MoE mimarisi sayesinde, çok daha düşük hesaplama maliyetiyle önde gelen tescilli modeller seviyesinde kalite sunar. Qwen3-235B artık ağdan kaldırılmıştır: Mevcut Gonka modelleri, JoinGonka Gateway üzerinden OpenAI uyumlu API aracılığıyla $0.0047/1M token fiyatıyla erişilebilen Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash'tır. Qwen3-235B'nin kendisi açık kaynaklı (Apache 2.0) olarak kalmaya devam etmekte ve üçüncü taraf open-weights model barındırma hizmetlerinde mevcuttur.

Daha fazla bilgi edinmek ister misiniz?

Diğer bölümleri keşfedin veya şimdi GNK kazanmaya başlayın.

Güncel Gonka modellerini deneyin →