Bilgi Tabanı Bölümleri ▾
Navigasyon
▸ Buradan başlayın Rol bazlıKategoriler
- Gonzo ağ mimarisi: Sprint, Transfer Aracılar, DiLoCo
- Geliştiriciler: GNK Nasıl Kazanılır
- Kendi Hostinginiz: Adım Adım Rehber
- Gonka için GPU seçimi: Donanım önerileri
- Qwen3-235B: Daha önce Gonka'nın sunduğu model
- Kimi K2.6: Gonka ağının ikinci modeli
- MiniMax M2.7: Gonka ağ modeli
- DeepSeek V4 Flash: 380K bağlamlı Gonka ağı modeli
Teknoloji
Qwen3-235B: Daha önce Gonka'nın sunduğu model
Qwen3-235B nedir
Qwen3-235B-A22B-Instruct-2507-FP8, Alibaba Cloud'daki Qwen ekibi tarafından geliştirilen Qwen3 ailesinin büyük bir dil modelidir (LLM). Tam adı şöyle açıklanır: Qwen3 — serinin üçüncü nesli, 235B — toplam 235 milyar parametre, A22B — her istekte 22 milyar aktif parametre, Instruct — talimatları takip etmek üzere eğitilmiş sürüm, 2507 — Temmuz 2025 sürümü, FP8 — bellek optimizasyonu için 8 bit nicemleme.
Temel mimari özellik – MoE (Mixture of Experts). Her token'ın tüm parametrelerden geçtiği “yoğun” modellerin (GPT-5.5, Claude Sonnet 4.6) aksine, MoE modeli her istek için yalnızca bir dizi “uzmanı” – sinir ağının özel bloklarını – etkinleştirir. Qwen3-235B durumunda, 235 milyar parametreden her token için yalnızca 22 milyar etkinleştirilir – %10'dan az. Bu, 22B'lik bir modelin hesaplama maliyetleriyle 200B+ parametreli modellere eşit kalite sağlar.
Pratikte bu, modelin hızından beklenenden daha akıllı olduğu anlamına gelir. Benzer kalitedeki yoğun modellerden önemli ölçüde daha hızlı istekleri işlerken, çıkarım için çok daha az VRAM gerektirir. MoE'nin 2025-2026 yıllarının en büyük modelleri için baskın mimari haline gelmesinin nedeni budur.
Qwen3-235B'nin bağlam penceresi 131.072 token'dır (yaklaşık 100.000 kelime) – bu, tek bir istekte bütün kitapları, kod tabanlarını veya uzun hukuki belgeleri analiz etmek için yeterlidir. Model, Rusça, İngilizce, Çince, Arapça, Hintçe ve onlarca diğerleri dahil 119 dili destekler – bu da onu piyasadaki en çok dilli modellerden biri yapar.
Özellikler ve Benchmarklar
Qwen3-235B, en büyük kapalı ve açık modellerle rekabet eder. İşte temel özelliklerin karşılaştırması:
| Model | Parametreler | Bağlam | MoE | Open Source | Fiyat (1M token için) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B aktif) | 131K | Evet | Evet (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (tahmini) | 128K | Evet (varsayılan) | Yok | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Açıklanmadı | 200K | Yok (varsayılan) | Yok | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B aktif) | 1M | Evet | Evet (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B aktif) | 128K | Evet | Evet (MIT) | $0.55 |
Qwen3-235B, çoğu benchmark'ta GPT-5.5 ve Claude Sonnet 4.6 ile kıyaslanabilir bir kalite seviyesi sergilerken, open-weights MoE modeli olarak tescilli emsallerinden kat kat daha ucuza mal olur: MoE mimarisi, istek başına parametrelerin sadece bir kısmını etkinleştirerek hesaplama maliyetlerini ciddi oranda düşürür. Gonka ağı, bugün aktif modelleri olan Kimi K2.6 ve MiniMax M2.7 modelleri için de aynı ucuz merkeziyetsiz inference prensibini uygulamaktadır; bu modeller JoinGonka Gateway üzerinden 1M token başına $0.0047 fiyatla (GPT-5.5 ve Claude'dan yüzlerce-binlerce kat daha ucuz) erişilebilirdir.
MMLU-Pro, HumanEval, MATH-500 ve GSM8K benchmark'larında model, matematiksel akıl yürütme (reasoning) görevlerinde sadece DeepSeek-R1'in gerisinde kalarak en iyi 3 açık kaynak modelden biri olmuştur. Kod oluşturma, çeviri ve talimatları izleme görevlerinde Qwen3-235B, Llama 4 Maverick'i sürekli olarak geride bırakmakta ve Claude Sonnet 4.6 ile kıyaslanabilir düzeydedir.
Gonka Qwen3-235B'yi nasıl kullandı
Qwen3-235B ağın ana modeli olduğunda, Gonka ağında dağıtık bir şekilde çalışıyordu; çıkarım için uyarlanmış DiLoCo protokolü aracılığıyla. FP8 formatındaki tam model yaklaşık 640 GB video belleği (VRAM) gerektirir ki bu tek bir GPU'ya sığdırılamaz; H100 80GB veya H200 141GB bile yeterli değildir. Bu nedenle model, birkaç ML-node arasında katmanlara ayrılmıştı (tensor parallelism + pipeline parallelism).
Pratikte Qwen3-235B, her biri en az 40 GB VRAM'e sahip 8-16 GPU-node kümesi üzerinde çalışıyordu. Transfer Agent'lar isteği ilgili kümeye yönlendiriyor, her node'daki vLLM modelin kendi parçasını işliyor, sonuçlar toplanıyor ve kullanıcıya dönüyordu. Tüm süreç yüzlerce milisaniye sürüyordu; kullanıcı, isteğinin dünyanın farklı noktalarındaki düzinelerce GPU tarafından işlendiğini hissetmiyordu. Ağ, dağıtık çıkarımın aynı prensibini bugün aktif modeller için de uygulamaya devam ediyor.
Önemli bir teknik detay: Gonka, sunum motoru olarak vLLM kullanır. vLLM, çok sayıda isteğin paralel işlenmesi sırasında video belleği kullanımını optimize eden bir algoritma olan PagedAttention aracılığıyla yüksek performanslı metin üretimi sağlayan açık kaynaklı bir projedir. Bu, ağın binlerce eşzamanlı kullanıcıya kalite kaybı olmadan hizmet vermesini sağlar.
Model, yerel tool calling özelliğini destekler; yani fonksiyon ve araçların doğrudan modelin yanıtından çağrılmasıdır. Bu yetenek, Gonka'ya PR #767 aracılığıyla, araç çağrılarını tanımlamak için 0.958 eşiğiyle eklenmişti. Qwen3-235B üzerinde bu, geliştiricilerin harici API'ler, veritabanları ve araçlarla etkileşime giren AI ajanları oluşturmasına olanak tanıyordu. Tool calling desteği, ağın mevcut modellerinde de korunmuştur.
Gonka ağı, 120'den fazla ML-node'da birleştirilmiş 4 000'den fazla GPU (H100, H200, A100, RTX 4090 ve diğerleri) içermektedir. Bu, AI çıkarımı için dünyanın en büyük dağıtık GPU ağlarından biridir ve eskiden bu güç Qwen3-235B'ye odaklanmışken, bugün ağın aktif modelleri olan Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash'a hizmet vermektedir.
Qwen3-235B'yi şimdi denemek mümkün mü
Doğrudan cevap: Gonka ağı üzerinden — artık hayır. Qwen3-235B ağdan çıkarıldığı için artık qwen3-235b-a22b tanımlayıcısı ile Gateway'imiz üzerinden çağrılamaz. Model açık kaynaklı olduğu için (Apache 2.0), yine de bağımsız olarak çalıştırabilir veya üçüncü taraf open-weights model barındırma hizmetleri üzerinden erişebilirsiniz — örneğin OpenRouter (tahmini 1M token başına $0.071/$0.100).
Eğer aradığınız şey, Gonka'ya gelme sebebiniz olan o ucuz merkeziyetsiz inference ise, o hala yerinde duruyor; sadece artık ağın mevcut modelleri üzerinde çalışıyor. JoinGonka API Gateway üzerinden Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash'a OpenAI uyumlu API ile erişilebilir: OpenAI için yazılmış herhangi bir kod, URL, API anahtarı ve model adını değiştirerek hiçbir değişiklik yapmadan çalışır.
Aktif bir modele örnek istek:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "MoE mimarisini açıkla"}]
}'Maliyet: $0.0047, 1 milyon token başına — bu, GPT-5.5'ten ($5.00/1M) ~800 kat, Claude Sonnet 4.6'dan ($3.00/1M) ise ~500 kat daha ucuzdur. Kayıt olduğunuzda test için ücretsiz 1.5M token alırsınız.
Gateway popüler geliştirme araçlarıyla uyumludur: Quick Start, Python, Node.js ve curl üzerinden bağlantıyı açıklar. Ayrıca IDE entegrasyonları — Cursor, Continue, Cline, Aider ve Claude Code — ve AI ajanları için frameworkler desteklenmektedir: LangChain, n8n, LibreChat, Open WebUI.
Hızlı başlangıç için:
- gate.joingonka.ai adresine kaydolun (cüzdanınızı bağlayın veya yeni bir tane oluşturun)
- Dashboard'dan API anahtarınızı alın
- Kodunuzdaki
api.openai.comkısmınıgate.joingonka.ai/apiile değiştirin - Ağın güncel modelini belirtin —
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7veyadeepseek-ai/DeepSeek-V4-Flash-0731(tam liste içinGET /v1/modelsendpoint'ine bakın)
Hobi projesi fiyatına kurumsal seviyede merkeziyetsiz inference hala yerli yerinde — Qwen3-235B sadece yerini ağın daha yeni modellerine bıraktı. Aynı fiyat-performans dengesi artık Kimi K2.6, MiniMax M2.7 ve DeepSeek V4 Flash üzerinde çalışıyor.
Daha fazla bilgi edinmek ister misiniz?
Diğer bölümleri keşfedin veya şimdi GNK kazanmaya başlayın.
Güncel Gonka modellerini deneyin →