Bagian Basis Pengetahuan ▾
Navigasi
▸ Mulai di sini Berdasarkan peranKategori
- Arsitektur jaringan Gonka: Sprint, Transfer Agents, DiLoCo
- Pengembang: Cara Mendapatkan GNK
- Hosting Mandiri: Panduan Langkah demi Langkah
- Memilih GPU untuk Gonka: Rekomendasi Perangkat Keras
- Qwen3-235B: model yang sebelumnya dilayani oleh Gonka
- Kimi K2.6: Model kedua jaringan Gonka
- MiniMax M2.7: model jaringan Gonka
Teknologi
Qwen3-235B: model yang sebelumnya dilayani oleh Gonka
Apa itu Qwen3-235B
Qwen3-235B-A22B-Instruct-2507-FP8 adalah Large Language Model (LLM) dari keluarga Qwen3, dikembangkan oleh tim Qwen di Alibaba Cloud. Nama lengkap diuraikan sebagai berikut: Qwen3 — generasi ketiga dari seri, 235B — 235 miliar parameter total, A22B — 22 miliar parameter aktif per permintaan, Instruct — versi yang dilatih untuk mengikuti instruksi, 2507 — rilis Juli 2025, FP8 — kuantisasi 8-bit untuk optimasi memori.
Fitur arsitektur utama adalah MoE (Mixture of Experts). Berbeda dengan model "dense" (GPT-5.5, Claude Sonnet 4.6), di mana setiap token melewati semua parameter, model MoE mengaktifkan hanya sebagian "ahli" — blok khusus jaringan saraf — untuk setiap permintaan. Dalam kasus Qwen3-235B, dari 235 miliar parameter, hanya 22 miliar yang diaktifkan per token — kurang dari 10%. Ini memberikan kualitas tingkat model dengan 200B+ parameter dengan biaya komputasi model 22B.
Secara praktis ini berarti: model lebih cerdas dari yang diharapkan dari kecepatannya. Ia memproses permintaan jauh lebih cepat daripada model dense dengan kualitas yang sebanding, sambil membutuhkan VRAM yang berkali-kali lipat lebih sedikit untuk inferensi. Inilah mengapa MoE menjadi arsitektur dominan untuk model terbesar tahun 2025—2026.
Jendela konteks Qwen3-235B adalah 131.072 token (~100.000 kata) — ini cukup untuk menganalisis seluruh buku, basis kode, atau dokumen hukum yang panjang dalam satu permintaan. Model ini mendukung 119 bahasa, termasuk Rusia, Inggris, Cina, Arab, Hindi, dan puluhan lainnya — menjadikannya salah satu model multibahasa paling unggul di pasar.
Karakteristik dan Benchmark
Qwen3-235B bersaing dengan model tertutup dan terbuka terbesar. Berikut adalah perbandingan karakteristik utama:
| Model | Parameter | Konteks | MoE | Open Source | Harga (per 1M token) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B aktif) | 131K | Ya | Ya (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (estimasi) | 128K | Ya (diasumsikan) | Tidak | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | Tidak diungkap | 200K | Tidak (diasumsikan) | Tidak | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B aktif) | 1M | Ya | Ya (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B aktif) | 128K | Ya | Ya (MIT) | $0.55 |
Qwen3-235B menunjukkan tingkat kualitas yang sebanding dengan GPT-5.5 dan Claude Sonnet 4.6 pada sebagian besar benchmark, sementara sebagai model open-weights MoE, nilainya jauh lebih murah dibandingkan alternatif berbayar: arsitektur MoE hanya mengaktifkan sebagian parameter untuk setiap permintaan sehingga memangkas biaya komputasi secara tajam. Jaringan Gonka saat ini menerapkan prinsip inference desentralisasi yang murah yang sama pada model jaringan aktifnya — Kimi K2.6 dan MiniMax M2.7, yang tersedia melalui JoinGonka Gateway dengan harga $0.003 per 1 juta token (ribuan kali lebih murah daripada GPT-5.5 dan Claude).
Pada benchmark MMLU-Pro, HumanEval, MATH-500, dan GSM8K, model ini masuk dalam tiga besar model open-source, hanya tertinggal di bawah DeepSeek-R1 dalam tugas penalaran matematis (reasoning). Dalam tugas pembuatan kode, terjemahan, dan mengikuti instruksi, Qwen3-235B secara konsisten melampaui Llama 4 Maverick dan sebanding dengan Claude Sonnet 4.6.
Bagaimana Gonka menggunakan Qwen3-235B
Ketika Qwen3-235B menjadi model utama jaringan, model ini berjalan di jaringan Gonka secara terdistribusi — melalui protokol DiLoCo, yang diadaptasi untuk inference. Model lengkap dalam format FP8 membutuhkan sekitar 640 GB VRAM (VRAM), yang mustahil untuk dimuat dalam satu GPU — bahkan H100 80GB atau H200 141GB tidak cukup. Oleh karena itu, model dipecah berdasarkan lapisan (tensor parallelism + pipeline parallelism) di antara beberapa ML-node.
Dalam praktiknya, Qwen3-235B berjalan di sebuah cluster dari 8—16 GPU-node, masing-masing dengan minimal 40 GB VRAM. Transfer Agents merutekan permintaan ke cluster yang tepat, vLLM di setiap node memproses fragmen modelnya masing-masing, hasilnya diagregasi dan dikembalikan ke pengguna. Seluruh proses memakan waktu ratusan milidetik — pengguna tidak merasakan bahwa permintaannya diproses oleh belasan GPU di titik yang berbeda di bumi. Prinsip inference terdistribusi yang sama kini diterapkan jaringan pada model-model yang saat ini aktif.
Detail teknis penting: Gonka menggunakan vLLM sebagai mesin untuk serving. vLLM adalah proyek open source yang menyediakan pembuatan teks performa tinggi melalui PagedAttention — algoritma yang mengoptimalkan penggunaan VRAM saat memproses banyak permintaan secara paralel. Ini memungkinkan jaringan untuk melayani ribuan pengguna secara bersamaan tanpa penurunan kualitas.
Model ini mendukung native tool calling — pemanggilan fungsi dan alat secara langsung dari jawaban model. Kemampuan ini ditambahkan ke Gonka melalui PR #767 dengan ambang batas 0.958 untuk mendeteksi pemanggilan alat. Pada Qwen3-235B, hal ini memungkinkan pengembang membangun AI-agent yang berinteraksi dengan API eksternal, basis data, dan alat — semuanya melalui satu permintaan. Dukungan tool calling tetap ada di model-model jaringan saat ini.
Jaringan Gonka mencakup lebih dari 4 000 GPU (H100, H200, A100, RTX 4090, dan lainnya), yang digabungkan ke dalam 120+ ML-nodes. Ini adalah salah satu jaringan GPU terdistribusi terbesar untuk AI inference di dunia — dan jika sebelumnya kapasitas ini diarahkan untuk Qwen3-235B, kini kapasitas tersebut melayani model-model aktif jaringan, yaitu Kimi K2.6 dan MiniMax M2.7.
Apakah bisa mencoba Qwen3-235B sekarang
Jawaban langsung: melalui jaringan Gonka — sudah tidak ada lagi. Qwen3-235B telah ditarik dari jaringan, jadi Anda tidak dapat lagi memanggilnya menggunakan identifier qwen3-235b-a22b melalui Gateway kami. Karena modelnya terbuka (Apache 2.0), Anda masih bisa menjalankannya sendiri atau mengaksesnya melalui penyedia hosting model open-weights pihak ketiga — misalnya melalui OpenRouter (sekitar $0.071/$0.100 per 1 juta token).
Jika Anda mencari inference desentralisasi murah yang menjadi alasan orang datang ke Gonka, itu masih ada, hanya saja sekarang berjalan pada model aktif jaringan. Melalui JoinGonka API Gateway tersedia Kimi K2.6 dan MiniMax M2.7 melalui API yang kompatibel dengan OpenAI: kode apa pun yang ditulis untuk OpenAI akan berjalan tanpa perubahan — Anda hanya perlu mengganti URL, API-key, dan nama model.
Contoh permintaan ke model aktif:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "Jelaskan arsitektur MoE"}]
}'Biaya: $0.003 per 1 juta token — ini 1.700 kali lebih murah daripada GPT-5.5 ($5.00/1M) dan 1.000 kali lebih murah daripada Claude Sonnet 4.6 ($3.00/1M). Saat mendaftar, Anda mendapatkan 10 juta token gratis untuk pengujian.
Gateway kompatibel dengan alat pengembangan populer: Quick Start menjelaskan koneksi melalui Python, Node.js, dan curl. Integrasi IDE juga didukung — Cursor, Continue, Cline, Aider, dan Claude Code — serta framework untuk AI-agent: LangChain, n8n, LibreChat, Open WebUI.
Untuk memulai dengan cepat:
- Daftar di gate.joingonka.ai (sambungkan dompet atau buat yang baru)
- Dapatkan API-key di Dashboard
- Ganti
api.openai.comdengangate.joingonka.ai/apidi kode Anda - Tentukan model jaringan yang sedang aktif —
moonshotai/Kimi-K2.6atauMiniMaxAI/MiniMax-M2.7(daftar lengkap ada di endpointGET /v1/models)
Inference desentralisasi tingkat enterprise dengan harga hobi tidak hilang — Qwen3-235B hanya memberi jalan bagi model jaringan yang lebih baru. Kombinasi harga dan kualitas yang sama kini bekerja pada Kimi K2.6 dan MiniMax M2.7.
Ingin tahu lebih banyak?
Jelajahi bagian lain atau mulai hasilkan GNK sekarang.
Coba model Gonka yang aktif →