Bagian Basis Pengetahuan ▾

Teknologi

Qwen3-235B: model yang sebelumnya dilayani oleh Gonka

Jaringan Gonka tidak hanya menyewakan GPU — mereka melayani model AI untuk inferensi. Untuk waktu yang lama, satu-satunya model utama di jaringan adalah Qwen3-235B-A22B-Instruct, yang dikembangkan oleh Alibaba Cloud. Seiring berjalannya waktu, jaringan beralih ke arsitektur multi-model dan Qwen3-235B ditarik dari jaringan: hari ini Gonka melayani Kimi K2.6 dari Moonshot AI, MiniMax M2.7, dan DeepSeek V4 Flash. Mari kita bahas apa itu Qwen3-235B, peran apa yang dimainkannya dalam jaringan Gonka, dan apa penggantinya — sebagai model MoE open-source yang menonjol, ia tetap menjadi tolok ukur yang berguna.

Apa itu Qwen3-235B

Qwen3-235B-A22B-Instruct-2507-FP8 adalah Large Language Model (LLM) dari keluarga Qwen3, dikembangkan oleh tim Qwen di Alibaba Cloud. Nama lengkap diuraikan sebagai berikut: Qwen3 — generasi ketiga dari seri, 235B — 235 miliar parameter total, A22B — 22 miliar parameter aktif per permintaan, Instruct — versi yang dilatih untuk mengikuti instruksi, 2507 — rilis Juli 2025, FP8 — kuantisasi 8-bit untuk optimasi memori.

Fitur arsitektur utama adalah MoE (Mixture of Experts). Berbeda dengan model "dense" (GPT-5.5, Claude Sonnet 4.6), di mana setiap token melewati semua parameter, model MoE mengaktifkan hanya sebagian "ahli" — blok khusus jaringan saraf — untuk setiap permintaan. Dalam kasus Qwen3-235B, dari 235 miliar parameter, hanya 22 miliar yang diaktifkan per token — kurang dari 10%. Ini memberikan kualitas tingkat model dengan 200B+ parameter dengan biaya komputasi model 22B.

Secara praktis ini berarti: model lebih cerdas dari yang diharapkan dari kecepatannya. Ia memproses permintaan jauh lebih cepat daripada model dense dengan kualitas yang sebanding, sambil membutuhkan VRAM yang berkali-kali lipat lebih sedikit untuk inferensi. Inilah mengapa MoE menjadi arsitektur dominan untuk model terbesar tahun 2025—2026.

Jendela konteks Qwen3-235B adalah 131.072 token (~100.000 kata) — ini cukup untuk menganalisis seluruh buku, basis kode, atau dokumen hukum yang panjang dalam satu permintaan. Model ini mendukung 119 bahasa, termasuk Rusia, Inggris, Cina, Arab, Hindi, dan puluhan lainnya — menjadikannya salah satu model multibahasa paling unggul di pasar.

Karakteristik dan Benchmark

Qwen3-235B bersaing dengan model tertutup dan terbuka terbesar. Berikut adalah perbandingan karakteristik kunci:

ModelParameterKonteksMoEOpen SourceHarga (per 1M token)
Qwen3-235B (Alibaba)235B (22B aktif)131KYaYa (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (estimasi)128KYa (diduga)Tidak$5.00
Claude Sonnet 4.6 (Anthropic)Tidak diungkap200KTidak (diduga)Tidak$3.00
Llama 4 Maverick (Meta)400B (17B aktif)1MYaYa (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B aktif)128KYaYa (MIT)$0.55

Qwen3-235B menunjukkan tingkat kualitas yang sebanding dengan GPT-5.5 dan Claude Sonnet 4.6 pada sebagian besar benchmark, sementara sebagai model open-weights MoE, biayanya jauh lebih murah daripada analog proprietary: arsitektur MoE hanya mengaktifkan sebagian parameter per permintaan dan secara drastis mengurangi biaya komputasi. Prinsip inference terdesentralisasi yang murah ini diterapkan oleh jaringan Gonka pada model saat ini — Kimi K2.6 dan MiniMax M2.7, yang tersedia melalui JoinGonka Gateway dengan harga $0.0047 per 1M token (ratusan hingga ribuan kali lebih murah daripada GPT-5.5 dan Claude).

Pada benchmark MMLU-Pro, HumanEval, MATH-500, dan GSM8K, model ini termasuk dalam tiga besar model open-source terbaik, hanya kalah dari DeepSeek-R1 dalam tugas penalaran matematika (reasoning). Dalam tugas pembuatan kode, penerjemahan, dan kepatuhan instruksi, Qwen3-235B secara konsisten mengungguli Llama 4 Maverick dan sebanding dengan Claude Sonnet 4.6.

Bagaimana Gonka menggunakan Qwen3-235B

Ketika Qwen3-235B menjadi model utama jaringan, ia beroperasi di jaringan Gonka secara terdistribusi — melalui protokol DiLoCo, yang diadaptasi untuk inferensi. Model lengkap dalam format FP8 membutuhkan sekitar 640 GB memori video (VRAM), yang tidak mungkin dimuat pada satu GPU — bahkan H100 80GB atau H200 141GB pun tidak cukup. Oleh karena itu, model dibagi berdasarkan lapisan (tensor parallelism + pipeline parallelism) di antara beberapa ML-node.

Dalam praktiknya, Qwen3-235B berjalan pada cluster 8-16 GPU-node, masing-masing dengan VRAM minimal 40 GB. Transfer Agents mengarahkan permintaan ke cluster yang tepat, vLLM pada setiap node memproses fragmen modelnya, hasilnya dikumpulkan dan dikembalikan ke pengguna. Seluruh proses memakan waktu ratusan milidetik — pengguna tidak merasakan bahwa permintaannya diproses oleh belasan GPU di berbagai belahan dunia. Jaringan menerapkan prinsip inferensi terdistribusi yang sama sekarang untuk model-model yang ada saat ini.

Detail teknis penting: Gonka menggunakan vLLM sebagai mesin untuk serving. vLLM adalah proyek open-source yang menyediakan pembuatan teks berkinerja tinggi melalui PagedAttention — algoritme yang mengoptimalkan penggunaan memori video saat memproses banyak permintaan secara paralel. Ini memungkinkan jaringan melayani ribuan pengguna secara bersamaan tanpa degradasi kualitas.

Model ini mendukung native tool calling — pemanggilan fungsi dan alat langsung dari jawaban model. Kemampuan ini ditambahkan ke Gonka melalui PR #767 dengan ambang batas 0,958 untuk menentukan pemanggilan alat. Pada Qwen3-235B, ini memungkinkan pengembang membangun AI-agent yang berinteraksi dengan API eksternal, basis data, dan alat — semua melalui satu permintaan. Dukungan tool calling tetap dipertahankan dalam model jaringan yang ada saat ini.

Jaringan Gonka mencakup lebih dari 4 000 GPU (H100, H200, A100, RTX 4090, dan lainnya), yang digabungkan menjadi 120+ ML-node. Ini adalah salah satu jaringan GPU terdistribusi terbesar untuk AI inference di dunia — dan jika sebelumnya kekuatan ini diarahkan pada Qwen3-235B, hari ini ia melayani model-model jaringan yang aktif — Kimi K2.6, MiniMax M2.7, dan DeepSeek V4 Flash.

Apakah bisa mencoba Qwen3-235B sekarang

Jawaban singkat: melalui jaringan Gonka — tidak lagi. Qwen3-235B telah ditarik dari jaringan, jadi Anda tidak bisa lagi memanggilnya melalui identifier qwen3-235b-a22b melalui Gateway kami. Karena model ini bersifat open-source (Apache 2.0), Anda masih bisa menjalankannya sendiri atau mengaksesnya melalui penyedia hosting pihak ketiga untuk model open-weights — contohnya melalui OpenRouter (perkiraan $0.071/$0.100 per 1M token).

Jika Anda mencari inferensi terdesentralisasi murah yang menjadi alasan orang menggunakan Gonka, layanan tersebut masih ada dan kini berjalan pada model jaringan yang aktif. Melalui JoinGonka API Gateway, Anda bisa mengakses Kimi K2.6, MiniMax M2.7, dan DeepSeek V4 Flash dengan API yang kompatibel dengan OpenAI: kode apa pun yang ditulis untuk OpenAI akan berjalan tanpa perubahan — cukup ganti URL, kunci API, dan nama model.

Contoh permintaan ke model yang aktif:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "Jelaskan arsitektur MoE"}]
  }'

Biaya: $0.0047 per 1 juta token — ini ~800 kali lebih murah dibandingkan GPT-5.5 ($5.00/1M) dan ~500 kali lebih murah dibandingkan Claude Sonnet 4.6 ($3.00/1M). Saat mendaftar, Anda akan mendapatkan bonus gratis 1.5M token untuk pengujian.

Gateway ini kompatibel dengan alat pengembangan populer: Quick Start menjelaskan koneksi melalui Python, Node.js, dan curl. Integrasi IDE juga didukung — Cursor, Continue, Cline, Aider, dan Claude Code — serta framework untuk AI agent: LangChain, n8n, LibreChat, Open WebUI.

Untuk memulai dengan cepat:

  1. Daftar di gate.joingonka.ai (hubungkan dompet atau buat yang baru)
  2. Dapatkan kunci API di Dashboard
  3. Ganti api.openai.com dengan gate.joingonka.ai/api di kode Anda
  4. Tentukan model jaringan yang aktif — moonshotai/Kimi-K2.6, MiniMaxAI/MiniMax-M2.7, atau deepseek-ai/DeepSeek-V4-Flash-0731 (daftar lengkap ada di endpoint GET /v1/models)

Inferensi terdesentralisasi tingkat enterprise dengan harga proyek hobi tetap tersedia — Qwen3-235B kini digantikan oleh model jaringan yang lebih baru. Kombinasi harga dan kualitas yang sama sekarang tersedia di Kimi K2.6, MiniMax M2.7, dan DeepSeek V4 Flash.

Qwen3-235B-A22B adalah model MoE dengan 235 miliar parameter (22 miliar aktif) dari Alibaba Cloud, yang pada tahap awal menjadi model utama jaringan Gonka untuk inferensi AI terdesentralisasi. Berkat arsitektur MoE, model ini memberikan kualitas setingkat model proprietari teratas dengan biaya komputasi yang jauh lebih rendah. Saat ini, Qwen3-235B telah ditarik dari jaringan: model Gonka saat ini adalah Kimi K2.6, MiniMax M2.7, dan DeepSeek V4 Flash, yang tersedia melalui JoinGonka Gateway via API yang kompatibel dengan OpenAI seharga $0.0047/1M token. Qwen3-235B sendiri tetap bersifat open-source (Apache 2.0) dan tersedia di layanan hosting model open-weights pihak ketiga.

Ingin tahu lebih banyak?

Jelajahi bagian lain atau mulai hasilkan GNK sekarang.

Coba model Gonka yang aktif →