Bagian Basis Pengetahuan ▾

Teknologi

GLM-5.3 Flash: model reasoning Z.ai di jaringan Gonka

Pada September 2026, model operasional baru muncul di jaringan Gonka — GLM-5.3 Flash dari laboratorium Tiongkok Z.ai. Proposal tata kelola #101 mengenai penambahannya telah disetujui melalui voting, host telah memperbarui bobot, dan model tersebut kini tersedia melalui gateway kami bersama dengan MiniMax M2.7 dan DeepSeek V4 Flash. Secara bersamaan, Kimi K2.6 telah keluar dari jaringan, dan model unggulan GLM-5.2, yang sudah lama berada di daftar tunggu penyebaran, tidak pernah dimasukkan ke dalam jajaran operasional — jaringan memilih model yang lebih ringan dari lini yang sama.

GLM-5.3 Flash berbeda dari model lain di jaringan karena satu properti prinsipil: ini adalah model reasoning. Sebelum menjawab, ia melakukan penalaran — dan penalaran ini menghabiskan token, waktu, dan memerlukan pengaturan permintaan yang tepat. Siapa pun yang memberinya max_tokens: 200 untuk «jawaban singkat», akan menerima jawaban kosong. Mari kita bahas apa model ini, apa karakteristiknya di jaringan Gonka, bagaimana anggaran penalaran disusun, bagaimana status alat (tools) dan JSON, berapa biayanya, dan kapan sebaiknya memilih model ini dibandingkan dua model lainnya di jaringan.

Apa itu GLM-5.3 Flash dan siapa di baliknya

Z.ai adalah merek internasional dari laboratorium Zhipu AI di Beijing, yang tumbuh dari Universitas Tsinghua. Keluarga GLM telah berkembang sejak 2023 (ChatGLM), dan mulai dari GLM-4.5 pada musim panas 2025, perusahaan merilis bobot model unggulannya di bawah lisensi MIT, yang menjadikan seri ini salah satu yang paling menonjol di dunia dalam hal bobot terbuka. Produk internal Z.ai — lingkungan pengembangan ZCode dan langganan GLM Coding Plan — dibangun di sekitar model-model ini.

GLM-5.3 Flash adalah model ringan dari lini 5.3. "Ringan" di sini bersifat relatif: ini adalah model MoE dengan 320 miliar parameter, yang sekitar 18 miliar di antaranya diaktifkan per token. Bobot didistribusikan dalam format FP8, dengan lisensi MIT. Fitur arsitekturalnya adalah atensi hibrida: sebagian lapisan menggunakan atensi jarang (sparse), dan sebagian menggunakan atensi linear, yang secara signifikan mengurangi biaya memori dan waktu untuk konteks panjang dibandingkan dengan atensi penuh klasik.

Properti kedua yang menentukan perilaku model adalah penalaran bawaan. GLM-5.3 Flash dilatih untuk berpikir terlebih dahulu, baru kemudian menjawab: alur penalaran dipisahkan dari jawaban dan diberikan kepada klien dalam kolom terpisah. Penalaran diaktifkan dan dinonaktifkan dengan parameter reasoning_effort, dan secara default aktif sepenuhnya. Hal ini membuat model kuat pada tugas-tugas yang memerlukan pemahaman logika yang rumit — dan menuntut pengaturan permintaan, seperti yang dijelaskan di bawah.

Perbedaan antara "Flash" dan GLM-5.3 yang lebih senior terlihat jelas dari harga vendor: di OpenRouter pada saat publikasi, Flash berharga $0,09 per juta token input dan $0,30 per juta token output, sementara model yang lebih senior berharga $1,40 dan $4,40. Dalam jaringan Gonka, tangga harga ini tidak ada: semua model dalam jaringan diberikan dengan tarif tunggal.

Karakteristik GLM-5.3 Flash di jaringan Gonka

Seperti halnya model jaringan lainnya, penting untuk membedakan karakteristik model "out-of-the-box" dengan parameter operasional dari penyebaran tertentu: ini ditentukan oleh konfigurasi inferensi vLLM pada host GPU jaringan. Nilai aktual melalui gateway kami:

  • Jendela konteks: 390.000 token. Ini adalah angka minimum yang terbukti melalui kueri, bukan sekadar angka dari kartu model: input 390.013 token telah diterima dan diproses, kami telah menjalankan prefill besar langsung ke host jaringan. Pengaturan teknis host memungkinkan hingga 400.000, namun kami mempublikasikan apa yang telah terverifikasi.
  • Output maksimal: 8.192 token per respons. Penting: batas ini mencakup token penalaran dan jawaban itu sendiri. Model yang berpikir 3.000 token dengan batas 4.096 hanya akan menyisakan sekitar seribu token untuk jawaban.
  • Penalaran dan pemanggilan alat (tool calling): model disebarkan dengan parser penalaran dan parser pemanggilan alat — penalaran muncul di kolom reasoning_content, dan panggilan alat di kolom standar tool_calls, seperti model yang kompatibel dengan OpenAI lainnya.
  • Kecepatan: dalam pengukuran kami melalui gateway, token pertama tiba sekitar 0,75 detik, generasi berjalan dengan kecepatan 25–44 token per detik tergantung pada beban. Untuk model penalaran, ini cepat — namun ingat bahwa ratusan token pertama akan digunakan untuk penalaran, dan jawaban yang terlihat akan muncul kemudian.
  • Persyaratan VRAM host: sekitar 560 GB per replika berdasarkan parameter on-chain model — lebih besar daripada MiniMax M2.7 (320 GB) dan DeepSeek V4 Flash (280 GB). Semakin tinggi ambang batas perangkat keras, semakin sedikit host yang dapat menjalankan model, dan ini berdampak langsung pada kapasitasnya di jaringan — ini dibahas di bagian tentang skenario dan batasan.

Harga inferensi di jaringan Gonka tidak bergantung pada pemilihan model: GLM-5.3 Flash tersedia dengan tarif yang sama dengan MiniMax M2.7 dan DeepSeek V4 Flash — melalui JoinGonka Gateway ini adalah $0.0069 per juta token input dan $0.021 per juta token output. Token penalaran dikenakan biaya sebagai token output. Ekonomi jaringan adalah topik terpisah: harga ditentukan oleh perhitungan pekerjaan komputasi, bukan harga vendor.

Reasoning dan anggaran token: cara agar tidak mendapatkan jawaban kosong

Kesalahan paling umum saat pertama kali menggunakan GLM-5.3 Flash adalah: pengembang mengirimkan pertanyaan pendek dengan max_tokens: 256 yang biasa, lalu menerima finish_reason: "length" dan kolom content yang kosong. Tidak ada yang rusak — model telah menghabiskan seluruh batas untuk penalaran dan belum sampai pada jawaban. Menurut pengukuran kami, bahkan untuk pertanyaan sepele, penalaran memakan 250–450 token, dan ribuan untuk tugas yang substansial.

Tiga aturan praktis:

PengaturanRekomendasiMengapa
max_tokensTidak kurang dari 600 bahkan untuk jawaban pendek; untuk tugas nyata mulai dari 2000Batas dibagi untuk penalaran dan jawaban; penalaran memakan ratusan token pertama
streamtrue di mana pun memungkinkanPenalaran dan jawaban muncul saat sedang dibuat: terlihat progresnya, tidak perlu menunggu "layar kosong", dan jawaban panjang tidak terkena timeout proxy
reasoning_effortlow saat penalaran tidak diperlukan; jangan sertakan saat diperlukanPemicunya biner: low mematikan penalaran, nilai lainnya membiarkannya penuh. Gateway mengonversi none dan minimal menjadi low, serta menghapus medium, high, xhigh, dan max karena dianggap berlebih. Bidang enable_thinking, chat_template_kwargs, reasoning.enabled, dan thinking.type diabaikan oleh jaringan

Contoh permintaan untuk tugas pendek — dengan penalaran terbatas dan batas yang cukup:

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-kunci-anda" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "reasoning_effort": "low",
    "max_tokens": 800,
    "messages": [{"role": "user", "content": "Sebutkan ibu kota Australia dalam satu kata"}]
  }'

Dalam jawabannya, penalaran terdapat di message.reasoning_content, dan jawabannya sendiri di message.content; dalam stream, mereka datang dalam delta terpisah. Sebagian besar klien yang kompatibel dengan OpenAI secara diam-diam mengabaikan kolom yang tidak dikenal, sehingga penalaran tidak "bocor" ke dalam teks jawaban — tetapi tetap dihitung dalam completion_tokens dan dikenakan biaya sebagai token output. Jika penalaran sama sekali tidak diperlukan, GLM-5.3 Flash bukanlah pilihan terbaik: untuk balasan cepat yang pendek, MiniMax M2.7 lebih ekonomis.

Catatan terpisah untuk skenario agen: alat seperti Cline atau Cursor sering menetapkan batas output kecil untuk permintaan sistem — kompresi konteks, pembuatan judul dialog. Jika permintaan seperti itu dikirim ke GLM-5.3 Flash dengan batas hanya beberapa ratus token, hasilnya akan kosong. Periksa pengaturan batas di alat tersebut atau kirimkan permintaan sistem ke model lain dalam jaringan.

Alat, JSON, dan perbandingan dengan model jaringan lainnya

Model penalaran terkadang tidak berjalan baik dengan kerangka kerja agen: penalaran menyela di antara panggilan alat dan merusak format. Dengan GLM-5.3 Flash, kami telah menjalankan siklus agen secara lengkap — deskripsi alat, panggilan, pengembalian hasil, putaran panggilan kedua — dan melalui jalur yang kompatibel dengan OpenAI, semuanya berjalan normal: panggilan masuk secara terstruktur dalam tool_calls, argumen valid, dan putaran kedua tidak mengacaukan riwayat. Mode JSON juga berfungsi (response_format: {"type": "json_object"}) — model memberikan objek yang valid, dan penalaran tetap berada di luar respons. Aturan anggaran yang sama berlaku untuk agen: batas output harus cukup, jika tidak panggilan alat bisa terputus di tengah jalan.

Bagaimana GLM-5.3 Flash dibandingkan dengan dua model jaringan lainnya:

ParameterGLM-5.3 FlashMiniMax M2.7DeepSeek V4 Flash
Konteks jaringan390 000200 000380 000
Output per respons8 1928 19232 768
ArsitekturMoE 320B (~18B aktif), perhatian hibridaMoE + perhatian linearMoE 284B (~13B aktif)
VRAM per replika560 GB320 GB280 GB
KelebihanLogika rumit, parsing kode, tugas "berpikir"; konteks jaringan terpanjangTugas sehari-hari, jawaban pendek cepat, model defaultKonteks jaringan terpanjang kedua, output terpanjang, pengkodean agen
Harga melalui Gatewaysama — $0.0069 input / $0.021 output per 1M

Konsekuensi praktis dari harga tunggal sama seperti sebelumnya: model dipilih berdasarkan tugas, bukan berdasarkan anggaran. Perlu memikirkan logika rumit — GLM-5.3 Flash; perlu membaca seluruh repositori — DeepSeek V4 Flash; perlu jawaban cepat dan stabil — MiniMax M2.7.

Cara menggunakan GLM-5.3 Flash melalui JoinGonka Gateway

Model tersedia melalui JoinGonka Gateway via API yang kompatibel dengan OpenAI dan Anthropic. ID model: zai-org/GLM-5.3-Flash. Kunci berupa jg-… dibuat di akun pribadi segera setelah pendaftaran; akun baru mendapatkan 3M token gratis — cukup untuk menjalankan model pada tugas Anda dan menyesuaikan anggaran penalaran Anda.

Panggilan API langsung (format OpenAI, stream diaktifkan — mode yang disarankan untuk model penalaran):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-kunci-anda" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "stream": true,
    "max_tokens": 4000,
    "messages": [{"role": "user", "content": "Temukan kesalahan dalam fungsi ini dan jelaskan: …"}]
  }'

Dalam perangkat pengembangan, model dihubungkan sama seperti model jaringan lainnya: base URL https://gate.joingonka.ai/v1, kunci jg-…, dan ID model. Panduan untuk Cursor, Claude Code, Cline, Continue, dan alat lainnya dikumpulkan di bagian "Alat"; installer npx @joingonka/setup akan menulis gateway ke konfigurasi alat dengan satu perintah. Untuk klien pada Anthropic Messages API, cukup atur ANTHROPIC_BASE_URL=https://gate.joingonka.ai.

Anda dapat mencoba tanpa registrasi di obrolan gratis: pilih GLM-5.3 Flash dari daftar model — penalaran di sana ditampilkan dalam blok terlipat terpisah, sehingga terlihat jelas berapa banyak model "berpikir" sebelum menjawab.

Kapan memilih GLM-5.3 Flash — skenario dan hal yang perlu dipertimbangkan

Skenario kuat untuk model ini:

  • Tugas yang memerlukan pemikiran. Analisis logika bisnis yang rumit, mencari bug yang tidak jelas, perancangan skema data, matematika, dan kesimpulan multi-langkah — itulah alasan model penalaran diciptakan. Di sini, penalaran terbayar dengan kualitas jawaban.
  • Review dan penjelasan kode. Model membedah kode orang lain dan memberikan argumen atas catatan-catatannya, dan alur penalaran dari reasoning_content dapat ditampilkan kepada pengguna sebagai "mengapa saya memutuskan demikian".
  • Ekstraksi terstruktur dengan validasi. Mode JSON ditambah penalaran memberikan hasil yang lebih akurat pada input data yang ambigu dibandingkan jawaban langsung tanpa berpikir.
  • Pipeline agen dengan peran "perencana". Dalam rangkaian beberapa model, masuk akal untuk menempatkan GLM-5.3 Flash di tempat yang menentukan "apa yang harus dilakukan", dan menyerahkan langkah eksekusi cepat kepada MiniMax M2.7.

Kapan model jaringan lain lebih masuk akal: untuk jawaban pendek yang cepat, auto-complete, dan permintaan massal yang murah — MiniMax M2.7 (penalaran di sana hanya menambah latensi dan biaya); untuk dokumen dan repositori yang harus dimuat dalam satu permintaan secara keseluruhan — DeepSeek V4 Flash dengan konteks 380K.

Hal yang perlu diperhatikan sebelum memindahkan beban kerja. GLM-5.3 Flash adalah model terbaru dan terberat secara perangkat keras di jaringan, dan saat ini dilayani oleh sebagian kecil host. Ini berarti cadangan kapasitas lebih kecil daripada MiniMax M2.7 dan DeepSeek V4 Flash: pada menit sibuk, permintaan mungkin menunggu lebih lama untuk slot kosong atau menerima respons kelebihan beban, yang perlu dicoba kembali beberapa detik kemudian. Batasan kedua adalah waktu: penyedia yang saat ini memberikan model jaringan memutus satu respons sekitar menit kelima generasi; pada 25–44 token per detik, ini sekitar 7–10 ribu token, jadi generasi yang sangat panjang lebih baik dipecah menjadi beberapa langkah. Komposisi jaringan berubah melalui voting, jadi selalu ambil daftar model terbaru dan batasannya dari GET https://gate.joingonka.ai/v1/models secara langsung, dan ketersediaan serta latensi saat ini pada halaman status gateway. Berkat harga tunggal, eksperimen tidak memakan biaya: mengganti model hanya perlu satu baris dalam permintaan.

GLM-5.3 Flash adalah model penalaran terbuka Z.ai (MoE dengan parameter 320B, sekitar 18B aktif, FP8, lisensi MIT, atensi hibrida), yang ditambahkan ke jaringan Gonka melalui proposal tata kelola #101 pada September 2026. Sebelum menjawab, model melakukan penalaran, dan penalaran tersebut termasuk dalam batas output: atur max_tokens mulai dari 600 bahkan untuk jawaban pendek, aktifkan stream, dan untuk tugas sederhana matikan penalaran melalui reasoning_effort: low — nilai lainnya membiarkannya penuh (gateway mengubah none dan minimal menjadi low). Tool calling (termasuk putaran berulang) dan mode JSON berfungsi; konteks dalam jaringan adalah 390.000 token, output hingga 8.192. Harganya sama dengan MiniMax M2.7 dan DeepSeek V4 Flash: melalui JoinGonka Gateway — $0.0069 per juta token input dan $0.021 per juta token output. Pengenal: zai-org/GLM-5.3-Flash; susunan jaringan saat ini — GET /v1/models.

Ingin tahu lebih banyak?

Jelajahi bagian lain atau mulai hasilkan GNK sekarang.

Coba GLM-5.3 Flash melalui Gateway →