Bagian Basis Pengetahuan ▾
Navigasi
▸ Mulai di sini Berdasarkan peranKategori
- Arsitektur jaringan Gonka: Sprint, Transfer Agents, DiLoCo
- Pengembang: Cara Mendapatkan GNK
- Hosting Mandiri: Panduan Langkah demi Langkah
- Memilih GPU untuk Gonka: Rekomendasi Perangkat Keras
- Qwen3-235B: model yang sebelumnya dilayani oleh Gonka
- Kimi K2.6: model yang sebelumnya didukung oleh Gonka
- MiniMax M2.7: model jaringan Gonka
- DeepSeek V4 Flash: model jaringan Gonka dengan konteks 380K
- GLM-5.3 Flash: model reasoning Z.ai di jaringan Gonka
Teknologi
DeepSeek V4 Flash: model jaringan Gonka dengan konteks 380K
Pada Agustus 2026, model aktif ketiga muncul di jaringan Gonka — DeepSeek V4 Flash. Proposal governance #94 untuk penambahannya diajukan oleh tim kaitaku.ai, yang dikenal di komunitas berkat optimasi ML-node: mereka menjalankan eksperimen yang mengonfirmasi kompatibilitas model dengan Proof of Compute dan validasi jaringan, dan pada 12 Agustus proposal itu disetujui lewat pemungutan suara. Keesokan harinya, model tersebut sudah melayani permintaan.
Bagi pengguna, ini memperluas kemampuan secara signifikan: DeepSeek V4 Flash memiliki jendela konteks 380.000 token — salah satu yang terpanjang di jaringan (hampir dua kali lipat MiniMax M2.7; hanya GLM-5.3 Flash yang sedikit lebih panjang — 390.000), dengan reasoning bawaan dan tool calling yang lengkap. Mari kita bahas model apa ini, siapa pembuatnya, bagaimana karakteristiknya khusus di jaringan Gonka, apa kata benchmark — dan kapan sebaiknya memilihnya dibanding dua model lain di jaringan.
Apa itu DeepSeek V4 Flash dan siapa di baliknya
DeepSeek adalah laboratorium AI asal Hangzhou, Tiongkok, yang mendapatkan popularitas dunia setelah rilis V3 dan R1: R1-lah yang pada awal 2025 menunjukkan bahwa model open-source dapat mengejar model tertutup dengan sebagian kecil anggaran mereka. Pada April 2026, DeepSeek merilis keluarga V4 dari dua model: V4 Pro yang berat dan V4 Flash yang ringan. Keduanya terbuka (lisensi MIT), keduanya dibangun di atas arsitektur MoE.
V4 Flash memiliki 284 miliar parameter, dengan sekitar 13 miliar di antaranya diaktifkan per token. Kelangkaan ini membuat model cepat dan murah dalam pemeliharaan: ia membutuhkan VRAM yang jauh lebih sedikit dibandingkan raksasa "padat", dan kecepatan generasinya lebih tinggi.
Di jaringan Gonka, versi yang bekerja adalah V4-Flash-0731 — build hasil pelatihan ulang (re-post-training) dari 31 Juli 2026. Arsitektur dan ukuran tidak berubah, tetapi kualitas dalam tugas agen meningkat drastis: menurut sembilan benchmark agen dan coding yang diterbitkan DeepSeek, build 0731 bahkan melampaui flagship mereka sendiri, V4 Pro, dalam versi preview. Catatan penting untuk kejujuran: sebagian angka ini adalah pengukuran oleh DeepSeek sendiri di testbed mereka, yang pada saat penulisan belum dirilis ke publik, jadi belum ada replikasi independen. Kesenjangan dengan model tertutup tetap ada: build 0731 tidak melampaui Claude Opus 4.8 dalam satu pun dari sembilan benchmark — tetapi biayanya jauh lebih murah, dan itulah intinya: kualitas agen maksimal dengan sebagian kecil harga.
Karakteristik DeepSeek V4 Flash di jaringan Gonka
Seperti pada model lain di jaringan, penting untuk membedakan karakteristik model "bawaan pabrik" dengan parameter operasional penerapan tertentu: itu ditentukan oleh konfigurasi inferensi vLLM di host GPU jaringan. Nilai aktualnya melalui Gateway kami:
- Jendela konteks: 380.000 token — salah satu yang terpanjang di jaringan Gonka (hanya GLM-5.3 Flash yang lebih besar — 390.000). Kami mengujinya secara empiris: permintaan dengan input 381.000 token diterima dan diproses dalam hitungan puluhan detik. Arsitektur V4 Flash sendiri mendukung konteks hingga 1 juta token; plafon praktis di jaringan ditentukan oleh konfigurasi host (jendela inferensi 400.000).
- Output maksimum: 32.768 token per respons — plafon terbesar di jaringan: pada MiniMax M2.7 dan GLM-5.3 Flash empat kali lebih kecil — 8.192; pada keduanya, ini konfigurasi gateway, bukan batas model.
- Reasoning dan tool calling: model diterapkan dengan parser penalaran dan pemanggilan tool — skenario agentik (Cursor, Claude Code, LangChain) langsung berfungsi; kami menguji skenario tool multi-langkah melalui jalur yang kompatibel dengan OpenAI dan Anthropic.
- Kebutuhan VRAM host: sekitar 280 GB — model paling ringan di jaringan (sebagai perbandingan: MiniMax M2.7 — 320 GB, GLM-5.3 Flash — 560 GB). Semakin rendah ambang perangkat keras, semakin mudah host menerapkan model — pertanda baik untuk ketersediaannya di jaringan.
Harga inferensi di jaringan Gonka tidak bergantung pada pilihan model: DeepSeek V4 Flash tersedia dengan tarif yang sama seperti MiniMax M2.7 dan GLM-5.3 Flash — melalui JoinGonka Gateway, yaitu $0.0069 per juta token input dan $0.021 per juta token output. Sebagai acuan: penyedia pihak ketiga di OpenRouter menawarkan model yang sama mulai dari $0.06/$0.12 per juta, dan DeepSeek sendiri pada September 2026 menarik V4 Flash 0731 dari API-nya — permintaan ke model itu kini dilayani oleh DeepSeek-V4.1-Flash dengan harga $0.30/$1.20 pada jam sibuk. Ekonomi jaringan adalah topik tersendiri: harga ditentukan oleh penyelesaian komputasi, bukan oleh daftar harga vendor.
Perbandingan DeepSeek V4 Flash, MiniMax M2.7, dan GLM-5.3 Flash
Terdapat tiga model aktif di jaringan — DeepSeek V4 Flash, MiniMax M2.7, dan GLM-5.3 Flash (Kimi K2.6 telah ditarik dari jaringan pada September 2026, dan GLM-5.2 yang lama terdaftar dalam registri tidak pernah masuk ke operasional). Perbandingan singkat:
| Parameter | DeepSeek V4 Flash | MiniMax M2.7 | GLM-5.3 Flash |
|---|---|---|---|
| Konteks jaringan | 380.000 | 200.000 | 390.000 |
| Output per respons | 32.768 | 8.192 | 8.192, termasuk penalaran |
| Arsitektur | MoE 284B (~13B aktif) | MoE + linear attention | MoE 320B (~18B aktif), hybrid attention |
| VRAM per node | 280 GB | 320 GB | 560 GB |
| Kelebihan | Konteks panjang, reasoning, kecepatan | Pengembangan sehari-hari, stabilitas | Logika rumit, analisis kode, tugas berpikir |
| Harga via Gateway | sama — $0.0069 input / $0.021 output per 1M | ||
Konsekuensi praktis dari harga yang sama: Anda dapat memilih model berdasarkan tugas tanpa memikirkan anggaran. Memerlukan prompt besar dengan jawaban cepat dan output terpanjang — DeepSeek V4 Flash; tugas yang membutuhkan pemikiran mendalam mengenai logika rumit (dan konteks jaringan terpanjang) — GLM-5.3 Flash; kuda beban kerja sehari-hari yang stabil — MiniMax M2.7.
Benchmark V4-Flash-0731: apa yang ditunjukkan oleh build ini
Hasil utama yang dipublikasikan untuk build 0731 (menurut DeepSeek dan agregator independen):
- SWE-bench Verified: 79,0% — penyelesaian tugas GitHub nyata; tingkat yang setahun lalu hanya tersedia untuk model flagship tertutup. Sebagai perbandingan: Kimi K2.6, yang sebelumnya dilayani jaringan, mencapai 71,3%.
- GPQA Diamond: 88,1% — pertanyaan tingkat pascasarjana dalam sains; mode penalaran yang diperluas menambah akurasi pada tugas multi-langkah.
- Terminal Bench 2.1: 82,7 — bekerja di terminal sebagai agen; versi preview Flash mencapai 61,8, dan V4 Pro Preview 72,1.
- DeepSWE: 54,4 — benchmark ketat baru dari DeepSeek dengan tingkat positif palsu yang hampir nol; angka berasal dari vendor, stand pengujian belum dipublikasikan — harap dicatat.
Kerangka jujur: berdasarkan sembilan benchmark agen, build 0731 mengungguli V4 Pro Preview miliknya sendiri, tetapi tidak Claude Opus 4.8 — tertinggal rata-rata sekitar 6 poin. Namun, harga per token model ini dua kali lipat lebih murah daripada Opus, dan melalui jaringan Gonka — bahkan ~9 kali lebih murah daripada model yang sama di penyedia pihak ketiga di OpenRouter. Rasio "kualitas mendekati frontier dengan sebagian kecil harga" inilah yang membuatnya menarik: pengukuran independen yang mendetail dapat dilihat di Artificial Analysis, sedangkan bobot dan kartu model ada di Hugging Face.
Cara menggunakan DeepSeek V4 Flash melalui JoinGonka Gateway
Model ini tersedia lewat JoinGonka Gateway dengan API yang kompatibel dengan OpenAI dan Anthropic. ID model: deepseek-ai/DeepSeek-V4-Flash-0731.
Cara tercepat — installer satu perintah yang langsung mengonfigurasi alat Anda (Claude Code, OpenClaw, Cline, opencode, Aider, dan lainnya) ke model ini:
npx @joingonka/setup --model deepseekDi tempat installer menulis config sendiri (Claude Code, Codex CLI, OpenClaw, opencode, Kilo Code, Hermes, Pi, dan lainnya), DeepSeek V4 Flash sudah terpasang secara default tanpa flag. Flag dibutuhkan untuk mengganti alat yang sudah dikonfigurasi, dan di tempat installer menampilkan nilai untuk ditempel (Cursor, Cline, Aider). Model jaringan lainnya dipilih dengan cara yang sama: --model minimax dan --model glm.
Panggilan API langsung (format OpenAI):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-your-key" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Hello!"}]}'Saat mendaftar, Anda mendapatkan 3M token gratis — dengan konteks 380K, ini kesempatan langsung menguji model pada dokumen besar dan basis kode nyata. Contoh langkah demi langkah di Python dan TypeScript ada di API Quickstart; untuk mencoba tanpa mendaftar, buka chat gratis dan pilih DeepSeek V4 Flash di daftar model.
Kapan memilih DeepSeek V4 Flash — skenario praktis
Skenario unggulan untuk model ini:
- Dokumen besar dan seluruh basis kode. 380.000 token setara dengan sekitar 280.000 kata: laporan tahunan, paket dokumen hukum, atau repositori berukuran sedang muat dalam satu permintaan, tanpa pemotongan dan tanpa kehilangan keterkaitan antar bagian.
- Sesi agen yang panjang. Agen otonom yang membaca file, memanggil alat, dan mengakumulasi riwayat paling cepat menemui batas konteks — cadangan 380K token berarti sesi yang jauh lebih panjang tanpa reset memori.
- RAG dengan sampel besar. Semakin banyak dokumen relevan yang muat dalam konteks, semakin kecil ketergantungan pada presisi pencarian.
- Tugas penalaran. Mode reasoning memberikan peningkatan pada matematika, sains, dan logika multi-langkah — dengan harga model biasa.
Kapan model lain di jaringan lebih bijak dipilih: untuk tugas yang membutuhkan pemikiran atas logika rumit, ada GLM-5.3 Flash — model reasoning jaringan (pembahasan lengkap model untuk pengembangan ada di artikel tentang model terbaik untuk kode), sementara MiniMax M2.7 tetap menjadi andalan yang teruji untuk tugas sehari-hari. Berkat harga tunggal, Anda bebas bereksperimen — mengganti model cukup satu baris dalam permintaan.
Ingin tahu lebih banyak?
Jelajahi bagian lain atau mulai hasilkan GNK sekarang.
Coba DeepSeek V4 Flash melalui Gateway →