Bagian Basis Pengetahuan ▾

Teknologi

DeepSeek V4 Flash: model jaringan Gonka dengan konteks 380K

Pada Agustus 2026, jaringan Gonka mendapatkan model ketiga yang beroperasi — DeepSeek V4 Flash. Proposal tata kelola #94 tentang penambahannya diajukan oleh tim kaitaku.ai, yang dikenal di komunitas karena pengoptimalan ML-node mereka: mereka menjalankan eksperimen yang mengonfirmasi kompatibilitas model dengan Proof of Compute dan validasi jaringan, dan proposal tersebut disetujui melalui pemungutan suara pada 12 Agustus. Keesokan harinya, model tersebut sudah melayani permintaan.

Bagi pengguna, ini adalah perluasan kemampuan yang nyata: DeepSeek V4 Flash memiliki jendela konteks terpanjang di jaringan — 380.000 token (hampir dua kali lipat dari Kimi K2.6 dan MiniMax M2.7), reasoning bawaan, dan tool calling penuh. Kami akan membahas apa model ini, siapa pembuatnya, karakteristik apa yang dimilikinya secara spesifik di jaringan Gonka, apa yang ditunjukkan oleh benchmark — dan kapan harus memilihnya alih-alih dua model jaringan lainnya.

Apa itu DeepSeek V4 Flash dan siapa di baliknya

DeepSeek adalah laboratorium AI asal Hangzhou, Tiongkok, yang mendapatkan popularitas dunia setelah rilis V3 dan R1: R1-lah yang pada awal 2025 menunjukkan bahwa model open-source dapat mengejar model tertutup dengan sebagian kecil anggaran mereka. Pada April 2026, DeepSeek merilis keluarga V4 dari dua model: V4 Pro yang berat dan V4 Flash yang ringan. Keduanya terbuka (lisensi MIT), keduanya dibangun di atas arsitektur MoE.

V4 Flash memiliki 284 miliar parameter, dengan sekitar 13 miliar di antaranya diaktifkan per token. Kelangkaan ini membuat model cepat dan murah dalam pemeliharaan: ia membutuhkan VRAM yang jauh lebih sedikit dibandingkan raksasa "padat", dan kecepatan generasinya lebih tinggi.

Di jaringan Gonka, versi yang bekerja adalah V4-Flash-0731 — build hasil pelatihan ulang (re-post-training) dari 31 Juli 2026. Arsitektur dan ukuran tidak berubah, tetapi kualitas dalam tugas agen meningkat drastis: menurut sembilan benchmark agen dan coding yang diterbitkan DeepSeek, build 0731 bahkan melampaui flagship mereka sendiri, V4 Pro, dalam versi preview. Catatan penting untuk kejujuran: sebagian angka ini adalah pengukuran oleh DeepSeek sendiri di testbed mereka, yang pada saat penulisan belum dirilis ke publik, jadi belum ada replikasi independen. Kesenjangan dengan model tertutup tetap ada: build 0731 tidak melampaui Claude Opus 4.8 dalam satu pun dari sembilan benchmark — tetapi biayanya jauh lebih murah, dan itulah intinya: kualitas agen maksimal dengan sebagian kecil harga.

Karakteristik DeepSeek V4 Flash di jaringan Gonka

Seperti model jaringan lainnya, penting untuk membedakan karakteristik model "siap pakai" dengan parameter kerja deployment spesifik: parameter tersebut ditentukan oleh konfigurasi inferensi vLLM pada GPU-host jaringan. Nilai aktual melalui Gateway kami:

  • Jendela konteks: 380.000 token — terpanjang di jaringan Gonka. Kami telah mengujinya secara empiris: permintaan dengan input 381.000 token diterima dan diproses dalam puluhan detik. Arsitektur V4 Flash sendiri mendukung konteks hingga 1 juta token; batas praktis di jaringan ditentukan oleh konfigurasi host (jendela inferensi 400.000).
  • Output maksimal: 8.192 token per jawaban — batas tunggal untuk semua model jaringan (konfigurasi gateway, bukan batasan model).
  • Reasoning dan tool calling: model di-deploy dengan parser penalaran dan pemanggilan alat — skenario agen (Cursor, Claude Code, LangChain) berfungsi langsung; kami telah menjalankan skenario alat multi-langkah melalui jalur yang kompatibel dengan OpenAI dan Anthropic.
  • Persyaratan VRAM host: sekitar 280 GB — model paling ringan di jaringan (sebagai perbandingan: MiniMax M2.7 — 320 GB, Kimi K2.6 — 720 GB). Semakin rendah ambang batas perangkat keras, semakin mudah bagi host untuk men-deploy model — ini adalah tanda yang baik untuk ketersediaannya di jaringan.

Harga inferensi di jaringan Gonka tidak bergantung pada pemilihan model: DeepSeek V4 Flash tersedia dengan tarif yang sama dengan Kimi K2.6 dan MiniMax M2.7 — melalui JoinGonka Gateway, ini adalah $0.0032 per satu juta token input dan $0.0097 per satu juta token output. Sebagai referensi: API resmi DeepSeek menjual model yang sama dengan harga $0.14/$0.28 per juta, OpenRouter — mulai dari $0.08/$0.18. Ekonomi jaringan adalah topik terpisah: harga ditentukan oleh perhitungan pekerjaan komputasi, bukan harga vendor.

DeepSeek V4 Flash, Kimi K2.6, dan MiniMax M2.7 — perbandingan

Sekarang terdapat tiga model yang beroperasi di jaringan (yang keempat, GLM-5.2, sudah terdaftar dan menunggu penerapan). Perbandingan singkat:

ParameterDeepSeek V4 FlashKimi K2.6MiniMax M2.7
Konteks di jaringan380 000200 000200 000
Output per respons8 1928 1928 192
ArsitekturMoE 284B (~13B aktif)MoE kelas ~1TMoE
VRAM per node280 GB720 GB320 GB
KeunggulanKonteks panjang, reasoning, kecepatanTugas agen, kodePengembangan harian, stabilitas
Harga via Gatewaysama — $0.0032 input / $0.0097 output per 1M

Konsekuensi praktis dari harga yang sama: Anda dapat memilih model murni berdasarkan tugas, tanpa memikirkan anggaran. Butuh konteks terpanjang atau jawaban cepat dengan penalaran — DeepSeek V4 Flash; keandalan agen maksimal pada kode yang kompleks — Kimi K2.6; kuda beban yang andal untuk sehari-hari — MiniMax M2.7.

Benchmark V4-Flash-0731: apa yang ditunjukkan oleh build ini

Hasil utama yang dipublikasikan untuk build 0731 (menurut data DeepSeek dan agregator independen):

  • SWE-bench Verified: 79,0% — penyelesaian tugas GitHub nyata; tingkat yang setahun lalu hanya tersedia untuk model flagship tertutup. Sebagai perbandingan: Kimi K2.6 — 71,3%.
  • GPQA Diamond: 88,1% — pertanyaan tingkat pascasarjana di bidang sains; mode penalaran yang diperluas menambahkan akurasi pada tugas multi-langkah.
  • Terminal Bench 2.1: 82,7 — pekerjaan di terminal oleh agen; versi preview Flash memiliki 61,8, V4 Pro Preview memiliki 72,1.
  • DeepSWE: 54,4 — benchmark ketat baru dari DeepSeek dengan tingkat false positive mendekati nol; angka ini dari vendor, stand belum dipublikasikan — harap dicatat.

Kerangka jujur: pada sembilan benchmark agen, build 0731 mengungguli V4 Pro Preview miliknya sendiri, tetapi tidak Claude Opus 4.8 — tertinggal rata-rata sekitar 6 poin. Namun, dengan harga per token, model ini dua tingkat lebih murah daripada Opus, dan melalui jaringan Gonka — puluhan kali lebih murah daripada API resmi DeepSeek. Rasio "kualitas mendekati frontier dengan sebagian kecil harga" inilah yang membuatnya menarik: pengukuran independen yang mendetail dapat dilihat di Artificial Analysis, bobot dan kartu model di Hugging Face.

Cara menggunakan DeepSeek V4 Flash melalui JoinGonka Gateway

Model ini tersedia melalui JoinGonka Gateway via API yang kompatibel dengan OpenAI dan Anthropic. ID model: deepseek-ai/DeepSeek-V4-Flash-0731.

Cara tercepat — penginstal satu perintah yang akan mengonfigurasi alat Anda (Claude Code, OpenClaw, Cline, opencode, Aider, dan lainnya) langsung ke model ini:

npx @joingonka/setup --model deepseek

Panggilan API Langsung (format OpenAI):

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer jg-kunci-anda" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Halo!"}]}'

Saat mendaftar, Anda mendapatkan 10 000 000 token gratis — dengan konteks 380K, ini adalah kesempatan untuk segera menguji model pada dokumen besar dan codebase yang nyata. Contoh langkah demi langkah dalam Python dan TypeScript tersedia di API Quickstart; Anda dapat mencoba tanpa mendaftar di chat gratis dengan memilih DeepSeek V4 Flash dalam daftar model.

Kapan memilih DeepSeek V4 Flash — skenario praktis

Skenario kuat untuk model ini:

  • Dokumen besar dan seluruh codebase. 380 000 token — setara dengan sekitar 280 000 kata: laporan tahunan, paket dokumen hukum, atau repositori menengah dapat masuk dalam satu permintaan, tanpa memotong menjadi potongan-potongan dan kehilangan hubungan antar bagian.
  • Sesi agen yang panjang. Agen otonom yang membaca file, memanggil alat, dan mengumpulkan riwayat akan mencapai batas konteks dengan sangat cepat — cadangan 380K token berarti sesi yang jauh lebih lama tanpa mereset memori.
  • RAG dengan sampel besar. Semakin banyak dokumen relevan yang masuk ke dalam konteks, semakin rendah ketergantungan pada akurasi pencarian.
  • Tugas dengan penalaran. Mode reasoning memberikan peningkatan pada matematika, sains, dan logika multi-langkah — dengan harga model biasa.

Kapan harus memilih model jaringan yang lain: untuk pengodean agen yang paling andal pada repositori yang kompleks, Kimi K2.6 tetap kuat (analisis mendetail ada di artikel tentang model terbaik untuk kode), dan MiniMax M2.7 tetap menjadi kuda beban yang terbukti untuk tugas sehari-hari. Berkat harga yang seragam, Anda dapat bereksperimen dengan bebas — mengganti model hanya dengan satu baris dalam permintaan.

DeepSeek V4 Flash 0731 — model MoE dari DeepSeek (284B parameter, ~13B aktif, lisensi MIT), ditambahkan ke jaringan Gonka melalui proposal tata kelola #94 dari tim kaitaku.ai dan aktif sejak 13 Agustus 2026. Perbedaan utama adalah konteks terpanjang di jaringan: 380.000 token (diverifikasi oleh permintaan nyata sebesar 381K), ditambah penalaran dan tool calling. SWE-bench Verified 79,0%, GPQA Diamond 88,1% — sangat mendekati frontier dengan harga dua tingkat lebih rendah dari flagship tertutup; melalui JoinGonka Gateway — dengan tarif yang sama dengan Kimi K2.6 dan MiniMax M2.7, puluhan kali lebih murah daripada API resmi DeepSeek. Identifikasi: deepseek-ai/DeepSeek-V4-Flash-0731; mulai cepat — npx @joingonka/setup --model deepseek.

Ingin tahu lebih banyak?

Jelajahi bagian lain atau mulai hasilkan GNK sekarang.

Coba DeepSeek V4 Flash melalui Gateway →