Bagian Basis Pengetahuan ▾

Teknologi

Kimi K2.6: model yang sebelumnya didukung oleh Gonka

Untuk waktu yang lama, jaringan Gonka berjalan pada satu model — Qwen3-235B dari Alibaba Cloud. Pada Mei 2026, hal itu berubah: dukungan untuk beberapa model diluncurkan melalui mekanisme DevShards, dan Kimi K2.6 dari perusahaan Tiongkok, Moonshot AI, menjadi yang pertama. Kemudian, MiniMax M2.7 dan DeepSeek V4 Flash ditambahkan, sementara Qwen3-235B ditarik dari jaringan. Pada September 2026, giliran Kimi K2.6: host berhenti melayaninya, dan proposal tata kelola #101 mengukuhkan kepergiannya — GLM-5.3 Flash mengambil tempatnya di dalam jaringan. Saat ini, Gonka melayani tiga model: MiniMax M2.7, DeepSeek V4 Flash, dan GLM-5.3 Flash. Mari kita bedah apa itu Kimi K2.6, perbedaannya dengan MiniMax M2.7, bagaimana Gonka secara teknis mengimplementasikan multi-model, mengapa model tersebut meninggalkan jaringan, dan apa yang harus dipilih sebagai penggantinya saat ini.

Apa itu Kimi K2.6 dari Moonshot AI

Kimi K2.6 — model bahasa besar (LLM) dari seri Kimi, yang dikembangkan oleh perusahaan asal Beijing, Moonshot AI. Moonshot AI adalah salah satu laboratorium AI terkemuka di Tiongkok, didirikan pada tahun 2023 oleh tim peneliti di bawah pimpinan Yang Zhilin. Perusahaan ini berhasil mengumpulkan pendanaan dari Alibaba, Tencent, dan investor besar lainnya, serta masuk dalam daftar "macan AI Tiongkok" — perusahaan-perusahaan yang menentukan laju perkembangan AI di Asia.

Seri Kimi dikenal sejak tahun 2024. Versi-versi awal (K1, K1.5) langsung menarik perhatian berkat jendela konteksnya yang luar biasa panjang — hingga 200.000 token dalam satu permintaan, yang saat dirilis merupakan rekor untuk model yang tersedia untuk publik. Konteks panjang berarti kemampuan praktis untuk menganalisis seluruh buku, basis kode berukuran sedang, atau kumpulan dokumen hukum dalam satu permintaan. Pada saat Kimi dirilis, karakteristik ini menjadi keunggulan kompetitif yang kuat.

Versi K2 muncul pada tahun 2025 dan membawa lompatan arsitektural yang mendasar — peralihan ke MoE (Mixture of Experts). Arsitektur yang sama juga mendasari Qwen3-235B dan DeepSeek-R1 — arsitektur ini telah menjadi standar de facto untuk model-model terbesar pada tahun 2025—2026. MoE memungkinkan model memiliki ratusan miliar parameter secara "total", tetapi hanya mengaktifkan sebagian kecil (biasanya 5—10%) pada setiap permintaan, yang secara radikal menurunkan biaya komputasi inference dengan kualitas yang setara.

K2.6 adalah iterasi terakhir seri K2 pada saat artikel ini ditulis. Dari pernyataan publik Moonshot AI, versi ini meningkatkan kemampuan model dalam reasoning (penalaran logis), pembuatan kode, dan pemanggilan alat secara native (tool calling). Selama model ini dilayani oleh jaringan Gonka, model tersedia dengan pengenal moonshotai/Kimi-K2.6; saat ini gateway tidak lagi menerima pengenal tersebut — daftar model terbaru selalu tersedia melalui GET /v1/models.

Perbandingan Kimi K2.6 dan MiniMax M2.7

Kedua model tersebut mewakili pengembangan unggulan dari laboratorium AI Tiongkok terbesar; selama keduanya dilayani oleh jaringan, keduanya tersedia melalui antarmuka tunggal yang kompatibel dengan OpenAI, JoinGonka Gateway — hari ini, dari pasangan ini, hanya MiniMax M2.7 yang tersedia melalui gateway. Namun, mereka memiliki kekuatan dan warisan yang berbeda, yang membuat pilihan di antara keduanya bukan pertanyaan tentang "mana yang lebih baik", melainkan "mana yang sesuai dengan tugasnya".

KarakteristikKimi K2.6MiniMax M2.7
ProdusenMoonshot AI (Beijing)MiniMax (Shanghai)
Tahun pendirian perusahaan20232021
ArsitekturMoEMoE + linear attention
Jendela konteks200.000 token200.000 token
KekuatanReasoning, konteks panjang, code generationKonteks panjang, attention (linear) yang efisien
Harga melalui JoinGonka— (model ditarik dari jaringan)$0.0069 per 1M token
Pengidentifikasi APImoonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7
Status di jaringan GonkaDilayani dari Mei hingga September 2026, ditarik (proposal #101)Model aktif (sejak Mei 2026, peningkatan v0.2.13)

Pada benchmark reasoning (MATH-500, GSM8K, AIME), seri Kimi K2 secara historis menunjukkan hasil di kelompok teratas model open-weights, bersaing dengan model DeepSeek-R1 dan model gaya o1. Pada tugas pembuatan kode (HumanEval, MBPP), kedua model berada di tingkat yang serupa. Kekuatan MiniMax M2.7 adalah attention (linear) yang efisien untuk urutan yang sangat panjang, sedangkan Kimi dikenal karena reasoning yang kuat dan konteks panjang dari seri Kimi.

Peringatan penting tentang benchmark di tahun 2026: kesenjangan antara model top dalam pengujian publik telah menyusut hingga beberapa persen, dan perbedaan ini sering kali berada dalam margin kesalahan statistik benchmark itu sendiri. Untuk pekerjaan praktis, yang penting bukan "siapa yang 2% lebih tinggi di MMLU", melainkan sifat tugasnya: konteks apa yang Anda berikan ke model, seberapa rumit rantai logikanya, apakah diperlukan riwayat dialog yang panjang, bahasa apa yang digunakan. Oleh karena itu, tabel di atas tidak memeringkat model — tabel tersebut membantu memahami dengan cepat untuk profil tugas mana masing-masing model dioptimalkan.

Untuk pilihan praktis hari ini: ceruk Kimi K2.6 — konteks panjang (analisis dokumen besar, membaca basis kode yang tebal, dialog panjang dengan penyimpanan riwayat) dan tugas reasoning yang rumit — dalam komposisi jaringan saat ini ditutup oleh dua model. Untuk penalaran, GLM-5.3 Flash bertanggung jawab: ia berpikir sebelum menjawab, dan itulah yang harus dipilih untuk logika yang membingungkan; ia juga memiliki konteks terpanjang di jaringan (390K). Untuk prompt besar tanpa penalaran dan sesi agen yang panjang — DeepSeek V4 Flash (380K, konteks terpanjang kedua). Jika prioritasnya adalah pemrosesan urutan input yang sangat panjang dan data streaming dengan respons cepat — MiniMax M2.7 dengan attention-nya yang efisien. Strategi yang baik dalam produksi tidak berubah — simpan beberapa model jaringan dalam kode Anda: perubahan cepat melalui parameter model memungkinkan peralihan di antara mereka tergantung pada tugas tanpa mengubah arsitektur aplikasi.

DevShards: bagaimana Gonka meluncurkan model kedua

Hingga musim semi 2026, seluruh jaringan Gonka hanya melayani satu model: Qwen3-235B. Dari sisi arsitektur, ini keputusan yang masuk akal: inference terdistribusi lewat DiLoCo mengharuskan semua peserta jaringan menyimpan model yang sama di memori video, kalau tidak, mustahil menjamin setiap node bisa memproses permintaan apa pun. Qwen3-235B penuh dalam format FP8 memakan sekitar 640 GB VRAM, yang sejak awal sudah menjadi komitmen besar bagi setiap ML-node.

Untuk beralih ke jaringan multi-model, dibutuhkan mekanisme yang memungkinkan beberapa model berjalan bersamaan tanpa menuntut setiap host menjalankan semuanya. Mekanisme itulah yang disebut DevShards — shard terpisah dalam jaringan, masing-masing mengkhususkan diri pada satu model. Node di dalam satu shard mengerjakan model yang sama, dan router jaringan mengarahkan permintaan ke shard yang memiliki model yang dituju.

Ide ini bukan muncul begitu saja — gagasan ini diformalkan dalam Gonka Improvement Proposal #800 «Multi-Model PoC», yang diputuskan lewat voting komunitas pada musim semi 2026. Proposal ini mendapat dukungan peserta dan validator jaringan lalu diimplementasikan pada April—Mei 2026. Kimi K2.6 menjadi model pertama yang diluncurkan di DevShard tersendiri — praktis menjadi implementasi uji coba pendekatan baru ini. Hasilnya sukses: menyusul kemudian MiniMax M2.7, DeepSeek V4 Flash, dan GLM-5.3 Flash hadir di shard masing-masing — semuanya dengan kumpulan host dan ekonomi sendiri. Mekanisme yang sama juga berlaku sebaliknya: model yang tidak lagi didukung host akan dikeluarkan dari jaringan lewat voting — itulah cara Kimi K2.6 sendiri pamit pada September 2026.

Artinya bagi pengguna dan developer:

  • Satu API — banyak model. Lewat JoinGonka Gateway, tidak perlu ganti endpoint atau kunci: cukup tentukan model lain di body permintaan. Format yang kompatibel dengan OpenAI tetap terjaga sepenuhnya.
  • Harganya tetap sama. Selama Kimi K2.6 dilayani, tarifnya sama dengan MiniMax M2.7; tarif tunggal jaringan ini juga berlaku untuk model-model yang ada sekarang — $0.0069 per 1M token lewat Gateway. Penetapan harga tunggal ini keputusan sengaja untuk memudahkan migrasi pengguna antar model.
  • Stabilitas bergantung pada beban shard. Pada tahap awal, shard model baru punya lebih sedikit host, jadi saat permintaan menumpuk, model bisa sementara mengembalikan 429 too many concurrent requests. Ini fase yang wajar untuk model baru: seiring minat bertambah, host bergabung ke shard-nya dan limitnya naik. Berlaku juga sebaliknya — kalau host hengkang dari shard, kapasitas model berkurang; begitulah akhir kisah Kimi K2.6 di jaringan ini.
  • Tool calling tiap model berbeda. Untuk Kimi K2.6 di jaringan Gonka, saat awal sempat ada masalah kecil dengan pemilihan tool otomatis (tool_choice: "auto"), yang kemudian diperbaiki lewat pembaruan node. Pelajarannya tetap relevan untuk model apa pun di jaringan ini: format pemanggilan tool adalah ciri khas model tertentu di node tertentu, jadi untuk skenario produksi yang kritis, uji dulu perilaku model pilihan Anda dengan permintaan Anda sendiri.

Apa penggantinya dan apa yang harus dipilih sekarang

Jawaban langsung: melalui jaringan Gonka, Kimi K2.6 tidak lagi tersedia. Host berhenti melayaninya pada awal September 2026, dan proposal governance #101 mengeluarkan model tersebut dari daftar model jaringan secara permanen — permintaan dengan model: "moonshotai/Kimi-K2.6" akan ditolak oleh gateway. Karena bobot modelnya terbuka, Anda masih bisa mendapatkannya dari hosting pihak ketiga untuk model open-weights (misalnya melalui OpenRouter) atau menyebarkannya sendiri.

Namun jika yang Anda butuhkan adalah inference terdesentralisasi murah yang membuat orang datang ke Gonka, itu tidak hilang — hanya saja kini berjalan pada model-model aktif jaringan. Melalui JoinGonka API Gateway dengan API yang kompatibel dengan OpenAI dan Anthropic, tersedia tiga model, dan masing-masing menutupi sebagian dari apa yang membuat Kimi dihargai:

  • GLM-5.3 Flash (zai-org/GLM-5.3-Flash) — model reasoning dari Z.ai: bernalar sebelum menjawab, jadi inilah pilihan untuk logika rumit, analisis kode, dan tugas "berpikir"; model ini juga punya konteks terpanjang di jaringan (390K). Penalaran masuk ke dalam batas respons — tetapkan max_tokens dengan cadangan dan aktifkan stream.
  • DeepSeek V4 Flash (deepseek-ai/DeepSeek-V4-Flash-0731) — salah satu konteks terpanjang di jaringan (380K), output terpanjang, dan agentic coding yang kuat: repo besar, rantai pemanggilan tool yang panjang.
  • MiniMax M2.7 (MiniMaxAI/MiniMax-M2.7) — model default gateway: respons cepat dan stabil untuk tugas sehari-hari, dokumen panjang, dan pemrosesan streaming.

Bermigrasi dari Kimi K2.6 hanya berarti mengganti satu baris. Kode apa pun yang ditulis untuk OpenAI berjalan tanpa perubahan: cukup ganti URL, API key, dan nama model.

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMaxAI/MiniMax-M2.7",
    "messages": [{"role": "user", "content": "Explain the difference between MoE and dense models"}]
  }'

Di alat pengembangan, aturannya sama: di mana pun konfigurasi memuat moonshotai/Kimi-K2.6, ganti dengan ID salah satu model aktif. Di Cursor itu field Custom Model, di Claude Code itu variabel lingkungan ANTHROPIC_MODEL atau flag --model, di OpenClaw, Cline, dan Continue.dev itu nama model di config provider, di LangChain dan n8n itu parameter model saat inisialisasi klien. Installer npx @joingonka/setup akan menuliskan gateway dan model terkini ke config alat dengan satu perintah. Daftar model yang tersedia selalu terbaru di endpoint GET /v1/models — praktis untuk menariknya secara dinamis ke UI aplikasi Anda, agar model yang keluar atau masuk di jaringan tidak merusak produk Anda.

Untuk mencoba tanpa registrasi, tersedia chat gratis di halaman /try — di sana tersedia model-model aktif jaringan. Dengan mendaftar di JoinGonka Gateway, Anda mendapat 3M token gratis untuk menguji semua model jaringan — cukup untuk menjalankan tugas Anda di ketiga model dan memilih penggantinya secara sadar.

Apa yang ditunjukkan kisah Kimi K2.6 bagi jaringan Gonka: mekanisme DevShards bekerja dua arah. Ia memungkinkan penambahan model tanpa menghentikan jaringan — setelah Kimi datang MiniMax M2.7, DeepSeek V4 Flash, dan GLM-5.3 Flash — dan ia juga memungkinkan penarikan model yang tak lagi didukung host tanpa hambatan. Jaringan yang terikat pada satu model pada dasarnya rapuh; jaringan yang mampu mengubah komposisinya lewat voting berevolusi dengan lembut dan berkelanjutan. Bagi developer, aturannya sederhana: jangan "memilih model untuk selamanya", melainkan simpan nama model di konfigurasi dan periksa daftar yang aktif.

Kimi K2.6 adalah model MoE dari Moonshot AI dengan konteks panjang dan kemampuan reasoning yang kuat. Pada Mei 2026, model ini menjadi model kedua di jaringan Gonka setelah Qwen3-235B, yang diluncurkan melalui mekanisme DevShards (shard terpisah untuk setiap model), dan dilayani oleh jaringan hingga September 2026 ketika host berhenti mendukungnya dan proposal tata kelola #101 menghapusnya dari keanggotaan. Saat ini, melalui JoinGonka Gateway dengan API yang kompatibel dengan OpenAI, tersedia MiniMax M2.7, DeepSeek V4 Flash, dan GLM-5.3 Flash — dengan tarif jaringan tunggal sebesar $0.0069 per 1M token; ceruk Kimi (reasoning dan konteks panjang) kini ditutup oleh GLM-5.3 Flash dan DeepSeek V4 Flash. Kimi K2.6 sendiri tetap menjadi model open-weights dan tersedia di penyedia hosting pihak ketiga.

Ingin tahu lebih banyak?

Jelajahi bagian lain atau mulai hasilkan GNK sekarang.

Coba model Gonka yang aktif →