Các phần cơ sở kiến thức ▾

Công nghệ

Kimi K2.6: Mô hình mà Gonka từng hỗ trợ

Trong một thời gian dài, mạng lưới Gonka vận hành trên một mô hình duy nhất — Qwen3-235B từ Alibaba Cloud. Vào tháng 5 năm 2026, điều này đã thay đổi: hỗ trợ đa mô hình đã được triển khai thông qua cơ chế DevShards, và đại diện đầu tiên là Kimi K2.6 từ công ty Trung Quốc Moonshot AI. Sau đó, MiniMax M2.7 và DeepSeek V4 Flash đã được thêm vào, còn Qwen3-235B đã được gỡ khỏi mạng lưới. Vào tháng 9 năm 2026, đến lượt Kimi K2.6: các host đã ngừng hỗ trợ mô hình này, và đề xuất quản trị #101 đã xác nhận việc rời đi hoàn toàn — thay thế vị trí của nó trong mạng lưới là GLM-5.3 Flash. Ngày nay, Gonka hỗ trợ ba mô hình: MiniMax M2.7, DeepSeek V4 Flash và GLM-5.3 Flash. Hãy cùng tìm hiểu Kimi K2.6 là gì, nó khác biệt ra sao với MiniMax M2.7, cách Gonka hiện thực hóa kỹ thuật đa mô hình, lý do tại sao mô hình này rời mạng lưới và những gì bạn nên chọn thay thế ngay bây giờ.

Kimi K2.6 của Moonshot AI là gì

Kimi K2.6 — mô hình ngôn ngữ lớn (LLM) thuộc dòng Kimi, được phát triển bởi công ty Moonshot AI có trụ sở tại Bắc Kinh. Moonshot AI là một trong những phòng thí nghiệm AI hàng đầu của Trung Quốc, được thành lập năm 2023 bởi một nhóm nhà nghiên cứu do Yang Zhilin dẫn dắt. Công ty đã huy động được vốn từ Alibaba, Tencent và nhiều nhà đầu tư lớn khác, đồng thời lọt vào danh sách "những con hổ AI Trung Quốc" — những công ty định hình nhịp độ phát triển AI tại châu Á.

Dòng Kimi được biết đến từ năm 2024. Các phiên bản đầu tiên (K1, K1.5) ngay lập tức gây chú ý nhờ cửa sổ ngữ cảnh dài đặc biệt — lên tới 200.000 token trong một yêu cầu, một kỷ lục vào thời điểm ra mắt đối với các mô hình công khai. Ngữ cảnh dài đồng nghĩa với khả năng thực tế là phân tích trọn một cuốn sách, một cơ sở mã cỡ trung bình hay một tập tài liệu pháp lý chỉ trong một yêu cầu. Vào thời điểm Kimi ra mắt, đặc điểm này là một lợi thế cạnh tranh mạnh mẽ.

Phiên bản K2 xuất hiện vào năm 2025 và mang đến một bước nhảy vọt về kiến trúc — chuyển sang MoE (Mixture of Experts). Chính kiến trúc này cũng là nền tảng của Qwen3-235B và DeepSeek-R1 — nó đã trở thành tiêu chuẩn thực tế cho các mô hình lớn nhất giai đoạn 2025—2026. MoE cho phép sở hữu hàng trăm tỷ tham số "tổng cộng", nhưng mỗi yêu cầu chỉ kích hoạt một tập con (thường 5—10%), nhờ đó giảm mạnh chi phí tính toán cho inference mà vẫn giữ chất lượng tương đương.

K2.6 là phiên bản mới nhất của dòng K2 tại thời điểm viết bài. Theo các tuyên bố công khai của Moonshot AI, phiên bản này cải thiện khả năng reasoning (lập luận logic), sinh mã và gọi công cụ gốc (tool calling) của mô hình. Khi mô hình còn được vận hành qua mạng lưới Gonka, nó khả dụng dưới mã định danh moonshotai/Kimi-K2.6; hiện tại gateway không còn chấp nhận mã định danh này nữa — danh sách mô hình hiện hành luôn được trả về qua GET /v1/models.

So sánh Kimi K2.6 và MiniMax M2.7

Cả hai mô hình đều là các sản phẩm phát triển chủ chốt của các phòng thí nghiệm AI lớn nhất Trung Quốc; trong khi cả hai được mạng lưới phục vụ, chúng có thể truy cập qua giao diện tương thích OpenAI — JoinGonka Gateway — ngày nay trong cặp đôi này, chỉ có MiniMax M2.7 là khả dụng qua cổng kết nối. Đồng thời, chúng có những điểm mạnh và di sản khác nhau, điều này khiến việc lựa chọn giữa chúng không còn là câu hỏi «cái nào tốt hơn» mà là câu hỏi «cái nào phù hợp với nhiệm vụ nào».

Đặc điểmKimi K2.6MiniMax M2.7
Nhà sản xuấtMoonshot AI (Bắc Kinh)MiniMax (Thượng Hải)
Năm thành lập20232021
Kiến trúcMoEMoE + linear attention
Cửa sổ ngữ cảnh200.000 token200.000 token
Điểm mạnhReasoning, ngữ cảnh dài, code generationNgữ cảnh dài, attention hiệu quả (tuyến tính)
Giá qua JoinGonka— (mô hình đã bị rút khỏi mạng)$0.0069 trên 1M token
Định danh APImoonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7
Trạng thái trong mạng GonkaĐã phục vụ từ tháng 5 đến tháng 9 năm 2026, đã rút (proposal #101)Mô hình đang hoạt động (từ tháng 5 năm 2026, nâng cấp v0.2.13)

Trên các bảng xếp hạng benchmarking về reasoning (MATH-500, GSM8K, AIME), dòng Kimi K2 thường cho thấy kết quả ở nhóm cao nhất của các mô hình open-weights, cạnh tranh với DeepSeek-R1 và các mô hình theo phong cách o1. Trong các tác vụ tạo mã (HumanEval, MBPP), cả hai mô hình đều duy trì ở mức độ tương đương. Điểm mạnh của MiniMax M2.7 là attention hiệu quả (tuyến tính) cho các chuỗi rất dài, trong khi Kimi nổi tiếng với khả năng reasoning mạnh mẽ và ngữ cảnh dài của dòng Kimi.

Một lưu ý quan trọng về các bài kiểm tra benchmark vào năm 2026: khoảng cách giữa các mô hình hàng đầu trong các bài kiểm tra công khai đã thu hẹp xuống dưới vài phần trăm, và sự khác biệt này thường nằm trong sai số thống kê của chính các benchmark. Đối với công việc thực tế, điều quan trọng không phải là «ai cao hơn 2% trong MMLU», mà là tính chất của các tác vụ: bạn đang cung cấp ngữ cảnh nào cho mô hình, các chuỗi logic phức tạp đến mức nào, bạn có cần lịch sử đối thoại dài hay không, ngôn ngữ nào được sử dụng. Vì vậy, bảng trên không xếp hạng các mô hình — nó giúp hiểu nhanh mô hình nào được tối ưu hóa cho cấu hình tác vụ nào.

Đối với lựa chọn thực tế hôm nay: phân khúc của Kimi K2.6 — ngữ cảnh dài (phân tích tài liệu lớn, đọc cơ sở mã nguồn đồ sộ, các cuộc đối thoại dài giữ nguyên lịch sử) và các tác vụ reasoning phức tạp — trong thành phần hiện tại của mạng lưới đã được thay thế bằng hai mô hình khác. GLM-5.3 Flash đảm nhận việc suy luận: nó suy nghĩ trước khi trả lời, và đây chính là lựa chọn nên dùng cho các logic phức tạp; nó cũng có ngữ cảnh dài nhất mạng lưới (390K). Đối với các prompt lớn không cần suy luận và các phiên làm việc của agent dài — DeepSeek V4 Flash (380K, ngữ cảnh dài thứ hai). Nếu ưu tiên xử lý các chuỗi đầu vào rất dài và dữ liệu luồng với phản hồi nhanh — MiniMax M2.7 với attention hiệu quả. Chiến lược tốt trong sản xuất không thay đổi — duy trì một số mô hình của mạng lưới trong mã nguồn của bạn: việc thay đổi nhanh qua tham số model cho phép chuyển đổi giữa chúng tùy thuộc vào tác vụ mà không cần thay đổi kiến trúc ứng dụng.

DevShards: Gonka đã khởi chạy mô hình thứ hai như thế nào

Trước mùa xuân 2026, toàn bộ mạng lưới Gonka chỉ phục vụ đúng một mô hình duy nhất — Qwen3-235B. Dưới góc độ kiến trúc, đây là một quyết định hợp lý: inference phân tán thông qua DiLoCo đòi hỏi mọi thành viên trong mạng phải giữ cùng một mô hình trong bộ nhớ video, nếu không thì không thể đảm bảo rằng bất kỳ node nào cũng có thể xử lý bất kỳ yêu cầu nào. Qwen3-235B đầy đủ ở định dạng FP8 chiếm khoảng 640 GB VRAM, bản thân con số này đã là một cam kết khổng lồ đối với mỗi ML-node.

Để chuyển sang mạng đa mô hình, cần một cơ chế cho phép giữ nhiều mô hình cùng lúc mà không buộc mỗi host phải chạy tất cả chúng. Cơ chế đó chính là DevShards — các shard riêng biệt của mạng lưới, mỗi shard chuyên về một mô hình. Các node trong cùng một shard làm việc trên cùng một mô hình, còn bộ định tuyến của mạng chuyển yêu cầu đến shard có mô hình tương ứng.

Ý tưởng này không từ trên trời rơi xuống — nó đã được chính thức hóa trong Gonka Improvement Proposal #800 «Multi-Model PoC», được đưa ra bỏ phiếu trước cộng đồng vào mùa xuân 2026. Đề xuất đã nhận được sự ủng hộ của các thành viên và validator trong mạng lưới, và được triển khai trong tháng 4—5 năm 2026. Kimi K2.6 trở thành mô hình đầu tiên chạy trên một DevShard riêng — nghĩa là trên thực tế, đây là bản triển khai thử nghiệm của cách tiếp cận mới. Kinh nghiệm cho thấy thành công: tiếp theo đó, MiniMax M2.7, DeepSeek V4 Flash và GLM-5.3 Flash lần lượt xuất hiện trên các shard riêng, mỗi mô hình có bộ host riêng và nền kinh tế riêng. Cơ chế này cũng hoạt động theo chiều ngược lại: một mô hình không còn được các host hỗ trợ sẽ bị loại khỏi mạng lưới thông qua bỏ phiếu — chính vì vậy mà vào tháng 9 năm 2026, bản thân Kimi K2.6 cũng đã ra đi.

Điều này có ý nghĩa gì đối với người dùng và nhà phát triển:

  • Một API — nhiều mô hình. Thông qua JoinGonka Gateway, không cần thay đổi endpoint hay khóa: chỉ cần chỉ định một model khác trong nội dung yêu cầu. Định dạng tương thích với OpenAI được giữ nguyên hoàn toàn.
  • Giá vẫn như cũ. Trong thời gian Kimi K2.6 được phục vụ, nó được tính phí theo cùng mức giá như MiniMax M2.7; mức giá chung của mạng lưới cũng được giữ nguyên cho các mô hình hiện tại — $0.0069 cho 1M token qua Gateway. Giá thống nhất là một quyết định có chủ đích nhằm đơn giản hóa việc người dùng chuyển đổi giữa các mô hình.
  • Tính ổn định phụ thuộc vào tải của shard. Ở giai đoạn đầu, shard của mô hình mới có ít host hơn, nên khi các yêu cầu tập trung lại, mô hình có thể tạm thời trả về 429 too many concurrent requests. Đây là giai đoạn bình thường đối với một mô hình mới: khi mức độ quan tâm tăng lên, các host sẽ kết nối vào shard của nó và các giới hạn sẽ tăng theo. Điều ngược lại cũng đúng — nếu các host rời khỏi shard, mô hình sẽ mất dung lượng; chính vì vậy mà câu chuyện của Kimi K2.6 trong mạng lưới đã kết thúc.
  • Tool calling của mỗi mô hình là khác nhau. Đối với Kimi K2.6 trên mạng Gonka, khi khởi chạy đã ghi nhận một số vấn đề nhỏ với việc tự động chọn công cụ (tool_choice: "auto"), sau đó đã được khắc phục bằng bản cập nhật node. Bài học vẫn còn nguyên giá trị đối với bất kỳ mô hình nào trên mạng: định dạng gọi công cụ là đặc tính của từng mô hình cụ thể trên từng node cụ thể, vì vậy đối với các kịch bản quan trọng trong sản xuất, hãy kiểm tra trước hành vi của mô hình được chọn trên chính các yêu cầu của bạn.

Thay thế bằng gì và nên chọn gì hiện nay

Trả lời thẳng: qua mạng Gonka, Kimi K2.6 không còn khả dụng nữa. Các host đã ngừng phục vụ nó vào đầu tháng 9 năm 2026, và đề xuất governance #101 đã chính thức loại mô hình này khỏi danh sách mô hình của mạng — gateway sẽ từ chối request với model: "moonshotai/Kimi-K2.6". Vì trọng số của mô hình được mở, bạn vẫn có thể lấy nó từ các hosting open-weights bên thứ ba (ví dụ qua OpenRouter) hoặc tự triển khai.

Còn nếu bạn cần đúng cái inference phi tập trung giá rẻ mà người ta tìm đến Gonka — nó vẫn còn nguyên, chỉ là giờ chạy trên các mô hình đang hoạt động của mạng. Qua JoinGonka API Gateway với API tương thích OpenAI và Anthropic, có ba mô hình khả dụng, mỗi mô hình đảm nhiệm một phần lý do người ta yêu thích Kimi:

  • GLM-5.3 Flash (zai-org/GLM-5.3-Flash) — mô hình reasoning của Z.ai: suy luận trước khi trả lời, nên đây chính là lựa chọn cho logic phức tạp, phân tích code và các bài toán cần "suy nghĩ"; đây cũng là mô hình có context dài nhất mạng (390K). Phần suy luận được tính vào giới hạn trả lời — hãy đặt max_tokens dư dả và bật stream.
  • DeepSeek V4 Flash (deepseek-ai/DeepSeek-V4-Flash-0731) — một trong những context dài nhất mạng (380K), output dài nhất và agentic coding mạnh: repo lớn, chuỗi gọi công cụ dài.
  • MiniMax M2.7 (MiniMaxAI/MiniMax-M2.7) — mô hình mặc định của gateway: trả lời nhanh, ổn định cho các tác vụ hằng ngày, tài liệu dài và xử lý streaming.

Chuyển khỏi Kimi K2.6 chỉ là thay một dòng. Mọi code viết cho OpenAI đều chạy không cần sửa: chỉ cần đổi URL, API key và tên mô hình.

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMaxAI/MiniMax-M2.7",
    "messages": [{"role": "user", "content": "Explain the difference between MoE and dense models"}]
  }'

Trong các công cụ phát triển, quy tắc cũng vậy: ở bất cứ đâu trong cấu hình có moonshotai/Kimi-K2.6, hãy thay bằng ID của một trong các mô hình đang hoạt động. Trong Cursor đó là trường Custom Model, trong Claude Code là biến môi trường ANTHROPIC_MODEL hoặc cờ --model, trong OpenClaw, Cline và Continue.dev là tên mô hình trong config của provider, trong LangChain và n8n là tham số model khi khởi tạo client. Trình cài đặt npx @joingonka/setup sẽ ghi gateway và mô hình hiện hành vào config của công cụ chỉ bằng một lệnh. Danh sách mô hình khả dụng luôn được cập nhật ở endpoint GET /v1/models — từ đó bạn có thể lấy động vào UI của ứng dụng để việc mô hình rời đi hay xuất hiện không làm hỏng sản phẩm của bạn.

Bạn có thể thử mà không cần đăng ký trong chat miễn phí tại trang /try — ở đó có các mô hình đang hoạt động của mạng. Khi đăng ký JoinGonka Gateway, bạn nhận được miễn phí 3M token để thử mọi mô hình của mạng — đủ để chạy thử các tác vụ của bạn trên cả ba mô hình và chọn phương án thay thế một cách sáng suốt.

Bài học từ câu chuyện Kimi K2.6 đối với mạng Gonka: cơ chế DevShards đã hoạt động theo cả hai chiều. Nó cho phép thêm mô hình mà không dừng mạng — sau Kimi là MiniMax M2.7, DeepSeek V4 Flash và GLM-5.3 Flash — và cũng chính nó cho phép rút một mô hình mà các host ngừng hỗ trợ một cách nhẹ nhàng. Một mạng gắn chặt với một mô hình thì về bản chất rất mong manh; một mạng có thể thay đổi thành phần bằng bỏ phiếu thì tiến hóa mềm mại và liên tục. Với nhà phát triển, từ đó rút ra một quy tắc đơn giản: đừng "chọn mô hình một lần là xong", mà hãy giữ tên mô hình trong config và kiểm tra danh sách trực tiếp.

Kimi K2.6 là một mô hình MoE của Moonshot AI với ngữ cảnh dài và khả năng lập luận mạnh mẽ. Vào tháng 5 năm 2026, nó trở thành mô hình thứ hai của mạng lưới Gonka sau Qwen3-235B, được ra mắt thông qua cơ chế DevShards (một shard riêng biệt cho mỗi mô hình), và được mạng lưới phục vụ cho đến tháng 9 năm 2026, khi các host ngừng hỗ trợ và đề xuất quản trị #101 đã loại bỏ nó khỏi danh sách. Hiện nay, thông qua JoinGonka Gateway với API tương thích OpenAI, bạn có thể truy cập MiniMax M2.7, DeepSeek V4 Flash và GLM-5.3 Flash — với mức phí đồng nhất của mạng lưới là $0.0069 cho mỗi 1M token; phân khúc của Kimi (lập luận và ngữ cảnh dài) được bao phủ bởi GLM-5.3 Flash và DeepSeek V4 Flash. Bản thân Kimi K2.6 vẫn là một mô hình mở và có sẵn tại các nhà cung cấp hosting open-weights bên thứ ba.

Muốn tìm hiểu thêm?

Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.

Thử nghiệm các mô hình Gonka hiện tại →