Các phần cơ sở kiến thức ▾
Điều hướng
▸ Bắt đầu tại đây Theo vai tròDanh mục
- Kiến trúc mạng Gonka: Sprint, Transfer Agents, DiLoCo
- Nhà phát triển: Cách kiếm GNK
- Tự lưu trữ: Hướng dẫn từng bước
- Chọn GPU cho Gonka: khuyến nghị về phần cứng
- Qwen3-235B: mô hình mà Gonka đã từng phục vụ
- Kimi K2.6: Mô hình thứ hai của mạng Gonka
- MiniMax M2.7: Mô hình của mạng Gonka
- DeepSeek V4 Flash: mô hình mạng lưới Gonka với bối cảnh 380K
Công nghệ
Kimi K2.6: Mô hình thứ hai của mạng Gonka
Trong một thời gian dài, mạng lưới Gonka hoạt động trên một mô hình duy nhất — Qwen3-235B từ Alibaba Cloud. Vào tháng 5 năm 2026, điều này đã thay đổi: hỗ trợ đa mô hình đã được triển khai thông qua cơ chế DevShards, và sản phẩm đầu tiên là Kimi K2.6 từ công ty Trung Quốc Moonshot AI. Sau đó, MiniMax M2.7 đã được thêm vào, và Qwen3-235B dần dần được rút khỏi mạng lưới — hiện nay Gonka đang vận hành ba mô hình: Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash. Hãy cùng tìm hiểu xem đây là mô hình gì, nó khác biệt thế nào so với MiniMax M2.7, cách Gonka triển khai kỹ thuật đa mô hình và cách thử nghiệm nó thông qua API Gateway của chúng tôi.
Kimi K2.6 của Moonshot AI là gì
Kimi K2.6 là một mô hình ngôn ngữ lớn (LLM) thuộc dòng Kimi, được phát triển bởi công ty Bắc Kinh Moonshot AI. Moonshot AI là một trong những phòng thí nghiệm AI hàng đầu của Trung Quốc, được thành lập vào năm 2023 bởi một nhóm các nhà nghiên cứu dưới sự lãnh đạo của Yang Zhilin. Công ty đã thu hút tài trợ từ Alibaba, Tencent và các nhà đầu tư lớn khác và lọt vào danh sách "hổ AI Trung Quốc" — các công ty đang tạo ra tốc độ phát triển AI ở châu Á.
Dòng Kimi đã được biết đến từ năm 2024. Các phiên bản đầu (K1, K1.5) ngay lập tức thu hút sự chú ý với cửa sổ ngữ cảnh cực kỳ dài — lên đến 200.000 token trong một yêu cầu, tại thời điểm phát hành là một kỷ lục đối với các mô hình có sẵn công khai. Ngữ cảnh dài có nghĩa là khả năng thực tế để phân tích toàn bộ một cuốn sách, một cơ sở mã cỡ trung bình hoặc một bộ tài liệu pháp lý chỉ trong một yêu cầu. Tại thời điểm Kimi ra mắt, đặc điểm này là một lợi thế cạnh tranh mạnh mẽ.
Phiên bản K2 xuất hiện vào năm 2025 và mang lại một bước nhảy vọt kiến trúc cơ bản — chuyển sang MoE (Mixture of Experts). Kiến trúc tương tự cũng là nền tảng của Qwen3-235B và DeepSeek-R1 — nó đã trở thành tiêu chuẩn thực tế cho các mô hình lớn nhất từ năm 2025—2026. MoE cho phép có hàng trăm tỷ tham số "tổng cộng", nhưng chỉ kích hoạt một tập hợp con (thường là 5—10%) cho mỗi yêu cầu, điều này làm giảm đáng kể chi phí tính toán inference với chất lượng tương đương.
K2.6 là phiên bản lặp mới nhất của dòng K2 tại thời điểm viết bài này. Từ các tuyên bố công khai của Moonshot AI, rõ ràng là trong phiên bản này, khả năng của mô hình trong reasoning (suy luận logic), tạo mã và gọi công cụ gốc (tool calling) đã được cải thiện. Trong mạng Gonka, mô hình được xác định là moonshotai/Kimi-K2.6 — đây chính là tên cần truyền vào trường model của yêu cầu API.
So sánh Kimi K2.6 và MiniMax M2.7
Cả hai mô hình đều đại diện cho các bước phát triển hàng đầu từ các phòng thí nghiệm AI lớn nhất của Trung Quốc và đều có sẵn thông qua một giao diện tương thích OpenAI duy nhất là JoinGonka Gateway. Tuy nhiên, chúng có những thế mạnh và nguồn gốc khác nhau, điều này khiến việc lựa chọn giữa chúng không phải là câu hỏi "cái nào tốt hơn" mà là "cái nào phù hợp với tác vụ".
| Đặc điểm | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|
| Nhà sản xuất | Moonshot AI (Bắc Kinh) | MiniMax (Thượng Hải) |
| Năm thành lập | 2023 | 2021 |
| Kiến trúc | MoE | MoE + attention tuyến tính |
| Cửa sổ ngữ cảnh | 200,000 token | 200,000 token |
| Thế mạnh | Reasoning, ngữ cảnh dài, code generation | Ngữ cảnh dài, attention hiệu quả (tuyến tính) |
| Giá qua JoinGonka | $0.0047 cho 1M token | $0.0047 cho 1M token |
| Định danh API | moonshotai/Kimi-K2.6 | MiniMaxAI/MiniMax-M2.7 |
| Trạng thái trong mạng Gonka | Đã khởi chạy qua DevShards (tháng 5/2026) | Đã khởi chạy qua bản nâng cấp v0.2.13 (tháng 5/2026) |
Trên các điểm chuẩn reasoning (MATH-500, GSM8K, AIME), dòng Kimi K2 trong lịch sử cho thấy kết quả trong nhóm hàng đầu của các mô hình open-weights, cạnh tranh với DeepSeek-R1 và các mô hình kiểu o1. Đối với các tác vụ tạo mã (HumanEval, MBPP), cả hai mô hình đều duy trì ở mức gần tương đương. Thế mạnh của MiniMax M2.7 là attention hiệu quả (tuyến tính) cho các chuỗi rất dài, trong khi Kimi nổi tiếng với khả năng reasoning mạnh mẽ và ngữ cảnh dài của dòng Kimi.
Một lưu ý quan trọng về các điểm chuẩn vào năm 2026: khoảng cách giữa các mô hình hàng đầu trong các bài kiểm tra công khai đã thu hẹp xuống còn vài phần trăm, và sự khác biệt này thường nằm trong phạm vi sai số thống kê của chính các điểm chuẩn. Đối với công việc thực tế, điều quan trọng không phải là "ai cao hơn 2% trong MMLU" mà là bản chất của các tác vụ: bạn cung cấp ngữ cảnh gì cho mô hình, các chuỗi logic phức tạp đến mức nào, bạn có cần lịch sử đối thoại dài hay không, và ngôn ngữ nào được sử dụng. Do đó, bảng trên không xếp hạng các mô hình — nó giúp hiểu nhanh mô hình nào được tối ưu hóa cho cấu hình tác vụ nào.
Để lựa chọn thực tế: nếu tác vụ yêu cầu ngữ cảnh dài (phân tích tài liệu lớn, đọc cơ sở mã đồ sộ, các cuộc đối thoại dài duy trì lịch sử) hoặc các tác vụ reasoning phức tạp — hãy bắt đầu với Kimi K2.6. Nếu ưu tiên là xử lý các chuỗi đầu vào rất dài và dữ liệu luồng — hãy kiểm tra MiniMax M2.7 với attention hiệu quả của nó. Một chiến lược tốt trong sản xuất là có cả hai mô hình trong mã nguồn của bạn: việc thay đổi nhanh thông qua tham số model cho phép bạn chuyển đổi giữa chúng tùy theo tác vụ mà không cần thay đổi kiến trúc ứng dụng.
DevShards: Gonka đã khởi chạy mô hình thứ hai như thế nào
Cho đến mùa xuân năm 2026, toàn bộ mạng lưới Gonka chỉ phục vụ đúng một mô hình — Qwen3-235B. Xét về kiến trúc, đây là một quyết định hợp lý: inference phân tán thông qua DiLoCo yêu cầu tất cả các bên tham gia mạng lưới phải lưu trữ cùng một mô hình trong VRAM, nếu không thì không thể đảm bảo rằng bất kỳ nút nào cũng có thể xử lý mọi yêu cầu. Qwen3-235B đầy đủ ở định dạng FP8 chiếm khoảng 640 GB VRAM, đây vốn đã là một cam kết khổng lồ đối với mỗi MLNode.
Để chuyển sang mạng lưới đa mô hình, cần một cơ chế cho phép lưu trữ nhiều mô hình cùng lúc mà không bắt buộc mỗi host phải chạy tất cả. Cơ chế này chính là DevShards — các shard riêng biệt của mạng lưới, mỗi shard chuyên biệt cho một mô hình. Các nút trong cùng một shard làm việc trên cùng một mô hình, và bộ định tuyến của mạng lưới sẽ điều hướng yêu cầu đến shard có mô hình cần thiết.
Ý tưởng này không tự nhiên mà có — nó đã được chính thức hóa trong Gonka Improvement Proposal #800 «Multi-Model PoC», được đưa ra bỏ phiếu bởi cộng đồng vào mùa xuân năm 2026. Đề xuất đã nhận được sự ủng hộ từ các thành viên và validator của mạng lưới và được triển khai vào tháng 4-5 năm 2026. Kimi K2.6 trở thành mô hình đầu tiên chạy trên DevShard riêng biệt — nghĩa là thực tế là một triển khai thử nghiệm của phương pháp mới. Nếu thử nghiệm thành công, không có gì ngăn cản việc chạy mô hình thứ ba, thứ tư, v.v. — mỗi mô hình trên shard riêng của nó, với tập hợp host riêng, nền kinh tế riêng và roadmap riêng.
Điều này có ý nghĩa gì đối với người dùng và nhà phát triển:
- Một API — nhiều mô hình. Thông qua JoinGonka Gateway, không cần thay đổi endpoint hoặc khóa: chỉ cần chỉ định
modelkhác trong phần thân của yêu cầu. Định dạng tương thích OpenAI được giữ nguyên hoàn toàn. - Giá không đổi. Hiện tại Kimi K2.6 trong mạng lưới được tính phí theo cùng mức giá với MiniMax M2.7 — $0.0047 cho 1M token thông qua Gateway. Trong tương lai, giá có thể khác nhau tùy theo mô hình, nhưng mức giá thống nhất khi bắt đầu là một quyết định có chủ đích để đơn giản hóa việc chuyển đổi cho người dùng.
- Độ ổn định phụ thuộc vào tải của shard. Ở giai đoạn đầu, shard của mô hình mới có ít host hơn, do đó khi có sự tập trung các yêu cầu, mô hình có thể tạm thời trả về
429 too many concurrent requests. Đây là giai đoạn bình thường đối với một mô hình mới — khi sự quan tâm tăng lên, các host sẽ kết nối vào shard của nó và các giới hạn sẽ tăng lên. - Tool calling — đang trong quá trình hoàn thiện. Tại thời điểm viết bài, Kimi K2.6 trong mạng lưới Gonka ghi nhận một số vấn đề nhỏ với việc tự động chọn công cụ (
tool_choice: "auto"). Đội ngũ Gonka đang làm việc để đưa hành vi này về tiêu chuẩn OpenAI; đối với các kịch bản quan trọng trong production sử dụng tool calling, hãy kiểm tra trước hành vi của mô hình trên các yêu cầu của bạn.
Cách thử Kimi K2.6 qua Gonka
Cách trực tiếp nhất là thông qua JoinGonka API Gateway. Gateway cung cấp API tương thích với OpenAI, điều đó có nghĩa là: cùng một mã nguồn hoạt động với GPT, Claude hoặc các mô hình khác sẽ bắt đầu hoạt động với Kimi sau khi thay đổi giá trị của trường model trong thân yêu cầu.
Ví dụ tối thiểu thông qua curl:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [
{"role": "user", "content": "Giải thích sự khác biệt giữa các mô hình MoE và dense"}
]
}'Yêu cầu tương tự với Python thông qua thư viện openai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://gate.joingonka.ai/v1",
)
response = client.chat.completions.create(
model="moonshotai/Kimi-K2.6",
messages=[{"role": "user", "content": "Chào Kimi"}],
)
print(response.choices[0].message.content)Streaming (Server-Sent Events) — dành cho các giao diện tương tác và chat, nơi bạn muốn hiển thị phản hồi ngay khi nó được tạo:
stream = client.chat.completions.create(
model="moonshotai/Kimi-K2.6",
messages=[{"role": "user", "content": "Viết một bài tiểu luận về MoE"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)Chi phí cho Kimi K2.6 là $0.0047 cho 1 triệu token, mức giá thống nhất của mạng lưới. Mức giá này rẻ hơn khoảng 800 lần so với GPT-5.5 và rẻ hơn khoảng 500 lần so với Claude Sonnet 4.6. Khi đăng ký tại JoinGonka Gateway, bạn nhận được miễn phí 1.5M token để kiểm tra bất kỳ mô hình nào trong mạng lưới — đủ để thử nghiệm mô hình mà không cần thẻ tín dụng hoặc thực hiện hàng chục nghìn yêu cầu thông thường.
Khả năng tương thích với các công cụ phát triển: mọi thứ hoạt động với OpenAI API đều hoạt động với Kimi thông qua Gateway. Ở cấp độ mô hình, chỉ cần thay đổi tham số model:
- Cursor: trong cài đặt Custom Model, chỉ định
moonshotai/Kimi-K2.6 - Claude Code: biến môi trường
ANTHROPIC_MODELhoặc cờ--model - OpenClaw, Cline, Continue.dev: trong cấu hình CustomChatModel, hãy đổi tên mô hình
- LangChain, n8n: tham số
modeltrong quá trình khởi tạo client - Open WebUI, LibreChat: mô hình sẽ xuất hiện trong danh sách thả xuống sau khi thêm Gonka làm nhà cung cấp tùy chỉnh
Danh sách các mô hình khả dụng luôn được cập nhật tại endpoint GET /v1/models của Gateway instance — từ đó bạn có thể dễ dàng lấy danh sách động vào UI của ứng dụng để người dùng có thể xem danh sách đầy đủ và tự chọn mô hình.
Demo chat tại trang /try tại thời điểm xuất bản đang sử dụng một trong các mô hình hoạt động của mạng lưới — bộ chọn đa mô hình trong widget nằm trong roadmap. Để thử Kimi ngay bây giờ, hãy sử dụng Gateway API: 1.5M token miễn phí là đủ để thử nghiệm mà không cần thẻ. Nếu nhận được phản hồi 429 too many concurrent requests — đây là giai đoạn bình thường đối với một mô hình mới trong giai đoạn đầu phát triển mạng lưới Gonka. Chỉ cần thử lại yêu cầu sau vài giây hoặc đợi đến khi lưu lượng truy cập thấp hơn.
Điều gì tiếp theo cho mạng lưới Gonka: sự thành công của DevShards cho Kimi mở đường cho các mô hình khác. Trong các cuộc thảo luận của cộng đồng, DeepSeek-V3/R1, Llama 4 và các mô hình chuyên biệt cho mã nguồn đang được nhắc đến. Mỗi mô hình mới là một shard mới, các host mới, cơ hội mới cho người dùng và nguồn thu nhập mới cho các nhà cung cấp GPU. Kiến trúc đa mô hình cũng mang tính chiến lược quan trọng: một mạng lưới bị ràng buộc với một mô hình sẽ về cơ bản rất mong manh (khi phiên bản mới ra đời sẽ gây khủng hoảng di chuyển), trong khi mạng lưới có khả năng duy trì nhiều mô hình cùng lúc sẽ phát triển một cách nhẹ nhàng và liên tục.
Kimi K2.6 tương tự thông qua OpenRouter có giá $0.684/$3.42 cho 1M, so với $0.0047 tại JoinGonka (đắt hơn hàng trăm lần).
Muốn tìm hiểu thêm?
Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.
Thử Kimi K2.6 qua Gateway →