Các phần cơ sở kiến thức ▾
Điều hướng
▸ Bắt đầu tại đây Theo vai tròDanh mục
- Kiến trúc mạng Gonka: Sprint, Transfer Agents, DiLoCo
- Nhà phát triển: Cách kiếm GNK
- Tự lưu trữ: Hướng dẫn từng bước
- Chọn GPU cho Gonka: khuyến nghị về phần cứng
- Qwen3-235B: mô hình mà Gonka đã từng phục vụ
- Kimi K2.6: Mô hình thứ hai của mạng Gonka
- MiniMax M2.7: Mô hình của mạng Gonka
- DeepSeek V4 Flash: mô hình mạng lưới Gonka với bối cảnh 380K
Công nghệ
MiniMax M2.7: Mô hình của mạng Gonka
Vào mùa xuân năm 2026, mạng lưới Gonka đã chuyển từ đơn mô hình sang đa mô hình. Ban đầu, Kimi K2.6 được thêm vào cùng với mô hình chủ đạo Qwen3-235B, và vào cuối tháng 5 năm 2026 — MiniMax M2.7 từ phòng thí nghiệm MiniMax của Trung Quốc. Sau đó, Qwen3-235B đã được rút khỏi mạng lưới, và ngày nay Gonka đang vận hành đồng thời ba mô hình — Kimi K2.6, MiniMax M2.7 và DeepSeek V4 Flash.
Hãy cùng phân tích MiniMax M2.7 là gì, ai đứng sau quá trình phát triển của nó, các thông số kỹ thuật của nó trong mạng lưới Gonka, sự khác biệt giữa nó và mô hình thứ hai đang hoạt động trong mạng lưới — Kimi K2.6 — cũng như cách gọi nó thông qua API Gateway của chúng tôi theo giao thức tương thích với OpenAI.
MiniMax M2.7 là gì và ai đứng đằng sau mô hình này?
MiniMax M2.7 là một mô hình ngôn ngữ lớn (LLM) từ công ty MiniMax, có trụ sở tại Thượng Hải. MiniMax được thành lập vào năm 2021 bởi một nhóm các nhà nghiên cứu dưới sự lãnh đạo của Yan Junjie (trước đây làm việc tại SenseTime) và nhanh chóng trở thành một trong những phòng thí nghiệm AI hàng đầu Trung Quốc. Công ty đã huy động được tài trợ từ Alibaba, Tencent và HongShan – đây là cùng một nhóm các nhà đầu tư chiến lược đứng sau các “con hổ AI Trung Quốc” khác, bao gồm Moonshot AI, nhà phát triển Kimi K2.6.
Ngoài các mô hình ngôn ngữ thuần túy, MiniMax còn được biết đến với các sản phẩm tiêu dùng: trợ lý trò chuyện Talkie và Hailuo, cũng như một trong những công cụ tạo video đáng chú ý nhất trong ngành. Nhưng đối với mạng Gonka, dòng mô hình văn bản của loạt M – những người kế nhiệm của các mô hình abab trước đó – là quan trọng nhất.
Đặc điểm kiến trúc chính của loạt M là đặt cược vào cơ chế chú ý hiệu quả. Nếu các mô hình lớn đời đầu sử dụng chú ý bậc hai cổ điển (chi phí tính toán tăng tỷ lệ thuận với bình phương độ dài ngữ cảnh), thì MiniMax là một trong những công ty đầu tiên đưa ra chú ý tuyến tính lai vào công khai. Điều này cho phép xử lý các chuỗi rất dài mà không làm tăng chi phí tính toán một cách bùng nổ – đây là dấu ấn lịch sử của dòng sản phẩm này. Giống như Qwen3-235B và Kimi K2.6, mô hình này được xây dựng trên kiến trúc MoE (Mixture of Experts): hàng trăm tỷ tham số “trên giấy”, nhưng chỉ một phần nhỏ trong số chúng được kích hoạt cho mỗi yêu cầu, điều này làm giảm đáng kể chi phí inferenced.
Trong mạng Gonka, mô hình được xác định là MiniMaxAI/MiniMax-M2.7 – đây là chuỗi cần được truyền trong trường model của yêu cầu API. Phiên bản M2.7 là phiên bản mới nhất của loạt M tại thời điểm bài viết được xuất bản.
Đặc điểm của MiniMax M2.7 trong mạng Gonka
Điều quan trọng là phải phân biệt đặc điểm của bản thân mô hình "ngay khi xuất xưởng" (out-of-the-box) và các đặc điểm khi nó được triển khai trong một mạng lưới cụ thể. Khi mô hình hoạt động trong mạng lưới phi tập trung Gonka, các tham số vận hành của nó được thiết lập bởi cấu hình vLLM-inferenced phía các GPU-host, chứ không chỉ dựa trên kiến trúc mô hình. Dưới đây là các giá trị thực tế mà Gateway của chúng tôi cung cấp:
- Cửa sổ ngữ cảnh (Context window): 200.000 token (khoảng 150.000 từ). Đây là cấu hình subnet trong mạng lưới Gonka. Bản thân kiến trúc MiniMax hỗ trợ ngữ cảnh dài hơn đáng kể, nhưng giới hạn thực tế tại mỗi thời điểm được quyết định bởi cấu hình inferenced trên các host.
- Đầu ra tối đa (Max output): 8.192 token cho một phản hồi. Con số này được đo lường thực nghiệm — bằng một yêu cầu thực hiện tạo nội dung dài có chủ đích, đạt đến giới hạn (finish_reason: length). Hiện tại, giới hạn này giống nhau cho tất cả các mô hình trong mạng — tối đa 8.192 token. Đây không phải là giới hạn của chính mô hình mà là cấu hình vLLM-subnet.
- Yêu cầu VRAM của host: khoảng 320 GB VRAM mỗi node. Đây là yêu cầu điển hình cho một mô hình MoE lớn ở định dạng lượng tử hóa FP8 — 320 GB tương tự cũng cần thiết cho Kimi K2.6. Trên thực tế, điều này có nghĩa là cần nhiều GPU loại H100/H200 kết hợp lại trong một node.
Giá inference trong mạng Gonka không phụ thuộc vào việc chọn mô hình mà được xác định bởi các tham số mạng: thông qua JoinGonka Gateway, MiniMax M2.7 khả dụng với cùng mức giá như Kimi K2.6. Giá thống nhất là kết quả của việc mạng lưới dựa trên cơ sở tính toán chi phí duy nhất cho công việc điện toán, thay vì bảng giá của một nhà cung cấp cụ thể.
MiniMax M2.7 và Kimi K2.6 — so sánh các mô hình Gonka
Người dùng mạng Gonka có sự lựa chọn giữa hai mô hình hàng đầu và cả hai đều khả dụng thông qua giao diện tương thích OpenAI duy nhất là JoinGonka Gateway. So sánh dưới đây giúp hiểu không phải "cái nào tốt hơn", mà là mỗi mô hình được tối ưu hóa cho cấu hình tác vụ nào.
| Đặc tính | MiniMax M2.7 | Kimi K2.6 |
|---|---|---|
| Nhà sản xuất | MiniMax (Thượng Hải) | Moonshot AI (Bắc Kinh) |
| Kiến trúc | MoE +attention tuyến tính | MoE |
| Ngữ cảnh trong Gonka | 200.000 token | 200.000 token |
| Đầu ra tối đa | 8.192 token | 8.192 token |
| Thế mạnh lịch sử | Ngữ cảnh dài, attention hiệu quả | Reasoning, ngữ cảnh dài |
| Định danh API | MiniMaxAI/MiniMax-M2.7 | moonshotai/Kimi-K2.6 |
| Trạng thái trong mạng | Đã khởi chạy qua bản nâng cấp v0.2.13 (Tháng 5/2026) | Đã khởi chạy qua DevShards (Tháng 5/2026) |
Một lưu ý quan trọng về các tiêu chuẩn đo lường (benchmarks) trong năm 2026: khoảng cách giữa các mô hình open-weights hàng đầu trong các bài kiểm tra công khai đã thu hẹp xuống mức vài phần trăm, và sự khác biệt này thường nằm trong sai số thống kê của chính các benchmark. Đối với công việc thực tế, điều quan trọng không phải là vị trí tuyệt đối trong bảng xếp hạng MMLU, mà là bản chất của tác vụ: độ dài ngữ cảnh, độ phức tạp của chuỗi logic, ngôn ngữ cần thiết, khả năng tool calling.
Định hướng thực tiễn: đối với các tác vụ với tài liệu rất dài và xử lý luồng khối lượng lớn văn bản, nên thử nghiệm MiniMax M2.7 — attention hiệu quả của dòng này từ lâu đã được tối ưu hóa cho các kịch bản như vậy. Đối với các tác vụ reasoning với logic phức tạp và ngữ cảnh dài, nên so sánh phản hồi với Kimi K2.6. Chiến lược tốt nhất trong sản xuất (production) là giữ cả hai mô hình trong mã và chuyển đổi giữa chúng bằng một tham số model duy nhất mà không cần thay đổi kiến trúc ứng dụng.
Cách Gonka khởi chạy MiniMax M2.7: nâng cấp v0.2.13
Việc thêm MiniMax M2.7 không phải là "tải tệp lên máy chủ", mà là kết quả của một bản nâng cấp mạng thông qua bỏ phiếu on-chain. Hỗ trợ cho mô hình đã được đưa vào bản phát hành giao thức v0.2.13, được phê duyệt theo đề xuất proposal #54: nó đã được thông qua vào ngày 21 tháng 5 năm 2026 (khoảng 63% phiếu thuận) và được kích hoạt ở chiều cao khối được chỉ định. Đây là cơ chế governance tương tự mà mạng lưới sử dụng để thực hiện bất kỳ thay đổi quan trọng nào — từ phí đến các mô hình mới.
Tính đa mô hình đối với một mạng phi tập trung là một bước đi mang tính nguyên tắc. Một mạng lưới chỉ gắn liền với một mô hình sẽ trở nên mong manh về mặt nền tảng: sự ra đời của phiên bản mô hình mới trở thành một cuộc khủng hoảng di cư, và bất kỳ sự cố nào của mô hình duy nhất đó đều làm sụp đổ toàn bộ dịch vụ. Mạng lưới có khả năng duy trì nhiều mô hình cùng lúc sẽ tiến hóa một cách nhẹ nhàng: các mô hình mới được thêm vào như các "làn đường" bổ sung, các mô hình cũ tiếp tục hoạt động, và các GPU-host có quyền lựa chọn dịch vụ nào để vận hành. Về mặt kỹ thuật, mỗi mô hình sống trong một shard của mạng lưới — cơ chế tương tự (DevShards) trước đây đã được sử dụng để chạy Kimi K2.6.
Một sắc thái riêng của các giai đoạn đầu: có thể có độ trễ giữa "mô hình xuất hiện trong danh sách mạng" và "mô hình mở cho tất cả khách hàng". Ban đầu, việc inferenced MiniMax M2.7 ở chế độ broker chỉ dành cho các khóa đặc quyền và trả về lỗi cho các yêu cầu thông thường — một giai đoạn chạy thử bình thường. Đến cuối tháng 5 năm 2026, quyền truy cập công khai đã mở và mô hình đã có sẵn cho tất cả khách hàng Gateway. Tìm hiểu thêm về cách mạng lưới được xây dựng và lý do tại sao các mô hình được chạy theo cách này trong bài viết về kiến trúc mạng Gonka.
Cùng một MiniMax M2.7 thông qua OpenRouter — $0.279/$1.20 cho mỗi 1M, so với $0.0047/$0.014 tại JoinGonka.
Cách sử dụng MiniMax M2.7 qua JoinGonka Gateway
Con đường trực tiếp nhất là thông qua JoinGonka API Gateway. Vì Gateway cung cấp API tương thích với OpenAI, cùng đoạn mã hoạt động với GPT, Claude hoặc Kimi sẽ bắt đầu hoạt động với MiniMax sau khi thay đổi giá trị của trường model.
Ví dụ tối thiểu thông qua curl:
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "MiniMaxAI/MiniMax-M2.7",
"messages": [
{"role": "user", "content": "Giải thích ngắn gọn linear attention là gì"}
]
}'Cùng yêu cầu đó trên Python thông qua thư viện openai:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://gate.joingonka.ai/v1",
)
response = client.chat.completions.create(
model="MiniMaxAI/MiniMax-M2.7",
messages=[{"role": "user", "content": "Chào MiniMax"}],
)
print(response.choices[0].message.content)Streaming (Server-Sent Events) — dành cho các giao diện tương tác, nơi phản hồi được hiển thị khi đang tạo:
stream = client.chat.completions.create(
model="MiniMaxAI/MiniMax-M2.7",
messages=[{"role": "user", "content": "Viết một bài tiểu luận ngắn về ngữ cảnh dài"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)Khi đăng ký tại JoinGonka Gateway, bạn nhận được miễn phí 1.5M token để kiểm thử bất kỳ mô hình nào trong mạng — đủ để so sánh cả ba mô hình của mạng trên các tác vụ thực tế của riêng bạn.
Khả năng tương thích với các công cụ phát triển: tất cả những gì hoạt động với OpenAI API đều hoạt động với MiniMax thông qua Gateway. Chỉ cần thay đổi tham số model:
- Cursor: trong cài đặt Custom Model, hãy chỉ định
MiniMaxAI/MiniMax-M2.7 - Claude Code, Cline, Continue.dev: tên mô hình trong file cấu hình
- LangChain, n8n: tham số
modelkhi khởi tạo client
Danh sách các mô hình hiện tại luôn có sẵn tại endpoint GET /v1/models — từ đó, bạn có thể dễ dàng lấy dữ liệu động để UI của ứng dụng tự hiển thị bộ sưu tập mới nhất. Nếu nhận được phản hồi 429 too many concurrent requests — đây là giai đoạn bình thường đối với một mô hình mới trong giai đoạn đầu phát triển mạng: hãy thử lại yêu cầu sau vài giây.
Khi nào nên chọn MiniMax M2.7 — các kịch bản thực tế
Việc có ba mô hình trong cùng một mạng mang lại giá trị vì bạn có thể chọn công cụ phù hợp cho các tác vụ khác nhau mà không cần thay đổi nhà cung cấp hay mã tích hợp. Dưới đây là các kịch bản bạn nên bắt đầu kiểm thử với MiniMax M2.7.
Phân tích tài liệu dài. Nếu tác vụ là tóm tắt hợp đồng, phân tích tài liệu kỹ thuật, xử lý các văn bản pháp lý hoặc tài chính lớn, cơ chế attention hiệu quả của dòng M được tối ưu hóa để duy trì ngữ cảnh dài mà không làm tăng chi phí đột ngột. Hãy truyền toàn bộ tài liệu trong một yêu cầu và yêu cầu mô hình làm việc với toàn bộ nội dung thay vì từng phần.
RAG và làm việc với cơ sở tri thức. Trong các kịch bản retrieval-augmented, nơi hàng chục đoạn văn bản từ cơ sở dữ liệu vector được thêm vào ngữ cảnh, khả năng duy trì nhiều mảnh thông tin đa dạng của mô hình ảnh hưởng trực tiếp đến chất lượng phản hồi. Đây là thị trường tự nhiên cho các mô hình có ngữ cảnh dài.
Xử lý transcript và log. Ghi chép cuộc họp, đối thoại hỗ trợ khách hàng dài, log luồng — đây là những tác vụ mà khối lượng đầu vào lớn, trong khi phản hồi thường ngắn. Ở đây, giới hạn đầu ra 8 192 token không gây cản trở: đầu vào nhận nhiều, đầu ra là tóm tắt hoặc các sự kiện được trích xuất.
Khi nào nên chọn mô hình khác. Hiện tại, tất cả các mô hình trong mạng trả về tối đa 8 192 token trong một phản hồi, vì vậy nếu ứng dụng cần một phản hồi rất dài trong một yêu cầu (tài liệu được tạo lớn, đoạn code lớn) — hãy tính toán giới hạn tổng này vào kiến trúc và chia nhỏ việc tạo phản hồi thành các phần. Đối với các tác vụ có lập luận nhiều bước phức tạp, bạn nên so sánh phản hồi với Kimi K2.6. Lời khuyên chung: hãy chạy thử cùng một tập hợp các yêu cầu thực tế của bạn qua cả hai mô hình và so sánh kết quả — 1.5M token miễn phí khi đăng ký là đủ cho lần chạy so sánh đầu tiên.
Về mặt kỹ thuật, việc chuyển đổi giữa các mô hình chỉ là thay đổi một dòng trong trường model. Do đó, kiến trúc ứng dụng thông minh trên mạng Gonka không "chọn mô hình vĩnh viễn", mà cho phép định tuyến các yêu cầu giữa Kimi K2.6 và MiniMax M2.7 tùy thuộc vào loại tác vụ — việc inference giá rẻ giúp loại định tuyến này trở nên hiệu quả về mặt chi phí.
Muốn tìm hiểu thêm?
Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.
Thử MiniMax M2.7 qua Gateway →