知识库章节 ▾

技术

Kimi K2.6:Gonka 曾支持的模型

长期以来,Gonka 网络仅运行单一模型——来自阿里云的 Qwen3-235B。2026 年 5 月情况发生了变化:通过 DevShards 机制实现了多模型支持,第一款上线的是中国公司 Moonshot AI 推出的 Kimi K2.6。随后,MiniMax M2.7 和 DeepSeek V4 Flash 也加入了支持列表,而 Qwen3-235B 则从网络中下架。2026 年 9 月,Kimi K2.6 也迎来了同样的情况:主机停止了对其服务,治理提案 #101 最终确定了其退出——GLM-5.3 Flash 取代了它在网络中的位置。今天,Gonka 提供三种模型:MiniMax M2.7、DeepSeek V4 Flash 和 GLM-5.3 Flash。我们将分析 Kimi K2.6 的特点、它与 MiniMax M2.7 的区别、Gonka 如何在技术上实现多模型支持、该模型为何离开网络以及现在该选择什么模型。

什么是 Moonshot AI 的 Kimi K2.6

Kimi K2.6 是 Kimi 系列的大型语言模型(LLM),由北京公司 Moonshot AI 开发。Moonshot AI 是中国领先的 AI 实验室之一,由杨植麟带领的研究团队于 2023 年创立。公司获得了阿里巴巴、腾讯等大型投资方的融资,并跻身“中国 AI 四小龙”之列——这些公司正引领亚洲 AI 发展的步伐。

Kimi 系列自 2024 年起为人所知。早期版本(K1、K1.5)凭借超长的上下文窗口一举引发关注——单次请求最高可达 200,000 tokens,这在发布时是公开可用模型中的纪录。长上下文意味着可以在一次请求中实际分析整本书、中等规模的代码库或一批法律文件。在 Kimi 发布之时,这一特性是强大的竞争优势。

K2 版本于 2025 年问世,带来了架构上的根本性飞跃——转向 MoE(Mixture of Experts)。Qwen3-235B 和 DeepSeek-R1 也采用同样的架构——它已成为 2025—2026 年超大模型事实上的标准。MoE 让模型可以拥有数千亿的总参数,但每次请求只激活其中一部分(通常为 5—10%),在质量相当的情况下大幅降低 inference 的计算成本。

截至本文撰写时,K2.6 是 K2 系列的最新迭代。从 Moonshot AI 的公开声明来看,该版本提升了模型的 reasoning(逻辑推理)、代码生成和原生工具调用(tool calling)能力。在该模型由 Gonka 网络提供服务期间,可通过标识符 moonshotai/Kimi-K2.6 访问;目前网关已不接受该标识符——最新模型列表始终通过 GET /v1/models 返回。

Kimi K2.6 与 MiniMax M2.7 对比

这两款模型均代表了中国大型 AI 实验室的旗舰产品;在两款模型均由网络提供服务期间,它们都可以通过统一的 OpenAI 兼容接口 JoinGonka Gateway 访问——今天,这对组合中只有 MiniMax M2.7 可通过网关访问。它们各自拥有不同的优势和传承,因此在它们之间做出选择,重点不在于“谁更好”,而在于“谁更适合当前任务”。

特性Kimi K2.6MiniMax M2.7
开发商Moonshot AI (北京)MiniMax (上海)
成立年份20232021
架构MoEMoE + 线性 attention
上下文窗口200,000 tokens200,000 tokens
核心优势Reasoning, 长上下文, 代码生成长上下文, 高效(线性) attention
JoinGonka 价格— (模型已从网络下架)$0.0069 每 1M tokens
API 标识符moonshotai/Kimi-K2.6MiniMaxAI/MiniMax-M2.7
Gonka 网络状态2026 年 5 月至 9 月提供服务,已下架 (提案 #101)活跃模型 (自 2026 年 5 月起,版本升级至 v0.2.13)

在推理基准测试 (MATH-500, GSM8K, AIME) 中,Kimi K2 系列历史上显示其处于开源权重模型的第一梯队,与 DeepSeek-R1 和 o1-style 模型竞争。在代码生成任务 (HumanEval, MBPP) 中,两款模型表现水平相当。MiniMax M2.7 的强项在于其针对超长序列的高效 (线性) attention,而 Kimi 则以其强大的 reasoning 和 Kimi 系列的长上下文而闻名。

关于 2026 年基准测试的一个重要提醒:顶尖模型在公开测试中的差距已缩小至百分之几,这种差异往往在测试本身的统计误差范围内。对于实际工作而言,重要的不是“谁在 MMLU 高 2%”,而是任务的性质:你向模型传递了什么上下文、逻辑链条有多复杂、是否需要长对话历史、使用了哪些语言。因此,上表并非对模型进行排名——它有助于快速了解每种模型针对的任务配置文件。

对于今天的实际选择:Kimi K2.6 的利基市场——长上下文(分析大型文档、阅读海量代码库、保留历史记录的长对话)和复杂的 reasoning 任务——在当前的网络配置中由两款模型覆盖。推理任务由 GLM-5.3 Flash 负责:它在回答前会进行思考,对于错综复杂的逻辑应该选择它;它还拥有网络中最长的上下文 (390K)。对于无需推理的大型 prompt 和长 Agent 会话,则选择 DeepSeek V4 Flash (380K,上下文长度第二)。如果优先考虑处理超长输入序列和具有快速响应的流数据,MiniMax M2.7 的高效 attention 是最佳选择。生产环境中的良好策略并未改变——在代码中保留多个网络模型:通过 model 参数快速切换,无需更改应用程序架构即可根据任务在它们之间进行切换。

DevShards:Gonka 如何启动第二个模型

直到 2026 年春季,整个 Gonka 网络只服务一个模型——Qwen3-235B。从架构角度看,这是合理的决定:通过 DiLoCo 实现的分布式推理要求所有网络参与者都在显存中保持同一个模型,否则无法保证任何节点都能处理任何请求。FP8 格式的完整 Qwen3-235B 占用约 640 GB VRAM,这对每个 ML 节点本身就已经是巨大的承诺。

要过渡到多模型网络,需要一种机制,能够同时保留多个模型,但不要求每个主机都运行全部模型。这种机制就是 DevShards——独立的网络分片,每个分片专注于一个模型。同一分片内的节点处理同一个模型,网络路由器将请求导向具有所需模型的分片。

这个想法并非凭空而来——它被正式写入 Gonka Improvement Proposal #800「Multi-Model PoC」,并于 2026 年春季提交社区投票。该提案获得了网络参与者和验证者的支持,并于 2026 年 4 月至 5 月实施。Kimi K2.6 成为首个在独立 DevShard 上启动的模型——实际上是对新方法的测试实现。结果证明成功:随后 MiniMax M2.7、DeepSeek V4 Flash 和 GLM-5.3 Flash 各自出现在自己的分片上,每个都有自己的主机集合和经济模型。同样的机制也反向运作:当主机停止支持某个模型时,该模型通过投票退出网络——2026 年 9 月 Kimi K2.6 本身就是这样退出的。

这对用户和开发者意味着什么:

  • 一个 API——多个模型。通过 JoinGonka Gateway,无需更换 endpoint 或密钥:只需在请求体中指定不同的 model。OpenAI 兼容格式完全保留。
  • 价格相同。Kimi K2.6 在服务期间,其计费率与 MiniMax M2.7 相同;网络统一资费同样适用于当前模型——通过 Gateway 每 1M token $0.0069。统一定价是简化用户在不同模型间迁移的有意决策。
  • 稳定性取决于分片负载。在早期阶段,新模型的分片主机较少,因此当请求集中时,模型可能暂时返回 429 too many concurrent requests。这是新模型的正常阶段:随着兴趣增长,主机会加入其分片,限制也会增加。反之亦然——如果主机离开分片,模型将失去容量;Kimi K2.6 在网络上的故事正是如此结束的。
  • 每个模型的工具调用各不相同。在 Gonka 上,Kimi K2.6 最初在自动工具选择(tool_choice: "auto")方面存在小问题,后来通过节点更新解决。这个教训对网络上的任何模型都仍然适用:工具调用格式是特定节点上特定模型的属性,因此对于生产关键场景,请提前在您的请求上测试所选模型的行为。

替代方案及当前选择建议

直接回答:在 Gonka 网络上,Kimi K2.6 已不再可用。托管方于 2026 年 9 月初停止提供该模型,而治理提案 #101 已将其从网络模型列表中彻底移除——带有 model: "moonshotai/Kimi-K2.6" 的请求会被网关拒绝。由于该模型的权重是开放的,你仍然可以从第三方 open-weights 模型托管方获取(例如通过 OpenRouter),或者自行部署。

不过,如果你想要的正是人们选择 Gonka 的那种便宜的去中心化 inference——它并没有消失,只是运行在网络的现行模型上。通过 JoinGonka API Gateway,兼容 OpenAI 和 Anthropic 的 API 提供三个模型,每个都覆盖了人们看重 Kimi 的某一部分能力:

  • GLM-5.3 Flash(zai-org/GLM-5.3-Flash)——Z.ai 的 reasoning 模型:回答前先推理,因此最适合复杂逻辑、代码分析和需要「想一想」的任务;它也是网络中上下文最长的(390K)。推理过程计入响应上限——设置 max_tokens 时要留足余量并开启 stream。
  • DeepSeek V4 Flash(deepseek-ai/DeepSeek-V4-Flash-0731)——网络中上下文最长的模型之一(380K),输出最长,agentic 编程能力强:适合大型代码库、长链路工具调用。
  • MiniMax M2.7(MiniMaxAI/MiniMax-M2.7)——网关的默认模型:日常任务上快速稳定的回答、长文档和流式处理。

从 Kimi K2.6 迁移只需改一行。任何为 OpenAI 写的代码都能原样运行:只要替换 URL、API 密钥和模型名称即可。

curl https://gate.joingonka.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "MiniMaxAI/MiniMax-M2.7",
    "messages": [{"role": "user", "content": "Explain the difference between MoE and dense models"}]
  }'

在开发工具中规则也一样:凡是设置里写着 moonshotai/Kimi-K2.6 的地方,替换成某个现行模型的标识符。在 Cursor 中是 Custom Model 字段,在 Claude Code 中是环境变量 ANTHROPIC_MODEL 或 --model 标志,在 OpenClaw、Cline 和 Continue.dev 中是提供商配置里的模型名称,在 LangChain 和 n8n 中是初始化客户端时的 model 参数。npx @joingonka/setup 安装器会用一条命令把网关和当前模型写入工具配置。可用模型列表始终在 GET /v1/models endpoint 保持最新——很方便动态拉取到应用 UI 中,这样模型离开或加入网络都不会让你的产品出问题。

无需注册即可在 /try 页面的免费聊天中试用——那里提供网络的现行模型。在 JoinGonka Gateway 注册时,你会获得免费的 3M token,可用于测试网络的任何模型——足以在三个模型上跑一遍自己的任务,从而有依据地做出选择。

Kimi K2.6 的故事对 Gonka 网络说明了什么:DevShards 机制双向都奏效。它让网络无需停机即可添加模型——继 Kimi 之后来了 MiniMax M2.7、DeepSeek V4 Flash 和 GLM-5.3 Flash——同样也让托管方不再支持的模型能够无痛退出。绑定单一模型的网络本质上很脆弱;能够通过投票调整阵容的网络则平滑而持续地演进。对开发者来说,由此得出一个简单规则:不要「永远选定一个模型」,而是把模型名称放在配置里,并检查实时列表。

Kimi K2.6 是 Moonshot AI 推出的 MoE 模型,具备长上下文和强大的推理能力。2026 年 5 月,它成为继 Qwen3-235B 之后 Gonka 网络的第二个模型,通过 DevShards 机制(每个模型独立分片)运行,并由网络服务至 2026 年 9 月。随后因主机停止支持及治理提案 #101 的通过,该模型被移出阵容。目前,通过 JoinGonka Gateway 的 OpenAI 兼容 API,您可以使用 MiniMax M2.7、DeepSeek V4 Flash 和 GLM-5.3 Flash — 网络统一费率为每 1M Token $0.0069;Kimi 原有的定位(推理与长上下文)已由 GLM-5.3 Flash 和 DeepSeek V4 Flash 取代。Kimi K2.6 本身依然是一个开放模型,可通过第三方开源权重模型托管服务获取。

想了解更多?

探索其他章节或立即开始赚取 GNK。

尝试 Gonka 当前模型 →