知识库章节 ▾
技术
DeepSeek V4 Flash:具有 380K 上下文的 Gonka 网络模型
2026 年 8 月,第三个活跃模型 DeepSeek V4 Flash 出现在 Gonka 网络中。关于添加该模型的 #94 号治理提案由 kaitaku.ai 团队提交,该团队在社区中以 ML-node 优化而闻名:他们进行了实验,确认了模型与 Proof of Compute 和网络验证的兼容性,提案于 8 月 12 日投票通过。第二天,该模型就开始处理请求了。
对于用户来说,这是一个显著的能力扩展:DeepSeek V4 Flash 拥有网络中最长的上下文窗口 — 380,000 tokens(几乎是 Kimi K2.6 和 MiniMax M2.7 的两倍),内置推理和全面的 tool calling 支持。我们将详细解析这是什么模型、它是谁开发的、它在 Gonka 网络中的具体特性、基准测试结果,以及何时应该选择它而不是其他两个网络模型。
什么是 DeepSeek V4 Flash 以及其背后的开发团队
DeepSeek 是一家总部位于杭州的中国 AI 实验室,在 V3 和 R1 发布后获得了全球声誉:正是 R1 在 2025 年初证明了开源模型可以以极低的预算追赶闭源旗舰模型。2026 年 4 月,DeepSeek 发布了包含两个模型的 V4 系列:重量级的 V4 Pro 和轻量级的 V4 Flash。两者均为开源(MIT 许可证),且均基于 MoE 架构构建。
V4 Flash 拥有 2840 亿参数,每个 token 激活约 130 亿。这种稀疏性使得模型运行快速且维护成本低:它比“稠密”的巨型模型需要更少的 VRAM,且生成速度更快。
在 Gonka 网络上运行的是 V4-Flash-0731 版本 — 这是 2026 年 7 月 31 日的重训练 (re-post-training) 版本。架构和大小未变,但在智能体任务上的性能有了大幅提升:根据 DeepSeek 公布的九项智能体和编码基准测试,0731 版本甚至超过了他们自己的旗舰模型 V4 Pro 的预览版。公平起见,有一个重要提醒:其中一些数字是 DeepSeek 在其自己的测试台上的测量结果,撰写本文时尚未公开,因此目前还没有独立的复现。与闭源前沿模型相比,差距依然存在:0731 版本在九项基准测试中均未超越 Claude Opus 4.8,但其成本低了几个数量级,这就是它的核心价值:以极高的性价比提供智能体性能。
Gonka 网络中 DeepSeek V4 Flash 的特性
与其他网络模型一样,区分“开箱即用”的模型规格与特定部署的操作参数非常重要:这些参数由网络 GPU 主机上的 vLLM 推理配置决定。通过我们的 Gateway 获取的实际数值:
- 上下文窗口:380,000 tokens — Gonka 网络中最长。我们经过了实测验证:输入 381,000 tokens 的请求在几十秒内被接收并处理。V4 Flash 架构本身支持高达 100 万 token 的上下文;网络中的实际上限由主机配置(推理窗口 400,000)决定。
- 最大输出:每次响应 8,192 tokens — 所有网络模型的统一上限(网关配置,而非模型限制)。
- 推理和 tool calling:该模型部署了推理解析器和工具调用 — 智能体场景(Cursor, Claude Code, LangChain)开箱即用;我们通过兼容 OpenAI 和 Anthropic 的路径测试了多步工具场景。
- 主机 VRAM 要求:约 280 GB — 网络中最轻的模型(相比之下:MiniMax M2.7 为 320 GB,Kimi K2.6 为 720 GB)。硬件门槛越低,主机部署模型就越容易 — 这对模型在网络中的可用性是一个好迹象。
Gonka 网络中的推理定价不取决于模型选择:DeepSeek V4 Flash 的价格与 Kimi K2.6 和 MiniMax M2.7 相同 — 通过 JoinGonka Gateway,输入为 $0.0032/百万 token,输出为 $0.0097/百万 token。参考:DeepSeek 官方 API 对同一模型的报价为 $0.14/$0.28 每百万,OpenRouter 价格从 $0.08/$0.18 开始。网络经济学是另一个话题:价格由计算工作量计算得出,而不是供应商的价目表。
DeepSeek V4 Flash、Kimi K2.6 与 MiniMax M2.7 对比
目前网络中共有三款运行中的模型(第四款 GLM-5.2 已注册,等待部署)。简要对比:
| 参数 | DeepSeek V4 Flash | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|---|
| 网络上下文 | 380,000 | 200,000 | 200,000 |
| 响应输出 | 8,192 | 8,192 | 8,192 |
| 架构 | MoE 284B (~13B 激活) | MoE ~1T 级别 | MoE |
| 单节点 VRAM | 280 GB | 720 GB | 320 GB |
| 优势 | 长上下文, reasoning, 速度 | 智能体任务, 代码 | 日常开发, 稳定性 |
| Gateway 价格 | 相同 — $0.0032 输入 / $0.0097 输出 (每百万 Token) | ||
价格统一的实际意义在于:你可以纯粹根据任务需求选择模型,无需考虑预算。如果需要超长上下文或带推理的快速响应,请选择 DeepSeek V4 Flash;若在处理复杂代码时追求极致的智能体可靠性,请使用 Kimi K2.6;如果需要一款稳健的日常主力模型,请选择 MiniMax M2.7。
V4-Flash-0731 基准测试:构建版表现
0731 构建版的主要发布结果(根据 DeepSeek 及第三方独立聚合平台数据):
- SWE-bench Verified: 79.0% — 解决真实 GitHub 任务的能力;这一水平在去年仅闭源顶级模型可达到。对比之下,Kimi K2.6 为 71.3%。
- GPQA Diamond: 88.1% — 研究生级别的科学问题;高级推理模式增强了在多步骤任务中的准确性。
- Terminal Bench 2.1: 82.7 — 智能体终端操作能力;之前的 Flash 预览版为 61.8,V4 Pro Preview 为 72.1。
- DeepSWE: 54.4 — DeepSeek 新推出的严格基准测试,误报率接近于零;此数据由厂商提供,测试平台尚未公开,请以此为参考。
公正评价:在九项智能体基准测试中,0731 构建版的表现超过了自家的 V4 Pro Preview,但略逊于 Claude Opus 4.8,平均差距约为 6 分。然而,其 Token 价格比 Opus 低两个数量级,且通过 Gonka 网络使用比官方 DeepSeek API 便宜数十倍。这种“以极低成本获得接近前沿的质量”的比例使其极具吸引力:详细的独立评测可查看 Artificial Analysis,模型权重及介绍可在 Hugging Face 查看。
如何通过 JoinGonka Gateway 使用 DeepSeek V4 Flash
该模型现已通过 JoinGonka Gateway 提供,支持 OpenAI 和 Anthropic 兼容 API。模型标识符:deepseek-ai/DeepSeek-V4-Flash-0731。
最快的使用方式 是使用单行命令安装程序,它可以自动配置您的开发工具(如 Claude Code, OpenClaw, Cline, opencode, Aider 等)直接使用此模型:
npx @joingonka/setup --model deepseek直接 API 调用 (OpenAI 格式):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-您的密钥" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"你好!"}]}'注册即可获得 10,000,000 免费 Token —— 配合 380K 上下文,足以让您立即在真实的大型文档和代码库中测试模型。Python 和 TypeScript 的分步指南请参考 API Quickstart;您也可以在 免费聊天室 中直接选择 DeepSeek V4 Flash 体验,无需注册。
DeepSeek V4 Flash 的适用场景
该模型的优势场景包括:
- 处理大型文档及完整代码库。 380,000 Token 相当于约 280,000 个单词:年度报告、法律文档包或中型代码仓库都可以放入单个请求中,无需切割,避免上下文碎片化。
- 长时智能体对话。 能够自主读取文件、调用工具并积累历史记录的智能体最容易达到上下文上限 —— 380K 的上下文储备意味着更长的对话会话,无需频繁重置记忆。
- 基于大规模采样进行 RAG。 放入上下文的相关文档越多,模型对检索准确性的依赖就越小。
- 逻辑推理任务。 推理模式在数学、科学和多步骤逻辑问题上提供了性能提升,且价格保持在普通模型水平。
何时选择网络中的其他模型:对于在复杂仓库中进行最可靠的智能体代码编写,Kimi K2.6 依然强劲(详细对比请见我们的文章 关于最好的代码模型),而 MiniMax M2.7 依然是经受过市场考验的日常主力工具。由于采用统一定价,您可以自由尝试 —— 切换模型只需修改请求中的一行代码。