知识库章节 ▾
技术
DeepSeek V4 Flash:具有 380K 上下文的 Gonka 网络模型
2026 年 8 月,Gonka 网络迎来了第三个在运模型——DeepSeek V4 Flash。添加该模型的 Governance 提案 #94 由 kaitaku.ai 团队提交,该团队因 ML 节点优化而为社区所熟知:他们进行了实验,验证了该模型与 Proof of Compute 及网络验证的兼容性,8 月 12 日提案经投票通过。次日模型便已开始处理请求。
对用户而言,这是能力的一次显著扩展:DeepSeek V4 Flash 拥有 380 000 代币的上下文窗口——网络中最长的之一(几乎是 MiniMax M2.7 的两倍;仅 GLM-5.3 Flash 稍长,为 390 000),内置 reasoning 与完整的 tool calling。我们来拆解一下:这是什么模型、由谁开发、它在 Gonka 网络上的具体特性有哪些、基准测试表现如何——以及何时该选它而非网络中另外两个模型。
什么是 DeepSeek V4 Flash 以及其背后的开发团队
DeepSeek 是一家总部位于杭州的中国 AI 实验室,在 V3 和 R1 发布后获得了全球声誉:正是 R1 在 2025 年初证明了开源模型可以以极低的预算追赶闭源旗舰模型。2026 年 4 月,DeepSeek 发布了包含两个模型的 V4 系列:重量级的 V4 Pro 和轻量级的 V4 Flash。两者均为开源(MIT 许可证),且均基于 MoE 架构构建。
V4 Flash 拥有 2840 亿参数,每个 token 激活约 130 亿。这种稀疏性使得模型运行快速且维护成本低:它比“稠密”的巨型模型需要更少的 VRAM,且生成速度更快。
在 Gonka 网络上运行的是 V4-Flash-0731 版本 — 这是 2026 年 7 月 31 日的重训练 (re-post-training) 版本。架构和大小未变,但在智能体任务上的性能有了大幅提升:根据 DeepSeek 公布的九项智能体和编码基准测试,0731 版本甚至超过了他们自己的旗舰模型 V4 Pro 的预览版。公平起见,有一个重要提醒:其中一些数字是 DeepSeek 在其自己的测试台上的测量结果,撰写本文时尚未公开,因此目前还没有独立的复现。与闭源前沿模型相比,差距依然存在:0731 版本在九项基准测试中均未超越 Claude Opus 4.8,但其成本低了几个数量级,这就是它的核心价值:以极高的性价比提供智能体性能。
Gonka 网络中 DeepSeek V4 Flash 的特性
与网络中的其他模型一样,重要的是区分模型的「开箱」特性与具体部署的运行参数:后者由网络 GPU 主机上 vLLM 推理的配置决定。以下是通过我们 Gateway 的实际数值:
- 上下文窗口:380 000 代币——Gonka 网络中最长的之一(仅 GLM-5.3 Flash 更大,为 390 000)。我们通过实测验证了这一点:一个输入 381 000 代币的请求被接受并在数十秒内处理完毕。V4 Flash 架构本身支持高达 100 万代币的上下文;网络中的实际上限由主机配置决定(推理窗口 400 000)。
- 最大输出:每次响应 32 768 代币——网络中最高的上限:MiniMax M2.7 和 GLM-5.3 Flash 仅为它的四分之一,即 8 192;两者均为网关配置,而非模型本身的限制。
- Reasoning 与 tool calling:该模型部署了推理与工具调用解析器——智能体场景(Cursor、Claude Code、LangChain)开箱即用;我们在兼容 OpenAI 和 Anthropic 的路径上跑通了多步 tool 场景。
- 主机 VRAM 要求:约 280 GB——网络中最轻量的模型(对比:MiniMax M2.7 为 320 GB,GLM-5.3 Flash 为 560 GB)。硬件门槛越低,主机越容易部署该模型——这对它在网络中的可用性是个好兆头。
在 Gonka 网络中,推理价格不因所选模型而异:DeepSeek V4 Flash 与 MiniMax M2.7 和 GLM-5.3 Flash 费率相同——通过 JoinGonka Gateway,每百万输入代币 $0.0069,每百万输出代币 $0.021。作为参照:OpenRouter 上的第三方供应商提供同一模型的价格从 $0.06/$0.12 每百万起,而 DeepSeek 自身在 2026 年 9 月前已将 V4 Flash 0731 从其 API 下线——相关请求现在由 DeepSeek-V4.1-Flash 在高峰时段以 $0.30/$1.20 处理。网络的经济机制是另一个话题:价格由对计算工作的结算决定,而非供应商的定价。
DeepSeek V4 Flash、MiniMax M2.7 和 GLM-5.3 Flash 比较
网络中有三款在用模型 —— DeepSeek V4 Flash、MiniMax M2.7 和 GLM-5.3 Flash(Kimi K2.6 已于 2026 年 9 月从网络中下架,而长期列入注册表的 GLM-5.2 最终未能进入现役)。简要比较如下:
| 参数 | DeepSeek V4 Flash | MiniMax M2.7 | GLM-5.3 Flash |
|---|---|---|---|
| 网络内上下文 | 380,000 | 200,000 | 390,000 |
| 单次回答输出 | 32,768 | 8,192 | 8,192(包含推理) |
| 架构 | MoE 284B (~13B 激活) | MoE + 线性注意力 | MoE 320B (~18B 激活), 混合注意力 |
| 单节点 VRAM | 280 GB | 320 GB | 560 GB |
| 核心优势 | 长上下文、推理能力、速度 | 日常开发、稳定性 | 复杂逻辑、代码分析、“思考”任务 |
| 网关价格 | 相同 —— 输入 $0.0069 / 输出 $0.021 每百万 tokens | ||
价格统一的实际意义在于:您可以纯粹根据任务需求选择模型,而无需考虑预算。需要大 Prompt、快速响应和最长输出的 —— DeepSeek V4 Flash;需要针对复杂逻辑进行思考的任务(以及网络中最长的上下文) —— GLM-5.3 Flash;日常稳定的主力工具 —— MiniMax M2.7。
V4-Flash-0731 基准测试:构建版表现
0731 版本发布后的关键结果(根据 DeepSeek 及独立聚合器的数据):
- SWE-bench Verified: 79.0% — 解决真实 GitHub 任务的能力;这一水平在一年前仅有闭源旗舰模型能够达到。作为对比:网络此前服务的 Kimi K2.6 为 71.3%。
- GPQA Diamond: 88.1% — 研究生级别的科学问题;高级推理模式增加了处理多步任务的准确性。
- Terminal Bench 2.1: 82.7 — 智能体终端操作能力;Flash 预览版为 61.8,V4 Pro Preview 为 72.1。
- DeepSWE: 54.4 — DeepSeek 新推出的严格基准测试,误报率接近零;此数字由厂商提供,测试平台尚未发布 — 请保持审慎态度。
公平评价:在九项智能体基准测试中,0731 版本超过了其自身的 V4 Pro Preview,但未超过 Claude Opus 4.8 — 平均落后约 6 个点。同时,其单位 Token 价格比 Opus 低两个数量级,通过 Gonka 网络使用比在 OpenRouter 第三方供应商处使用该模型便宜约 ~9 倍。这种“以极低成本获得接近前沿模型的质量”的性价比正是其吸引力所在:详细的独立评测请查看 Artificial Analysis,模型权重及卡片请见 Hugging Face。
如何通过 JoinGonka Gateway 使用 DeepSeek V4 Flash
该模型可通过 JoinGonka Gateway 访问,支持 OpenAI 和 Anthropic 兼容的 API。模型 ID:deepseek-ai/DeepSeek-V4-Flash-0731。
最快的方式是一条命令搞定安装,直接把你手头的工具(Claude Code、OpenClaw、Cline、opencode、Aider 等)配置为使用该模型:
npx @joingonka/setup --model deepseek对于安装器会自动写入配置的工具(Claude Code、Codex CLI、OpenClaw、opencode、Kilo Code、Hermes、Pi 等),DeepSeek V4 Flash 是默认选项,无需加 flag。flag 的作用是切换已经配置好的工具,以及安装器只打印待粘贴值的情况(Cursor、Cline、Aider)。网络中的其他模型也用同样的方式选择:--model minimax 和 --model glm。
直接调用 API(OpenAI 格式):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-your-key" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Hello!"}]}'注册即可获得 3M 免费 token——配合 380K 上下文,你可以立刻在真实的大型文档和代码库上测试这个模型。Python 和 TypeScript 的分步示例请见 API Quickstart;无需注册即可在免费聊天中试用,从模型列表里选择 DeepSeek V4 Flash 即可。
DeepSeek V4 Flash 的适用场景
该模型的强项场景:
- 处理大型文档和整个代码库。 380,000 个 Token 约等于 280,000 个单词:年报、法律文件包或中型代码仓库均可放入单次请求中,无需切割,避免了碎片化导致的信息丢失。
- 长时智能体对话。 阅读文件、调用工具并积累历史记录的自主智能体最容易触及上下文限制 — 380K Token 的余量意味着更长的对话会话,无需频繁重置记忆。
- 基于大规模样本的 RAG。 放入上下文的相关文档越多,对搜索准确性的依赖就越小。
- 推理任务。 推理模式在数学、科学和多步逻辑任务上提供了增强,且价格保持普通模型水平。
何时使用网络中的其他模型:对于需要深入思考复杂逻辑的任务,可以使用 GLM-5.3 Flash — 该网络的推理模型(开发模型详细分析请参阅最佳代码模型文章),而 MiniMax M2.7 依然是处理日常任务的可靠主力。由于统一的价格体系,您可以自由尝试 — 切换模型只需修改请求中的一行代码。