Các phần cơ sở kiến thức ▾
Điều hướng
▸ Bắt đầu tại đây Theo vai tròDanh mục
- Kiến trúc mạng Gonka: Sprint, Transfer Agents, DiLoCo
- Nhà phát triển: Cách kiếm GNK
- Tự lưu trữ: Hướng dẫn từng bước
- Chọn GPU cho Gonka: khuyến nghị về phần cứng
- Qwen3-235B: mô hình mà Gonka đã từng phục vụ
- Kimi K2.6: Mô hình mà Gonka từng hỗ trợ
- MiniMax M2.7: Mô hình của mạng Gonka
- DeepSeek V4 Flash: mô hình mạng lưới Gonka với bối cảnh 380K
- GLM-5.3 Flash: mô hình lập luận Z.ai trong mạng Gonka
Công nghệ
DeepSeek V4 Flash: mô hình mạng lưới Gonka với bối cảnh 380K
Tháng 8 năm 2026, mạng Gonka có thêm mô hình hoạt động thứ ba — DeepSeek V4 Flash. Đề xuất quản trị #94 về việc bổ sung mô hình này do nhóm kaitaku.ai đưa ra, vốn nổi tiếng trong cộng đồng nhờ tối ưu hóa MLNode: họ đã chạy các thử nghiệm xác nhận mô hình tương thích với Proof of Compute và cơ chế xác thực của mạng, và ngày 12 tháng 8 đề xuất đã được biểu quyết thông qua. Ngay hôm sau, mô hình đã phục vụ các yêu cầu.
Với người dùng, đây là một bước mở rộng đáng kể: DeepSeek V4 Flash có cửa sổ ngữ cảnh 380 000 token — một trong những cửa sổ dài nhất trong mạng (gần gấp đôi MiniMax M2.7; chỉ GLM-5.3 Flash dài hơn chút — 390 000), kèm reasoning tích hợp và tool calling đầy đủ. Hãy cùng tìm hiểu đây là mô hình gì, ai làm ra nó, các đặc điểm của nó trong mạng Gonka, benchmark cho thấy điều gì — và khi nào nên chọn nó thay vì hai mô hình kia của mạng.
DeepSeek V4 Flash là gì và ai đứng sau nó
DeepSeek là một phòng thí nghiệm AI của Trung Quốc tại Hàng Châu, nổi tiếng toàn cầu sau khi phát hành V3 và R1: chính R1 vào đầu năm 2025 đã chứng minh rằng một mô hình mã nguồn mở có thể bắt kịp các mô hình hàng đầu đóng với chi phí thấp hơn nhiều. Vào tháng 4 năm 2026, DeepSeek đã phát hành dòng V4 gồm hai mô hình: bản nặng V4 Pro và bản nhẹ V4 Flash. Cả hai đều là mã nguồn mở (giấy phép MIT), và cả hai đều được xây dựng trên kiến trúc MoE.
V4 Flash có 284 tỷ tham số, trong đó khoảng 13 tỷ được kích hoạt cho mỗi token. Sự thưa thớt này giúp mô hình nhanh và chi phí vận hành thấp: nó cần ít VRAM hơn đáng kể so với các mô hình "dày đặc" khổng lồ, và tốc độ tạo văn bản cao hơn.
Trong mạng lưới Gonka đang chạy phiên bản V4-Flash-0731 — phiên bản được đào tạo lại (re-post-training) từ ngày 31 tháng 7 năm 2026. Kiến trúc và kích thước không thay đổi, nhưng chất lượng trên các tác vụ tác tử đã tăng vọt: theo chín bài kiểm tra tác tử và mã hóa được DeepSeek công bố, phiên bản 0731 thậm chí còn vượt qua cả mô hình hàng đầu V4 Pro của chính họ trong phiên bản xem trước. Một lưu ý quan trọng để đảm bảo tính khách quan: một phần các số liệu này là kết quả đo lường bởi chính DeepSeek trên nền tảng thử nghiệm riêng của họ, vốn chưa được công bố công khai tại thời điểm viết bài, vì vậy vẫn chưa có xác nhận độc lập. Khoảng cách với các mô hình đóng hàng đầu vẫn còn: Claude Opus 4.8 không bị phiên bản 0731 vượt qua ở bất kỳ bài kiểm tra nào trong số chín bài kiểm tra — nhưng chi phí rẻ hơn nhiều lần, và đó chính là điểm mấu chốt: chất lượng tác tử tối đa với mức giá thấp.
Đặc tính của DeepSeek V4 Flash trong mạng lưới Gonka
Như với các mô hình khác của mạng, điều quan trọng là phân biệt đặc điểm "nguyên bản" của mô hình với các tham số vận hành của một triển khai cụ thể: chúng do cấu hình inference vLLM trên các GPU host của mạng quyết định. Các giá trị thực tế qua Gateway của chúng tôi:
- Cửa sổ ngữ cảnh: 380 000 token — một trong những cửa sổ dài nhất trong mạng Gonka (chỉ GLM-5.3 Flash lớn hơn — 390 000). Chúng tôi đã kiểm chứng bằng thực nghiệm: yêu cầu với đầu vào 381 000 token được chấp nhận và xử lý trong vài chục giây. Bản thân kiến trúc V4 Flash hỗ trợ ngữ cảnh lên tới 1 triệu token; giới hạn thực tế trong mạng do cấu hình host quyết định (cửa sổ inference 400 000).
- Đầu ra tối đa: 32 768 token mỗi phản hồi — giới hạn lớn nhất trong mạng: MiniMax M2.7 và GLM-5.3 Flash thấp hơn bốn lần — 8 192; trong cả hai trường hợp đây là cấu hình gateway, không phải giới hạn của mô hình.
- Reasoning và tool calling: mô hình được triển khai với các parser suy luận và gọi công cụ — các kịch bản agent (Cursor, Claude Code, LangChain) hoạt động ngay; chúng tôi đã chạy nhiều kịch bản tool nhiều bước qua các đường dẫn tương thích OpenAI và Anthropic.
- Yêu cầu VRAM host: khoảng 280 GB — mô hình nhẹ nhất trong mạng (để so sánh: MiniMax M2.7 — 320 GB, GLM-5.3 Flash — 560 GB). Ngưỡng phần cứng càng thấp, host càng dễ triển khai mô hình — đây là dấu hiệu tốt cho tính khả dụng của nó trong mạng.
Giá inference trong mạng Gonka không phụ thuộc vào việc chọn mô hình: DeepSeek V4 Flash có cùng mức giá như MiniMax M2.7 và GLM-5.3 Flash — qua JoinGonka Gateway là $0.0069 cho một triệu token đầu vào và $0.021 cho một triệu token đầu ra. Để tham khảo: các nhà cung cấp bên thứ ba trên OpenRouter cung cấp cùng mô hình từ $0.06/$0.12 cho một triệu, và bản thân DeepSeek đến tháng 9 năm 2026 đã rút V4 Flash 0731 khỏi API của mình — các yêu cầu tới nó giờ do DeepSeek-V4.1-Flash phục vụ với giá $0.30/$1.20 vào giờ cao điểm. Kinh tế của mạng là một chủ đề riêng: giá được xác định bằng thanh toán cho công việc tính toán, chứ không phải theo bảng giá của nhà cung cấp.
So sánh DeepSeek V4 Flash, MiniMax M2.7 và GLM-5.3 Flash
Trong mạng lưới có ba mô hình đang hoạt động — DeepSeek V4 Flash, MiniMax M2.7 và GLM-5.3 Flash (Kimi K2.6 đã bị loại khỏi mạng lưới vào tháng 9 năm 2026, và GLM-5.2, mặc dù nằm trong danh sách đăng ký trong thời gian dài, đã không bao giờ được đưa vào biên chế chiến đấu). So sánh tóm tắt:
| Tham số | DeepSeek V4 Flash | MiniMax M2.7 | GLM-5.3 Flash |
|---|---|---|---|
| Ngữ cảnh trong mạng lưới | 380 000 | 200 000 | 390 000 |
| Đầu ra mỗi phản hồi | 32 768 | 8 192 | 8 192, bao gồm reasoning |
| Kiến trúc | MoE 284B (~13B hoạt động) | MoE + chú ý tuyến tính | MoE 320B (~18B hoạt động), chú ý hỗn hợp |
| VRAM mỗi node | 280 GB | 320 GB | 560 GB |
| Điểm mạnh | Ngữ cảnh dài, reasoning, tốc độ | Phát triển hàng ngày, sự ổn định | Logic phức tạp, phân tích mã nguồn, các tác vụ cần "suy nghĩ" |
| Giá qua Gateway | như nhau — $0.0069 đầu vào / $0.021 đầu ra cho 1M | ||
Hệ quả thực tế của việc có cùng mức giá: bạn có thể chọn mô hình hoàn toàn dựa trên tác vụ mà không cần suy nghĩ về ngân sách. Nếu bạn cần các prompt lớn với phản hồi nhanh và đầu ra dài nhất — DeepSeek V4 Flash; các tác vụ cần suy nghĩ về logic phức tạp (và ngữ cảnh dài nhất mạng lưới) — GLM-5.3 Flash; một "con ngựa thồ" ổn định cho công việc hàng ngày — MiniMax M2.7.
Benchmarks V4-Flash-0731: kết quả kiểm thử
Các kết quả chính được công bố cho bản build 0731 (theo DeepSeek và các đơn vị tổng hợp độc lập):
- SWE-bench Verified: 79,0% — giải quyết các nhiệm vụ GitHub thực tế; mức độ mà một năm trước chỉ các flagships đóng mới làm được. Để so sánh: Kimi K2.6, mà mạng lưới từng phục vụ trước đây, đạt 71,3%.
- GPQA Diamond: 88,1% — các câu hỏi khoa học trình độ sau đại học; chế độ suy luận mở rộng tăng độ chính xác cho các nhiệm vụ nhiều bước.
- Terminal Bench 2.1: 82,7 — vận hành trong terminal bằng agent; bản preview Flash đạt 61,8, V4 Pro Preview đạt 72,1.
- DeepSWE: 54,4 — một benchmark nghiêm ngặt mới của DeepSeek với tỷ lệ dương tính giả gần bằng 0; con số này là từ nhà cung cấp, stand chưa được công bố — cần xem xét với lưu ý này.
Thừa nhận công bằng: theo chín benchmark đại lý, bản build 0731 vượt qua V4 Pro Preview của chính nó, nhưng không vượt qua Claude Opus 4.8 — độ trễ trung bình khoảng 6 điểm. Tuy nhiên, về giá mỗi token, model này rẻ hơn Opus hai bậc, và qua mạng Gonka — rẻ hơn khoảng ~9 lần so với cùng model đó tại các nhà cung cấp bên thứ ba trên OpenRouter. Chính tỷ lệ "chất lượng tiệm cận frontier với giá chỉ bằng một phần nhỏ" này làm cho nó trở nên thú vị: bạn có thể xem các phép đo độc lập chi tiết tại Artificial Analysis, và xem weight cũng như thẻ model tại Hugging Face.
Cách sử dụng DeepSeek V4 Flash qua JoinGonka Gateway
Mô hình có sẵn qua JoinGonka Gateway với API tương thích cả OpenAI lẫn Anthropic. ID mô hình: deepseek-ai/DeepSeek-V4-Flash-0731.
Cách nhanh nhất — trình cài đặt một lệnh, tự động cấu hình công cụ của bạn (Claude Code, OpenClaw, Cline, opencode, Aider và nhiều công cụ khác) dùng ngay mô hình này:
npx @joingonka/setup --model deepseekỞ những công cụ mà trình cài đặt tự ghi config (Claude Code, Codex CLI, OpenClaw, opencode, Kilo Code, Hermes, Pi và nhiều công cụ khác), DeepSeek V4 Flash được đặt mặc định và không cần cờ. Cờ chỉ cần thiết để chuyển đổi một công cụ đã được cấu hình sẵn, và ở những nơi trình cài đặt in ra giá trị để bạn dán vào (Cursor, Cline, Aider). Các mô hình khác trong mạng cũng được chọn tương tự: --model minimax và --model glm.
Gọi API trực tiếp (định dạng OpenAI):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-your-key" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Hello!"}]}'Khi đăng ký, bạn nhận được 3M token miễn phí — với context 380K, đây là cơ hội để thử ngay mô hình trên những tài liệu lớn và codebase thực tế. Ví dụ từng bước bằng Python và TypeScript có trong API Quickstart; muốn thử mà không cần đăng ký, hãy vào chat miễn phí và chọn DeepSeek V4 Flash trong danh sách mô hình.
Khi nào chọn DeepSeek V4 Flash — các kịch bản thực tế
Các kịch bản phát huy tối đa sức mạnh của mô hình này:
- Tài liệu lớn và toàn bộ cơ sở mã. 380.000 token tương đương khoảng 280.000 từ: một báo cáo thường niên, một bộ hồ sơ pháp lý hay một repository cỡ trung bình đều vừa trong một yêu cầu, không cần cắt nhỏ và không mất liên kết giữa các phần.
- Phiên agent dài. Một agent tự hành đọc tệp, gọi công cụ và tích lũy lịch sử sẽ chạm trần ngữ cảnh nhanh nhất — dư địa 380K token đồng nghĩa với những phiên dài hơn hẳn mà không phải xóa bộ nhớ.
- RAG với tập trích xuất lớn. Càng nhiều tài liệu liên quan vừa trong ngữ cảnh, mức phụ thuộc vào độ chính xác của tìm kiếm càng giảm.
- Tác vụ suy luận. Chế độ reasoning mang lại bước tiến rõ rệt ở toán học, khoa học và logic nhiều bước — với mức giá của một mô hình thông thường.
Khi nào nên chọn mô hình khác trong mạng: với những tác vụ cần đào sâu vào logic rối rắm, đã có GLM-5.3 Flash — mô hình reasoning của mạng (bài phân tích chi tiết các mô hình cho phát triển nằm trong bài về những mô hình lập trình tốt nhất), còn MiniMax M2.7 vẫn là chú ngựa thồ đáng tin cho công việc hằng ngày. Nhờ mức giá đồng nhất, bạn cứ thoải mái thử nghiệm — đổi mô hình chỉ là một dòng trong yêu cầu.
Muốn tìm hiểu thêm?
Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.
Dùng thử DeepSeek V4 Flash qua Gateway →