Các phần cơ sở kiến thức ▾
Điều hướng
▸ Bắt đầu tại đây Theo vai tròDanh mục
- Kiến trúc mạng Gonka: Sprint, Transfer Agents, DiLoCo
- Nhà phát triển: Cách kiếm GNK
- Tự lưu trữ: Hướng dẫn từng bước
- Chọn GPU cho Gonka: khuyến nghị về phần cứng
- Qwen3-235B: mô hình mà Gonka đã từng phục vụ
- Kimi K2.6: Mô hình thứ hai của mạng Gonka
- MiniMax M2.7: Mô hình của mạng Gonka
- DeepSeek V4 Flash: mô hình mạng lưới Gonka với bối cảnh 380K
Công nghệ
DeepSeek V4 Flash: mô hình mạng lưới Gonka với bối cảnh 380K
Vào tháng 8 năm 2026, mạng lưới Gonka đã có thêm mô hình thứ ba đang hoạt động — DeepSeek V4 Flash. Đề xuất quản trị #94 về việc bổ sung nó đã được đưa ra bởi nhóm kaitaku.ai, nổi tiếng trong cộng đồng về việc tối ưu hóa MLNode: họ đã chạy các thử nghiệm xác nhận tính tương thích của mô hình với Proof of Compute và xác thực mạng lưới, và vào ngày 12 tháng 8, đề xuất đã được thông qua bằng cách bỏ phiếu. Ngay ngày hôm sau, mô hình đã bắt đầu xử lý các yêu cầu.
Đối với người dùng, đây là một sự mở rộng đáng kể về khả năng: DeepSeek V4 Flash có cửa sổ ngữ cảnh dài nhất trong mạng lưới — 380.000 token (gần gấp đôi so với Kimi K2.6 và MiniMax M2.7), tích hợp sẵn reasoning và tool calling đầy đủ. Chúng ta hãy cùng tìm hiểu mô hình này là gì, ai đã tạo ra nó, đặc tính của nó trong mạng lưới Gonka, các kết quả benchmark cho thấy điều gì — và khi nào nên chọn nó thay vì hai mô hình khác trong mạng lưới.
DeepSeek V4 Flash là gì và ai đứng sau nó
DeepSeek là một phòng thí nghiệm AI của Trung Quốc tại Hàng Châu, nổi tiếng toàn cầu sau khi phát hành V3 và R1: chính R1 vào đầu năm 2025 đã chứng minh rằng một mô hình mã nguồn mở có thể bắt kịp các mô hình hàng đầu đóng với chi phí thấp hơn nhiều. Vào tháng 4 năm 2026, DeepSeek đã phát hành dòng V4 gồm hai mô hình: bản nặng V4 Pro và bản nhẹ V4 Flash. Cả hai đều là mã nguồn mở (giấy phép MIT), và cả hai đều được xây dựng trên kiến trúc MoE.
V4 Flash có 284 tỷ tham số, trong đó khoảng 13 tỷ được kích hoạt cho mỗi token. Sự thưa thớt này giúp mô hình nhanh và chi phí vận hành thấp: nó cần ít VRAM hơn đáng kể so với các mô hình "dày đặc" khổng lồ, và tốc độ tạo văn bản cao hơn.
Trong mạng lưới Gonka đang chạy phiên bản V4-Flash-0731 — phiên bản được đào tạo lại (re-post-training) từ ngày 31 tháng 7 năm 2026. Kiến trúc và kích thước không thay đổi, nhưng chất lượng trên các tác vụ tác tử đã tăng vọt: theo chín bài kiểm tra tác tử và mã hóa được DeepSeek công bố, phiên bản 0731 thậm chí còn vượt qua cả mô hình hàng đầu V4 Pro của chính họ trong phiên bản xem trước. Một lưu ý quan trọng để đảm bảo tính khách quan: một phần các số liệu này là kết quả đo lường bởi chính DeepSeek trên nền tảng thử nghiệm riêng của họ, vốn chưa được công bố công khai tại thời điểm viết bài, vì vậy vẫn chưa có xác nhận độc lập. Khoảng cách với các mô hình đóng hàng đầu vẫn còn: Claude Opus 4.8 không bị phiên bản 0731 vượt qua ở bất kỳ bài kiểm tra nào trong số chín bài kiểm tra — nhưng chi phí rẻ hơn nhiều lần, và đó chính là điểm mấu chốt: chất lượng tác tử tối đa với mức giá thấp.
Đặc tính của DeepSeek V4 Flash trong mạng lưới Gonka
Giống như các mô hình khác trong mạng lưới, điều quan trọng là phải phân biệt đặc tính của mô hình "nguyên bản" và các tham số vận hành cụ thể của việc triển khai: chúng được thiết lập bởi cấu hình vLLM-inference trên các host GPU của mạng lưới. Các giá trị thực tế thông qua Gateway của chúng tôi:
- Cửa sổ ngữ cảnh: 380.000 token — dài nhất trong mạng lưới Gonka. Chúng tôi đã kiểm tra thực nghiệm: một yêu cầu đầu vào 381.000 token đã được chấp nhận và xử lý trong hàng chục giây. Bản thân kiến trúc V4 Flash hỗ trợ bối cảnh lên đến 1 triệu token; giới hạn thực tế trong mạng lưới được đặt bởi cấu hình host (cửa sổ inference 400.000).
- Đầu ra tối đa: 8.192 token cho mỗi câu trả lời — giới hạn chung cho tất cả các mô hình trong mạng lưới (cấu hình gateway, không phải giới hạn của mô hình).
- Reasoning và tool calling: mô hình được triển khai với bộ phân tích lập luận và gọi công cụ — các kịch bản tác tử (Cursor, Claude Code, LangChain) hoạt động ngay lập tức; chúng tôi đã chạy thử các kịch bản công cụ nhiều bước theo các đường dẫn tương thích với OpenAI và Anthropic.
- Yêu cầu VRAM của host: khoảng 280 GB — là mô hình nhẹ nhất trong mạng lưới (để so sánh: MiniMax M2.7 — 320 GB, Kimi K2.6 — 720 GB). Ngưỡng phần cứng càng thấp, các host càng dễ dàng triển khai mô hình — đây là dấu hiệu tốt cho tính khả dụng của nó trong mạng lưới.
Giá inference trong mạng lưới Gonka không phụ thuộc vào việc chọn mô hình: DeepSeek V4 Flash có sẵn với cùng mức giá như Kimi K2.6 và MiniMax M2.7 — thông qua JoinGonka Gateway, mức giá là $0.0032 cho một triệu token đầu vào và $0.0097 cho một triệu token đầu ra. Để tham khảo: API chính thức của DeepSeek bán cùng mô hình này với giá $0.14/$0.28 mỗi triệu, OpenRouter từ $0.08/$0.18. Kinh tế mạng lưới là một chủ đề riêng: giá được xác định bằng cách tính toán công việc tính toán, không phải theo bảng giá của nhà cung cấp.
So sánh DeepSeek V4 Flash, Kimi K2.6 và MiniMax M2.7
Hiện tại có ba mô hình đang hoạt động trong mạng (mô hình thứ tư, GLM-5.2, đã được đăng ký và đang chờ triển khai). So sánh tóm tắt:
| Tham số | DeepSeek V4 Flash | Kimi K2.6 | MiniMax M2.7 |
|---|---|---|---|
| Context trong mạng | 380 000 | 200 000 | 200 000 |
| Output mỗi phản hồi | 8 192 | 8 192 | 8 192 |
| Kiến trúc | MoE 284B (~13B hoạt động) | MoE ~1T class | MoE |
| VRAM mỗi node | 280 GB | 720 GB | 320 GB |
| Điểm mạnh | Context dài, reasoning, tốc độ | Tác vụ đại lý (agentic), code | Phát triển hàng ngày, ổn định |
| Giá qua Gateway | giống nhau — $0.0032 input / $0.0097 output cho 1M | ||
Hệ quả thực tế của việc đồng giá: bạn có thể chọn mô hình hoàn toàn dựa trên tác vụ mà không cần lo về ngân sách. Cần context dài nhất hoặc câu trả lời nhanh với suy luận — DeepSeek V4 Flash; cần độ tin cậy đại lý tối đa cho code phức tạp — Kimi K2.6; công cụ đắc lực mỗi ngày — MiniMax M2.7.
Benchmarks V4-Flash-0731: kết quả kiểm thử
Các kết quả chính đã công bố của bản build 0731 (theo dữ liệu từ DeepSeek và các bộ tổng hợp độc lập):
- SWE-bench Verified: 79,0% — giải quyết các tác vụ GitHub thực tế; mức độ mà một năm trước chỉ các flagship đóng mới đạt được. Để so sánh: Kimi K2.6 — 71,3%.
- GPQA Diamond: 88,1% — câu hỏi khoa học cấp độ sau đại học; chế độ suy luận mở rộng tăng độ chính xác cho các tác vụ đa bước.
- Terminal Bench 2.1: 82,7 — làm việc trong terminal dưới dạng agent; bản xem trước Flash đạt 61,8, V4 Pro Preview đạt 72,1.
- DeepSWE: 54,4 — benchmark nghiêm ngặt mới của DeepSeek với tỷ lệ dương tính giả gần bằng 0; con số từ phía vendor, stand chưa được công bố — hãy lưu ý điều này.
Khung đánh giá công bằng: qua chín benchmark dành cho agent, bản build 0731 vượt qua cả V4 Pro Preview của chính nó, nhưng chưa vượt được Claude Opus 4.8 — mức chênh lệch trung bình khoảng 6 điểm. Tuy nhiên, tính theo giá mỗi token thì mô hình rẻ hơn Opus hai bậc độ lớn, và qua mạng Gonka thì còn rẻ hơn hàng chục lần so với API chính thức của DeepSeek. Chính tỷ lệ "chất lượng gần sát frontier với giá rẻ" này làm cho nó trở nên thú vị: các phép đo độc lập chi tiết có thể xem tại Artificial Analysis, trọng số và thẻ mô hình tại Hugging Face.
Cách sử dụng DeepSeek V4 Flash qua JoinGonka Gateway
Mô hình khả dụng qua JoinGonka Gateway theo API tương thích với OpenAI và Anthropic. ID mô hình: deepseek-ai/DeepSeek-V4-Flash-0731.
Cách nhanh nhất — trình cài đặt bằng một lệnh duy nhất, cấu hình công cụ của bạn (Claude Code, OpenClaw, Cline, opencode, Aider và các công cụ khác) để sử dụng ngay mô hình này:
npx @joingonka/setup --model deepseekGọi API trực tiếp (định dạng OpenAI):
curl https://gate.joingonka.ai/v1/chat/completions \
-H "Authorization: Bearer jg-your-key" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-V4-Flash-0731","messages":[{"role":"user","content":"Xin chào!"}]}'Khi đăng ký, bạn nhận được 10 000 000 token miễn phí — với context 380K, đây là cơ hội để thử nghiệm mô hình ngay trên các tài liệu lớn và codebase thực tế. Các ví dụ từng bước cho Python và TypeScript có trong API Quickstart; bạn có thể thử mà không cần đăng ký trong chat miễn phí bằng cách chọn DeepSeek V4 Flash từ danh sách mô hình.
Khi nào chọn DeepSeek V4 Flash — các kịch bản thực tế
Các kịch bản mạnh mẽ cho mô hình này:
- Tài liệu lớn và toàn bộ codebase. 380 000 token — tương đương khoảng 280 000 từ: báo cáo thường niên, bộ tài liệu pháp lý hoặc một kho lưu trữ trung bình có thể nằm gọn trong một yêu cầu, không cần chia nhỏ và không mất kết nối giữa các phần.
- Các phiên làm việc dài của agent. Một agent tự động đọc file, gọi công cụ và tích lũy lịch sử thường bị giới hạn bởi context nhanh nhất — mức dự phòng 380K token giúp các phiên làm việc kéo dài hơn đáng kể mà không cần xóa bộ nhớ.
- RAG với các tập dữ liệu lớn. Càng nhiều tài liệu liên quan nằm trong context, sự phụ thuộc vào độ chính xác của tìm kiếm càng thấp.
- Các tác vụ yêu cầu suy luận. Chế độ reasoning mang lại sự cải thiện về toán học, khoa học và logic đa bước — với mức giá của một mô hình thông thường.
Khi nào chọn mô hình khác trong mạng: để lập trình agent đáng tin cậy nhất trên các kho lưu trữ phức tạp, Kimi K2.6 vẫn mạnh mẽ (phân tích chi tiết — trong bài viết về các mô hình tốt nhất cho code), và MiniMax M2.7 vẫn là một công cụ đáng tin cậy cho các tác vụ hàng ngày. Nhờ giá thống nhất, bạn có thể tự do thử nghiệm — việc chuyển đổi mô hình chỉ cần thay đổi một dòng trong yêu cầu.
Muốn tìm hiểu thêm?
Khám phá các phần khác hoặc bắt đầu kiếm GNK ngay bây giờ.
Dùng thử DeepSeek V4 Flash qua Gateway →