ส่วนของฐานความรู้ ▾
การนำทาง
▸ เริ่มต้นที่นี่ ตามบทบาทหมวดหมู่
- สถาปัตยกรรมเครือข่าย Gonka: Sprint, Transfer Agents, DiLoCo
- นักพัฒนา: วิธีหา GNK
- โฮสต์เอง: คู่มือทีละขั้นตอน
- การเลือก GPU สำหรับ Gonka: คำแนะนำฮาร์ดแวร์
- Qwen3-235B: โมเดลที่ Gonka เคยให้บริการ
- Kimi K2.6: โมเดลตัวที่สองของเครือข่าย Gonka
- MiniMax M2.7: โมเดลเครือข่าย Gonka
- DeepSeek V4 Flash: โมเดลของเครือข่าย Gonka พร้อมบริบท 380K
เทคโนโลยี
Qwen3-235B: โมเดลที่ Gonka เคยให้บริการ
Qwen3-235B คืออะไร
Qwen3-235B-A22B-Instruct-2507-FP8 คือโมเดลภาษาขนาดใหญ่ (LLM) ในตระกูล Qwen3 ซึ่งพัฒนาโดยทีม Qwen แห่ง Alibaba Cloud ชื่อเต็มสามารถถอดความได้ดังนี้: Qwen3 — รุ่นที่สามของซีรีส์, 235B — มีพารามิเตอร์ทั้งหมด 235 พันล้านตัว, A22B — มีพารามิเตอร์ที่ใช้งานอยู่ 22 พันล้านตัวต่อคำขอ, Instruct — เวอร์ชันที่ได้รับการฝึกฝนให้ปฏิบัติตามคำแนะนำ, 2507 — รุ่นที่ออกในเดือนกรกฎาคม 2025, FP8 — การควอนติเซชันแบบ 8 บิตเพื่อปรับปรุงหน่วยความจำ
คุณสมบัติทางสถาปัตยกรรมที่สำคัญคือ MoE (Mixture of Experts) แตกต่างจากโมเดลแบบ 'หนาแน่น' (GPT-5.5, Claude Sonnet 4.6) ที่ทุกโทเค็นผ่านพารามิเตอร์ทั้งหมดนั้น โมเดล MoE จะเปิดใช้งานเพียงส่วนย่อยของ 'ผู้เชี่ยวชาญ' — บล็อกโครงข่ายประสาทเทียมเฉพาะทางสำหรับแต่ละคำขอ ในกรณีของ Qwen3-235B จากพารามิเตอร์ 235 พันล้านตัว มีเพียง 22 พันล้านตัวเท่านั้นที่ถูกเปิดใช้งานต่อโทเค็น — น้อยกว่า 10% สิ่งนี้ให้คุณภาพของโมเดลที่มีพารามิเตอร์มากกว่า 200 พันล้านตัวในขณะที่ใช้ทรัพยากรการคำนวณของโมเดลที่มีพารามิเตอร์ 22 พันล้านตัว
ในทางปฏิบัติหมายความว่า: โมเดลนี้ฉลาดกว่าที่คาดไว้จากความเร็วในการทำงาน มันประมวลผลคำขอได้เร็วกว่าโมเดลหนาแน่นที่มีคุณภาพเทียบเท่ากันอย่างมาก และใช้ VRAM สำหรับการอนุมานน้อยกว่ามาก ด้วยเหตุนี้ MoE จึงกลายเป็นสถาปัตยกรรมที่โดดเด่นสำหรับโมเดลที่ใหญ่ที่สุดในปี 2025—2026
หน้าต่างบริบท (Context window) ของ Qwen3-235B มีขนาด 131,072 โทเค็น (ประมาณ 100,000 คำ) — ซึ่งเพียงพอสำหรับการวิเคราะห์หนังสือทั้งเล่ม ฐานโค้ด หรือเอกสารทางกฎหมายยาวๆ ในคำขอเดียว โมเดลรองรับ 119 ภาษา รวมถึงรัสเซีย อังกฤษ จีน อาหรับ ฮินดี และภาษาอื่นๆ อีกหลายสิบภาษา — ทำให้เป็นหนึ่งในโมเดลหลายภาษาที่แพร่หลายที่สุดในตลาด
คุณสมบัติและเกณฑ์มาตรฐาน
Qwen3-235B แข่งขันกับโมเดลแบบปิดและแบบเปิดที่ใหญ่ที่สุด นี่คือการเปรียบเทียบคุณสมบัติหลัก:
| โมเดล | พารามิเตอร์ | บริบท | MoE | Open Source | ราคา (ต่อ 1M tokens) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B ใช้งาน) | 131K | ใช่ | ใช่ (Apache 2.0) | $0.07+ (โฮสติ้ง) |
| GPT-5.5 (OpenAI) | ~1.8T (ประมาณการ) | 128K | ใช่ (คาดการณ์) | ไม่ใช่ | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | ไม่เปิดเผย | 200K | ไม่ใช่ (คาดการณ์) | ไม่ใช่ | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B ใช้งาน) | 1M | ใช่ | ใช่ (Llama License) | $0.20+ (โฮสติ้ง) |
| DeepSeek-R1 (DeepSeek) | 671B (37B ใช้งาน) | 128K | ใช่ | ใช่ (MIT) | $0.55 |
Qwen3-235B แสดงให้เห็นถึงคุณภาพที่เทียบเท่ากับ GPT-5.5 และ Claude Sonnet 4.6 ในการทดสอบส่วนใหญ่ ในฐานะโมเดล open-weights MoE มันมีราคาถูกกว่าโมเดลที่เป็นกรรมสิทธิ์อย่างมาก: สถาปัตยกรรม MoE จะเปิดใช้งานเฉพาะพารามิเตอร์บางส่วนในการร้องขอ ช่วยลดต้นทุนการประมวลผลได้อย่างมาก เครือข่าย Gonka ใช้หลักการเดียวกันในการทำ inference แบบกระจายศูนย์ราคาประหยัดกับโมเดลปัจจุบัน ได้แก่ Kimi K2.6 และ MiniMax M2.7 ซึ่งมีให้บริการผ่าน JoinGonka Gateway ที่ราคา $0.0047 ต่อ 1M tokens (ถูกกว่า GPT-5.5 และ Claude หลายร้อยถึงหลายพันเท่า)
ในการทดสอบ MMLU-Pro, HumanEval, MATH-500 และ GSM8K โมเดลนี้ติดอันดับ 1 ใน 3 ของโมเดล open-source ที่ดีที่สุด โดยเป็นรองเพียง DeepSeek-R1 ในด้านการให้เหตุผลทางคณิตศาสตร์ (reasoning) ในการสร้างโค้ด การแปล และการทำตามคำสั่ง Qwen3-235B ทำผลงานได้ดีกว่า Llama 4 Maverick อย่างสม่ำเสมอและเทียบเท่ากับ Claude Sonnet 4.6
วิธีการที่ Gonka ใช้ Qwen3-235B
เมื่อ Qwen3-235B เป็นโมเดลหลักของเครือข่าย มันทำงานใน เครือข่าย Gonka แบบกระจายศูนย์ผ่านโปรโตคอล DiLoCo ที่ปรับแต่งสำหรับการทำ inference โมเดลที่สมบูรณ์ในรูปแบบ FP8 ต้องใช้ VRAM ประมาณ 640 GB (VRAM) ซึ่งไม่สามารถใส่ใน GPU เพียงตัวเดียวได้ แม้แต่ H100 80GB หรือ H200 141GB ก็ไม่เพียงพอ ดังนั้นโมเดลจึงถูกแบ่งออกเป็นส่วนๆ ตามชั้น (tensor parallelism + pipeline parallelism) ระหว่าง ML-nodes หลายตัว
ในทางปฏิบัติ Qwen3-235B ทำงานบนคลัสเตอร์ของ GPU-nodes 8–16 ตัว โดยแต่ละตัวมี VRAM ขั้นต่ำ 40 GB Transfer Agents จะกำหนดเส้นทางคำขอไปยังคลัสเตอร์ที่ถูกต้อง และ vLLM บนแต่ละโหนดจะประมวลผลส่วนของโมเดลของตนเอง ก่อนที่ผลลัพธ์จะถูกรวบรวมและส่งกลับไปยังผู้ใช้ กระบวนการทั้งหมดใช้เวลาเพียงหลายร้อยมิลลิวินาที ผู้ใช้จึงไม่รู้สึกว่าคำขอของตนถูกประมวลผลโดย GPU หลายสิบตัวที่อยู่คนละมุมโลก เครือข่ายยังคงใช้หลักการเดียวกันนี้ในการทำ inference แบบกระจายศูนย์กับโมเดลปัจจุบัน
รายละเอียดทางเทคนิคที่สำคัญ: Gonka ใช้ vLLM เป็นเอ็นจิ้นสำหรับการทำ serving ซึ่งเป็นโปรเจกต์ open-source ที่ช่วยให้การสร้างข้อความมีประสิทธิภาพสูงผ่าน PagedAttention ซึ่งเป็นอัลกอริทึมที่ปรับการใช้ VRAM ให้เหมาะสมในระหว่างการประมวลผลหลายคำขอพร้อมกัน สิ่งนี้ช่วยให้เครือข่ายสามารถรองรับผู้ใช้จำนวนหลายพันคนพร้อมกันได้โดยที่คุณภาพไม่ลดลง
โมเดลรองรับ native tool calling คือการเรียกใช้ฟังก์ชันและเครื่องมือโดยตรงจากคำตอบของโมเดล ความสามารถนี้ถูกเพิ่มเข้ามาใน Gonka ผ่าน PR #767 ด้วยเกณฑ์ 0.958 สำหรับการระบุการเรียกใช้เครื่องมือ บน Qwen3-235B สิ่งนี้ช่วยให้นักพัฒนาสามารถสร้าง AI-agents ที่โต้ตอบกับ API ภายนอก ฐานข้อมูล และเครื่องมือต่างๆ ผ่านคำขอเดียว การสนับสนุน tool calling ยังคงมีอยู่ในโมเดลปัจจุบันของเครือข่าย
เครือข่าย Gonka มี GPU มากกว่า 4,000 ตัว (H100, H200, A100, RTX 4090 และอื่นๆ) ที่รวมกันเป็น ML-nodes มากกว่า 120 แห่ง นี่คือหนึ่งในเครือข่าย GPU แบบกระจายศูนย์ที่ใหญ่ที่สุดสำหรับ AI inference ในโลก และหากก่อนหน้านี้กำลังนี้ถูกใช้สำหรับ Qwen3-235B ปัจจุบันมันกำลังให้บริการโมเดลปัจจุบันของเครือข่าย ได้แก่ Kimi K2.6, MiniMax M2.7 และ DeepSeek V4 Flash
สามารถลองใช้ Qwen3-235B ตอนนี้ได้หรือไม่
คำตอบโดยตรงคือ: ผ่านเครือข่าย Gonka ไม่ได้แล้ว Qwen3-235B ถูกถอดออกจากเครือข่ายแล้ว ดังนั้นคุณจึงไม่สามารถเรียกใช้งานผ่านตัวระบุ qwen3-235b-a22b ผ่าน Gateway ของเราได้อีกต่อไป เนื่องจากโมเดลนี้เป็นแบบเปิด (Apache 2.0) คุณยังสามารถรันด้วยตัวเองหรือเข้าถึงผ่านโฮสต์ของบุคคลที่สามสำหรับโมเดล open-weights ได้ เช่น ผ่าน OpenRouter (ราคาโดยประมาณอยู่ที่ $0.071/$0.100 ต่อ 1M tokens)
หากคุณต้องการการ inference แบบกระจายศูนย์ (decentralized inference) ในราคาประหยัดซึ่งเป็นเหตุผลหลักที่คนเลือกใช้ Gonka มันยังคงอยู่เหมือนเดิม เพียงแต่ตอนนี้ทำงานอยู่บนโมเดลที่ใช้งานได้จริงในเครือข่าย ผ่าน JoinGonka API Gateway คุณสามารถเข้าถึง Kimi K2.6, MiniMax M2.7 และ DeepSeek V4 Flash ผ่าน API ที่เข้ากันได้กับ OpenAI: โค้ดใดๆ ที่เขียนสำหรับ OpenAI สามารถใช้งานได้โดยไม่ต้องแก้ไข เพียงแค่เปลี่ยน URL, API-key และชื่อโมเดล
ตัวอย่างคำขอไปยังโมเดลที่ใช้งานได้:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "อธิบายสถาปัตยกรรม MoE"}]
}'ราคา: $0.0047 ต่อ 1 ล้าน tokens — ซึ่งถูกกว่า GPT-5.5 ($5.00/1M) ถึงประมาณ 800 เท่า และถูกกว่า Claude Sonnet 4.6 ($3.00/1M) ประมาณ 500 เท่า เมื่อลงทะเบียนคุณจะได้รับโบนัส 1.5M tokens สำหรับการทดสอบฟรี
Gateway รองรับเครื่องมือพัฒนายอดนิยม: Quick Start อธิบายวิธีการเชื่อมต่อผ่าน Python, Node.js และ curl นอกจากนี้ยังรองรับการใช้งานกับ IDE-integrations — Cursor, Continue, Cline, Aider และ Claude Code — รวมถึงเฟรมเวิร์กสำหรับ AI-agents: LangChain, n8n, LibreChat, Open WebUI
สำหรับจุดเริ่มต้นที่รวดเร็ว:
- ลงทะเบียนที่ gate.joingonka.ai (เชื่อมต่อกระเป๋าเงินหรือสร้างใหม่)
- รับ API-key ใน Dashboard
- เปลี่ยน
api.openai.comเป็นgate.joingonka.ai/apiในโค้ดของคุณ - ระบุโมเดลที่ใช้งานได้จริงในเครือข่าย —
moonshotai/Kimi-K2.6,MiniMaxAI/MiniMax-M2.7หรือdeepseek-ai/DeepSeek-V4-Flash-0731(ดูรายการทั้งหมดได้ที่ endpointGET /v1/models)
การทำ decentralized inference ระดับองค์กรในราคาโปรเจกต์งานอดิเรกยังคงอยู่เหมือนเดิม Qwen3-235B เพียงแค่หลีกทางให้กับโมเดลใหม่ๆ ในเครือข่าย ความคุ้มค่าและคุณภาพระดับเดิมตอนนี้ทำงานอยู่บน Kimi K2.6, MiniMax M2.7 และ DeepSeek V4 Flash
ต้องการเรียนรู้เพิ่มเติมหรือไม่?
สำรวจส่วนอื่นๆ หรือเริ่มรับ GNK ทันที
ลองใช้โมเดลปัจจุบันของ Gonka →