ส่วนของฐานความรู้ ▾
เทคโนโลยี
Qwen3-235B: โมเดลที่ Gonka เคยให้บริการ
Qwen3-235B คืออะไร
Qwen3-235B-A22B-Instruct-2507-FP8 คือโมเดลภาษาขนาดใหญ่ (LLM) ในตระกูล Qwen3 ซึ่งพัฒนาโดยทีม Qwen แห่ง Alibaba Cloud ชื่อเต็มสามารถถอดความได้ดังนี้: Qwen3 — รุ่นที่สามของซีรีส์, 235B — มีพารามิเตอร์ทั้งหมด 235 พันล้านตัว, A22B — มีพารามิเตอร์ที่ใช้งานอยู่ 22 พันล้านตัวต่อคำขอ, Instruct — เวอร์ชันที่ได้รับการฝึกฝนให้ปฏิบัติตามคำแนะนำ, 2507 — รุ่นที่ออกในเดือนกรกฎาคม 2025, FP8 — การควอนติเซชันแบบ 8 บิตเพื่อปรับปรุงหน่วยความจำ
คุณสมบัติทางสถาปัตยกรรมที่สำคัญคือ MoE (Mixture of Experts) แตกต่างจากโมเดลแบบ 'หนาแน่น' (GPT-5.5, Claude Sonnet 4.6) ที่ทุกโทเค็นผ่านพารามิเตอร์ทั้งหมดนั้น โมเดล MoE จะเปิดใช้งานเพียงส่วนย่อยของ 'ผู้เชี่ยวชาญ' — บล็อกโครงข่ายประสาทเทียมเฉพาะทางสำหรับแต่ละคำขอ ในกรณีของ Qwen3-235B จากพารามิเตอร์ 235 พันล้านตัว มีเพียง 22 พันล้านตัวเท่านั้นที่ถูกเปิดใช้งานต่อโทเค็น — น้อยกว่า 10% สิ่งนี้ให้คุณภาพของโมเดลที่มีพารามิเตอร์มากกว่า 200 พันล้านตัวในขณะที่ใช้ทรัพยากรการคำนวณของโมเดลที่มีพารามิเตอร์ 22 พันล้านตัว
ในทางปฏิบัติหมายความว่า: โมเดลนี้ฉลาดกว่าที่คาดไว้จากความเร็วในการทำงาน มันประมวลผลคำขอได้เร็วกว่าโมเดลหนาแน่นที่มีคุณภาพเทียบเท่ากันอย่างมาก และใช้ VRAM สำหรับการอนุมานน้อยกว่ามาก ด้วยเหตุนี้ MoE จึงกลายเป็นสถาปัตยกรรมที่โดดเด่นสำหรับโมเดลที่ใหญ่ที่สุดในปี 2025—2026
หน้าต่างบริบท (Context window) ของ Qwen3-235B มีขนาด 131,072 โทเค็น (ประมาณ 100,000 คำ) — ซึ่งเพียงพอสำหรับการวิเคราะห์หนังสือทั้งเล่ม ฐานโค้ด หรือเอกสารทางกฎหมายยาวๆ ในคำขอเดียว โมเดลรองรับ 119 ภาษา รวมถึงรัสเซีย อังกฤษ จีน อาหรับ ฮินดี และภาษาอื่นๆ อีกหลายสิบภาษา — ทำให้เป็นหนึ่งในโมเดลหลายภาษาที่แพร่หลายที่สุดในตลาด
คุณสมบัติและเกณฑ์มาตรฐาน
Qwen3-235B แข่งขันกับโมเดลปิดและเปิดขนาดใหญ่ที่สุด นี่คือการเปรียบเทียบคุณสมบัติหลัก:
| รุ่น | พารามิเตอร์ | บริบท | MoE | Open Source | ราคา (ต่อ 1M โทเค็น) |
|---|---|---|---|---|---|
| Qwen3-235B (Alibaba) | 235B (22B active) | 131K | ใช่ | ใช่ (Apache 2.0) | $0.07+ (hosting) |
| GPT-5.5 (OpenAI) | ~1.8T (ประเมิน) | 128K | ใช่ (คาดการณ์) | ไม่ใช่ | $5.00 |
| Claude Sonnet 4.6 (Anthropic) | ไม่เปิดเผย | 200K | ไม่ใช่ (คาดการณ์) | ไม่ใช่ | $3.00 |
| Llama 4 Maverick (Meta) | 400B (17B active) | 1M | ใช่ | ใช่ (Llama License) | $0.20+ (hosting) |
| DeepSeek-R1 (DeepSeek) | 671B (37B active) | 128K | ใช่ | ใช่ (MIT) | $0.55 |
Qwen3-235B แสดงระดับคุณภาพเทียบเท่ากับ GPT-5.5 และ Claude Sonnet 4.6 ในเบนช์มาร์คส่วนใหญ่ ในฐานะโมเดล open-weights MoE ที่ประหยัดกว่าโมเดลที่เป็นกรรมสิทธิ์หลายเท่าตัว โดยสถาปัตยกรรม MoE จะเปิดใช้งานเพียงบางส่วนของพารามิเตอร์ต่อการเรียกใช้ ทำให้ต้นทุนการประมวลผลลดลงอย่างมาก เครือข่าย Gonka ใช้หลักการเดียวกันนี้กับโมเดลปัจจุบันอย่าง Kimi K2.6 และ MiniMax M2.7 ซึ่งสามารถเข้าถึงได้ผ่าน JoinGonka Gateway ในราคา $0.003 ต่อ 1 ล้านโทเค็น (ถูกกว่า GPT-5.5 และ Claude นับพันเท่า)
ในเบนช์มาร์ค MMLU-Pro, HumanEval, MATH-500 และ GSM8K โมเดลติดอันดับ Top 3 ของโมเดล open-source โดยแพ้เพียง DeepSeek-R1 ในด้านการให้เหตุผล (reasoning) สำหรับงานเขียนโค้ด การแปลภาษา และการทำตามคำสั่ง Qwen3-235B นั้นแซงหน้า Llama 4 Maverick อย่างสม่ำเสมอและอยู่ในระดับเดียวกับ Claude Sonnet 4.6
วิธีการที่ Gonka ใช้ Qwen3-235B
เมื่อ Qwen3-235B เป็นโมเดลหลักของเครือข่าย มันทำงานบน เครือข่าย Gonka แบบกระจายศูนย์ผ่านโปรโตคอล DiLoCo ที่ปรับแต่งมาสำหรับการ inference โมเดลฉบับสมบูรณ์ในรูปแบบ FP8 ต้องการ VRAM ประมาณ 640 GB ซึ่งไม่สามารถใส่ไว้ใน GPU ตัวเดียวได้ แม้แต่ H100 80GB หรือ H200 141GB ก็ไม่เพียงพอ ดังนั้นโมเดลจึงถูกแบ่งออกเป็นส่วนๆ (tensor parallelism + pipeline parallelism) ไปยัง ML-nodes หลายๆ ตัว
ในทางปฏิบัติ Qwen3-235B ทำงานบนคลัสเตอร์ของ GPU-nodes จำนวน 8—16 โหนด โดยแต่ละโหนดมี VRAM อย่างน้อย 40 GB ระบบ Transfer Agents จะทำหน้าที่ส่งคำขอไปยังคลัสเตอร์ที่ถูกต้อง โดยมี vLLM บนแต่ละโหนดประมวลผลข้อมูลในส่วนของตัวเอง จากนั้นผลลัพธ์จะถูกรวบรวมและส่งกลับไปยังผู้ใช้ กระบวนการทั้งหมดใช้เวลาเพียงไม่กี่ร้อยมิลลิวินาที ผู้ใช้จึงไม่รู้สึกว่าคำขอของตนถูกประมวลผลโดย GPU กว่าสิบตัวที่อยู่คนละมุมโลก หลักการ inference แบบกระจายศูนย์นี้ยังคงถูกใช้ในเครือข่ายจนถึงปัจจุบันกับโมเดลที่ใช้งานอยู่
รายละเอียดทางเทคนิคที่สำคัญ: Gonka ใช้ vLLM เป็นเอนจิ้นสำหรับการทำ serving ซึ่งเป็นโปรเจกต์โอเพนซอร์สที่ช่วยให้การสร้างข้อความมีประสิทธิภาพสูงผ่าน PagedAttention โดยเป็นอัลกอริทึมที่เพิ่มประสิทธิภาพการใช้ VRAM เมื่อต้องประมวลผลคำขอจำนวนมากพร้อมกัน สิ่งนี้ช่วยให้เครือข่ายรองรับผู้ใช้งานหลายพันคนพร้อมกันได้โดยที่คุณภาพไม่ลดลง
โมเดลนี้รองรับ native tool calling ซึ่งเป็นการเรียกใช้ฟังก์ชันและเครื่องมือโดยตรงจากการตอบกลับของโมเดล ความสามารถนี้ถูกเพิ่มเข้ามาใน Gonka ผ่าน PR #767 ด้วยเกณฑ์ (threshold) 0.958 สำหรับการระบุการเรียกใช้เครื่องมือ บน Qwen3-235B สิ่งนี้ช่วยให้นักพัฒนาสามารถสร้าง AI-agents ที่โต้ตอบกับ API ภายนอก ฐานข้อมูล และเครื่องมือต่างๆ ได้ผ่านคำขอเดียว การรองรับ tool calling ยังคงมีอยู่ในโมเดลปัจจุบันของเครือข่าย
เครือข่าย Gonka มี GPU มากกว่า 4,000 ตัว (H100, H200, A100, RTX 4090 และอื่นๆ) ที่รวมกันเป็น ML-nodes มากกว่า 120 โหนด นี่เป็นหนึ่งในเครือข่าย GPU แบบกระจายศูนย์สำหรับการทำ AI inference ที่ใหญ่ที่สุดในโลก และในขณะที่พลังการประมวลผลนี้เคยทุ่มเทให้กับ Qwen3-235B ในปัจจุบันมันกำลังขับเคลื่อนโมเดลที่ใช้งานจริงของเครือข่ายอย่าง Kimi K2.6 และ MiniMax M2.7
สามารถลองใช้ Qwen3-235B ตอนนี้ได้หรือไม่
คำตอบคือ: ผ่านเครือข่าย Gonka ไม่ได้แล้ว Qwen3-235B ถูกนำออกจากเครือข่าย ดังนั้นไม่สามารถเรียกใช้ผ่าน ID qwen3-235b-a22b บน Gateway ของเราได้อีกต่อไป เนื่องจากเป็นโมเดลเปิด (Apache 2.0) คุณยังคงเรียกใช้ด้วยตัวเองหรือใช้งานผ่านผู้ให้บริการโฮสติ้ง open-weights รายอื่นได้ เช่น OpenRouter (ประมาณ $0.071/$0.100 ต่อ 1M โทเค็น)
หากคุณต้องการ inference แบบกระจายศูนย์ราคาถูกซึ่งเป็นจุดเด่นของ Gonka สิ่งนี้ยังคงอยู่และทำงานได้ปกติผ่านโมเดลปัจจุบันของเครือข่าย ผ่าน JoinGonka API Gateway คุณสามารถเข้าถึง Kimi K2.6 และ MiniMax M2.7 ผ่าน API ที่เข้ากันได้กับ OpenAI: โค้ดใดๆ ที่เขียนสำหรับ OpenAI สามารถทำงานได้ทันทีโดยไม่ต้องแก้ไข แค่เปลี่ยน URL, API-key และชื่อโมเดล
ตัวอย่างการใช้งานโมเดลปัจจุบัน:
curl https://gate.joingonka.ai/api/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "moonshotai/Kimi-K2.6",
"messages": [{"role": "user", "content": "อธิบายสถาปัตยกรรม MoE"}]
}'ค่าใช้จ่าย: $0.003 ต่อ 1 ล้านโทเค็น ซึ่งถูกกว่า GPT-5.5 ($5.00/1M) 1,700 เท่า และถูกกว่า Claude Sonnet 4.6 ($3.00/1M) 1,000 เท่า เมื่อลงทะเบียนคุณจะได้รับ 10 ล้านโทเค็นฟรีเพื่อทดสอบ
Gateway รองรับเครื่องมือพัฒนามากมาย: Quick Start มีคำแนะนำการเชื่อมต่อผ่าน Python, Node.js และ curl นอกจากนี้ยังรองรับการเชื่อมต่อ IDE เช่น Cursor, Continue, Cline, Aider และ Claude Code รวมถึงเฟรมเวิร์ก AI agent เช่น LangChain, n8n, LibreChat, Open WebUI
วิธีเริ่มต้นใช้งานด่วน:
- ลงทะเบียนที่ gate.joingonka.ai (เชื่อมต่อวอลเล็ตหรือสร้างใหม่)
- รับ API-key ใน Dashboard
- เปลี่ยน
api.openai.comเป็นgate.joingonka.ai/apiในโค้ดของคุณ - ระบุโมเดลที่ใช้งานได้ในเครือข่าย —
moonshotai/Kimi-K2.6หรือMiniMaxAI/MiniMax-M2.7(ดูรายการเต็มได้ที่ endpointGET /v1/models)
การประมวลผล inference ระดับองค์กรแบบกระจายศูนย์ในราคาโปรเจกต์งานอดิเรกยังคงมีอยู่ Qwen3-235B เพียงแค่ส่งไม้ต่อให้กับโมเดลรุ่นใหม่ของเครือข่าย ความคุ้มค่าและคุณภาพเดียวกันนี้ตอนนี้มอบให้ผ่าน Kimi K2.6 และ MiniMax M2.7 แล้ว
ต้องการเรียนรู้เพิ่มเติมหรือไม่?
สำรวจส่วนอื่นๆ หรือเริ่มรับ GNK ทันที
ลองใช้โมเดลปัจจุบันของ Gonka →