ส่วนของฐานความรู้ ▾

เทคโนโลยี

Qwen3-235B: โมเดลที่ Gonka เคยให้บริการ

เครือข่าย Gonka ไม่ได้แค่ให้เช่า GPU เท่านั้น แต่ยังให้บริการ AI-models สำหรับ inference เป็นเวลานานที่โมเดลหลักและโมเดลเดียวของเครือข่ายคือ Qwen3-235B-A22B-Instruct ซึ่งพัฒนาโดย Alibaba Cloud แต่เมื่อเวลาผ่านไป เครือข่ายได้เปลี่ยนไปใช้สถาปัตยกรรมแบบมัลติโมเดล และได้นำ Qwen3-235B ออกจากเครือข่าย ปัจจุบัน Gonka ให้บริการ Kimi K2.6 จาก Moonshot AI และ MiniMax M2.7 เราจะมาแจกแจงกันว่า Qwen3-235B คืออะไร มีบทบาทอย่างไรในเครือข่าย Gonka และอะไรเข้ามาแทนที่ โดยในฐานะโมเดล MoE แบบ open-source ที่โดดเด่น มันยังคงเป็นเกณฑ์มาตรฐานที่มีประโยชน์

Qwen3-235B คืออะไร

Qwen3-235B-A22B-Instruct-2507-FP8 คือโมเดลภาษาขนาดใหญ่ (LLM) ในตระกูล Qwen3 ซึ่งพัฒนาโดยทีม Qwen แห่ง Alibaba Cloud ชื่อเต็มสามารถถอดความได้ดังนี้: Qwen3 — รุ่นที่สามของซีรีส์, 235B — มีพารามิเตอร์ทั้งหมด 235 พันล้านตัว, A22B — มีพารามิเตอร์ที่ใช้งานอยู่ 22 พันล้านตัวต่อคำขอ, Instruct — เวอร์ชันที่ได้รับการฝึกฝนให้ปฏิบัติตามคำแนะนำ, 2507 — รุ่นที่ออกในเดือนกรกฎาคม 2025, FP8 — การควอนติเซชันแบบ 8 บิตเพื่อปรับปรุงหน่วยความจำ

คุณสมบัติทางสถาปัตยกรรมที่สำคัญคือ MoE (Mixture of Experts) แตกต่างจากโมเดลแบบ 'หนาแน่น' (GPT-5.5, Claude Sonnet 4.6) ที่ทุกโทเค็นผ่านพารามิเตอร์ทั้งหมดนั้น โมเดล MoE จะเปิดใช้งานเพียงส่วนย่อยของ 'ผู้เชี่ยวชาญ' — บล็อกโครงข่ายประสาทเทียมเฉพาะทางสำหรับแต่ละคำขอ ในกรณีของ Qwen3-235B จากพารามิเตอร์ 235 พันล้านตัว มีเพียง 22 พันล้านตัวเท่านั้นที่ถูกเปิดใช้งานต่อโทเค็น — น้อยกว่า 10% สิ่งนี้ให้คุณภาพของโมเดลที่มีพารามิเตอร์มากกว่า 200 พันล้านตัวในขณะที่ใช้ทรัพยากรการคำนวณของโมเดลที่มีพารามิเตอร์ 22 พันล้านตัว

ในทางปฏิบัติหมายความว่า: โมเดลนี้ฉลาดกว่าที่คาดไว้จากความเร็วในการทำงาน มันประมวลผลคำขอได้เร็วกว่าโมเดลหนาแน่นที่มีคุณภาพเทียบเท่ากันอย่างมาก และใช้ VRAM สำหรับการอนุมานน้อยกว่ามาก ด้วยเหตุนี้ MoE จึงกลายเป็นสถาปัตยกรรมที่โดดเด่นสำหรับโมเดลที่ใหญ่ที่สุดในปี 2025—2026

หน้าต่างบริบท (Context window) ของ Qwen3-235B มีขนาด 131,072 โทเค็น (ประมาณ 100,000 คำ) — ซึ่งเพียงพอสำหรับการวิเคราะห์หนังสือทั้งเล่ม ฐานโค้ด หรือเอกสารทางกฎหมายยาวๆ ในคำขอเดียว โมเดลรองรับ 119 ภาษา รวมถึงรัสเซีย อังกฤษ จีน อาหรับ ฮินดี และภาษาอื่นๆ อีกหลายสิบภาษา — ทำให้เป็นหนึ่งในโมเดลหลายภาษาที่แพร่หลายที่สุดในตลาด

คุณสมบัติและเกณฑ์มาตรฐาน

Qwen3-235B แข่งขันกับโมเดลปิดและเปิดขนาดใหญ่ที่สุด นี่คือการเปรียบเทียบคุณสมบัติหลัก:

รุ่นพารามิเตอร์บริบทMoEOpen Sourceราคา (ต่อ 1M โทเค็น)
Qwen3-235B (Alibaba)235B (22B active)131Kใช่ใช่ (Apache 2.0)$0.07+ (hosting)
GPT-5.5 (OpenAI)~1.8T (ประเมิน)128Kใช่ (คาดการณ์)ไม่ใช่$5.00
Claude Sonnet 4.6 (Anthropic)ไม่เปิดเผย200Kไม่ใช่ (คาดการณ์)ไม่ใช่$3.00
Llama 4 Maverick (Meta)400B (17B active)1Mใช่ใช่ (Llama License)$0.20+ (hosting)
DeepSeek-R1 (DeepSeek)671B (37B active)128Kใช่ใช่ (MIT)$0.55

Qwen3-235B แสดงระดับคุณภาพเทียบเท่ากับ GPT-5.5 และ Claude Sonnet 4.6 ในเบนช์มาร์คส่วนใหญ่ ในฐานะโมเดล open-weights MoE ที่ประหยัดกว่าโมเดลที่เป็นกรรมสิทธิ์หลายเท่าตัว โดยสถาปัตยกรรม MoE จะเปิดใช้งานเพียงบางส่วนของพารามิเตอร์ต่อการเรียกใช้ ทำให้ต้นทุนการประมวลผลลดลงอย่างมาก เครือข่าย Gonka ใช้หลักการเดียวกันนี้กับโมเดลปัจจุบันอย่าง Kimi K2.6 และ MiniMax M2.7 ซึ่งสามารถเข้าถึงได้ผ่าน JoinGonka Gateway ในราคา $0.003 ต่อ 1 ล้านโทเค็น (ถูกกว่า GPT-5.5 และ Claude นับพันเท่า)

ในเบนช์มาร์ค MMLU-Pro, HumanEval, MATH-500 และ GSM8K โมเดลติดอันดับ Top 3 ของโมเดล open-source โดยแพ้เพียง DeepSeek-R1 ในด้านการให้เหตุผล (reasoning) สำหรับงานเขียนโค้ด การแปลภาษา และการทำตามคำสั่ง Qwen3-235B นั้นแซงหน้า Llama 4 Maverick อย่างสม่ำเสมอและอยู่ในระดับเดียวกับ Claude Sonnet 4.6

วิธีการที่ Gonka ใช้ Qwen3-235B

เมื่อ Qwen3-235B เป็นโมเดลหลักของเครือข่าย มันทำงานบน เครือข่าย Gonka แบบกระจายศูนย์ผ่านโปรโตคอล DiLoCo ที่ปรับแต่งมาสำหรับการ inference โมเดลฉบับสมบูรณ์ในรูปแบบ FP8 ต้องการ VRAM ประมาณ 640 GB ซึ่งไม่สามารถใส่ไว้ใน GPU ตัวเดียวได้ แม้แต่ H100 80GB หรือ H200 141GB ก็ไม่เพียงพอ ดังนั้นโมเดลจึงถูกแบ่งออกเป็นส่วนๆ (tensor parallelism + pipeline parallelism) ไปยัง ML-nodes หลายๆ ตัว

ในทางปฏิบัติ Qwen3-235B ทำงานบนคลัสเตอร์ของ GPU-nodes จำนวน 8—16 โหนด โดยแต่ละโหนดมี VRAM อย่างน้อย 40 GB ระบบ Transfer Agents จะทำหน้าที่ส่งคำขอไปยังคลัสเตอร์ที่ถูกต้อง โดยมี vLLM บนแต่ละโหนดประมวลผลข้อมูลในส่วนของตัวเอง จากนั้นผลลัพธ์จะถูกรวบรวมและส่งกลับไปยังผู้ใช้ กระบวนการทั้งหมดใช้เวลาเพียงไม่กี่ร้อยมิลลิวินาที ผู้ใช้จึงไม่รู้สึกว่าคำขอของตนถูกประมวลผลโดย GPU กว่าสิบตัวที่อยู่คนละมุมโลก หลักการ inference แบบกระจายศูนย์นี้ยังคงถูกใช้ในเครือข่ายจนถึงปัจจุบันกับโมเดลที่ใช้งานอยู่

รายละเอียดทางเทคนิคที่สำคัญ: Gonka ใช้ vLLM เป็นเอนจิ้นสำหรับการทำ serving ซึ่งเป็นโปรเจกต์โอเพนซอร์สที่ช่วยให้การสร้างข้อความมีประสิทธิภาพสูงผ่าน PagedAttention โดยเป็นอัลกอริทึมที่เพิ่มประสิทธิภาพการใช้ VRAM เมื่อต้องประมวลผลคำขอจำนวนมากพร้อมกัน สิ่งนี้ช่วยให้เครือข่ายรองรับผู้ใช้งานหลายพันคนพร้อมกันได้โดยที่คุณภาพไม่ลดลง

โมเดลนี้รองรับ native tool calling ซึ่งเป็นการเรียกใช้ฟังก์ชันและเครื่องมือโดยตรงจากการตอบกลับของโมเดล ความสามารถนี้ถูกเพิ่มเข้ามาใน Gonka ผ่าน PR #767 ด้วยเกณฑ์ (threshold) 0.958 สำหรับการระบุการเรียกใช้เครื่องมือ บน Qwen3-235B สิ่งนี้ช่วยให้นักพัฒนาสามารถสร้าง AI-agents ที่โต้ตอบกับ API ภายนอก ฐานข้อมูล และเครื่องมือต่างๆ ได้ผ่านคำขอเดียว การรองรับ tool calling ยังคงมีอยู่ในโมเดลปัจจุบันของเครือข่าย

เครือข่าย Gonka มี GPU มากกว่า 4,000 ตัว (H100, H200, A100, RTX 4090 และอื่นๆ) ที่รวมกันเป็น ML-nodes มากกว่า 120 โหนด นี่เป็นหนึ่งในเครือข่าย GPU แบบกระจายศูนย์สำหรับการทำ AI inference ที่ใหญ่ที่สุดในโลก และในขณะที่พลังการประมวลผลนี้เคยทุ่มเทให้กับ Qwen3-235B ในปัจจุบันมันกำลังขับเคลื่อนโมเดลที่ใช้งานจริงของเครือข่ายอย่าง Kimi K2.6 และ MiniMax M2.7

สามารถลองใช้ Qwen3-235B ตอนนี้ได้หรือไม่

คำตอบคือ: ผ่านเครือข่าย Gonka ไม่ได้แล้ว Qwen3-235B ถูกนำออกจากเครือข่าย ดังนั้นไม่สามารถเรียกใช้ผ่าน ID qwen3-235b-a22b บน Gateway ของเราได้อีกต่อไป เนื่องจากเป็นโมเดลเปิด (Apache 2.0) คุณยังคงเรียกใช้ด้วยตัวเองหรือใช้งานผ่านผู้ให้บริการโฮสติ้ง open-weights รายอื่นได้ เช่น OpenRouter (ประมาณ $0.071/$0.100 ต่อ 1M โทเค็น)

หากคุณต้องการ inference แบบกระจายศูนย์ราคาถูกซึ่งเป็นจุดเด่นของ Gonka สิ่งนี้ยังคงอยู่และทำงานได้ปกติผ่านโมเดลปัจจุบันของเครือข่าย ผ่าน JoinGonka API Gateway คุณสามารถเข้าถึง Kimi K2.6 และ MiniMax M2.7 ผ่าน API ที่เข้ากันได้กับ OpenAI: โค้ดใดๆ ที่เขียนสำหรับ OpenAI สามารถทำงานได้ทันทีโดยไม่ต้องแก้ไข แค่เปลี่ยน URL, API-key และชื่อโมเดล

ตัวอย่างการใช้งานโมเดลปัจจุบัน:

curl https://gate.joingonka.ai/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "moonshotai/Kimi-K2.6",
    "messages": [{"role": "user", "content": "อธิบายสถาปัตยกรรม MoE"}]
  }'

ค่าใช้จ่าย: $0.003 ต่อ 1 ล้านโทเค็น ซึ่งถูกกว่า GPT-5.5 ($5.00/1M) 1,700 เท่า และถูกกว่า Claude Sonnet 4.6 ($3.00/1M) 1,000 เท่า เมื่อลงทะเบียนคุณจะได้รับ 10 ล้านโทเค็นฟรีเพื่อทดสอบ

Gateway รองรับเครื่องมือพัฒนามากมาย: Quick Start มีคำแนะนำการเชื่อมต่อผ่าน Python, Node.js และ curl นอกจากนี้ยังรองรับการเชื่อมต่อ IDE เช่น Cursor, Continue, Cline, Aider และ Claude Code รวมถึงเฟรมเวิร์ก AI agent เช่น LangChain, n8n, LibreChat, Open WebUI

วิธีเริ่มต้นใช้งานด่วน:

  1. ลงทะเบียนที่ gate.joingonka.ai (เชื่อมต่อวอลเล็ตหรือสร้างใหม่)
  2. รับ API-key ใน Dashboard
  3. เปลี่ยน api.openai.com เป็น gate.joingonka.ai/api ในโค้ดของคุณ
  4. ระบุโมเดลที่ใช้งานได้ในเครือข่าย — moonshotai/Kimi-K2.6 หรือ MiniMaxAI/MiniMax-M2.7 (ดูรายการเต็มได้ที่ endpoint GET /v1/models)

การประมวลผล inference ระดับองค์กรแบบกระจายศูนย์ในราคาโปรเจกต์งานอดิเรกยังคงมีอยู่ Qwen3-235B เพียงแค่ส่งไม้ต่อให้กับโมเดลรุ่นใหม่ของเครือข่าย ความคุ้มค่าและคุณภาพเดียวกันนี้ตอนนี้มอบให้ผ่าน Kimi K2.6 และ MiniMax M2.7 แล้ว

Qwen3-235B-A22B คือโมเดล MoE ที่มีพารามิเตอร์ 235 พันล้านตัว (ใช้งานจริง 22 พันล้านตัว) จาก Alibaba Cloud ซึ่งเคยเป็นโมเดลหลักของเครือข่าย Gonka สำหรับการทำ decentralized AI inference ในช่วงแรก ด้วยสถาปัตยกรรม MoE ทำให้ได้คุณภาพระดับโมเดล proprietary ชั้นนำโดยมีต้นทุนการคำนวณที่ต่ำกว่ามาก ปัจจุบัน Qwen3-235B ถูกถอดออกจากเครือข่ายแล้ว โดยโมเดลปัจจุบันของ Gonka คือ Kimi K2.6 และ MiniMax M2.7 ซึ่งสามารถเข้าถึงได้ผ่าน JoinGonka Gateway ด้วย API ที่รองรับ OpenAI ในราคา $0.003 ต่อ 1M tokens ส่วน Qwen3-235B ยังคงเป็น open-weights (Apache 2.0) และมีให้บริการบนโฮสติ้งโมเดลภายนอก

ต้องการเรียนรู้เพิ่มเติมหรือไม่?

สำรวจส่วนอื่นๆ หรือเริ่มรับ GNK ทันที

ลองใช้โมเดลปัจจุบันของ Gonka →