ข้ามไปยังเนื้อหา
KoishiAI
EN
← กลับไปยังบทความทั้งหมด

ZGCM-1 LLM โอเพนซอร์ส: แข่งขันได้กับ Qwen3 ด้วยระบบ Hybrid Attention

ค้นพบ ZGCM-1 โมเดลภาษาขนาดใหญ่ (LLM) ขนาด 7B ที่เปิดเผยซอร์สโค้ดทั้งหมด ซึ่งสามารถแข่งขันกับ Qwen3 ได้ เรียนรู้วิธีการที่กลไก Attention แบบไฮบริดและการค้นหาแบบเอเจนต์ช่วยเพิ่มประสิทธิภาพและสมรรถนะของโมเดล

KoishiAI · บรรณาธิการ: เกียรติดำรง ตรีครุธพันธ์ · · 28 นาทีในการอ่าน
บทความนี้ AI เขียนจากแหล่งอ้างอิง ผ่านการตรวจสอบข้อเท็จจริงและกลั่นกรองโดยบรรณาธิการ วิธีทำงาน · มาตรฐาน · แจ้งข้อผิดพลาด
Abstract glass surfaces reflecting digital text create a mysterious tech ambiance.
Photo by Google DeepMind on Pexels

สรุปสั้น: ZGCM-1 โมเดลโอเพนซอร์สขนาด 7.39 พันพารามิเตอร์ ใช้สถาปัตยกรรม Hybrid Attention และ AI Agent ช่วยฝึกฝน ทำให้สามารถแข่งขันกับโมเดลขนาดใหญ่อย่าง Qwen3 ได้ โดยทำคะแนนคณิตศาสตร์บน MATH-500 สูงถึง 97.13% ซึ่งพิสูจน์ว่าประสิทธิภาพสูงไม่จำเป็นต้องพึ่งพาพารามิเตอร์จำนวนมากอีกต่อไป

ข้อเท็จจริงสำคัญ

  • ZGCM-1 เป็นโมเดลภาษาขนาดใหญ่ (LLM) แบบโอเพนซอร์สขนาด 7.39 พันพารามิเตอร์ พัฒนาโดย Zhongguancun Academy และสถาบันปัญญาประดิษฐ์ Zhongguancun
  • ยื่นบทความวิจัยต่อ arXiv เมื่อวันที่ 11 กันยายน 2026 พร้อมเปิดเผยซอร์สโค้ด น้ำหนักโมเดล รวมถึงจุดตรวจสอบกลางและบันทึกการฝึกฝนอย่างครบถ้วน
  • ใช้สถาปัตยกรรม Hybrid Attention ผสมผสาน interleaved gated sliding-window attention กับ full attention รองรับหน้าต่างบริบทขนาด 256K token
  • ใช้ตัวเพิ่มประสิทธิภาพ FP8 Muon และกระบวนการฝึกแบบ AI-native ด้วย agent swarms ซึ่งช่วยเพิ่มอัตราการผลิตในการฝึกฝนขึ้นสูงถึงประมาณ 3.94 เท่า
  • ทำคะแนนแม่นยำ 97.13% บน MATH-500, 75.00% บน AIME 2026 และ 70.42% บน HMMT 2025 โดยสามารถแข่งขันกับโมเดลขนาดใหญ่อย่าง Qwen3-235B-A22B ได้
  • แสดงประสิทธิภาพด้านการค้นหาแบบเอเจนต์ (Agentic Search) สูง โดยทำคะแนนได้ 63.09% บน WebWalkerQA, 19.43% บน BrowseComp และ 62.00% บน Binary Function Search

ประสิทธิภาพในฐานะฟีเจอร์: ZGCM-1 ท้าทายความนิยมของขนาดโมเดล

ทีมวิจัยจาก Zhongguancun Academy และสถาบันปัญญาประดิษฐ์ Zhongguancun ได้เปิดตัว ZGCM-1 โมเดลพื้นฐานแบบโอเพนซอร์สเต็มรูปแบบ ซึ่งมุ่งพิสูจน์ว่าระบบ AI ขนาดกะทัดรัดสามารถแข่งขันกับโมเดลชั้นนำที่มีขนาดใหญ่กว่าได้อย่างมาก ผ่านประสิทธิภาพทางสถาปัตยกรรมและความสามารถในการทำงานแบบเอเจนต์ [1] โมเดลดิสก์ (dense model) ที่มีพารามิเตอร์ 7.39 พันล้านตัวนี้ถูกยื่นต่อ arXiv เมื่อวันที่ 11 กันยายน 2026 โดยนำเสนอสถาปัตยกรรม attention แบบไฮบริดและเวิร์กโฟลว์การฝึกฝนอัตโนมัติที่ออกแบบมาเพื่อเพิ่มประสิทธิภาพสูงสุดขณะลดภาระด้านการคำนวณ [5]

สมมติฐานหลักของโปรเจกต์นี้ท้าทายความเชื่อในอุตสาหกรรมที่ว่าโมเดลขนาดเล็กมีข้อจำกัดโดยธรรมชาติจากการจดจำข้อมูลเว็บแบบพาสซีฟ แทนที่จะเป็นเช่นนั้น ZGCM-1 จึงผสานการให้เหตุผลภายในกับการใช้งานเครื่องมือภายนอกแบบแอคทีฟ ทำให้มันสามารถทำงานค้นหาแบบเอเจนต์ซึ่งปกติต้องการจำนวนพารามิเตอร์ที่สูงกว่ามาก [1] โดยการเปิดเผยไม่เพียงแต่ถ้ำนสุดท้าย (final weights) แต่ยังรวมถึงจุดตรวจสอบกลาง (intermediate checkpoints) และบันทึกการฝึกฝน (training logs) ผู้พัฒนาหวังที่จะมอบพิมพ์เขียวที่โปร่งใสสำหรับการสร้างระบบ AI ที่มีประสิทธิภาพสูง [4]

นวัตกรรมทางสถาปัตยกรรมเพื่อขนาดและความเร็ว

แกนกลางของ ZGCM-1 ถูกสร้างขึ้นจากการออกแบบร่วมระหว่างสถาปัตยกรรมและระบบ (architecture-system co-design) ที่ให้ความสำคัญกับประสิทธิภาพทั้งในการจัดการข้อมูลและอัตราการผลิตเชิงคำนวณ โมเดลนี้ใช้การผสมผสานระหว่างการ attention แบบเลื่อนที่มีเกตสลับกัน (interleaved gated sliding-window attention) กับกลไก full attention ซึ่งเป็นแนวทางไฮบริดที่สร้างสมดุลระหว่างการติดตามความสัมพันธ์ระยะยาวและการประมวลผลบริบทเฉพาะที่ [1] การออกแบบนี้ทำให้โมเดลรองรับหน้าต่างบริบทขนาด 256K token ได้ โดยไม่ต้องแบกรับต้นทุนที่สูงลิ่วซึ่งมักพบในโมเดล full attention ขนาดใกล้เคียงกัน

กระบวนการฝึกฝนได้รับการปรับให้เหมาะสมเพื่อความเสถียรและความเร็ว ทีมงานใช้ตัวเพิ่มประสิทธิภาพ FP8 Muon ซึ่งช่วยลดการใช้หน่วยความจำขณะรักษาความแม่นยำระหว่างการอัปเดตเกรเดียนต์ [1] เพื่อจัดการกับหน้าต่างบริบทที่กว้างขวาง พวกเขาได้ใช้การปรับขนาดหลักสูตรแบบก้าวหน้า (progressive curriculum scaling) โดยพาโมเดลผ่านบริบท 16K, 64K และสุดท้ายคือ 256K token เป็นขั้นตอน [7] การสัมผัสข้อมูลอย่างค่อยเป็นค่อยไปนี้ช่วยสร้างความเสถียรให้กับพลวัตการเรียนรู้เมื่อต้องจัดการกับลำดับข้อความที่ยาว

หนึ่งในแง่มุมที่น่าสังเกตของการพัฒนา ZGCM-1 คือเวิร์กโฟลว์การวิจัยและพัฒนาแบบ “AI-native” แทนที่จะพึ่งพาวิศวกรมนุษย์เพียงอย่างเดียวในการจัดการคลัสเตอร์ การคัดกรองข้อมูล และการประเมินผลวินิจฉัย ทีมงานได้ใช้ฝูงเอเจนต์ (agent swarms) เพื่อจัดการปฏิบัติการเหล่านี้โดยอัตโนมัติ [4] วิธีการฝึกฝนโมเดลแบบขับเคลื่อนด้วยตนเองนี้ reportedly สร้างการปรับปรุงประสิทธิภาพอย่างมีนัยสำคัญ: การปรับปรุงเวลาจนกว่าจะถึงค่า loss (time-to-loss) สำหรับการฝึกฝนล่วงหน้าบริบท 16K สูงขึ้นประมาณ 4.2 เท่าเมื่อเทียบกับค่าฐาน และเพิ่มอัตราการผลิตในการฝึกฝนที่หน้าต่างบริบทเต็มขนาด 256K ขึ้นสูงถึงประมาณ 3.94 เท่า [5]

ประสิทธิภาพในการทดสอบ: การแข่งขันกับยักษ์ใหญ่

ประสิทธิภาพของ ZGCM-1 เป็นจุดที่ปรัชญาการออกแบบของมันปรากฏชัดเจนที่สุด ในงานด้านเหตุผลทางคณิตศาสตร์ โมเดลแสดงให้เห็นถึงความเชี่ยวชาญในระดับสูงเมื่อเทียบกับขนาดของมัน โดยทำความแม่นยำได้ 97.13% บน MATH-500, 75.00% บน AIME 2026 และ 70.42% บน HMMT 2025 [5] ผลลัพธ์เหล่านี้โดดเด่นเป็นพิเศษเนื่องจากรายงานระบุว่า ZGCM-1 ยังคงมีความสามารถแข่งขันกับโมเดลขนาดใหญ่กว่ามาก เช่น Qwen3-235B-A22B และ GLM-5.1 ในชุดงานคณิตศาสตร์ที่ท้าทาย [1]

ในด้านความสามารถด้านการค้นหาแบบเอเจนต์ (agentic search)—ซึ่งหมายถึงงานที่ต้องใช้โมเดลในการสืบค้น เรียกข้อมูล และสังเคราะห์ข้อมูลจากเครื่องมือภายนอก—โมเดลก็แสดงประสิทธิภาพที่แข็งแกร่งเช่นกัน โดยทำคะแนนได้ 63.09% บน WebWalkerQA, 19.43% บน BrowseComp และ 62.00% บน Binary Function Search [5] ความสามารถในการทำคะแนนเหล่านี้ด้วยโมเดลแบบหนาแน่น (dense model) ที่มีพารามิเตอร์ขนาด 7B ชี้ให้เห็นว่าการเชื่อมโยงระหว่างการคิดภายในกับการใช้งานเครื่องมือภายนอกเป็นกลยุทธ์ที่มีประสิทธิภาพในการเอาชนะข้อจำกัดของความจุพารามิเตอร์ [1]

ระบบนิเวศแบบเปิด: ความพร้อมของข้อมูลและโค้ด

เพื่ออำนวยความสะดวกต่อการวิจัยและการนำไปใช้เพิ่มเติม ทีมงาน ZGCM-1 ได้ยึดถือแนวทางแบบเปิดอย่างเต็มที่ นอกเหนือจากน้ำหนักโมเดล (model weights) สุดท้ายแล้ว พวกเขายังได้เผยแพร่Weights จากขั้นตอนการฝึกเบื้องต้น (pre-training), กลาง (mid-training) และหลังการฝึก (post-training) รวมถึงจุดตรวจสอบระหว่างทาง (intermediate checkpoints) [5] โค้ดสำหรับการฝึก, สูตรข้อมูลสำหรับแต่ละขั้นตอน และบันทึกจาก Weights & Biases ก็พร้อมใช้งานต่อสาธารณะเช่นกัน ทำให้ผู้วิจัยคนอื่นสามารถทำซ้ำหรือพัฒนาต่อยอดจากกระบวนการทำงานของพวกเขาได้ [1]

ชุดข้อมูลพื้นฐาน ZGCM-1-Data เป็นคัมภีร์คู่ภาษาจีน-อังกฤษที่ครอบคลุมการฝึกเบื้องต้นทั่วไป, การฝึกกลางสำหรับบริบทยาว และการปรับแต่งด้วยผู้ดูแล (supervised fine-tuning) ในหลากหลายโดเมน รวมถึงโค้ด คณิตศาสตร์ และเส้นทางการใช้งานเครื่องมือ [6] การเผยแพร่ข้อมูลที่ครอบคลุมนี้สนับสนุนจุดเน้นสองประการของโมเดล นั่นคือเหตุผลเชิงลึกและการประยุกต์ใช้งานในทางปฏิบัติ

ผลกระทบต่อ AI แบบโอเพนซอร์ส

การเปิดตัว ZGCM-1 สะท้อนให้เห็นถึงการเปลี่ยนผ่านกระบวนทัศน์ในการพัฒนาโมเดลพื้นฐาน (foundation model) เมื่อต้นทุนด้านการคำนวณเพิ่มขึ้น ความสนใจในวิธีการที่ช่วยให้โมเดลขนาดเล็กสามารถแสดงผลเหนือระดับชั้นของมันเองผ่านการนวัตกรรมด้านสถาปัตยกรรมและเทคนิคการฝึกอัตโนมัติก็เพิ่มสูงขึ้น [4] โดยการแสดงให้เห็นว่าโมเดลขนาด 7B พารามิเตอร์สามารถเทียบเคียงกับระบบขนาดใหญ่กว่าได้ทั้งในด้านคณิตศาสตร์และการค้นหาแบบเอเจนต์ ZGCM-1 จึงนำเสนอทางเลือกที่น่าสนใจสำหรับองค์กรที่ต้องการประสิทธิภาพสูงโดยไม่ต้องแบกรับความต้องการด้านโครงสร้างพื้นฐานของโมเดลที่มีพารามิเตอร์หลายพันล้านตัว

โครงการนี้เป็นเครื่องยืนยันถึงศักยภาพของการออกแบบที่มุ่งเน้นประสิทธิภาพ ไม่ว่าจะเป็นผ่านกลไกความสนใจแบบไฮบริด (hybrid attention mechanisms), การปรับให้เหมาะสมด้วย FP8 หรือเวิร์กโฟลว์การฝึกที่ขับเคลื่อนโดย AI ZGCM-1 ให้หลักฐานเชิงประจักษ์ว่าขนาดที่กะทัดรัดไม่จำเป็นต้องแลกมาซึ่งความสามารถ [5] สำหรับชุมชนโอเพนซอร์ส มันนำเสนอทั้งโมเดลที่มีประสิทธิภาพสูงและแผนผังรายละเอียดสำหรับการบรรลุการเพิ่มประสิทธิภาพแบบเดียวกันในรอบถัดไป

แหล่งข้อมูล

  1. ZGCM-1: โมเดลพื้นฐานแบบเปิดทั้งหมดและทรงประสิทธิภาพสูงสำหรับการคำนวณและการค้นหาเชิงเอเจนต์ (arxiv.org) — 2026-09-11
  2. GitHub - zgcagi/ZGCM-1 (github.com) — 2026-09-07
  3. หน้ากระดาษงานวิจัย - ZGCM-1: โมเดลพื้นฐานแบบเปิดทั้งหมดและทรงประสิทธิภาพสูงสำหรับการคำนวณและการค้นหาเชิงเอเจนต์ (huggingface.co) — 2026-09-15
  4. ZGCM-1: โมเดลพื้นฐานแบบเปิดทั้งหมดและทรงประสิทธิภาพสูงสำหรับการคำนวณและการค้นหาเชิงเอเจนต์ (papers.cool) — 2026-09-11
  5. zgcagi/ZGCM-1-Data · ชุดข้อมูลบน Hugging Face (huggingface.co) — 2026-09-11

คำถามที่พบบ่อย

ZGCM-1 คืออะไรและมีความสามารถอย่างไร
ZGCM-1 เป็นโมเดลภาษาขนาดใหญ่ (LLM) ขนาด 7.39 พันพารามิเตอร์ที่พัฒนาโดย Zhongguancun Academy ซึ่งใช้สถาปัตยกรรม Attention แบบไฮบริดเพื่อเพิ่มประสิทธิภาพการทำงาน
ZGCM-1 ใช้สถาปัตยกรรม Attention แบบใด
โมเดลนี้ใช้กลไก Attention แบบไฮบริดที่ผสมผสานระหว่าง sliding-window attention และ full attention ทำให้รองรับหน้าต่างบริบทขนาด 256K token ได้อย่างมีประสิทธิภาพ
ZGCM-1 แข่งขันกับ Qwen3 หรือโมเดลอื่น ๆ ได้อย่างไร
ในด้านการทดสอบคณิตศาสตร์ ZGCM-1 ทำคะแนนได้สูงถึง 97.13% บน MATH-500 และมีความสามารถแข่งขันกับโมเดลขนาดใหญ่อย่าง Qwen3-235B-A22B ได้
ZGCM-1 เปิดให้เข้าถึงซอร์สโค้ดและข้อมูลฝึกฝนหรือไม่
ผู้พัฒนาเปิดเผยข้อมูลแบบเปิดเต็มที่รวมถึงถ้ำนสุดท้าย จุดตรวจสอบกลางระหว่างฝึก และบันทึกการฝึกฝน เพื่อให้ชุมชนวิจัยสามารถทำซ้ำหรือพัฒนาต่อได้
ZGCM-1 ใช้ระบบอัตโนมัติหรือ AI-native workflow ในการพัฒนาอย่างไร
ทีมงานใช้เอเจนต์อัตโนมัติ (agent swarms) ในการจัดการกระบวนการวิจัยและการฝึกฝน ซึ่งช่วยเพิ่มอัตราการผลิตในการฝึกฝนขึ้นสูงถึงประมาณ 3.94 เท่า