Granite Embedding Multilingual R2 โมเดลหลายภาษา รองรับ 32k โทเค็น
Granite Embedding Multilingual R2 โมเดลฝังข้อความหลายภาษา รองรับกว่า 200 ภาษาและความยาวบริบท 32,768 โทเค็น ให้การค้นหาข้ามภาษาที่แม่นยำสำหรับองค์กร
สรุปสั้น: โมเดล Granite Embedding Multilingual R2 จาก IBM เปิดตัวสองรุ่น โดยรุ่นเล็กขนาด 97 ล้านพารามิเตอร์ ทำคะแนน MTEB ได้สูงสุดในกลุ่มโมเดลขนาดต่ำกว่า 100 ล้านพารามิเตอร์ที่ 60.3 และรองรับบริบทยาวถึง 32,768 โทเค็น เท่ากับอ่านหนังสือเล่มหนึ่งจบในครั้งเดียว พร้อมไลเซนส์ Apache 2.0 ที่อนุญาตใช้งานฟรีทั้งเชิงวิจัยและเชิงพาณิชย์ ทำให้เหมาะกับการพัฒนาแอปพลิเคชันค้นหาข้อมูลข้ามภาษาในองค์กรและผู้พัฒนาไทยที่ต้องการควบคุมระบบเอง
ข้อเท็จจริงสำคัญ
- โมเดล Granite Embedding Multilingual R2 มีสองรุ่น: รุ่นใหญ่ 311 ล้านพารามิเตอร์ และรุ่นเล็ก 97 ล้านพารามิเตอร์
- รุ่นเล็กขนาด 97 ล้านพารามิเตอร์ ทำคะแนน MTEB Multilingual Retrieval ได้ 60.3 ซึ่งสูงที่สุดในกลุ่มโมเดลเปิดตัวที่มีขนาดต่ำกว่า 100 ล้านพารามิเตอร์
- รองรับบริบทยาวสูงสุด 32,768 โทเค็น เท่ากับเพิ่มความยาวจาก R1 ถึง 64 เท่า
- ครอบคลุมภาษาเกิน 200 ภาษา โดยปรับปรุงคุณภาพการค้นหาใน 52 ภาษา และรองรับการค้นหาโค้ดใน 9 ภาษาโปรแกรม
- ใช้สถาปัตยกรรม ModernBERT และฝึกด้วยขั้นตอนห้าขั้นตอน ได้แก่ การฝึกเบื้องต้นเพื่อการค้นหา การปรับแต่งแบบคอนทราสต์ การถ่ายทอดความรู้ และการรวมโมเดล
- ใช้ข้อมูลฝึกจากแหล่งสาธารณะที่ได้รับอนุญาตและข้อมูลที่ IBM สร้างเอง ทั้งหมดผ่านการตรวจสอบด้านความเป็นส่วนตัวและคำหยาบ
- เผยแพร่ภายใต้ไลเซนส์ Apache 2.0 อนุญาตให้ใช้งานได้ฟรีทั้งในเชิงวิจัยและเชิงพาณิชย์
IBM เปิดตัวโมเดล Granite Embedding Multilingual R2 สองรุ่น พร้อมวางมาตรฐานใหม่ให้กับการค้นหาข้อมูลข้ามภาษาในระดับองค์กรและผู้พัฒนาทั่วโลก โดยเฉพาะผู้ที่ต้องการใช้งานแบบโอเพนซอร์ส และควบคุมระบบได้เอง โมเดลทั้งสองรุ่นรองรับภาษาเกิน 200 ภาษา รวมถึงภาษาไทยและภาษาในภูมิภาคอาเซียนที่เคยถูกละเลยในโมเดลก่อนหน้า
รุ่นเล็กขนาด 97 ล้านพารามิเตอร์ ทำคะแนน MTEB Multilingual Retrieval ได้ 60.3 ซึ่งสูงที่สุดในกลุ่มโมเดลเปิดตัวที่มีขนาดต่ำกว่า 100 ล้านพารามิเตอร์ [4] ถือเป็นข้อได้เปรียบสำคัญสำหรับผู้พัฒนาไทยที่ต้องการลดต้นทุนการใช้งาน AI โดยไม่เสียคุณภาพการค้นหา ขณะที่รุ่นใหญ่ขนาด 311 ล้านพารามิเตอร์ ทำคะแนนได้ 65.2 และอยู่อันดับสองในกลุ่มโมเดลเปิดตัวที่มีขนาดต่ำกว่า 500 ล้านพารามิเตอร์
สิ่งที่โดดเด่นที่สุดคือความยาวบริบท (context length) ที่เพิ่มขึ้นเป็น 32,768 โทเค็น เท่ากับเพิ่มขึ้น 64 เท่าจากเวอร์ชัน R1 ที่รองรับแค่ 512 โทเค็น [2][4] แปลว่าสามารถอ่านเอกสารยาว เช่น รายงาน หนังสือ หรือบทสนทนาหลายรอบ (multi-turn conversation) ได้ครบในครั้งเดียว โดยไม่ต้องแบ่งส่วน คล้ายกับการอ่านนิยายเล่มหนึ่งจบในรอบเดียว
โมเดลทั้งสองใช้สถาปัตยกรรม ModernBERT และผ่านขั้นตอนฝึกห้าขั้นตอน ได้แก่ การฝึกเบื้องต้นเพื่อการค้นหา การปรับแต่งแบบคอนทราสต์ การถ่ายทอดความรู้ (knowledge distillation) และการรวมโมเดล (model merging) [1][3] ข้อมูลที่ใช้ฝึกประกอบด้วยแหล่งสาธารณะที่ได้รับอนุญาต เช่น Wikipedia และข้อมูลโค้ดที่ IBM สร้างเอง ทั้งหมดผ่านการตรวจสอบด้านความเป็นส่วนตัวและคำหยาบ [6]
สำหรับผู้พัฒนาไทย การที่โมเดลนี้เผยแพร่ภายใต้ไลเซนส์ Apache 2.0 ถือเป็นข้อได้เปรียบมหาศาล เพราะอนุญาตให้ใช้งานฟรีทั้งในเชิงวิจัยและเชิงพาณิชย์ โดยไม่ต้องกังวลเรื่องสิทธิ์หรือค่าลิขสิทธิ์ [1][4][7] ทำให้สามารถนำโมเดลไปใช้ในระบบค้นหาข้อมูลภายในบริษัท หรือพัฒนาแอปพลิเคชันค้นหาข้อมูลข้ามภาษาได้อย่างเสรี
โมเดลสามารถเข้าถึงได้ผ่าน Hugging Face และใช้งานร่วมกับไลบรารี sentence-transformers หรือ Transformers ได้ทันที [2] พร้อมรองรับการปรับใช้ในระบบทั่วไป เช่น Docker บนคลาวด์หรือเซิร์ฟเวอร์ภายในองค์กร [5]
แม้จะไม่มีการเปิดเผยรายละเอียดเฉพาะเจาะจงเกี่ยวกับประสิทธิภาพในภาษาไทยโดยตรง แต่การที่โมเดลรองรับภาษาเกิน 200 ภาษา และปรับปรุงคุณภาพการค้นหาใน 52 ภาษา รวมถึงรองรับการค้นหาโค้ดใน 9 ภาษาโปรแกรม แสดงว่ามีศักยภาพสูงในการรองรับภาษาที่ใช้ในงานจริงในภูมิภาค [4] ผู้พัฒนาไทยจึงควรติดตามผลการทดสอบในบริบทภาษาไทยเพื่อประเมินความเหมาะสมก่อนนำไปใช้งานจริง
Sources
- Granite Embedding Multilingual R2: Open Apache 2.0 Multilingual Embeddings with 32K Context — Best Sub-100M Retrieval Quality (huggingface.co) — 2026-05-14
- ibm-granite/granite-embedding-311m-multilingual-r2 · Hugging Face (huggingface.co) — 2022-05-26
- GitHub - ibm-granite/granite-embedding-models (github.com) — 2024-12-10
- Granite Embedding Multilingual R2 Models (arxiv.org)
- Granite Embedding R2: Setting New Standards for Enterprise Retrieval (www.linkedin.com) — 2025-10-14
- Granite Embedding | IBM Granite (www.ibm.com) — 2026-01-01
- ai/granite-embedding-multilingual repository overview (hub.docker.com) — 2025-08-08