Gemini 3.8 Live vs Extended Thinking: เปรียบเทียบประสิทธิภาพและ API
เจาะลึกการเปรียบเทียบ Gemini 3.8 Live กับ Extended Thinking: คะแนนประสิทธิภาพ การรองรับภาษา และ API สำหรับ Voice Agents ระดับองค์กรที่ประมวลผลเสียงเป็นเสียงแบบเรียลไทม์
สรุปสั้น: Google DeepMind เปิดตัว Gemini 3.8 Live และ Extended Thinking เพื่อแทนที่ระบบประมวลผลเสียงแบบเดิมด้วยสถาปัตยกรรม native ที่รองรับ 97 ภาษาและทำงานเรียลไทม์ โดยโมเดล Extended Thinking ครองอันดับหนึ่งบนดัชนี Speech to Speech Quality Index ด้วยคะแนน 82.6 ซึ่งช่วยยกระดับประสิทธิภาพของ Voice Agents ระดับองค์กรให้มีความเป็นธรรมชาติและแม่นยำยิ่งขึ้น
ข้อเท็จจริงสำคัญ
- Google DeepMind ประกาศโมเดลเสียง Gemini 3.8 Live และ Extended Thinking เมื่อวันที่ 15 กันยายน 2026 เพื่อแทนที่ระบบประมวลผลแบบเดิม
- Gemini 3.8 Live รองรับการตรวจจับภาษาอัตโนมัติถึง 97 ภาษา พร้อมฟีเจอร์ Visual Grounding สำหรับวิเคราะห์ภาพ/วิดีโอแบบเรียลไทม์
- โมเดลนี้รองรับ Asynchronous Function Calling ช่วยให้ AI ทำงานพื้นหลังเช่นค้นหาข้อมูลได้โดยไม่ขัดจังหวะการสตรีมเสียงตอบกลับผู้ใช้
- Gemini 3.8 Live Extended Thinking ครองอันดับหนึ่งบน Speech to Speech Quality Index ของ Artificial Analysis ด้วยคะแนน 82.6
- ประสิทธิภาพในงานเชิงเอเจนต์ (Agentic tasks) ทำคะแนนได้ 68.6% บนเทสต์ τ-Voice และ 35.1% บนเทสต์ Sierra’s τ-Voice-banking
การแทนที่ระบบสายการผลิตแบบต่อเนื่องด้วยโมเดลเสียงแบบเนทีฟ
Google DeepMind ได้เผยแพร่โมเดล AI ที่เน้นด้านเสียงสองตัวใหม่ ได้แก่ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ซึ่งออกแบบมาเพื่อแทนที่ระบบประมวลผลเสียงแบบดั้งเดิมสำหรับแอปพลิเคชันระดับองค์กร [1][2] ซึ่งประกาศเมื่อวันที่ 15 กันยายน 2026 โมเดลเสียงแบบเนทีฟที่แปลงเสียงเป็นเสียงนี้มุ่งหมายที่จะขจัดความล่าช้าและความแตกแยกของสายการผลิตแบบ “ต่อเนื่อง” (cascaded) แบบเก่า โดยการผสานการให้เหตุผล การใช้เครื่องมือ และการสร้างเสียงเข้าไว้ในกระบวนการไหลเดียวอย่างต่อเนื่อง [4]
การเปิดตัวนี้ถือเป็นจุดเปลี่ยนสำคัญในวิธีการสร้างเอเจนต์เสียงของ AI แทนที่จะพึ่งพาส่วนประกอบแยกต่างหากสำหรับการรู้จำเสียง การประมวลผลภาษา และการสังเคราะห์เสียงจากข้อความ (text-to-speech) โมเดลเหล่านี้จะประมวลผลข้อมูลนำเข้าและส่งออกโดยตรงในรูปแบบสตรีมเสียง [1][2] สถาปัตยกรรมนี้ช่วยให้ AI รักษาสัมผัสของการสนทนาที่เป็นธรรมชาติไปพร้อมๆ กับการดำเนินการงานพื้นหลังหรือวิเคราะห์ข้อมูลภาพโดยไม่ทำลายประสบการณ์ของผู้ใช้ [4]
ความสามารถและประสิทธิภาพของโมเดล
โมเดลใหม่ทั้งสองตัวรองรับระดับความซับซ้อนที่แตกต่างกันภายในตระกูล Gemini Audio ซึ่งก่อนหน้านี้ได้ขยายเพิ่มเติมด้วยโมเดล Gemini 3.5 Transcribe เมื่อเดือนที่แล้ว [4]
Gemini 3.8 Live: ขอบเขตและความมีประสิทธิภาพ
Gemini 3.8 Live ได้รับการปรับให้เหมาะสมสำหรับแอปพลิเคชันที่มีปริมาณสูงและประหยัดต้นทุน โดยให้ความสำคัญกับความเร็วและความลื่นไหลเหนือการวิเคราะห์เชิงลึก [1][2] โมเดลนี้มีคุณสมบัติการเชื่อมโยงกับภาพ (visual grounding) ซึ่งช่วยให้สามารถประมวลผลรูปภาพหรือวิดีโอแบบเกือบเรียลไทม์ เพื่อเพิ่มรายละเอียดเชิงบริบทให้กับบทสนทนา [1][2][4]
โมเดลนี้รองรับการตรวจจับภาษาอัตโนมัติสำหรับ 97 ภาษา ทำให้เหมาะสำหรับการบริการลูกค้าระดับโลกและแอปพลิเคชันหลายภาษา [3] คุณสมบัติทางเทคนิคที่สำคัญคือความสามารถในการเรียกใช้ฟังก์ชันแบบอะซิงโครนัส (asynchronous function calling) ซึ่งช่วยให้ AI สามารถทำงานพื้นหลัง เช่น การค้นหาข้อมูลในฐานข้อมูลหรือการจัดตารางนัดหมาย ไปพร้อมกับการสตรีมเสียงตอบกลับไปยังผู้ใช้โดยไม่มีการขัดจังหวะ [3][4]
ในการประเมินความพึงพอใจของมนุษย์บน Speech Agent Arena Gemini 3.8 Live เข้าอันดับที่สองเมื่อเทียบกับตัวแทนเสียงอื่นๆ [1][2][4] สิ่งนี้บ่งชี้ถึงประสิทธิภาพที่แข็งแกร่งในด้านความธรรมชาติและการตอบสนอง แม้ว่าจะแลกกับรายละเอียดเชิงวิเคราะห์บ้างเพื่อแลกกับความรวดเร็วก็ตาม
Gemini 3.8 Live Extended Thinking: การให้เหตุผลที่ซับซ้อน
สำหรับงานที่ต้องการการวางแผนหลายขั้นตอนและสติปัญญาที่สูงขึ้น Google ได้แนะนำ Gemini 3.8 Live Extended Thinking [1][2][4] โมเดลนี้ถูกออกแบบมาเพื่อจัดการกับเวิร์กโฟลว์ที่ซับซ้อนซึ่งความถูกต้องและความสอดคล้องเชิงตรรกะเป็นสิ่งสำคัญ [1][2]
โมเดลนี้ครองอันดับหนึ่งบนดัชนี Speech to Speech Quality Index ของ Artificial Analysis ด้วยคะแนน 82.6 [1][2][4] ประสิทธิภาพของโมเดลในงานเชิงเอเจนต์ (agentic tasks)—ซึ่งตัวแทน AI ต้องบรรลุเป้าหมายหลายขั้นตอน—ถือว่าสูงมาก โดยทำได้ 68.6% บนเทสต์ τ-Voice และ 35.1% บนเทสต์ Sierra’s τ-Voice-banking [1][2][4] นอกจากนี้ ยังทำคะแนนได้ 97.7% บน Big Bench Audio ซึ่งเป็นมาตรฐานการทดสอบความสามารถในการเข้าใจเสียง [1][2][4]
Google รายงานว่าบน EVA-Bench ของ ServiceNow ซึ่งวัดประสิทธิภาพในเวิร์กโฟลว์องค์กรที่ซับซ้อน โมเดลเหล่านี้ได้ผลักดัน “ขอบเขตพาเรโต” (Pareto Frontier) โดยการสร้างสมดุลระหว่างความแม่นยำของงานกับคุณภาพการสนทนาที่เป็นธรรมชาติ [1][2][4] สิ่งนี้ชี้ให้เห็นว่าโมเดลเหล่านี้มีประสิทธิภาพเป็นพิเศษสำหรับบทบาทการสนับสนุนลูกค้าหรือการช่วยเหลือทางเทคนิคที่ซับซ้อน ซึ่งทั้งความถูกต้องและประสบการณ์ของผู้ใช้ต่างก็สำคัญ
การใช้งานและการบูรณาการในระบบนิเวศ
โมเดล Gemini 3.8 Live ทั้งสองรุ่นใช้งานได้ผ่าน Gemini Live API และ Google AI Studio [4] อย่างไรก็ตาม Google ได้ชี้แจงว่านี่เป็นบริการที่โฮสต์เท่านั้น; ไม่มีเวอร์ชันที่ติดตั้งเอง (self-hosted) หรือแบบโอเพนเวต (open-weight) ของโมเดลเฉพาะเหล่านี้ให้แก่นักพัฒนาเพื่อรันบนฮาร์ดแวร์ของตนเอง [4]
โมเดลการโฮสต์นี้สอดคล้องกับกลยุทธ์โดยรวมของ Google สำหรับการบูรณาการระดับองค์กร โมเดลเหล่านี้ถูกออกแบบมาให้ทำงานได้อย่างราบรื่นภายในแอป Gemini, Google Workspace และ Search โดยมอบโครงสร้างพื้นฐานแบบรวมศูนย์สำหรับเครื่องมือเพิ่มผลผลิตที่รองรับเสียง [1][2]
บริบทภายในตระกูล Gemini 3.8
โมเดล Live เข้ามาเป็นส่วนหนึ่งของครอบครัวโมเดล Gemini 3.8 ที่กำลังขยายตัว ซึ่งเปิดตัวในเดือนกันยายน 2026 ก่อนหน้านี้ในช่วงต้นเดือน Google ได้ปล่อย Gemini 3.8 Flash และ Gemini 3.8 Flash Cyber [5][6] การเปิดตัวก่อนหน้านี้เหล่านี้มุ่งเน้นไปที่งานวิศวกรรมซอฟต์แวร์และความปลอดภัยทางไซเบอร์ตามลำดับ โดยกำหนดเป้าหมายไปยังนักพัฒนา rather than การโต้ตอบด้วยเสียง [7]
ในขณะที่โมเดล Flash ให้ความสำคัญกับการสร้างโค้ดและการวิเคราะห์ความปลอดภัย โมเดล Live ตอบสนองต่อความต้องการที่เพิ่มขึ้นสำหรับเอเจนต์เสียงแบบเรียลไทม์ในการบริการลูกค้า ระบบโทรศัพท์ และผู้ช่วยแบบโต้ตอบ [4] การสร้างความหลากหลายนี้ช่วยให้องค์กรสามารถเลือกโมเดลตามความต้องการเฉพาะของตนได้: ความเร็วและต้นทุนสำหรับการโต้ตอบทั่วไป (Live), การให้เหตุผลเชิงลึกสำหรับการแก้ปัญหาที่ซับซ้อน (Extended Thinking) หรือโค้ด/การวิเคราะห์สำหรับเวิร์กโฟลว์ทางเทคนิค (Flash)
การนำความสามารถด้านการพูดสู่เสียงแบบเนทีฟเข้ามาแทนที่สถาปัตยกรรม AI แบบโมดูลาร์ที่เคยครองตลาดในช่วงหลายปีที่ผ่านมา โดยรวมกระบวนการรับฟัง การให้เหตุผล และการสร้างผลลัพธ์เข้าไว้ในโมเดลเดียว Google DeepMind ตั้งเป้าลดเวลาแฝง (latency) และเพิ่มความเป็นธรรมชาติให้กับปฏิสัมพันธ์ด้วยเสียงของ AI [4] เมื่อองค์กรต่างๆ ยังคงนำเอเจนต์เสียงไปใช้สำหรับการสนับสนุนลูกค้าและการดำเนินงานภายใน เกณฑ์การวัดเหล่านี้ช่วยให้เห็นภาพที่ชัดเจนยิ่งขึ้นเกี่ยวกับสถานะปัจจุบันของเทคโนโลยี ทั้งในด้านความสามารถและความน่าเชื่อถือ
แหล่งข้อมูล
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (deepmind.google) — 2026-09-15
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog.google) — 2026-09-15
- Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agents (www.marktechpost.com) — 2026-09-15
- Google DeepMind (@GoogleDeepMind) on X (x.com) — 2026-09-15
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber (blog.google) — 2026-09-02
- Gemini 3.8 Flash Cyber (radar.mahdi.uk) — 2026-09-02
- Google DeepMind Launches Gemini 3.8 Flash Cyber? How AI Defense Works (www.opoinstall.com) — 2026-09-03