ข้ามไปยังเนื้อหา
KoishiAI
EN
← กลับไปยังบทความทั้งหมด

Gemini 3.8 Live vs Extended Thinking: เปรียบเทียบประสิทธิภาพและ API

เจาะลึกการเปรียบเทียบ Gemini 3.8 Live กับ Extended Thinking: คะแนนประสิทธิภาพ การรองรับภาษา และ API สำหรับ Voice Agents ระดับองค์กรที่ประมวลผลเสียงเป็นเสียงแบบเรียลไทม์

KoishiAI · บรรณาธิการ: เกียรติดำรง ตรีครุธพันธ์ · · 43 นาทีในการอ่าน
บทความนี้ AI เขียนจากแหล่งอ้างอิง ผ่านการตรวจสอบข้อเท็จจริงและกลั่นกรองโดยบรรณาธิการ วิธีทำงาน · มาตรฐาน · แจ้งข้อผิดพลาด
A digitally rendered abstract image showcasing a futuristic eye with complex network patterns.
Photo by Merlin Lightpainting on Pexels

สรุปสั้น: Google DeepMind เปิดตัว Gemini 3.8 Live และ Extended Thinking เพื่อแทนที่ระบบประมวลผลเสียงแบบเดิมด้วยสถาปัตยกรรม native ที่รองรับ 97 ภาษาและทำงานเรียลไทม์ โดยโมเดล Extended Thinking ครองอันดับหนึ่งบนดัชนี Speech to Speech Quality Index ด้วยคะแนน 82.6 ซึ่งช่วยยกระดับประสิทธิภาพของ Voice Agents ระดับองค์กรให้มีความเป็นธรรมชาติและแม่นยำยิ่งขึ้น

ข้อเท็จจริงสำคัญ

  • Google DeepMind ประกาศโมเดลเสียง Gemini 3.8 Live และ Extended Thinking เมื่อวันที่ 15 กันยายน 2026 เพื่อแทนที่ระบบประมวลผลแบบเดิม
  • Gemini 3.8 Live รองรับการตรวจจับภาษาอัตโนมัติถึง 97 ภาษา พร้อมฟีเจอร์ Visual Grounding สำหรับวิเคราะห์ภาพ/วิดีโอแบบเรียลไทม์
  • โมเดลนี้รองรับ Asynchronous Function Calling ช่วยให้ AI ทำงานพื้นหลังเช่นค้นหาข้อมูลได้โดยไม่ขัดจังหวะการสตรีมเสียงตอบกลับผู้ใช้
  • Gemini 3.8 Live Extended Thinking ครองอันดับหนึ่งบน Speech to Speech Quality Index ของ Artificial Analysis ด้วยคะแนน 82.6
  • ประสิทธิภาพในงานเชิงเอเจนต์ (Agentic tasks) ทำคะแนนได้ 68.6% บนเทสต์ τ-Voice และ 35.1% บนเทสต์ Sierra’s τ-Voice-banking

การแทนที่ระบบสายการผลิตแบบต่อเนื่องด้วยโมเดลเสียงแบบเนทีฟ

Google DeepMind ได้เผยแพร่โมเดล AI ที่เน้นด้านเสียงสองตัวใหม่ ได้แก่ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ซึ่งออกแบบมาเพื่อแทนที่ระบบประมวลผลเสียงแบบดั้งเดิมสำหรับแอปพลิเคชันระดับองค์กร [1][2] ซึ่งประกาศเมื่อวันที่ 15 กันยายน 2026 โมเดลเสียงแบบเนทีฟที่แปลงเสียงเป็นเสียงนี้มุ่งหมายที่จะขจัดความล่าช้าและความแตกแยกของสายการผลิตแบบ “ต่อเนื่อง” (cascaded) แบบเก่า โดยการผสานการให้เหตุผล การใช้เครื่องมือ และการสร้างเสียงเข้าไว้ในกระบวนการไหลเดียวอย่างต่อเนื่อง [4]

การเปิดตัวนี้ถือเป็นจุดเปลี่ยนสำคัญในวิธีการสร้างเอเจนต์เสียงของ AI แทนที่จะพึ่งพาส่วนประกอบแยกต่างหากสำหรับการรู้จำเสียง การประมวลผลภาษา และการสังเคราะห์เสียงจากข้อความ (text-to-speech) โมเดลเหล่านี้จะประมวลผลข้อมูลนำเข้าและส่งออกโดยตรงในรูปแบบสตรีมเสียง [1][2] สถาปัตยกรรมนี้ช่วยให้ AI รักษาสัมผัสของการสนทนาที่เป็นธรรมชาติไปพร้อมๆ กับการดำเนินการงานพื้นหลังหรือวิเคราะห์ข้อมูลภาพโดยไม่ทำลายประสบการณ์ของผู้ใช้ [4]

ความสามารถและประสิทธิภาพของโมเดล

โมเดลใหม่ทั้งสองตัวรองรับระดับความซับซ้อนที่แตกต่างกันภายในตระกูล Gemini Audio ซึ่งก่อนหน้านี้ได้ขยายเพิ่มเติมด้วยโมเดล Gemini 3.5 Transcribe เมื่อเดือนที่แล้ว [4]

Gemini 3.8 Live: ขอบเขตและความมีประสิทธิภาพ

Gemini 3.8 Live ได้รับการปรับให้เหมาะสมสำหรับแอปพลิเคชันที่มีปริมาณสูงและประหยัดต้นทุน โดยให้ความสำคัญกับความเร็วและความลื่นไหลเหนือการวิเคราะห์เชิงลึก [1][2] โมเดลนี้มีคุณสมบัติการเชื่อมโยงกับภาพ (visual grounding) ซึ่งช่วยให้สามารถประมวลผลรูปภาพหรือวิดีโอแบบเกือบเรียลไทม์ เพื่อเพิ่มรายละเอียดเชิงบริบทให้กับบทสนทนา [1][2][4]

โมเดลนี้รองรับการตรวจจับภาษาอัตโนมัติสำหรับ 97 ภาษา ทำให้เหมาะสำหรับการบริการลูกค้าระดับโลกและแอปพลิเคชันหลายภาษา [3] คุณสมบัติทางเทคนิคที่สำคัญคือความสามารถในการเรียกใช้ฟังก์ชันแบบอะซิงโครนัส (asynchronous function calling) ซึ่งช่วยให้ AI สามารถทำงานพื้นหลัง เช่น การค้นหาข้อมูลในฐานข้อมูลหรือการจัดตารางนัดหมาย ไปพร้อมกับการสตรีมเสียงตอบกลับไปยังผู้ใช้โดยไม่มีการขัดจังหวะ [3][4]

ในการประเมินความพึงพอใจของมนุษย์บน Speech Agent Arena Gemini 3.8 Live เข้าอันดับที่สองเมื่อเทียบกับตัวแทนเสียงอื่นๆ [1][2][4] สิ่งนี้บ่งชี้ถึงประสิทธิภาพที่แข็งแกร่งในด้านความธรรมชาติและการตอบสนอง แม้ว่าจะแลกกับรายละเอียดเชิงวิเคราะห์บ้างเพื่อแลกกับความรวดเร็วก็ตาม

Gemini 3.8 Live Extended Thinking: การให้เหตุผลที่ซับซ้อน

สำหรับงานที่ต้องการการวางแผนหลายขั้นตอนและสติปัญญาที่สูงขึ้น Google ได้แนะนำ Gemini 3.8 Live Extended Thinking [1][2][4] โมเดลนี้ถูกออกแบบมาเพื่อจัดการกับเวิร์กโฟลว์ที่ซับซ้อนซึ่งความถูกต้องและความสอดคล้องเชิงตรรกะเป็นสิ่งสำคัญ [1][2]

โมเดลนี้ครองอันดับหนึ่งบนดัชนี Speech to Speech Quality Index ของ Artificial Analysis ด้วยคะแนน 82.6 [1][2][4] ประสิทธิภาพของโมเดลในงานเชิงเอเจนต์ (agentic tasks)—ซึ่งตัวแทน AI ต้องบรรลุเป้าหมายหลายขั้นตอน—ถือว่าสูงมาก โดยทำได้ 68.6% บนเทสต์ τ-Voice และ 35.1% บนเทสต์ Sierra’s τ-Voice-banking [1][2][4] นอกจากนี้ ยังทำคะแนนได้ 97.7% บน Big Bench Audio ซึ่งเป็นมาตรฐานการทดสอบความสามารถในการเข้าใจเสียง [1][2][4]

Google รายงานว่าบน EVA-Bench ของ ServiceNow ซึ่งวัดประสิทธิภาพในเวิร์กโฟลว์องค์กรที่ซับซ้อน โมเดลเหล่านี้ได้ผลักดัน “ขอบเขตพาเรโต” (Pareto Frontier) โดยการสร้างสมดุลระหว่างความแม่นยำของงานกับคุณภาพการสนทนาที่เป็นธรรมชาติ [1][2][4] สิ่งนี้ชี้ให้เห็นว่าโมเดลเหล่านี้มีประสิทธิภาพเป็นพิเศษสำหรับบทบาทการสนับสนุนลูกค้าหรือการช่วยเหลือทางเทคนิคที่ซับซ้อน ซึ่งทั้งความถูกต้องและประสบการณ์ของผู้ใช้ต่างก็สำคัญ

การใช้งานและการบูรณาการในระบบนิเวศ

โมเดล Gemini 3.8 Live ทั้งสองรุ่นใช้งานได้ผ่าน Gemini Live API และ Google AI Studio [4] อย่างไรก็ตาม Google ได้ชี้แจงว่านี่เป็นบริการที่โฮสต์เท่านั้น; ไม่มีเวอร์ชันที่ติดตั้งเอง (self-hosted) หรือแบบโอเพนเวต (open-weight) ของโมเดลเฉพาะเหล่านี้ให้แก่นักพัฒนาเพื่อรันบนฮาร์ดแวร์ของตนเอง [4]

โมเดลการโฮสต์นี้สอดคล้องกับกลยุทธ์โดยรวมของ Google สำหรับการบูรณาการระดับองค์กร โมเดลเหล่านี้ถูกออกแบบมาให้ทำงานได้อย่างราบรื่นภายในแอป Gemini, Google Workspace และ Search โดยมอบโครงสร้างพื้นฐานแบบรวมศูนย์สำหรับเครื่องมือเพิ่มผลผลิตที่รองรับเสียง [1][2]

บริบทภายในตระกูล Gemini 3.8

โมเดล Live เข้ามาเป็นส่วนหนึ่งของครอบครัวโมเดล Gemini 3.8 ที่กำลังขยายตัว ซึ่งเปิดตัวในเดือนกันยายน 2026 ก่อนหน้านี้ในช่วงต้นเดือน Google ได้ปล่อย Gemini 3.8 Flash และ Gemini 3.8 Flash Cyber [5][6] การเปิดตัวก่อนหน้านี้เหล่านี้มุ่งเน้นไปที่งานวิศวกรรมซอฟต์แวร์และความปลอดภัยทางไซเบอร์ตามลำดับ โดยกำหนดเป้าหมายไปยังนักพัฒนา rather than การโต้ตอบด้วยเสียง [7]

ในขณะที่โมเดล Flash ให้ความสำคัญกับการสร้างโค้ดและการวิเคราะห์ความปลอดภัย โมเดล Live ตอบสนองต่อความต้องการที่เพิ่มขึ้นสำหรับเอเจนต์เสียงแบบเรียลไทม์ในการบริการลูกค้า ระบบโทรศัพท์ และผู้ช่วยแบบโต้ตอบ [4] การสร้างความหลากหลายนี้ช่วยให้องค์กรสามารถเลือกโมเดลตามความต้องการเฉพาะของตนได้: ความเร็วและต้นทุนสำหรับการโต้ตอบทั่วไป (Live), การให้เหตุผลเชิงลึกสำหรับการแก้ปัญหาที่ซับซ้อน (Extended Thinking) หรือโค้ด/การวิเคราะห์สำหรับเวิร์กโฟลว์ทางเทคนิค (Flash)

การนำความสามารถด้านการพูดสู่เสียงแบบเนทีฟเข้ามาแทนที่สถาปัตยกรรม AI แบบโมดูลาร์ที่เคยครองตลาดในช่วงหลายปีที่ผ่านมา โดยรวมกระบวนการรับฟัง การให้เหตุผล และการสร้างผลลัพธ์เข้าไว้ในโมเดลเดียว Google DeepMind ตั้งเป้าลดเวลาแฝง (latency) และเพิ่มความเป็นธรรมชาติให้กับปฏิสัมพันธ์ด้วยเสียงของ AI [4] เมื่อองค์กรต่างๆ ยังคงนำเอเจนต์เสียงไปใช้สำหรับการสนับสนุนลูกค้าและการดำเนินงานภายใน เกณฑ์การวัดเหล่านี้ช่วยให้เห็นภาพที่ชัดเจนยิ่งขึ้นเกี่ยวกับสถานะปัจจุบันของเทคโนโลยี ทั้งในด้านความสามารถและความน่าเชื่อถือ

แหล่งข้อมูล

  1. Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (deepmind.google) — 2026-09-15
  2. Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog.google) — 2026-09-15
  3. Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agents (www.marktechpost.com) — 2026-09-15
  4. Google DeepMind (@GoogleDeepMind) on X (x.com) — 2026-09-15
  5. Introducing Gemini 3.8 Flash and 3.8 Flash Cyber (blog.google) — 2026-09-02
  6. Gemini 3.8 Flash Cyber (radar.mahdi.uk) — 2026-09-02
  7. Google DeepMind Launches Gemini 3.8 Flash Cyber? How AI Defense Works (www.opoinstall.com) — 2026-09-03

คำถามที่พบบ่อย

ความแตกต่างหลักระหว่าง Gemini 3.8 Live และ Extended Thinking คืออะไร?
Gemini 3.8 Live ออกแบบมาเพื่อแอปพลิเคชันที่ต้องการความเร็วและประหยัดต้นทุน โดยเน้นการตอบสนองที่ลื่นไหลมากกว่าการวิเคราะห์เชิงลึก ในขณะที่ Gemini 3.8 Live Extended Thinking เหมาะกับงานที่ต้องใช้การวางแผนหลายขั้นตอนและความถูกต้องสูง
ทำไม Gemini 3.8 ถึงดีกว่าระบบประมวลผลเสียงแบบดั้งเดิม?
โมเดลทั้งสองตัวเป็นเสียงแบบเนทีฟ (Native Voice) ที่ประมวลผลข้อมูลนำเข้าและส่งออกโดยตรงในรูปแบบสตรีมเสียง โดยไม่ต้องพึ่งพาระบบแยกส่วนแบบเดิม ทำให้ลดความล่าช้าและรักษาความเป็นธรรมชาติของการสนทนาได้ดียิ่งขึ้น
Gemini 3.8 รองรับกี่ภาษาในการสนทนา?
Gemini 3.8 Live รองรับการตรวจจับภาษาอัตโนมัติสำหรับ 97 ภาษา ทำให้เหมาะสำหรับการบริการลูกค้าระดับโลกและแอปพลิเคชันที่ต้องรองรับหลายภาษาอย่างมีประสิทธิภาพ
Gemini 3.8 Live สามารถทำงานพื้นหลังขณะสนทนาได้หรือไม่?
โมเดลนี้สามารถเรียกใช้ฟังก์ชันแบบอะซิงโครนัส (Asynchronous Function Calling) ได้ ซึ่งช่วยให้ AI ทำงานพื้นหลัง เช่น การค้นหาข้อมูลหรือจัดตารางนัดหมาย ไปพร้อมกับการสตรีมเสียงตอบกลับผู้ใช้โดยไม่มีการขัดจังหวะ
โมเดลไหนให้คุณภาพเสียงและการให้เหตุผลที่ดีกว่ากัน?
Gemini 3.8 Live Extended Thinking ครองอันดับหนึ่งบนดัชนี Speech to Speech Quality Index ของ Artificial Analysis ด้วยคะแนน 82.6 และมีประสิทธิภาพสูงในงานเชิงเอเจนต์ที่ต้องบรรลุเป้าหมายหลายขั้นตอน