โมเดลจำลองผ่าตัดเรียลไทม์ 160 fps ของ NVIDIA เปิดตัว Cosmos-H-Dreams
NVIDIA เปิดตัวโมเดลจำลองผ่าตัดเรียลไทม์ Cosmos-H-Dreams ที่ทำงานได้ 160 fps บน GPU เดียว ช่วยเร่งการฝึกหุ่นยนต์ผ่าตัดอัตโนมัติและทดสอบระบบควบคุมแบบปิดวงจรอย่างมีประสิทธิภาพ
สรุปสั้น: โมเดล Cosmos-H-Dreams จาก NVIDIA จำลองการผ่าตัดแบบเรียลไทม์ได้ถึง 160 เฟรมต่อวินาที บนการ์ดจอเดียว โดยใช้เทคโนโลยี FlashDreams และ self-forcing distillation ทำให้เร็วกว่าระบบจำลองทั่วไป 10 เท่า ช่วยฝึกหุ่นยนต์ผ่าตัดอัตโนมัติได้เร็วขึ้นอย่างมาก โมเดลนี้ออกแบบเฉพาะสำหรับเครื่องมือ da Vinci Research Kit และสามารถใช้งานร่วมกับระบบควบคุม Versius ของ CMR Surgical
ข้อเท็จจริงสำคัญ
- Cosmos-H-Dreams ทำงานได้ถึง 160 เฟรมต่อวินาที (fps) เมื่อใช้การ์ด NVIDIA RTX PRO 6000 ซึ่งเร็วกว่าระบบจำลองแบบเดิมที่อยู่ที่ประมาณ 10 fps
- โมเดลนี้ใช้เทคนิค self-forcing distillation ที่เรียนรู้จากตัวเองโดยอิงจากเฟรมก่อนหน้า และใช้เพียงสองขั้นตอนการลดเสียงรบกวน (denoising) ต่อเฟรม
- Cosmos-H-Dreams พัฒนามาจากโมเดลพื้นฐาน Cosmos-Predict2.5-2B และเริ่มต้นจาก checkpoint ของ Open-H ที่มีมิติการควบคุม 44 มิติ
- โมเดลถูกออกแบบมาเฉพาะสำหรับงานผ่าตัดเย็บท่อ (tabletop suturing) บนระบบ da Vinci Research Kit (dVRK) และได้ทดลองใช้งานร่วมกับตัวควบคุม Versius ของ CMR Surgical
- เทคโนโลยี FlashDreams ที่ใช้ในโมเดลช่วยให้การประมวลผลมีความหน่วงต่ำ โดยใช้ streaming key-value caches และ CUDA-Graph capture
- โมเดลนี้สามารถใช้ฝึกทักษะผ่าตัดแบบเรียลไทม์ ประเมินนโยบายของหุ่นยนต์แบบปิดวงจร (closed-loop) และสร้างข้อมูลจำลองขนาดใหญ่เพื่อฝึกโมเดล
- Cosmos-H-Dreams เปิดให้ใช้งานได้ทั้งเชิงพาณิชย์และไม่เชิงพาณิชย์ ภายใต้สัญญาอนุญาต NVIDIA Open Model License
NVIDIA เปิดตัว Cosmos-H-Dreams โมเดลจำลองการผ่าตัดแบบเรียลไทม์ที่สามารถทำงานได้ถึง 160 เฟรมต่อวินาที โดยใช้การ์ดจอเดียวเท่านั้น ซึ่งเร็วกว่าระบบจำลองทั่วไปประมาณ 10 เท่า [4] โมเดลนี้ไม่ใช่แค่สร้างภาพวิดีโอเหมือนเดิม แต่สามารถตอบสนองต่อคำสั่งการเคลื่อนไหวของหุ่นยนต์ได้แบบเรียลไทม์ ทำให้ผู้ใช้หรือระบบควบคุมอัตโนมัติสามารถเห็นผลลัพธ์ของการกระทำทันที
สิ่งที่ทำให้ Cosmos-H-Dreams แตกต่างจากโมเดลก่อนหน้าอย่าง Cosmos-H-Surgical-Simulator ที่ทำงานแบบออฟไลน์ คือมันเป็นระบบเชิงเหตุผล (causal) ที่สามารถสร้างวิดีโอในอนาคตได้ทีละช่วงสั้น ๆ โดยอิงจากเฟรมก่อนหน้า และรับคำสั่งการเคลื่อนไหว (action-conditioned) อย่างต่อเนื่อง [1] โมเดลนี้ถูกสร้างขึ้นจากการเรียนรู้ของเครื่องแบบ distilled student จาก teacher ที่เป็น bidirectional ซึ่งช่วยให้สามารถเรียนรู้จากตัวเองได้อย่างมีประสิทธิภาพ โดยใช้เพียงสองขั้นตอนการลดเสียงรบกวนต่อเฟรม [4]
เทคโนโลยี FlashDreams ที่อยู่เบื้องหลังช่วยให้โมเดลทำงานได้รวดเร็วและมี latency ต่ำ โดยใช้ streaming key-value caches และ CUDA-Graph capture เพื่อเพิ่มประสิทธิภาพการประมวลผล [4] ทำให้แม้จะอยู่บน GPU เดียวกัน ก็สามารถรันได้เรียลไทม์ ไม่ต้องพึ่งระบบจำลองขนาดใหญ่หรือคลัสเตอร์
โมเดลนี้ถูกออกแบบมาเฉพาะสำหรับงานผ่าตัดเย็บท่อ (tabletop suturing) บนระบบ da Vinci Research Kit (dVRK) และได้ทดลองใช้งานร่วมกับตัวควบคุม Versius ของ CMR Surgical แล้ว [1][4] ซึ่งหมายความว่า นักพัฒนาสามารถนำโมเดลไปใช้ฝึกทักษะผ่าตัดแบบเรียลไทม์ ประเมินนโยบายการควบคุมหุ่นยนต์แบบปิดวงจร (closed-loop) หรือสร้างข้อมูลจำลองขนาดใหญ่เพื่อฝึกโมเดลอื่นได้ [5]
NVIDIA เปิดตัวโมเดลนี้ภายใต้สัญญาอนุญาต NVIDIA Open Model License ซึ่งอนุญาตให้ใช้งานทั้งในเชิงพาณิชย์และไม่เชิงพาณิชย์ได้ทั่วโลก [1] นี่ถือเป็นก้าวสำคัญในการลดต้นทุนการพัฒนาหุ่นยนต์ผ่าตัด โดยไม่ต้องพึ่งเครื่องมือจริงหรือระบบจำลองที่มีราคาแพง
ในอนาคต โมเดลนี้อาจขยายไปยังงานผ่าตัดอื่น ๆ ได้ หากสามารถปรับให้รองรับหุ่นยนต์และเทคนิคการผ่าตัดที่หลากหลายขึ้น คำถามใหญ่ที่ยังไม่มีคำตอบคือ โมเดลที่เรียนรู้จากข้อมูลจำลอง จะสามารถถ่ายโอนความรู้ไปใช้งานจริงได้ดีเพียงใด โดยเฉพาะในสถานการณ์ที่ไม่เคยเห็นมาก่อน
Sources
- HyperAI (hyper.ai) — 2026-07-27
- nvidia/Cosmos-H-Dreams · Hugging Face (huggingface.co) — 2024-07-17
- Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling (arxiv.org) — 2026-01-31