TwelveLabs เปิดตัว Pegasus 1.6 โมเดล 생성형ที่วิเคราะห์วิดีโอจากมุมมองของผู้ปฏิบัติงาน โดยออกแบบมาเพื่อจัดโครงสร้างข้อมูลการเคลื่อนไหวและฉากเป็นข้อความ สำหรับจำแนกและตรวจสอบวิดีโอด้านหุ่นยนต์และ Physical AI
TwelveLabs แนะนำ Pegasus 1.6 ว่าเป็นโมเดลที่รองรับการทำความเข้าใจวิดีโอแบบเอโกเซนทริกในประกาศเมื่อวันที่ 6 วิดีโอประเภทนี้ถ่ายจากมุมมองบุคคลที่หนึ่งของผู้ปฏิบัติงานหรือผู้ควบคุม บริษัทระบุกรณีใช้งาน เช่น วิดีโอการทำอาหาร การประกอบชิ้นงานในโรงงาน และการควบคุมหุ่นยนต์จากระยะไกล
โมเดลแยกแยะขั้นตอนการทำงานและปฏิสัมพันธ์ระหว่างมือกับวัตถุ พร้อมข้อมูลเวลา ทั้งยังสร้างข้อความอธิบายความสัมพันธ์เชิงพื้นที่และบริบทของฉากได้ นอกจากนี้ยังประเมินความคมชัด องค์ประกอบภาพ และความนิ่งของวิดีโอ เพื่อคัดเลือกคลิปที่ควรตรวจสอบ และรองรับการค้นหาด้วยภาษาธรรมชาติ ประกาศยังระบุฟังก์ชันตรวจจับและทำเครื่องหมายข้อมูลอ่อนไหวที่ปรากฏบนใบหน้า บุคคลรอบข้าง หน้าจอ หรือเอกสาร
เอกสารสำหรับนักพัฒนาอย่างเป็นทางการของ TwelveLabs ระบุฟีเจอร์ใหม่ ได้แก่ การทำความเข้าใจวิดีโอแบบเอโกเซนทริก การวิเคราะห์ภาพ การรู้จำวัตถุและการดึงข้อมูลเมทาดาทาที่ปรับปรุงแล้ว ตลอดจนการดึงเหตุการณ์พร้อมระบุเวลาในช่วงวิดีโอ เอกสารยังอธิบายการใช้งานเพื่อตรวจสอบคุณภาพวิดีโอจากหุ่นยนต์ และคาดการณ์การกระทำถัดไปจากวิดีโอควบคุมระยะไกล ทั้งหมดนี้เป็นฟีเจอร์และตัวอย่างการใช้งานที่บริษัทนำเสนอ
การเปิดตัวครั้งนี้เป็นความพยายามนำโมเดลทำความเข้าใจวิดีโอมาใช้กับการประมวลผลข้อมูลสำหรับหุ่นยนต์และ Physical AI ก่อนหน้านี้ TokenPost เคยรายงานแนวโน้มการลงทุนในด้านหุ่นยนต์และ Physical AI อย่างไรก็ตาม ประกาศและเอกสารอย่างเป็นทางการยังไม่มีผลประเมินอิสระที่ยืนยันประสิทธิภาพของ Pegasus 1.6 ในการฝึกหุ่นยนต์หรือการปรับปรุงความปลอดภัยในการใช้งานจริง รวมถึงยังไม่พบกรณีการใช้งานจากลูกค้า
ความคิดเห็น 0