ByteDance(ByteDance) นำโมเดล AI แบบสื่อสารสองทางเต็มรูปแบบ (full-duplex) ที่ชื่อ SeedRealtime ซึ่งประมวลผลเสียง วิดีโอ และข้อความไปพร้อมกัน มาใช้งานในแอปพลิเคชัน Doubao(Doubao)
Seed(Seed) ทีมวิจัย AI ของ ByteDance เปิดตัว SeedRealtime เมื่อวันที่ 10 โดย TechFlow รายงานว่าโมเดลนี้รวมเสียง วิดีโอ และข้อความเข้าด้วยกันในโครงสร้างแบบ end-to-end พร้อมประมวลผลการรับรู้ ความเข้าใจ การตัดสินใจ และการแสดงออกไปพร้อมกันแบบขนาน
SeedRealtime รองรับการโต้ตอบแบบสื่อสารสองทางเต็มรูปแบบ ที่สามารถตัดสินใจทิศทางบทสนทนาได้ในระหว่างรับข้อมูลเข้า โดยไม่ต้องรอให้ผู้ใช้พูดจบก่อน ฟังก์ชันสลับลำดับการพูดถูกฝังไว้ภายในตัวโมเดลเอง ทดแทนตัวตรวจจับกิจกรรมเสียงพูด (VAD) จากภายนอก จากผลประเมินภายในของ ByteDance พบว่าปัญหาจังหวะการสนทนาลดลงครึ่งหนึ่งเมื่อเทียบกับโครงสร้างแบบต่อเนื่อง (cascade) เดิม
โมเดลนี้เป็นการต่อยอดจากโมเดลเสียงแบบสื่อสารสองทางเต็มรูปแบบที่ชื่อ Seeduplex(Seeduplex) ซึ่งเปิดตัวไปเมื่อเดือนเมษายนที่ผ่านมา โดยขยายขีดความสามารถไปสู่วิดีโอ ทาง ByteDance ระบุว่า Seeduplex ช่วยลดอัตราการตอบสนองผิดพลาดและอัตราการตัดบทสนทนาผิดพลาดลงครึ่งหนึ่งในสภาพแวดล้อมที่มีเสียงรบกวนซับซ้อน อัตราที่ AI พูดแทรกขณะผู้ใช้กำลังลังเลลดลง 40% ส่วนดัชนีความลื่นไหลของบทสนทนาดีขึ้น 12%
ก่อนหน้านี้สำนักข่าวเราเคยรายงานว่า Doubao นำฟีเจอร์มัลติโมดัลแบบเรียลไทม์ที่ประมวลผลเสียงและหน้าจอไปพร้อมกัน พร้อมแจ้งเตือนข้อผิดพลาดในการทำงานล่วงหน้ามาใช้ ส่วน SeedRealtime คือโมเดลที่ขยายขีดความสามารถของ AI สนทนาซึ่งเดิมจำกัดอยู่แค่การสร้างข้อความ ให้ครอบคลุมไปถึงการโทรด้วยเสียงแบบเรียลไทม์ การทำความเข้าใจหน้าจอ และการรับรู้วิดีโอ
อย่างไรก็ตาม ยังไม่มีการยืนยันความเชื่อมโยงโดยตรงระหว่างการเปิดตัวครั้งนี้กับตลาดคริปโตหรือบล็อกเชน เนื้อหาที่ ByteDance เปิดเผยไม่มีแผนการออกโทเคนหรือเชื่อมต่อกับเครือข่ายบล็อกเชนแต่อย่างใด ทั้งรายงานทางเทคนิค ขนาดพารามิเตอร์ ค่าน้ำหนักแบบโอเพนซอร์ส และ API สำหรับนักพัฒนาภายนอก ก็ยังไม่ได้เปิดเผยเช่นกัน
ความคิดเห็น 0