Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

เอ็นวิเดียเปิดตัวโมเดลแยกเสียงพูดแบบเรียลไทม์ รองรับสูงสุด 8 คน

เอ็นวิเดีย($NVDA) เปิดตัวเนโมตรอน 3 ไดอาไรเซชัน (Nemotron 3 Diarization) โมเดลแยกเสียงพูดขนาดราว 100 ล้านพารามิเตอร์ที่จำแนกเสียงของผู้พูดได้สูงสุด 8 คนแบบเรียลไทม์ โดยเป็นโมเดลเปิดน้ำหนักที่นำไปใช้จัดทำบันทึกการประชุม วิเคราะห์คอลเซ็นเตอร์ และพัฒนาเอเจนต์ AI แบบใช้เสียงได้

เอ็นวิเดียเปิดตัวโมเดลดังกล่าวผ่านโพสต์บน Hugging Face เมื่อวันที่ 23 โดยเนโมตรอน 3 ไดอาไรเซชันใช้งานได้บน Hugging Face และ NeMo รองรับทั้งการประมวลผลไฟล์บันทึกเสียงและการสตรีมแบบเรียลไทม์ในโมเดลเดียว

การแยกเสียงผู้พูดแตกต่างจากการรู้จำเสียงพูดที่แปลงเสียงเป็นข้อความ เพราะเป็นเทคโนโลยีที่ระบุว่า 'ใครพูดเมื่อใด' โมเดลไม่ได้ตรวจสอบชื่อจริงของผู้พูด แต่กำหนดป้ายกำกับแบบไม่ระบุตัวตนตามลำดับการพูด เช่น speaker_1 และ speaker_2

ดังนั้น หากไม่มีข้อมูลผู้เข้าร่วมการประชุมหรือโมเดลยืนยันตัวตนผู้พูด ก็ไม่สามารถเชื่อมโยงป้ายกำกับกับบุคคลจริงได้ การนำไปใช้กับบันทึกการประชุม บันทึกการให้คำปรึกษา หรือการตัดต่อบทสัมภาษณ์ ซึ่งต้องจัดการทั้งเนื้อหาเสียงและผู้พูด จึงจำเป็นต้องมีระบบระบุตัวตนเพิ่มเติม

โมเดลจะแสดงความน่าจะเป็นของกิจกรรมเสียงพูดในช่วงเวลา 10 มิลลิวินาที นอกจากนี้ยังรองรับเสียงพูดซ้อนกันของหลายคน โดยสามารถปรับเวลาแฝงของบัฟเฟอร์อินพุตเป็น 0.32 วินาที, 0.64 วินาที, 1.04 วินาที หรือ 30.4 วินาทีได้

เวลา 0.32 วินาทีเป็นการตั้งค่าที่มีเวลาแฝนต่ำที่สุดในบรรดาค่าที่เอ็นวิเดียแนะนำ แม้ในทางเทคนิคจะใช้บัฟเฟอร์อินพุต 80 มิลลิวินาทีได้ แต่ความแม่นยำและปริมาณการประมวลผลอาจลดลง

กระบวนการสตรีมใช้ฟังก์ชัน 'Arrival-Order Speaker Cache' ซึ่งกำหนดป้ายกำกับตามลำดับที่ผู้พูดปรากฏตัวครั้งแรก และคงป้ายกำกับเดิมไว้ในช่วงเสียงถัดไป เพื่อลดปัญหาหมายเลขผู้พูดสลับกันเมื่อเปลี่ยนช่วงเสียง

เอ็นวิเดียระบุว่า เนโมตรอน 3 ไดอาไรเซชันครองอันดับหนึ่งจาก 12 ระบบในการประเมินเบื้องต้นของ Diarization-Bench โดย VoiceArena การประเมินครอบคลุมบทสนทนาภาษาอังกฤษ 139 รายการ รวมเสียงประมาณ 22 ชั่วโมง และรวมกรณีเสียงพูดซ้อนกัน โมเดลมีอัตราความผิดพลาดในการแยกเสียงผู้พูด (DER) อยู่ที่ 14.72%

ระบบอันดับสองมีค่า DER อยู่ที่ 19.3% อย่างไรก็ตาม เอ็นวิเดียระบุว่าผลลัพธ์ดังกล่าวเป็นการประเมินเบื้องต้น และอาจเปลี่ยนแปลงได้หลังการประเมินอย่างเป็นทางการและการวิเคราะห์ทางสถิติเสร็จสิ้น

เนโมตรอน 3 ไดอาไรเซชันเพิ่มจำนวนผู้พูดที่รองรับเป็น 8 คน จากเดิม 4 คนใน Streaming Sortformer v2.1 เอ็นวิเดียระบุว่าโมเดลได้รับการฝึกด้วยข้อมูลเสียงแบบเปิดและข้อมูลเสียงที่มีใบอนุญาต รวมถึงข้อมูลเสียงหลายผู้พูดจาก David AI

เอ็นวิเดียอธิบายว่า ภายใต้เงื่อนไขการประเมินบางรูปแบบ หลังเพิ่มข้อมูลดังกล่าว ค่า DER ปรับดีขึ้นจาก 11.19% เป็น 10.42% หรือลดลง 0.77 จุดเปอร์เซ็นต์ อย่างไรก็ตาม ตัวเลขนี้มาจากเงื่อนไขการประเมินอีกชุดหนึ่ง จึงไม่สามารถนำไปเปรียบเทียบโดยตรงกับค่า 14.72% ของ VoiceArena ได้

จุดเด่นอีกประการคือการเป็นโมเดลเปิดน้ำหนัก หน้าโมเดลบน Hugging Face และ Baseten ระบุใบอนุญาตเป็น OpenMDW-1.1 ขณะที่ Baseten ให้สภาพแวดล้อมสำหรับการใช้งานแบบสตรีมมิงและการอนุมานแบบแบตช์

อย่างไรก็ตาม ควรแยกประเมินปริมาณการประมวลผลของผู้ให้บริการจัดจำหน่ายออกจากประสิทธิภาพของตัวโมเดล อัตราความผิดพลาดในการแยกเสียงผู้พูดขึ้นอยู่กับชุดข้อมูล เวลาแฝง การรวมเสียงพูดซ้อนกัน และช่วงเวลาที่ยอมรับความคลาดเคลื่อนของขอบเขตเสียง จึงยากที่จะนำไปเปรียบเทียบโดยตรงกับผลการประเมินจากชุดข้อมูลอื่น เช่น AISHELL-4

ประสิทธิภาพของโมเดลกับข้อมูลเสียงในประเทศและสภาพแวดล้อมภาษาไทยยังจำเป็นต้องได้รับการตรวจสอบแยกต่างหาก หากนำโมเดลเสียงไปใช้กับระบบจัดทำบันทึกการประชุมหรือคอลเซ็นเตอร์ในประเทศ ต้องพิจารณาทั้งภาษาที่รองรับ เวลาแฝงในการประมวลผล ต้นทุน และความเสถียรของป้ายกำกับผู้พูด

การเปิดตัวครั้งนี้ไม่ได้เชื่อมโยงโดยตรงกับสินทรัพย์ดิจิทัลหรือเทคโนโลยีบล็อกเชน แต่สะท้อนว่าเอ็นวิเดียกำลังขยายขอบเขตการเปิดตัวโมเดลจากเดิมที่เน้นโมเดลภาษาขนาดใหญ่ ไปสู่โมเดลประมวลผลเสียงด้วย ตามแนวทางการขยายระบบนิเวศโมเดลเปิด

เอ็นวิเดียขยายกลยุทธ์โมเดลเปิดจากการเน้นโมเดลภาษาขนาดใหญ่ไปสู่การประมวลผลเสียง โดยประสิทธิภาพในสภาพแวดล้อมภาษาไทยและหลายผู้พูด รวมถึงขอบเขตการใช้ใบอนุญาตในการให้บริการจริง ยังเป็นประเด็นที่ต้องติดตาม

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1