เอ็นวิเดีย($NVDA) เปิดตัวเนโมตรอน 3 ไดอาไรเซชัน (Nemotron 3 Diarization) โมเดลแยกเสียงพูดขนาดราว 100 ล้านพารามิเตอร์ที่จำแนกเสียงของผู้พูดได้สูงสุด 8 คนแบบเรียลไทม์ โดยเป็นโมเดลเปิดน้ำหนักที่นำไปใช้จัดทำบันทึกการประชุม วิเคราะห์คอลเซ็นเตอร์ และพัฒนาเอเจนต์ AI แบบใช้เสียงได้
เอ็นวิเดียเปิดตัวโมเดลดังกล่าวผ่านโพสต์บน Hugging Face เมื่อวันที่ 23 โดยเนโมตรอน 3 ไดอาไรเซชันใช้งานได้บน Hugging Face และ NeMo รองรับทั้งการประมวลผลไฟล์บันทึกเสียงและการสตรีมแบบเรียลไทม์ในโมเดลเดียว
การแยกเสียงผู้พูดแตกต่างจากการรู้จำเสียงพูดที่แปลงเสียงเป็นข้อความ เพราะเป็นเทคโนโลยีที่ระบุว่า 'ใครพูดเมื่อใด' โมเดลไม่ได้ตรวจสอบชื่อจริงของผู้พูด แต่กำหนดป้ายกำกับแบบไม่ระบุตัวตนตามลำดับการพูด เช่น speaker_1 และ speaker_2
ดังนั้น หากไม่มีข้อมูลผู้เข้าร่วมการประชุมหรือโมเดลยืนยันตัวตนผู้พูด ก็ไม่สามารถเชื่อมโยงป้ายกำกับกับบุคคลจริงได้ การนำไปใช้กับบันทึกการประชุม บันทึกการให้คำปรึกษา หรือการตัดต่อบทสัมภาษณ์ ซึ่งต้องจัดการทั้งเนื้อหาเสียงและผู้พูด จึงจำเป็นต้องมีระบบระบุตัวตนเพิ่มเติม
โมเดลจะแสดงความน่าจะเป็นของกิจกรรมเสียงพูดในช่วงเวลา 10 มิลลิวินาที นอกจากนี้ยังรองรับเสียงพูดซ้อนกันของหลายคน โดยสามารถปรับเวลาแฝงของบัฟเฟอร์อินพุตเป็น 0.32 วินาที, 0.64 วินาที, 1.04 วินาที หรือ 30.4 วินาทีได้
เวลา 0.32 วินาทีเป็นการตั้งค่าที่มีเวลาแฝนต่ำที่สุดในบรรดาค่าที่เอ็นวิเดียแนะนำ แม้ในทางเทคนิคจะใช้บัฟเฟอร์อินพุต 80 มิลลิวินาทีได้ แต่ความแม่นยำและปริมาณการประมวลผลอาจลดลง
กระบวนการสตรีมใช้ฟังก์ชัน 'Arrival-Order Speaker Cache' ซึ่งกำหนดป้ายกำกับตามลำดับที่ผู้พูดปรากฏตัวครั้งแรก และคงป้ายกำกับเดิมไว้ในช่วงเสียงถัดไป เพื่อลดปัญหาหมายเลขผู้พูดสลับกันเมื่อเปลี่ยนช่วงเสียง
เอ็นวิเดียระบุว่า เนโมตรอน 3 ไดอาไรเซชันครองอันดับหนึ่งจาก 12 ระบบในการประเมินเบื้องต้นของ Diarization-Bench โดย VoiceArena การประเมินครอบคลุมบทสนทนาภาษาอังกฤษ 139 รายการ รวมเสียงประมาณ 22 ชั่วโมง และรวมกรณีเสียงพูดซ้อนกัน โมเดลมีอัตราความผิดพลาดในการแยกเสียงผู้พูด (DER) อยู่ที่ 14.72%
ระบบอันดับสองมีค่า DER อยู่ที่ 19.3% อย่างไรก็ตาม เอ็นวิเดียระบุว่าผลลัพธ์ดังกล่าวเป็นการประเมินเบื้องต้น และอาจเปลี่ยนแปลงได้หลังการประเมินอย่างเป็นทางการและการวิเคราะห์ทางสถิติเสร็จสิ้น
เนโมตรอน 3 ไดอาไรเซชันเพิ่มจำนวนผู้พูดที่รองรับเป็น 8 คน จากเดิม 4 คนใน Streaming Sortformer v2.1 เอ็นวิเดียระบุว่าโมเดลได้รับการฝึกด้วยข้อมูลเสียงแบบเปิดและข้อมูลเสียงที่มีใบอนุญาต รวมถึงข้อมูลเสียงหลายผู้พูดจาก David AI
เอ็นวิเดียอธิบายว่า ภายใต้เงื่อนไขการประเมินบางรูปแบบ หลังเพิ่มข้อมูลดังกล่าว ค่า DER ปรับดีขึ้นจาก 11.19% เป็น 10.42% หรือลดลง 0.77 จุดเปอร์เซ็นต์ อย่างไรก็ตาม ตัวเลขนี้มาจากเงื่อนไขการประเมินอีกชุดหนึ่ง จึงไม่สามารถนำไปเปรียบเทียบโดยตรงกับค่า 14.72% ของ VoiceArena ได้
จุดเด่นอีกประการคือการเป็นโมเดลเปิดน้ำหนัก หน้าโมเดลบน Hugging Face และ Baseten ระบุใบอนุญาตเป็น OpenMDW-1.1 ขณะที่ Baseten ให้สภาพแวดล้อมสำหรับการใช้งานแบบสตรีมมิงและการอนุมานแบบแบตช์
อย่างไรก็ตาม ควรแยกประเมินปริมาณการประมวลผลของผู้ให้บริการจัดจำหน่ายออกจากประสิทธิภาพของตัวโมเดล อัตราความผิดพลาดในการแยกเสียงผู้พูดขึ้นอยู่กับชุดข้อมูล เวลาแฝง การรวมเสียงพูดซ้อนกัน และช่วงเวลาที่ยอมรับความคลาดเคลื่อนของขอบเขตเสียง จึงยากที่จะนำไปเปรียบเทียบโดยตรงกับผลการประเมินจากชุดข้อมูลอื่น เช่น AISHELL-4
ประสิทธิภาพของโมเดลกับข้อมูลเสียงในประเทศและสภาพแวดล้อมภาษาไทยยังจำเป็นต้องได้รับการตรวจสอบแยกต่างหาก หากนำโมเดลเสียงไปใช้กับระบบจัดทำบันทึกการประชุมหรือคอลเซ็นเตอร์ในประเทศ ต้องพิจารณาทั้งภาษาที่รองรับ เวลาแฝงในการประมวลผล ต้นทุน และความเสถียรของป้ายกำกับผู้พูด
การเปิดตัวครั้งนี้ไม่ได้เชื่อมโยงโดยตรงกับสินทรัพย์ดิจิทัลหรือเทคโนโลยีบล็อกเชน แต่สะท้อนว่าเอ็นวิเดียกำลังขยายขอบเขตการเปิดตัวโมเดลจากเดิมที่เน้นโมเดลภาษาขนาดใหญ่ ไปสู่โมเดลประมวลผลเสียงด้วย ตามแนวทางการขยายระบบนิเวศโมเดลเปิด
เอ็นวิเดียขยายกลยุทธ์โมเดลเปิดจากการเน้นโมเดลภาษาขนาดใหญ่ไปสู่การประมวลผลเสียง โดยประสิทธิภาพในสภาพแวดล้อมภาษาไทยและหลายผู้พูด รวมถึงขอบเขตการใช้ใบอนุญาตในการให้บริการจริง ยังเป็นประเด็นที่ต้องติดตาม
ความคิดเห็น 0