มีการพบในหลายการทดลองว่า เมื่อโมเดล AI ประเมินคำตอบของโมเดลอื่น โมเดลดังกล่าวมีแนวโน้มให้คะแนนคำตอบจากตระกูลเดียวกันสูงกว่า 58% ความเอนเอียงนี้อาจสะสมในอันดับโมเดลและผลการวัดประสิทธิภาพ
CryptoBriefing นำเสนอผลการศึกษาที่ระบุว่า ผู้ประเมิน AI มีโอกาสเลือกคำตอบของตนเองประมาณ 58% อย่างไรก็ตาม บทความดังกล่าวไม่ได้ระบุชื่อรายงานวิจัยหรือลิงก์ไปยังแหล่งข้อมูลต้นฉบับ จึงยังไม่อาจถือว่าตัวเลขนี้เป็นผลการศึกษาที่ตรวจสอบแล้ว
โครงสร้างความเอนเอียงของผู้ประเมิน AI
Chatbot Arena เป็นแพลตฟอร์มประเมินผลที่นำคำตอบของโมเดลสองตัวมาเปรียบเทียบแบบไม่เปิดเผยชื่อ จากนั้นให้ผู้ใช้เลือกคำตอบที่ต้องการมากกว่า งานวิจัยที่เกี่ยวข้องอธิบายโครงสร้างการประเมินโมเดลตามความชอบของมนุษย์ โดยอ้างอิงข้อมูลการสนทนา 243,329 รายการและโมเดล 50 ตัว ณ เดือนมกราคม 2024 งานวิจัย Chatbot Arena แตกต่างจากการประเมินโดย AI เนื่องจากผู้ประเมินเป็นผู้ใช้มนุษย์
ปัญหาอาจรุนแรงขึ้นเมื่อเปลี่ยนผู้ประเมินจากมนุษย์เป็นโมเดล AI งานวิจัยจาก KAIST และ KRAFTON วิเคราะห์ว่า ผู้ประเมินที่เป็นโมเดลภาษาขนาดใหญ่ได้รับอิทธิพลไม่เพียงจากความถูกต้อง แต่ยังรวมถึงลักษณะภายนอก เช่น ความยาวคำตอบและสำนวนที่ดูมีอำนาจ เมื่อเปรียบเทียบคำตอบสองรายการโดยตรง ความเอนเอียงเหล่านี้อาจเพิ่มขึ้น งานวิจัยที่เกี่ยวข้อง
IOV Labs เปิดเผยการทดลองแบบควบคุมเมื่อวันที่ 6 มิถุนายน โดยเปรียบเทียบคำตอบเป็นคู่จำนวน 1,152 รายการจากโมเดลแนวหน้าจำนวน 4 ตัว โมเดลทั้ง 4 ตัวมีแนวโน้มชอบคำตอบจากตระกูลเดียวกันมากกว่า โดยดัชนีความชอบตนเองเฉลี่ยอยู่ที่ +0.14 ขณะที่ GPT-4o อยู่ที่ +0.21 งานวิจัยของ IOV Labs
อย่างไรก็ตาม มีโมเดลเพียง 1 ใน 4 ตัวที่สามารถระบุได้จริงว่าผู้เขียนคำตอบคือตัวเอง นักวิจัยจึงวิเคราะห์ว่า ปรากฏการณ์ดังกล่าวอาจไม่ใช่การจำคำตอบของตนเองแล้วเข้าข้างตัวเอง แต่เป็นการตัดสินว่าสำนวน โครงสร้าง และรูปแบบการใช้คำที่คล้ายกับตนเองดูเป็นธรรมชาติหรือมีคุณภาพมากกว่า
การทดลองยังพบความเอนเอียงตามลำดับการนำเสนอและความยาวคำตอบ คำตอบที่ถูกแสดงเป็นรายการแรกได้รับเลือก 63% ของกรณีทั้งหมด ขณะที่ค่าสหสัมพันธ์ระหว่างความยาวคำตอบกับผลการประเมินอยู่ที่ 0.98 ซึ่งหมายความว่าลำดับการนำเสนอและปริมาณเนื้อหาอาจมีผลต่อผลลัพธ์ แม้ไม่เกี่ยวข้องกับคุณภาพจริงของคำตอบ
ผลกระทบต่อความน่าเชื่อถือของกระดานจัดอันดับ
หากผู้ประเมิน AI ให้คะแนนคำตอบของโมเดล แล้วผลลัพธ์ถูกนำไปจัดอันดับโมเดลหรือใช้เป็นข้อมูลฝึกสอนต่อ ความชอบของผู้ประเมินอาจสะสมในอันดับได้ โดยเฉพาะเมื่อใช้โมเดลประเมินเพียงตัวเดียวซ้ำหลายครั้ง ผลลัพธ์อาจเอื้อให้สำนวนหรือโครงสร้างคำตอบบางรูปแบบ
งานวิจัยที่เผยแพร่ใน AAAI เมื่อปี 2026 ระบุว่า โมเดลแต่ละตัวมีความเอนเอียงด้านความชอบแตกต่างกัน ทำให้อันดับที่จัดโดยผู้ประเมินแต่ละตัวอาจไม่สอดคล้องกัน นักวิจัยเสนอให้ปรับผลลัพธ์จากผู้ประเมินหลายรายเพื่อลดความไม่ตรงกันระหว่างผู้ประเมิน งานวิจัย AAAI
แนวทางรับมือที่เสนอ ได้แก่ การรวมโมเดลที่แตกต่างกันไว้ในคณะผู้ประเมิน และการเปรียบเทียบผลลัพธ์กับกลุ่มตัวอย่างผู้ประเมินมนุษย์ นอกจากนี้ควรสลับลำดับคำตอบเพื่อประเมินซ้ำ และวัดผลกระทบจากความยาวและสำนวนแยกต่างหาก
การทดลองในชุมชนออนไลน์ก็สะท้อนข้อกังวลว่าควรเปรียบเทียบผลการประเมินของมนุษย์กับ AI โดยการทดลองบน Reddit มีมนุษย์ 29 คนและผู้ประเมิน AI 13 ตัว ทำการเปรียบเทียบคำตอบเป็นคู่ 1,181 รายการ ผู้จัดทำระบุว่า ในคำถาม 32 ข้อ มี 26 ข้อที่ทั้งสองกลุ่มแสดงความชอบไปในทิศทางเดียวกัน อย่างไรก็ตาม เนื่องจากเป็นการทดลองของชุมชน ไม่ใช่งานวิจัยทางวิชาการอย่างเป็นทางการ จึงยากที่จะนำผลไปสรุปทั่วไป ผลการทดลอง
ความเอนเอียงในการชอบคำตอบของตนเองไม่ได้หมายความว่าผลการประเมินผิดทั้งหมด สาเหตุบางส่วนอาจมาจากความแตกต่างด้านคุณภาพจริงของคำตอบ ดังนั้นจึงจำเป็นต้องมีการทดลองเพิ่มเติมเพื่อแยกความเอนเอียงออกจากความแตกต่างด้านคุณภาพ
ประเด็นเรื่องความเป็นอิสระของการประเมินและโครงสร้างพื้นฐานสำหรับการตรวจสอบยังเคยถูกหยิบยกใน กรณีที่เรียกร้องสิทธิ์เข้าถึงและอำนาจบรรณาธิการของผู้ประเมิน AI รวมถึงมาตรการป้องกันการตอบโต้ ความน่าเชื่อถือของระบบประเมินยังขึ้นอยู่กับข้อมูลที่บริษัทซึ่งถูกประเมินและผู้ประเมินแบ่งปัน ตลอดจนวิธีเปิดเผยผลลัพธ์
งานวิจัยที่ตรวจสอบได้ในปัจจุบันแสดงให้เห็นว่า ผู้ประเมิน AI อาจมีความเอนเอียงในการชอบคำตอบของตนเอง รวมถึงความเอนเอียงจากลำดับการนำเสนอและความยาวคำตอบ แต่ยังไม่สามารถนำอัตราเดียวกันไปใช้กับโมเดลและสภาพแวดล้อมการประเมินทุกประเภทได้
ยังไม่มีการระบุผลกระทบโดยตรงต่อราคาสินทรัพย์ดิจิทัลหรือโครงการบล็อกเชน ประเด็นสำคัญของการอภิปรายครั้งนี้คือ การประเมินอันดับโมเดล AI และผลการทดสอบมาตรฐานไม่ควรอาศัยผลจากผู้ประเมินเพียงรายเดียว แต่ควรใช้ผู้ประเมินหลายรูปแบบ เปรียบเทียบกับกลุ่มตัวอย่างมนุษย์ สลับลำดับคำตอบ และตรวจสอบความเอนเอียงจากความยาวและสำนวนควบคู่กัน
ความคิดเห็น 0