Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

Perplexity ลดอัตราเรียกใช้เครื่องมือผิดพลาดลง 21.2%

Perplexity ลดอัตราการเรียกใช้เครื่องมือที่ล้มเหลวจาก 2.24% เหลือ 1.77% หลังนำข้อผิดพลาดและการแก้ไขของผู้ใช้จากเซสชันจริงมาใช้ฝึกโมเดล คิดเป็นการลดลงแบบสัมพัทธ์ 21.2%

Perplexity เปิดเผยผลการทดสอบออนไลน์แบบ A/B ของจุดตรวจการฝึกอบรมสองระยะต่อเนื่องในบล็อกวิจัยชื่อ ‘Learning from Real-World Mistakes’ เมื่อวันที่ 21 โดยระบุว่าตัวเลขดังกล่าวไม่ได้มาจากการเปรียบเทียบโดยตรงระหว่างโมเดลพื้นฐาน GLM 5.2 กับจุดตรวจการฝึกอบรมระยะต่อมา

แนวทางการฝึกครั้งนี้มุ่งแก้ข้อจำกัดของการปรับจูนแบบสุ่มตัวอย่างปฏิเสธ (RFT) ซึ่งฝึกโมเดลให้เลียนแบบเฉพาะเซสชันที่ประสบความสำเร็จ โดยเซสชันที่สำเร็จจะถูกใช้เพื่อเรียนรู้การกระทำที่ถูกต้อง ขณะที่เซสชันที่ล้มเหลวจะถูกนำมาใช้สกัดจุดที่ต้องแก้ไขจากการปรับเปลี่ยนของผู้ใช้และข้อผิดพลาดของเครื่องมือ

ขั้นตอนการแก้ไขใช้การกลั่นความรู้ด้วยตนเองแบบออนโพลิซี (OPSD) โดยโมเดลเดียวกันรับบทเป็นทั้งครูและนักเรียน โมเดลครูจะได้รับคำใบ้สั้น ๆ ที่อธิบายสาเหตุของข้อผิดพลาด ขณะที่โมเดลนักเรียนเรียนรู้การคาดการณ์โทเคนถัดไปของโมเดลครูโดยไม่เห็นคำใบ้ดังกล่าว

Perplexity ยังนำเสนอการทดลองสร้างซ้ำจากเซสชัน 985 รายการที่แสดงข้อผิดพลาดของเครื่องมือแยกต่างหาก เมื่อมีการให้คำใบ้ อัตราการหลีกเลี่ยงข้อผิดพลาดเดิมเพิ่มจาก 75.1% เป็น 93.7% และอัตราการดำเนินการแก้ไขได้จริงเพิ่มจาก 60.6% เป็น 82.3%

อย่างไรก็ตาม การทดลองนี้วัดความสามารถในการหลีกเลี่ยงข้อผิดพลาดเท่านั้น การหลีกเลี่ยงข้อผิดพลาดไม่ได้หมายความโดยอัตโนมัติว่าการเรียกใช้เครื่องมือหรือการทำงานโดยรวมจะประสบความสำเร็จ

ผลการประเมินออฟไลน์พบว่าอัตราข้อผิดพลาดของเครื่องมืออยู่ที่ 2.79% สำหรับ GLM 5.2 พื้นฐาน 1.35% สำหรับจุดตรวจที่ใช้ RFT เพียงอย่างเดียว และ 0.87% สำหรับจุดตรวจที่ใช้ RFT ร่วมกับ OPSD โดย Perplexity ระบุว่าข้อมูลฝึกของแต่ละจุดตรวจแตกต่างกัน จึงไม่ใช่การทดลองที่ควบคุมเฉพาะผลของ OPSD

ประสิทธิภาพในระดับงานไม่ได้ปรับตัวดีขึ้นอย่างสม่ำเสมอในทุกด้าน ดังนั้นจึงยังไม่สามารถยืนยันโดยอิสระจากตัวเลขออฟไลน์เพียงอย่างเดียวว่า OPSD เป็นสาเหตุที่ทำให้อัตราข้อผิดพลาดของเครื่องมือลดลง

การทดลองออนไลน์ดำเนินการสองครั้ง ในการทดลองครั้งแรก อัตราการเรียกใช้เครื่องมือที่ล้มเหลวของจุดตรวจ RFT และ OPSD รุ่นแรกอยู่ที่ 2.82% ต่ำกว่า 2.94% ของ GLM 5.2 แต่ความแตกต่างดังกล่าวไม่มีนัยสำคัญทางสถิติ

มีเพียงการทดลองที่เปรียบเทียบจุดตรวจ RFT และ OPSD สองรุ่นเท่านั้นที่พบการลดลงอย่างมีนัยสำคัญ จาก 2.24% เหลือ 1.77% ทั้งนี้ ยังไม่มีการเปิดเผยผลการเปรียบเทียบโดยตรงระหว่างจุดตรวจรุ่นต่อมากับ GLM 5.2

การปรับปรุงความพึงพอใจของผู้ใช้ก็ยังไม่ยืนยันในเชิงสถิติ ในการทดลองระยะต่อมา ความน่าจะเป็นของความไม่พอใจระดับปานกลางขึ้นไปลดจาก 2.58% ในจุดตรวจรุ่นก่อนหน้าเหลือ 2.54% ในจุดตรวจรุ่นถัดมา แต่ความแตกต่างไม่มีนัยสำคัญ

งานวิจัยที่เกี่ยวข้องอย่างบทความ DART-SD ยังชี้ว่า การนำส่วนที่ดำเนินการถูกต้องอยู่แล้วกลับมาฝึกใหม่ทั้งกระบวนการในการเรียกใช้เครื่องมือหลายขั้นตอน อาจทำลายพฤติกรรมการสำรวจที่มีประโยชน์ได้ งานวิจัยดังกล่าวเสนอให้เลือกฝึกเฉพาะขั้นตอนการกู้คืนหลังจุดวิกฤตที่ข้อผิดพลาดเริ่มต้นขึ้น แต่ไม่ได้ใช้วิธีการหรือโมเดลเดียวกับการทดลองของ Perplexity

เอเจนต์ AI ใช้เครื่องมือหลายชนิดต่อเนื่องกัน เช่น การค้นหา การตีความผลการค้นหา และการเรียกใช้ API ภายนอก หากเกิดคำขอในรูปแบบที่ไม่ถูกต้องหรือมีการตีความผลตอบกลับจากเครื่องมือผิดพลาด ก็อาจนำไปสู่ข้อผิดพลาดในคำตอบสุดท้าย ขณะที่การเรียกใช้เครื่องมือโดยไม่จำเป็นอาจเพิ่มต้นทุนการประมวลผลและความล่าช้าของการตอบสนอง

ในโครงสร้างเช่นนี้ ความสามารถของเอเจนต์ในการค้นหาและเรียกใช้เฉพาะเครื่องมือที่จำเป็นมีความสำคัญเช่นกัน ก่อนหน้านี้มีการนำเสนอแนวทางที่ให้เอเจนต์เรียกใช้เฉพาะเครื่องมือที่ต้องการแล้ว ทำให้การเชื่อมต่อเครื่องมือและการกู้คืนจากข้อผิดพลาดกลายเป็นโจทย์ที่ต้องบริหารแยกจากความสามารถในการสร้างคำตอบของโมเดล

ในชุมชน Perplexity บน Reddit ผู้ใช้บางรายรายงานว่าการเรียกใช้เครื่องมือหยุดลงหรือเกิดข้อผิดพลาดหลังการค้นหาเป็นเวลานาน อย่างไรก็ตาม นี่เป็นประสบการณ์ของผู้ใช้รายบุคคล และไม่อาจเชื่อมโยงโดยตรงกับสถิติของผู้ใช้ทั้งหมดที่ Perplexity เปิดเผย

ผลลัพธ์ครั้งนี้ชี้ให้เห็นว่า การฝึกเอเจนต์ AI อาจใช้ข้อผิดพลาดที่เกิดขึ้นระหว่างการค้นหาและการเรียกใช้เครื่องมือภายนอกเป็นสัญญาณการเรียนรู้ได้ ไม่ใช่พิจารณาเฉพาะความสำเร็จของคำตอบสุดท้ายเท่านั้น อย่างไรก็ตาม ตัวเลขที่เปิดเผยสนับสนุนเพียงการปรับปรุงความน่าเชื่อถือของการเรียกใช้เครื่องมือ และยังไม่ควรตีความเกินจริงว่าเพียงพอที่จะยืนยันว่าความพึงพอใจของผู้ใช้หรืออัตราความสำเร็จของงานโดยรวมดีขึ้นพร้อมกัน

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1