คะแนนเฉลี่ยของโมเดล AI แบบโอเพนเวต 7 รุ่นลดลง 62.8% เมื่อเพิ่มความยาวบริบทอินพุตจาก 4K เป็น 128K ผลการศึกษาชี้ว่า ความสามารถในการรับบริบทที่ยาวขึ้นเพียงอย่างเดียวอาจไม่เพียงพอที่จะบอกได้ว่าโมเดลทำงานหลายขั้นตอนได้อย่างแม่นยำต่อเนื่องหรือไม่
ทีมวิจัยของ NVIDIA($NVDA) เผยแพร่บทความวิจัยชื่อ ‘Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability’ เมื่อวันที่ 30 กันยายน พร้อมเสนอวิธีประเมินงานระยะยาวที่เรียกว่า ‘Long-Transduction’ ตามรายงานของ Crypto Briefing เบนช์มาร์กนี้ครอบคลุมงานที่โมเดลต้องอ้างอิงอินพุตต่อเนื่องและสร้างผลลัพธ์เป็นลำดับ เช่น การคำนวณเลข การเรียง UUID การค้นค่าตัวแปร และการแปลงตาราง
นักวิจัยเปลี่ยนความยาวบริบท รูปแบบข้อมูลอินพุต และความซับซ้อนของงานในแต่ละขั้น เพื่อวัดการเปลี่ยนแปลงของประสิทธิภาพ เมื่อเปลี่ยนรูปแบบอินพุต คะแนนเฉลี่ยลดลง 36.5% ส่วนการเพิ่มความซับซ้อนของงานทีละขั้นทำให้คะแนนลดลง 39.9%
การนำตัวระบุที่คงที่ของรายการอินพุตออกก็ทำให้ผลลัพธ์ในบางงานลดลงเช่นกัน โดยคะแนนการเรียง UUID ลดลง 64.3% และการค้นค่าตัวแปรลดลง 66.4% ตัวเลขทั้งสองเป็นผลจากงานและเงื่อนไขด้านรูปแบบเฉพาะที่กำหนดไว้ในบทความวิจัย
Long-Transduction ออกแบบมาเพื่อประเมินว่าโมเดลสามารถอ่านอินพุต เปลี่ยนสถานะ และสร้างผลลัพธ์ต่อเนื่องได้ดีเพียงใดระหว่างกระบวนการสร้างข้อความที่ยาว นักวิจัยจึงตั้งข้อสังเกตว่า คะแนนจากการถามตอบสั้น ๆ หรืองานขั้นตอนเดียว อาจไม่เพียงพอสำหรับประเมินความเสถียรของงานที่ต้องทำต่อเนื่องหลายขั้น
ตัวเลขดังกล่าววัดจากเบนช์มาร์กที่ควบคุมเงื่อนไขไว้ จึงไม่ได้หมายความว่าประสิทธิภาพในงานขององค์กรจริงหรือบริการ AI ทุกประเภทจะลดลงในระดับเดียวกัน
นักวิจัยเสนอให้แบ่งงานยาวออกเป็นส่วนย่อย และกำหนด ID ที่คงที่ให้กับรายการอินพุตและผลลัพธ์ระหว่างทาง นอกจากนี้ยังเสนอไม่ให้รวมงานซับซ้อนทั้งหมดไว้ในบริบทยาวชุดเดียว
การประเมินครั้งนี้ครอบคลุมงานที่กำหนดไว้ ได้แก่ การคำนวณเลข การเรียงลำดับ การค้นข้อมูล และการแปลงตาราง ผลการศึกษาเพียงอย่างเดียวยังไม่สามารถใช้ตัดสินความแม่นยำหรือผลจากการนำไปใช้ในระบบงานจริงได้
ความคิดเห็น 0