Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

NVIDIA เผยโมเดลโอเพนเวต 7 รุ่นทำคะแนนเฉลี่ยลดลง 62.8% เมื่อเพิ่มบริบทจาก 4K เป็น 128K

เอกสารประเมินเบนช์มาร์กที่มีการจัดเรียง UUID และรายการในตาราง / TokenPost.ai

คะแนนเฉลี่ยของโมเดล AI แบบโอเพนเวต 7 รุ่นลดลง 62.8% เมื่อเพิ่มความยาวบริบทอินพุตจาก 4K เป็น 128K ผลการศึกษาชี้ว่า ความสามารถในการรับบริบทที่ยาวขึ้นเพียงอย่างเดียวอาจไม่เพียงพอที่จะบอกได้ว่าโมเดลทำงานหลายขั้นตอนได้อย่างแม่นยำต่อเนื่องหรือไม่

ทีมวิจัยของ NVIDIA($NVDA) เผยแพร่บทความวิจัยชื่อ ‘Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability’ เมื่อวันที่ 30 กันยายน พร้อมเสนอวิธีประเมินงานระยะยาวที่เรียกว่า ‘Long-Transduction’ ตามรายงานของ Crypto Briefing เบนช์มาร์กนี้ครอบคลุมงานที่โมเดลต้องอ้างอิงอินพุตต่อเนื่องและสร้างผลลัพธ์เป็นลำดับ เช่น การคำนวณเลข การเรียง UUID การค้นค่าตัวแปร และการแปลงตาราง

นักวิจัยเปลี่ยนความยาวบริบท รูปแบบข้อมูลอินพุต และความซับซ้อนของงานในแต่ละขั้น เพื่อวัดการเปลี่ยนแปลงของประสิทธิภาพ เมื่อเปลี่ยนรูปแบบอินพุต คะแนนเฉลี่ยลดลง 36.5% ส่วนการเพิ่มความซับซ้อนของงานทีละขั้นทำให้คะแนนลดลง 39.9%

การนำตัวระบุที่คงที่ของรายการอินพุตออกก็ทำให้ผลลัพธ์ในบางงานลดลงเช่นกัน โดยคะแนนการเรียง UUID ลดลง 64.3% และการค้นค่าตัวแปรลดลง 66.4% ตัวเลขทั้งสองเป็นผลจากงานและเงื่อนไขด้านรูปแบบเฉพาะที่กำหนดไว้ในบทความวิจัย

Long-Transduction ออกแบบมาเพื่อประเมินว่าโมเดลสามารถอ่านอินพุต เปลี่ยนสถานะ และสร้างผลลัพธ์ต่อเนื่องได้ดีเพียงใดระหว่างกระบวนการสร้างข้อความที่ยาว นักวิจัยจึงตั้งข้อสังเกตว่า คะแนนจากการถามตอบสั้น ๆ หรืองานขั้นตอนเดียว อาจไม่เพียงพอสำหรับประเมินความเสถียรของงานที่ต้องทำต่อเนื่องหลายขั้น

ตัวเลขดังกล่าววัดจากเบนช์มาร์กที่ควบคุมเงื่อนไขไว้ จึงไม่ได้หมายความว่าประสิทธิภาพในงานขององค์กรจริงหรือบริการ AI ทุกประเภทจะลดลงในระดับเดียวกัน

นักวิจัยเสนอให้แบ่งงานยาวออกเป็นส่วนย่อย และกำหนด ID ที่คงที่ให้กับรายการอินพุตและผลลัพธ์ระหว่างทาง นอกจากนี้ยังเสนอไม่ให้รวมงานซับซ้อนทั้งหมดไว้ในบริบทยาวชุดเดียว

การประเมินครั้งนี้ครอบคลุมงานที่กำหนดไว้ ได้แก่ การคำนวณเลข การเรียงลำดับ การค้นข้อมูล และการแปลงตาราง ผลการศึกษาเพียงอย่างเดียวยังไม่สามารถใช้ตัดสินความแม่นยำหรือผลจากการนำไปใช้ในระบบงานจริงได้

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1