งานวิจัยที่ปรับปรุงสภาพแวดล้อมการทำงานของ AI Agent หลายด้านพบว่า คะแนนทดสอบคณิตศาสตร์และการเขียนโค้ดสูงกว่าวิธีเดิม โดยความแม่นยำในการให้เหตุผลทางคณิตศาสตร์ระดับโอลิมปิกอยู่ที่ 62.0% เทียบกับ 46.0% ของ Meta-Harness แต่ระบบใช้โทเคนในการแก้โจทย์เพิ่มขึ้นด้วย
นักวิจัยจาก Meta (เมตา), Duke University (มหาวิทยาลัยดุ๊ก) และ University of California, Davis (มหาวิทยาลัยแคลิฟอร์เนีย เดวิส) เผยแพร่บทความชื่อ “Mixture of Self-Improving Branches for Agent Harness Optimization” บนคลังบทความ arXiv เมื่อวันที่ 29 กันยายน บทความดังกล่าวเป็นงานวิจัยฉบับก่อนผ่านการประเมินโดยผู้ทรงคุณวุฒิ
Harness คือโค้ดและสภาพแวดล้อมที่กำหนดข้อมูลซึ่งส่งให้โมเดล เครื่องมือที่ใช้ได้ ตลอดจนขั้นตอนการเรียกใช้และตรวจสอบผลลัพธ์ งานวิจัยนี้มุ่งปรับปรุง Harness โดยอัตโนมัติ แทนการฝึกน้ำหนักของโมเดลใหม่
Meta-Harness ซึ่งเป็นวิธีเดิม จะสร้าง Harness ที่เป็นตัวเลือก นำไปใช้กับข้อมูลพัฒนา แล้วเสนอทางเลือกถัดไปจากผลลัพธ์และบันทึกการค้นหา นักวิจัยมองว่าการค้นหาผ่านเส้นทางเดียวอาจมีข้อจำกัด จึงแบ่งการค้นหาออกเป็นหลายสาขา
แต่ละสาขาปรับ Harness โดยอาศัยกรณีศึกษาและคำแนะนำในการปรับปรุงที่แตกต่างกัน อีกทั้งยังปรับข้อเสนอถัดไปตามบันทึกการค้นหาก่อนหน้า เมื่อมีข้อมูลใหม่ Router จะเลือก Harness จากสาขาที่เหมาะสมมาทำงาน
นักวิจัยระบุว่าใช้เฉพาะข้อมูลพัฒนาในการเลือกและตั้งค่า Harness กับ Router โดยไม่ได้ใช้ผลทดสอบจากชุดประเมินผล ในโจทย์ให้เหตุผลทางคณิตศาสตร์ระดับโอลิมปิก ระบบใหม่มีความแม่นยำ 62.0% ส่วน Meta-Harness อยู่ที่ 46.0% บทความระบุว่าอัตราการปรับปรุงเมื่อเทียบกันอยู่ที่ 34.8%
ระบบมีอัตราการปรับปรุงเมื่อเทียบกัน 11.6% ใน Terminal-Bench 2.0 และ 3.8% ใน SWE-bench Lite ตัวเลขเหล่านี้จำกัดอยู่กับเบนช์มาร์กและเงื่อนไขการทดลองที่ผู้เขียนกำหนดไว้
การเพิ่มประสิทธิภาพมาพร้อมต้นทุนการคำนวณที่สูงขึ้น ข้อมูลการใช้โทเคนในภาคผนวกของบทความระบุว่า ระบบที่ใช้สองสาขาใช้โทเคนมากกว่า Meta-Harness 1.21 เท่าในการทดลองคณิตศาสตร์ 1.71 เท่าใน Terminal-Bench 2.0 และ 1.50 เท่าใน SWE-bench Lite ดังนั้นคะแนนที่สูงขึ้นเพียงอย่างเดียวยังไม่ยืนยันว่าประสิทธิภาพด้านต้นทุนดีขึ้น
Router ก็ไม่ได้ให้ผลดีกว่า Harness เดี่ยวที่แข็งแกร่งที่สุดเสมอไป บทความระบุว่า ในการตั้งค่าหนึ่งของการให้เหตุผลทางคณิตศาสตร์และในการทดสอบ SWE-bench Lite ผลจาก Router ทำได้น้อยกว่าแขนงเดี่ยวที่แข็งแกร่งกว่าอย่างละหนึ่งกรณีทดสอบ นักวิจัยเสนอว่าอาจผสานจุดแข็งของแต่ละสาขาได้ แต่ผลการทดลองยังไม่ได้แสดงว่าการเลือกเส้นทางให้ผลเหนือกว่า Harness เดี่ยวทุกครั้ง
นักวิจัยนำเสนอผลจากโมเดลและเบนช์มาร์กที่มีขอบเขตจำกัด โดยใช้การตั้งค่าสองสาขา ผลที่มีอยู่ยังไม่เพียงพอสำหรับประเมินความสม่ำเสมอในการทดลองซ้ำ หรือประสิทธิภาพและต้นทุนเมื่อเพิ่มจำนวนสาขา เนื่องจากเป็นงานวิจัยฉบับก่อนผ่านการประเมิน การตรวจสอบว่าผลทำซ้ำได้ภายใต้เงื่อนไขที่หลากหลายขึ้นจึงยังเป็นโจทย์ต่อไป
ความคิดเห็น 0