Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

คะแนน AI Agent สูงขึ้นสูงสุด 34.8% แต่ใช้โทเคนเพิ่ม

เอกสารประเมินเปรียบเทียบเส้นทางการทำงานแบบแยกสาขา / TokenPost.ai (macro)

งานวิจัยที่ปรับปรุงสภาพแวดล้อมการทำงานของ AI Agent หลายด้านพบว่า คะแนนทดสอบคณิตศาสตร์และการเขียนโค้ดสูงกว่าวิธีเดิม โดยความแม่นยำในการให้เหตุผลทางคณิตศาสตร์ระดับโอลิมปิกอยู่ที่ 62.0% เทียบกับ 46.0% ของ Meta-Harness แต่ระบบใช้โทเคนในการแก้โจทย์เพิ่มขึ้นด้วย

นักวิจัยจาก Meta (เมตา), Duke University (มหาวิทยาลัยดุ๊ก) และ University of California, Davis (มหาวิทยาลัยแคลิฟอร์เนีย เดวิส) เผยแพร่บทความชื่อ “Mixture of Self-Improving Branches for Agent Harness Optimization” บนคลังบทความ arXiv เมื่อวันที่ 29 กันยายน บทความดังกล่าวเป็นงานวิจัยฉบับก่อนผ่านการประเมินโดยผู้ทรงคุณวุฒิ

Harness คือโค้ดและสภาพแวดล้อมที่กำหนดข้อมูลซึ่งส่งให้โมเดล เครื่องมือที่ใช้ได้ ตลอดจนขั้นตอนการเรียกใช้และตรวจสอบผลลัพธ์ งานวิจัยนี้มุ่งปรับปรุง Harness โดยอัตโนมัติ แทนการฝึกน้ำหนักของโมเดลใหม่

Meta-Harness ซึ่งเป็นวิธีเดิม จะสร้าง Harness ที่เป็นตัวเลือก นำไปใช้กับข้อมูลพัฒนา แล้วเสนอทางเลือกถัดไปจากผลลัพธ์และบันทึกการค้นหา นักวิจัยมองว่าการค้นหาผ่านเส้นทางเดียวอาจมีข้อจำกัด จึงแบ่งการค้นหาออกเป็นหลายสาขา

แต่ละสาขาปรับ Harness โดยอาศัยกรณีศึกษาและคำแนะนำในการปรับปรุงที่แตกต่างกัน อีกทั้งยังปรับข้อเสนอถัดไปตามบันทึกการค้นหาก่อนหน้า เมื่อมีข้อมูลใหม่ Router จะเลือก Harness จากสาขาที่เหมาะสมมาทำงาน

นักวิจัยระบุว่าใช้เฉพาะข้อมูลพัฒนาในการเลือกและตั้งค่า Harness กับ Router โดยไม่ได้ใช้ผลทดสอบจากชุดประเมินผล ในโจทย์ให้เหตุผลทางคณิตศาสตร์ระดับโอลิมปิก ระบบใหม่มีความแม่นยำ 62.0% ส่วน Meta-Harness อยู่ที่ 46.0% บทความระบุว่าอัตราการปรับปรุงเมื่อเทียบกันอยู่ที่ 34.8%

ระบบมีอัตราการปรับปรุงเมื่อเทียบกัน 11.6% ใน Terminal-Bench 2.0 และ 3.8% ใน SWE-bench Lite ตัวเลขเหล่านี้จำกัดอยู่กับเบนช์มาร์กและเงื่อนไขการทดลองที่ผู้เขียนกำหนดไว้

การเพิ่มประสิทธิภาพมาพร้อมต้นทุนการคำนวณที่สูงขึ้น ข้อมูลการใช้โทเคนในภาคผนวกของบทความระบุว่า ระบบที่ใช้สองสาขาใช้โทเคนมากกว่า Meta-Harness 1.21 เท่าในการทดลองคณิตศาสตร์ 1.71 เท่าใน Terminal-Bench 2.0 และ 1.50 เท่าใน SWE-bench Lite ดังนั้นคะแนนที่สูงขึ้นเพียงอย่างเดียวยังไม่ยืนยันว่าประสิทธิภาพด้านต้นทุนดีขึ้น

Router ก็ไม่ได้ให้ผลดีกว่า Harness เดี่ยวที่แข็งแกร่งที่สุดเสมอไป บทความระบุว่า ในการตั้งค่าหนึ่งของการให้เหตุผลทางคณิตศาสตร์และในการทดสอบ SWE-bench Lite ผลจาก Router ทำได้น้อยกว่าแขนงเดี่ยวที่แข็งแกร่งกว่าอย่างละหนึ่งกรณีทดสอบ นักวิจัยเสนอว่าอาจผสานจุดแข็งของแต่ละสาขาได้ แต่ผลการทดลองยังไม่ได้แสดงว่าการเลือกเส้นทางให้ผลเหนือกว่า Harness เดี่ยวทุกครั้ง

นักวิจัยนำเสนอผลจากโมเดลและเบนช์มาร์กที่มีขอบเขตจำกัด โดยใช้การตั้งค่าสองสาขา ผลที่มีอยู่ยังไม่เพียงพอสำหรับประเมินความสม่ำเสมอในการทดลองซ้ำ หรือประสิทธิภาพและต้นทุนเมื่อเพิ่มจำนวนสาขา เนื่องจากเป็นงานวิจัยฉบับก่อนผ่านการประเมิน การตรวจสอบว่าผลทำซ้ำได้ภายใต้เงื่อนไขที่หลากหลายขึ้นจึงยังเป็นโจทย์ต่อไป

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1