นักวิจัยของ Nvidia เพิ่มอัตราสำเร็จของเอเจนต์เทอร์มินัลในการทดสอบ TerminalBench-Lite จาก 50.00% เป็น 68.03% ด้วยการตรวจสอบคำสั่งที่เอเจนต์เสนอ ก่อนสั่งให้ทำงาน
ระบบ ‘Mid-Harness’ ที่นักวิจัย Nvidia เผยแพร่ไว้ทำงานโดยให้เอเจนต์สร้างคำสั่งหลายตัวเลือกในแต่ละขั้นตอน จากนั้นโมเดลตรวจสอบจะประเมินตัวเลือกและเลือกหนึ่งคำสั่งไปดำเนินการ Nvidia อธิบายในหน้าวิจัยว่า คำสั่งที่ผิดพลาดอาจส่งผลต่อสภาพแวดล้อมการทำงานในขั้นต่อไป จึงเพิ่มขั้นตอนตรวจสอบก่อนเริ่มทำงาน
การทดลองใช้ TMAX-9B สร้างตัวเลือกคำสั่ง และให้ GPT-5.6 Sol ทำหน้าที่ตรวจสอบ เมื่อสร้างตัวเลือก 8 รายการในแต่ละขั้นตอน อัตรา Pass@1 เพิ่มจาก 50.00% เป็น 68.03% โดย Pass@1 หมายถึงสัดส่วนงานที่ทำสำเร็จจากการลองเพียงครั้งเดียว
นักวิจัยระบุว่า การเพิ่มจำนวนตัวเลือกเพียงอย่างเดียวอาจไม่ช่วยให้ประสิทธิภาพดีขึ้น หากความสามารถในการตรวจสอบยังอ่อน ก็ยากที่จะใช้ประโยชน์จากตัวเลือกที่เพิ่มขึ้น จึงต้องมีตัวตรวจสอบที่คัดเลือกการกระทำที่เหมาะสมได้ ในการทดลองที่ให้ TMAX-9B สร้างและตรวจสอบตัวเลือกเอง วิธีตรวจสอบแบบจับคู่ให้ผลดีที่สุดในบรรดาวิธีที่นำมาประเมิน
นักวิจัยยังเปรียบเทียบ ‘การขยายเส้นทางการทำงาน’ ซึ่งหมายถึงการเริ่มทำงานหนึ่งชิ้นซ้ำหลายครั้ง กับ ‘การขยายการกระทำ’ ซึ่งเพิ่มตัวเลือกในแต่ละขั้นตอน หน้าวิจัยของ Nvidia ระบุว่า เมื่อใช้ TMAX-9B ร่วมกับ TerminalBench-Lite การใช้ทั้งสองวิธีทำให้อัตราสำเร็จสูงกว่าการเพิ่มจำนวนเส้นทางเพียงอย่างเดียว และมีค่าใช้จ่ายโทเคนโดยประมาณต่ำกว่า แต่ไม่ได้ระบุตัวเลขการประหยัดค่าใช้จ่าย
Mid-Harness ทดสอบการตรวจสอบการกระทำที่สร้างขึ้นก่อนลงมือ โดยไม่เปลี่ยนโมเดลหรือฝึกโมเดลใหม่ อย่างไรก็ตาม ตัวเลขที่เผยแพร่เป็นผลจากการทดสอบบนเบนช์มาร์กที่กำหนดไว้แล้ว จึงยังไม่ยืนยันว่าจะได้ผลเช่นเดียวกันกับงานเทอร์มินัลจริงหรือกระบวนการทำงานที่ยาวขึ้น
ความคิดเห็น 0