Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

43.5% สู่ 93.0%: อัตราความสำเร็จของ AI Agent จาก Salesforce เพิ่มขึ้นโดยไม่เปลี่ยนน้ำหนักโมเดล

การประเมินงานบนเว็บที่กำลังดำเนินการบนแล็ปท็อป / TokenPost.ai

อัตราความสำเร็จของ AI Agent จาก Salesforce ในงานบนเว็บเพิ่มขึ้นจาก 43.5% เป็น 93.0% โดยไม่เปลี่ยนน้ำหนักโมเดล นักวิจัยปรับปรุงประสิทธิภาพด้วยการพัฒนาโครงสร้างการทำงาน ซึ่งรวมถึงพรอมต์ เครื่องมือ หน่วยความจำ และลำดับการควบคุม

นักวิจัย 12 คนจาก Salesforce(Salesforce, $CRM) AI Research และ Agentforce นำเสนอผลลัพธ์ดังกล่าวในงานวิจัยเรื่อง ‘DarwinX: Evolving Agent Harnesses Through Natural Selection’ ซึ่งส่งเมื่อวันที่ 31 กรกฎาคม 2026 งานวิจัยอธิบายเฟรมเวิร์กที่ปรับปรุงโครงสร้างการทำงานของ AI โดยไม่ฝึกโมเดลใหม่

DarwinX มุ่งเปลี่ยน ‘ฮาร์เนส’ ซึ่งหมายถึงโครงสร้างการทำงานที่จัดให้โมเดล AI ใช้พรอมต์ เครื่องมือ หน่วยความจำ ทักษะ และลำดับการควบคุมเพื่อทำงานจริง

DarwinX ไม่ได้พัฒนาเส้นทางเดียวซ้ำ ๆ แต่รักษาฮาร์เนสหลายรูปแบบไว้พร้อมกัน ระบบจะเก็บรูปแบบที่แก้โจทย์ใหม่ได้โดยไม่ทำให้งานเดิมเสียหายอย่างมาก และรวมความสามารถจากรูปแบบที่แตกต่างกัน

การปรับปรุงที่ชัดเจนที่สุดปรากฏในการประเมิน WebArena-Infinity เมื่อใช้โมเดล GPT-5.5 เดียวกัน ค่า pass@1 หลังการตรวจสอบของฮาร์เนสพื้นฐานอยู่ที่ 43.5% ขณะที่ฮาร์เนสที่ใช้ DarwinX ทำได้ 93.0%

pass@1 คือสัดส่วนงานที่ทำสำเร็จภายในความพยายามครั้งเดียว จากงานบนเว็บจริงทั้งหมด 1260 งาน จำนวนงานที่สำเร็จเพิ่มจาก 548 งานด้วยฮาร์เนสพื้นฐานเป็น 1171 งานหลังใช้ DarwinX

การตรวจสอบยังครอบคลุมความถูกต้องตามข้อกำหนดของกระบวนการทำงานด้วย จำนวนเส้นทางการทำงานที่ไม่ถูกต้องลดลงจาก 293 รายการด้วยฮาร์เนสพื้นฐานเหลือ 17 รายการหลังใช้ DarwinX และงานวิจัยระบุว่ารูปแบบที่เข้าถึงพื้นที่ประเมินหรือโฮสต์ที่มีสิทธิ์พิเศษหายไป

อย่างไรก็ตาม การตรวจสอบดังกล่าวใช้กับเส้นทางการทำงานที่นักวิจัยสร้างขึ้นเท่านั้น เนื่องจากไม่ได้ใช้การตรวจสอบแบบเดียวกันกับคู่เปรียบเทียบภายนอก จึงไม่ควรเปรียบเทียบตัวเลขประสิทธิภาพโดยตรงในแง่ความปลอดภัย

ผลการปรับปรุงยังปรากฏในการประเมินอื่นด้วย โดยประสิทธิภาพบน Terminal-Bench 2.1 เมื่อใช้ GPT-5.5 เพิ่มจาก 75.5% เป็น 83.2% ส่วน GPT-5.6 Sol ทำได้ 84.7%

สำหรับ TerminalWorld ซึ่งเป็นงานที่อยู่ระหว่างการระงับแยกต่างหาก ระบบแก้โจทย์ได้ 28 จาก 41 งาน ขณะที่การนำฮาร์เนสที่พัฒนาบน Terminal-Bench 2.1 ไปใช้กับ SWE-bench Verified โดยไม่แก้ไขเพิ่มเติม ให้ผลลัพธ์ 84.2%

นักวิจัยระบุว่า หากพัฒนาฮาร์เนสเดียวไปตามเส้นทางเดียว ประสิทธิภาพของงานบางประเภทอาจเพิ่มขึ้น แต่ทำให้งานประเภทอื่นถดถอยได้ วิธีการของ DarwinX ที่รักษาหลายสายวิวัฒนาการไว้พร้อมกันจึงมุ่งลดความเอนเอียงของประสิทธิภาพดังกล่าว

การประเมินใช้ตัวตรวจสอบของแต่ละเบนช์มาร์ก โดยเปรียบเทียบประสิทธิภาพของฮาร์เนสจากผลการตรวจสอบรายงาน แทนการพึ่งพาเฉลยแยกต่างหากหรือรูปแบบที่นักวิจัยคัดเลือกให้เป็นผู้ชนะ

งานวิจัยนี้สะท้อนแนวโน้มการปรับปรุงประสิทธิภาพโดยไม่เปลี่ยนพารามิเตอร์ของโมเดล เช่นเดียวกับงานวิจัย WikiSkills ที่สะสมประสบการณ์การทำงานของ AI Agent เป็นความรู้เพื่อเพิ่มประสิทธิภาพ หาก WikiSkills เปลี่ยนร่องรอยของความสำเร็จและความล้มเหลวให้เป็นโครงสร้างความรู้ DarwinX ก็พัฒนาโครงสร้างการทำงานเอง ซึ่งรวมถึงการใช้พรอมต์ เครื่องมือ และลำดับการควบคุม

อย่างไรก็ตาม กรณีที่ตัวชี้วัดทางธุรกิจของ Agentforce นำเสนอเป็นรายได้ประจำต่อปีแทนรายได้รายไตรมาส แสดงให้เห็นว่าผลลัพธ์ด้านการวิจัยและผลลัพธ์ด้านการค้าควรพิจารณาแยกจากกัน

งานวิจัยนี้เป็นผลลัพธ์ในระยะการวิจัย และไม่ได้ระบุถึงการนำไปใช้งานในผลิตภัณฑ์จริงหรือผลต่อรายได้ นอกจากนี้ ยังไม่ได้แยกผล贡献ของการนำฮาร์เนสมารวมกันออกจากการกลายพันธุ์ของสายวิวัฒนาการเดียวด้วยการทดลองควบคุม จึงจำเป็นต้องตรวจสอบเพิ่มเติมถึงการทำซ้ำผลลัพธ์ในสภาพแวดล้อมบริการจริงและต้นทุนการดำเนินงาน

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1