Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

21 จาก 24 ชุดทดสอบทำผลงานสูงสุดหรือร่วมสูงสุด นักวิจัย Google เสนอ Procedural Graphs

การจัดโครงสร้างขั้นตอนการทำงานของเอเจนต์ปัญญาประดิษฐ์แบบจำลองภาษาขนาดใหญ่ (LLM) เป็นกราฟ อาจช่วยเพิ่มประสิทธิภาพงานระยะยาวได้ โดยผลการวิจัยพบว่าแนวทางดังกล่าวทำผลงานสูงสุดหรือร่วมสูงสุดใน 21 จาก 24 ชุดการทดสอบโมเดลและเบนช์มาร์ก

Yuxing Lu, Yicheng Chen, Shanchan Wu และ Sercan Ö. Arık เผยแพร่ข้อเสนอ ‘Procedural Graphs: A Self-Evolving Execution Structure for LLM Agents’ บน arXiv เมื่อวันที่ 8 กันยายน งานวิจัยมีนักวิจัยจาก Google และแวดวงวิชาการเข้าร่วม แต่ยังไม่มีประกาศอย่างเป็นทางการจาก Google เกี่ยวกับการนำไปใช้กับผลิตภัณฑ์หรือกำหนดการเชิงพาณิชย์

โครงสร้างความรู้ด้านขั้นตอน

Procedural Graphs แสดงลำดับและเงื่อนไขของงานในรูปแบบ ‘ขั้นตอน-ความสัมพันธ์-ขั้นตอน’ คล้ายกับที่กราฟความรู้จัดเก็บข้อเท็จจริงในรูปแบบ ‘เอนทิตี-ความสัมพันธ์-เอนทิตี’ โหนดใช้แทนการเรียกใช้เครื่องมือ ขั้นตอนการอนุมาน และสถานะของงาน ส่วนเส้นเชื่อมบันทึกเงื่อนไขการเปลี่ยนผ่าน คำแนะนำการทำงาน และข้อผิดพลาดที่ควรหลีกเลี่ยง

ระหว่างทำงาน เอเจนต์จะค้นหาตำแหน่งปัจจุบันบนกราฟและส่งโครงสร้างในขอบเขต 2 ขั้นรอบข้างให้โมเดล guidance โมเดลดังกล่าวจะแปลงข้อมูลเป็นคำแนะนำที่สอดคล้องกับสถานการณ์ แล้วส่งต่อให้ solver แต่ไม่ได้บังคับการกระทำขั้นสุดท้าย นักวิจัยระบุว่าแนวทางนี้ออกแบบมาเพื่อรักษาทั้งการอนุมานอย่างอิสระและการควบคุมตามขั้นตอน

กราฟสามารถปรับแก้ตัวเองตามผลลัพธ์การทำงาน โดย refiner ที่ใช้ LLM จะเปรียบเทียบงานที่สำเร็จและล้มเหลวเพื่อเสนอการเปลี่ยนแปลงโหนดและเส้นเชื่อม จากนั้นจะนำการเปลี่ยนแปลงไปใช้ก็ต่อเมื่อประสิทธิภาพในชุดตรวจสอบยังคงเดิมหรือดีขึ้นเท่านั้น ข้อเสนอที่ไม่ได้รับการยอมรับจะถูกบันทึกเป็นข้อมูลเชิงลบ เพื่อป้องกันการเสนอการแก้ไขแบบเดิมซ้ำ

แนวทางนี้สอดคล้องกับกระแสที่การแข่งขันด้านเอเจนต์ AI กำลังเปลี่ยนจากประสิทธิภาพของโมเดลไปสู่ระบบขององค์กร ตามที่ TokenPost รายงานก่อนหน้านี้ เนื่องจากมุ่งลดข้อผิดพลาดในงานระยะยาวด้วยการจัดระเบียบโครงสร้างการทำงานภายนอก แทนการฝึกโมเดลใหม่

ทำผลงานสูงสุดหรือร่วมสูงสุด 21 จาก 24 ชุด

นักวิจัยประเมิน 7 เบนช์มาร์ก ได้แก่ HotpotQA, MultiChallenge, GDPval, ALFWorld, τ-bench, BFCL v3 และ EnterpriseArena ร่วมกับ LLM 4 รุ่น ได้แก่ Claude Sonnet 4.6, Gemini 3.1 Pro, Gemini 3.5 Flash และ Grok 4.1 Fast

Procedural Graphs ทำผลงานสูงสุดหรือร่วมสูงสุดใน 21 จาก 24 ชุดการทดสอบโมเดลและเบนช์มาร์ก อย่างไรก็ตาม ระดับการปรับปรุงไม่เท่ากันในทุกงาน และความแตกต่างของประสิทธิภาพในบางงานตอบคำถามยังมีจำกัด

ใน EnterpriseArena ซึ่งใช้ประเมินงานระยะยาว อัตราการอยู่รอดโดยรวมของ Gemini 3.1 Pro เพิ่มจาก 6% ในวิธีเดิมเป็น 34% หลังใช้กราฟ หรือเพิ่มขึ้น 28 จุดเปอร์เซ็นต์ EnterpriseArena เป็นการจำลองที่เอเจนต์ต้องตัดสินใจด้านการเงินขององค์กรในระยะยาว โดยการจัดหาเงินทุนใช้เวลา 1-6 เดือนจึงสะท้อนผลจริง และสภาพแวดล้อมยังครอบคลุมการรับมือวิกฤตเศรษฐกิจหลายครั้ง

ในสภาพแวดล้อมดังกล่าว ผลลัพธ์ไม่ได้ขึ้นอยู่เพียงความสามารถในการตอบคำถามแต่ละข้อ แต่ยังรวมถึงความสามารถในการรักษาการตัดสินใจและเงื่อนไขการทำงานก่อนหน้าเป็นเวลานาน Procedural Graphs จึงจัดโครงสร้างขั้นตอนและเงื่อนไขจากก่อนหน้า เพื่อใช้ประกอบการเลือกการกระทำถัดไป

ในการทดลองการพัฒนาตัวเอง อัตราการอยู่รอดในชุดตรวจสอบเพิ่มจาก 0% เป็น 90% ขณะที่อัตราการอยู่รอดในชุดทดสอบของกราฟสุดท้ายอยู่ที่ 85% นักวิจัยระบุว่าการทดลองอาศัย 20 ตอนต่อแต่ละการแบ่งชุดข้อมูล ทำให้การตัดสินใจยอมรับการเปลี่ยนแปลงแต่ละรายการอาจขึ้นอยู่กับเพียงหนึ่งหรือสองตอน

ความคิดเห็นที่เปิดเผยต่อสาธารณะจนถึงขณะนี้มาจากบันทึกการวิจัยอิสระและบทสรุปงานวิจัยเป็นหลัก ฝ่ายหนึ่งมองว่า Procedural Graphs ช่วยตรวจสอบการกระทำถัดไปได้ง่ายกว่าบันทึกการสนทนาหรือความจำในรูปข้อความ ขณะที่อีกฝ่ายชี้ว่าการยอมรับอัตโนมัติโดยอาศัยชุดตรวจสอบเพียงอย่างเดียว ยังไม่อาจรับประกันได้ว่าเงื่อนไขในกราฟจะถูกต้องในสภาพแวดล้อมจริง

ยังไม่พบการนำ Procedural Graphs ไปใช้กับผลิตภัณฑ์อย่างเป็นทางการของ Google การนำไปใช้โดยลูกค้าองค์กร หรือการเปิดตัวบริการที่เกี่ยวข้อง นอกจากนี้ งานวิจัยยังไม่ได้เสนอความเชื่อมโยงโดยตรงกับอุตสาหกรรมสินทรัพย์ดิจิทัลหรือบล็อกเชน

งานวิจัยนี้อ้างอิงพรีพรินต์บน arXiv ไม่ใช่บทความในวารสารวิชาการที่ผ่านการประเมินโดยผู้ทรงคุณวุฒิหรือผลการทำซ้ำจากสถาบันอิสระ จึงควรตีความว่าเป็นผลที่แสดงให้เห็นถึงความเป็นไปได้ของความรู้ด้านขั้นตอนที่มีโครงสร้างในโมเดลและเบนช์มาร์กบางชุด

กระบวนการค้นหากราฟและการสร้างคำแนะนำจาก guidance ต้องใช้การอนุมานและโทเคนเพิ่มเติม แม้ความแม่นยำและอัตราการอยู่รอดระยะยาวจะเพิ่มขึ้น แต่ต้นทุนการดำเนินงานและเวลาแฝงอาจสูงขึ้น อีกทั้งยังต้องตรวจสอบความเสี่ยงจากการสะสมการแก้ไขกราฟที่ไม่ถูกต้อง

ผลการวิจัยชี้ว่า Procedural Graphs อาจช่วยลดปัญหาการทำงานระยะยาวของเอเจนต์ LLM ได้ แต่ความสามารถในการทำซ้ำในบริการจริงและผลกระทบในแต่ละอุตสาหกรรมยังเป็นประเด็นที่ต้องศึกษาเพิ่มเติม

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1