เอ็นวิเดีย(NVDA) เสนอแนวทางใหม่ในการประเมิน 'ทักษะ' (skill) ที่ป้อนให้เอเจนต์ปัญญาประดิษฐ์ (AI) โดยชี้ว่าควรวัดจาก 'ผลการทำงานจริง' ไม่ใช่แค่คุณภาพของเอกสารประกอบ ทีมวิจัยวิเคราะห์ทักษะจริง 145 รายการและการรันแบบจับคู่ (paired execution) รวม 947 ครั้ง เพื่อวัดว่าแต่ละทักษะช่วยให้เอเจนต์ทำงานสำเร็จมากขึ้นแค่ไหน
ทีมวิจัยของเอ็นวิเดียเผยแพร่ผลการศึกษานี้ในรูปแบบเปเปอร์บน arXiv เมื่อวันที่ 20 (เวลาท้องถิ่น) ภายใต้ชื่อ 'Evaluating Skills, Not Just Agents' โดยแนะนำวิธีการที่เรียกว่า ACES (Agentic Continuous Evaluation of Skills) ซึ่งจะรันงานเดียวกันสองครั้ง ครั้งหนึ่งเปิดใช้ทักษะและอีกครั้งปิดการใช้ทักษะ แล้ววัดผลต่างที่เกิดขึ้นเป็นค่าที่เรียกว่า 'Skill Lift'
เปเปอร์ระบุว่าค่าสหสัมพันธ์ระหว่างคะแนนจากการตรวจโครงสร้างแบบสถิต (static) กับคะแนนที่ตัดสินโดย LLM อยู่ที่เพียง Spearman ρ=0.14 เท่านั้น ขณะที่ในเงื่อนไขเดียวกัน ค่าเฉลี่ย composite Skill Lift อยู่ที่ 0.2134 และสัดส่วนของกรณีที่ได้ค่า lift เป็นบวกอยู่ที่ 72.8%
ทีมวิจัยอธิบายว่า Skill Lift ไม่ใช่ตัวชี้วัดประสิทธิภาพแบบสัมบูรณ์ แต่เป็นผลบวกสุทธิที่เพิ่มขึ้นจากการเปิดใช้ทักษะภายใต้เงื่อนไขเดียวกัน ค่านี้จึงเปลี่ยนแปลงได้ตามการกระจายของงาน โมเดลที่ใช้ เครื่องมือประเมิน (harness) พื้นที่ทำงาน (workspace) และตัวให้คะแนน (scorer) ที่แตกต่างกัน
ใจความสำคัญของงานวิจัยนี้คือการมอง 'ทักษะ' ไม่ใช่แค่คู่มือใช้งาน แต่เป็นชิ้นส่วนที่เอเจนต์นำไปใช้งานได้จริง เปเปอร์อธิบายว่าทักษะหนึ่งชุดประกอบด้วยไฟล์ SKILL.md สคริปต์เสริม (ถ้ามี) เอกสารอ้างอิง และตัวอย่างการใช้งาน
โครงสร้างนี้ตั้งอยู่บนแนวคิด progressive disclosure คือเอเจนต์จะเรียกอ่านเฉพาะข้อมูลที่จำเป็นเมื่อต้องใช้เท่านั้น ยิ่งคลังทักษะ (skill catalog) มีขนาดใหญ่ขึ้นเท่าไหร่ การเรียกใช้เฉพาะคำแนะนำที่จำเป็นก็ยิ่งสำคัญกว่าการอ่านคำสั่งทั้งหมดพร้อมกัน
การตรวจสอบแบบเดิมมีจุดแข็งในการเช็กรูปแบบไฟล์ ข้อมูล frontmatter ไวยากรณ์สคริปต์ และรูปแบบที่เกี่ยวข้องกับความปลอดภัย แต่กลับตอบไม่ได้ว่าเอเจนต์ตัวจริงจะ 'ค้นเจอ' ทักษะนั้นหรือไม่ ใส่ค่าพารามิเตอร์ถูกต้องหรือไม่ และทำงานจนจบหรือไม่
ACES จึงเป็นแนวทางที่พยายามปิดช่องว่างนี้ด้วยการรันเปรียบเทียบแบบ A/B สด โดยเน้นดูว่าในกระบวนการทำงานจริง ทักษะนั้นถูกค้นพบ ถูกเรียกใช้ และถูกทำจนสำเร็จหรือไม่ มากกว่าจะดูว่าเอกสารประกอบเขียนไว้ดีแค่ไหน
บล็อกเทคโนโลยีของเอ็นวิเดียยังเปิดตัวเครื่องมือ SkillEvaluator เป็นเครื่องมือประเมินแบบเปิด โดยระบุว่าได้ทดสอบกับทักษะที่ผ่านการตรวจสอบแล้ว (verified skills) มากกว่า 300 รายการ และผลิตภัณฑ์มากกว่า 30 รายการ ผ่านการประเมิน 3 ระดับ พบว่าคะแนนเฉลี่ยในด้าน Correctness, Discoverability, Effectiveness และ Efficiency เพิ่มขึ้น 31 คะแนน และเพิ่มขึ้น 39 คะแนนหากไม่นับด้าน Security
ตัวเลขชุดนี้มีขอบเขตต่างจากการทดลองในเปเปอร์ที่ใช้ทักษะ 145 รายการ กล่าวคือเปเปอร์เน้นอธิบายกรอบวิธีการ ACES และแนวคิด Skill Lift ส่วนบล็อกนำเสนอผลทดลองที่ใกล้เคียงกับการวัดผลระดับผลิตภัณฑ์ในคลังทักษะจริงมากกว่า
เอกสารของ SkillEvaluator อธิบายว่าเครื่องมือนี้เป็นเฟรมเวิร์กแบบโอเพนซอร์สหลายระดับ โดย Tier 1 คือการตรวจสอบแบบสถิต Tier 2 คือการเช็กความซ้ำซ้อนและความคล้ายคลึงกัน และ Tier 3 คือการประเมินแบบสดกับเอเจนต์จริง
ที่เก็บโค้ดบน GitHub ของโครงการยังระบุว่า SkillEvaluator ครอบคลุมทั้งการตั้งเกณฑ์คุณภาพ (quality gate) การตรวจจับความซ้ำซ้อนเชิงความหมาย การสร้างชุดข้อมูลประเมินสังเคราะห์ และการประเมินเอเจนต์แบบสด สะท้อนว่าการตรวจสอบทักษะกำลังขยายออกจากระดับตรวจเอกสารทั่วไป ไปสู่การเป็นขั้นตอนหนึ่งในไปป์ไลน์การนำไปใช้งานจริง
ในบล็อกดังกล่าว เอ็นวิเดียยังกล่าวถึงปลั๊กอินสำหรับ Claude Code, Codex และ Cursor ซึ่งบ่งชี้ว่างานวิจัยชิ้นนี้ไม่ได้หยุดอยู่แค่ข้อเสนอเชิงทฤษฎี แต่เชื่อมโยงกับการใช้งานและตรวจสอบทักษะจริงในไปป์ไลน์การพัฒนา
ทิศทางนี้สอดคล้องกับกระแสการขยายตัวของ AI ระดับองค์กรของเอ็นวิเดียที่ TokenPost เคยนำเสนอไปก่อนหน้านี้ เนื่องจาก AI สำหรับองค์กรกำลังขยายขอบเขตจากตัวโมเดลเพียงอย่างเดียว ไปสู่โครงสร้างพื้นฐานด้านการปฏิบัติงานที่รวมเครื่องมือ ทักษะ และระบบประเมินผลเข้าไว้ด้วยกัน
อย่างไรก็ตาม อุปสรรคในการนำไปใช้จริงยังคงมีอยู่ เอกสารของ SkillEvaluator ระบุระดับการสนับสนุนไว้ว่าเป็น 'Experimental' อาศัยความร่วมมือจากชุมชนแบบ best-effort และไม่มีข้อตกลงระดับบริการ (no SLA) ในสภาพแวดล้อมการใช้งานจริง ผู้ใช้จึงต้องพิจารณาเรื่องความสามารถในการทำซ้ำผลลัพธ์ ความผันผวนระหว่างการรันแต่ละครั้ง และต้นทุนการประเมินไปพร้อมกัน
การเปิดเผยครั้งนี้ไม่ได้เชื่อมโยงโดยตรงกับตลาดคริปโทเคอร์เรนซี แต่มีนัยสำคัญในฐานะข่าวด้านโครงสร้างพื้นฐาน AI ที่เกี่ยวข้องกับการดูแลเอเจนต์ ทูลเชน และคลังทักษะ เกณฑ์การประเมินทักษะกำลังเปลี่ยนจาก 'เอกสารที่เขียนไว้ดี' ไปสู่ 'หน่วยการทำงานที่ทำงานจนสำเร็จได้จริง'
ความคิดเห็น 0