Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

เปิดดัชนี Cyber Index v1 วัดความสามารถ AI รับมือช่องโหว่ตั้งแต่ค้นพบถึงแพตช์

มีการเปิดเผยดัชนีเปรียบเทียบความสามารถของโมเดลปัญญาประดิษฐ์ (AI) ในการรับมือช่องโหว่ด้านความปลอดภัยขององค์กร โดยประเมินตั้งแต่การค้นพบช่องโหว่ การตรวจสอบยืนยัน ไปจนถึงการออกแพตช์ เพื่อสะท้อนการทำงานด้านการป้องกันจริงมากขึ้น

อาร์ติฟิเชียล อะนาลิซิส (Artificial Analysis) เปิดตัว ‘Cyber Index v1’ เมื่อวันที่ 25 ซึ่งเป็นดัชนีประเมินความสามารถด้านความปลอดภัยขององค์กร โดยมุ่งเน้นงานป้องกัน เช่น การจัดการช่องโหว่และการออกแพตช์ มากกว่าความสามารถในการโจมตี

Cyber Index เป็นดัชนีที่รวมผลการประเมิน 3 รายการ ได้แก่ CWE-Bench-AA, DeepsecBench-AA และ CyberGym-E2E-AA โดยพิจารณาว่า AI สามารถค้นหาช่องโหว่ ตรวจสอบว่าสามารถทำซ้ำได้หรือไม่ และแก้ไขปัญหาโดยไม่ทำให้ฟังก์ชันเดิมเสียหายได้หรือไม่

คะแนนยังสะท้อนว่า AI สามารถแก้ไขปัญหาได้โดยยังรักษาการทำงานปกติไว้หรือไม่ วิธีดังกล่าวมุ่งประเมินทั้งผลบวกลวงที่อาจเกิดขึ้นในงานความปลอดภัย และผลกระทบที่อาจเกิดขึ้นหลังติดตั้งแพตช์

◇ ประเมินตั้งแต่ค้นพบช่องโหว่ถึงออกแพตช์

CWE-Bench เป็นการประเมินเอเจนต์เขียนโค้ดเชิงป้องกัน โดยให้ตรวจสอบและออกแพตช์ช่องโหว่ในคลังซอฟต์แวร์โอเพนซอร์สจริง ข้อมูลที่เปิดเผยล่าสุดประกอบด้วยโจทย์ตรวจสอบและออกแพตช์ที่ไม่เปิดเผย 120 รายการ และประเภทช่องโหว่ตาม CWE จำนวน 73 ประเภท พร้อมใช้การตรวจสอบโปรแกรมและคณะผู้ประเมินจากเอเจนต์ 3 ราย

CWE เป็นระบบจัดประเภทช่องโหว่ซอฟต์แวร์ ใน CWE-Bench การจะได้รับคะแนนต้องป้องกันช่องโหว่ได้พร้อมกับผ่านการทดสอบการถดถอยเดิม ดังนั้นการออกแพตช์ที่เพียงลบข้อผิดพลาดจึงยังไม่เพียงพอ

CyberGym-E2E ประเมินงานตั้งแต่การค้นพบช่องโหว่ การสร้างหลักฐานยืนยันแนวคิด ไปจนถึงการเขียนแพตช์ งานวิจัยระบุว่าการประเมินนี้ออกแบบจากช่องโหว่จริง 920 รายการในโครงการโอเพนซอร์ส 139 โครงการ

หอสังเกตการณ์อย่างเป็นทางการของ CyberGym ยังแบ่งวงจรชีวิตช่องโหว่ออกเป็นขั้นตอนต่าง ๆ เช่น การค้นพบ การทำซ้ำ และการออกแพตช์ เพื่อประเมินความสามารถของ AI อย่างไรก็ตาม CyberGym และ CyberGym-E2E ถูกนำเสนอเป็นเบนช์มาร์กแยกกัน จึงยังไม่อาจสรุปจากคำอธิบายของหอสังเกตการณ์ CyberGym เพียงอย่างเดียวว่า Cyber Index รวมการประเมินดังกล่าวไว้โดยตรง

◇ ขอบเขตข้อมูลและความสามารถในการเปรียบเทียบ

อาร์ติฟิเชียล อะนาลิซิสเคยดำเนินการ Capability Index สำหรับสาขาต่าง ๆ เช่น การเงิน กฎหมาย และการแพทย์ ขณะที่ Intelligence Index ซึ่งวัดประสิทธิภาพ AI ทั่วไปก็ใช้วิธีรวมผลการประเมินย่อยหลายรายการ โดยองค์ประกอบและวิธีการประเมินอาจเปลี่ยนแปลงไปตามแต่ละเวอร์ชัน

สำหรับดัชนีครั้งนี้ ความเป็นอิสระของชุดทดสอบ การเก็บรักษาการทดสอบแบบไม่เปิดเผย และน้ำหนักของการประเมินแต่ละรายการ ล้วนมีผลต่อความสามารถในการเปรียบเทียบระหว่างโมเดล โดยเฉพาะเมื่อดูเพียงคะแนนรวมและอันดับ จะยังไม่ทราบชัดว่าความสามารถในการค้นพบช่องโหว่หรือคุณภาพของแพตช์มีผลต่อผลลัพธ์มากกว่ากัน

การค้นหาข้อมูลสาธารณะยังไม่พบคะแนนรายโมเดล อันดับรวม และค่าใช้จ่ายในการประเมินของ Cyber Index อย่างชัดเจน จึงมีความเห็นว่าต้องเปิดเผยวิธีการโดยละเอียดและขั้นตอนการทำซ้ำเพิ่มเติม ก่อนที่ดัชนีนี้จะถูกใช้เป็นเกณฑ์สำหรับการนำไปใช้ด้านความปลอดภัยขององค์กร

ปฏิกิริยาที่เป็นรูปธรรมจากตลาดและอุตสาหกรรมยังมีจำกัด คำอธิบายที่เปิดเผยในปัจจุบันยังทำให้เปรียบเทียบขอบเขตของการประเมินเชิงโจมตีและเชิงป้องกัน รวมถึงสัดส่วนของการประเมินทั้ง 3 รายการได้ยาก

ในภาคปฏิบัติด้านความปลอดภัยขององค์กร สิ่งสำคัญไม่ใช่เพียงจำนวนช่องโหว่ที่ค้นพบ แต่รวมถึงการที่โค้ดซึ่งแก้ไขแล้วต้องรักษาการทำงานของบริการเดิมไว้ด้วย ด้วยเหตุนี้ Cyber Index จึงแตกต่างจากดัชนีวัดประสิทธิภาพ AI แบบเดิม เพราะประเมินกระบวนการที่เชื่อมโยงการค้นพบ การตรวจสอบ และการออกแพตช์เข้าด้วยกัน

หากการตรวจจับและออกแพตช์ช่องโหว่ด้วย AI ขยายตัวมากขึ้น กระบวนการตรวจสอบโดยมนุษย์และการจัดการสิทธิ์การเข้าถึงก็จำเป็นต้องได้รับการพิจารณาควบคู่กัน ท่ามกลางการหารือเกี่ยวกับการใช้ AI ด้านความปลอดภัยและความสามารถในการป้องกันอย่างต่อเนื่อง ดัชนีนี้ถือเป็นกรณีที่นำ AI มาประเมินในฐานะเครื่องมือป้องกัน มากกว่าจะเป็นเครื่องมือโจมตี

จะต้องติดตามว่าอาร์ติฟิเชียล อะนาลิซิสจะเปิดเผยคะแนนโดยละเอียดและวิธีการประเมินเพิ่มเติมหรือไม่ รวมถึง Cyber Index จะถูกนำไปใช้เป็นเกณฑ์เปรียบเทียบจริงในกระบวนการนำระบบความปลอดภัยขององค์กรมาใช้หรือไม่

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1