Grok 4.7 และ Xiaomi MiMo-V2.6-Pro ได้คะแนน 56 เท่ากันและครองอันดับหนึ่งร่วมกันใน Cyber Index โดยมีต้นทุนต่อภารกิจประเมินอยู่ที่ 11.67 ดอลลาร์ (ประมาณ 15,738 วอน) สำหรับ Grok 4.7 และ 0.18 ดอลลาร์ (ประมาณ 243 วอน) สำหรับ MiMo-V2.6-Pro
Artificial Analysis ระบุการตั้งค่าของ Grok 4.7 บนหน้าผลประเมินว่าเป็น ‘xhigh’ ส่วน GPT-6 Luna ตามมาเป็นอันดับถัดไปด้วยคะแนน 53 คะแนน ทั้งนี้ อันดับหนึ่งในพาดหัวต้นฉบับหมายถึงการครองอันดับร่วม ไม่ใช่อันดับหนึ่งเพียงรายเดียว
Cyber Index ประเมินงานป้องกันไซเบอร์โดยให้ค้นหาช่องโหว่ในคลังซอฟต์แวร์จริง ทำซ้ำและตรวจสอบช่องโหว่ แล้วแก้ไขโดยไม่กระทบการทำงานเดิม Artificial Analysis อธิบายว่า คะแนนมาจากการรวมผลการประเมิน CWE-Bench-AA, DeepsecBench-AA และ CyberGym-E2E-AA ในสัดส่วนเท่ากัน การพัฒนาชุดโจมตีเพื่อใช้ประโยชน์จากช่องโหว่ไม่อยู่ในขอบเขตการประเมิน
Artificial Analysis ระบุด้วยว่า การประเมินทั้งสามชุดครอบคลุมงานที่แตกต่างกัน เช่น การตรวจสอบและแก้ไขช่องโหว่ การค้นหาช่องโหว่ ตลอดจนการค้นหา ทำซ้ำ และแก้ไขปัญหาความปลอดภัยของหน่วยความจำ คะแนน 56 จึงเป็นผลรวมจากงานป้องกันหลายประเภท และไม่ได้หมายความว่าโมเดลจะทำได้ในระดับเดียวกันกับฐานโค้ดหรือขั้นตอนรักษาความปลอดภัยของทุกบริษัท
แม้ทั้งสองโมเดลจะได้คะแนนรวมสูงสุดร่วมกัน แต่ต้นทุนต่อภารกิจต่างกันมาก ต้นทุนที่ Artificial Analysis เผยแพร่เป็นค่าเฉลี่ยของงานในเกณฑ์มาตรฐานนี้ ส่วนต้นทุนจริงในสภาพแวดล้อมของแต่ละบริษัทอาจเปลี่ยนแปลงตามประเภทงานและปริมาณการใช้งาน
บริษัทที่นำโมเดล AI มาใช้กับงานรักษาความปลอดภัยควรพิจารณาทั้งผลลัพธ์ในงานที่จำเป็นและต้นทุน ควบคู่กับอันดับโดยรวม การประเมินครั้งนี้ไม่ได้ครอบคลุมความสะดวกในการผสานระบบ ความเสถียรในการดำเนินงาน หรือผลที่เกิดขึ้นจริงหลังนำไปใช้
ก่อนหน้านี้มีรายงานว่า Grok 4.7 ตามหลัง Claude ในเกณฑ์มาตรฐานอีกชุดหนึ่ง ซึ่งใช้ตัวชี้วัดคนละด้านกับการประเมินงานป้องกันครั้งนี้ นอกจากนี้ยังมีรายงานเกี่ยวกับการเปิดตัว MiMo-V2.6 Series ของ Xiaomi และคำกล่าวอ้างด้านประสิทธิภาพของโมเดลโอเพนซอร์ส
ความคิดเห็น 0