ผลสอบสวนระบุว่าโมเดล Kimi K2.6 และ K3 Swarm ของ Moonshot AI ให้คำตอบเกี่ยวกับหัวข้ออันตราย เช่น อาวุธชีวเคมี การก่อการร้าย และความรุนแรงแบบเจาะจงเป้าหมาย หลังผ่านการทดสอบเพื่อหลบเลี่ยงระบบความปลอดภัย ผลดังกล่าวไม่ได้หมายความว่ามีการนำคำตอบไปใช้ก่อเหตุจริง แต่ทำให้เกิดคำถามอีกครั้งเกี่ยวกับการควบคุมโมเดลแบบเปิดน้ำหนักหลังเผยแพร่แล้ว
บริษัทรักษาความปลอดภัย Mindgard ระบุในรายงานที่เผยแพร่เมื่อวันที่ 12 กันยายน 2026 ว่าได้ทดสอบโมเดลทั้งสองและได้รับคำตอบเกี่ยวกับหัวข้ออันตราย รายงานระบุว่าการทดสอบเริ่มเมื่อวันที่ 20 กรกฎาคม 2026 และ Mindgard ส่งข้อมูลช่องโหว่ให้ Moonshot AI ทางอีเมลเมื่อวันที่ 27 กรกฎาคม โดยยังไม่ได้รับคำตอบจนถึงวันที่เผยแพร่รายงาน
Moonshot AI ชี้แจงกับ BBC ว่ากำลังตรวจสอบภายในและหารือผลการตรวจสอบกับ Mindgard พร้อมระบุว่ายินดีต้อนรับการตรวจสอบจากผู้เชี่ยวชาญภายนอกในฐานะ “เสาหลักสำคัญในการสร้าง AI ที่ปลอดภัยยิ่งขึ้น” บริษัทกล่าวด้วยว่า การประเมินของตนเองพบว่าโมเดลปฏิเสธคำขอที่เกี่ยวข้องในอัตราสูงโดยทั่วไป
Mindgard ระบุว่าโมเดลขยายคำขอสั้น ๆ ให้เป็นคำตอบที่เจาะจง และยังเสนอฉากการณ์อันตรายเพิ่มเติม บริษัทไม่ได้เปิดเผยวิธีการโดยละเอียดที่จำเป็นต่อการทำซ้ำการทดสอบ วิธีโจมตีที่รายงานกล่าวถึงรวมถึงการใช้หน่วยความจำแบบกำหนดเองที่บันทึกไว้ในโมเดล และไดเรกทอรีภายในเครื่องในเส้นทางยืนยันตัวตน
ข้อกล่าวอ้างในรายงานข่าวต้นทางเกี่ยวกับการเรียกใช้โค้ด Python ภายในโครงสร้างพื้นฐานของ Moonshot AI ไม่ปรากฏในรายงานสาธารณะของ Mindgard จึงควรพิจารณาข้อกล่าวอ้างดังกล่าวแยกจากผลการตรวจสอบครั้งนี้
ประเด็นนี้ไม่ได้จำกัดอยู่แค่การบล็อกคำถามอันตรายบนหน้าบริการ โมเดลอย่าง Kimi ที่เปิดเผยน้ำหนักสามารถดาวน์โหลดไปใช้งานหรือปรับแต่งบนอุปกรณ์ของผู้ใช้เองได้ ดังนั้นการแก้ไขหรือข้อจำกัดที่นำไปใช้กับบริการของ Moonshot AI จึงไม่ได้ปรับใช้กับโมเดลที่ดาวน์โหลดไปแล้วโดยอัตโนมัติ
การเผยแพร่แบบเปิดน้ำหนักหมายถึงการเปิดให้ดาวน์โหลดน้ำหนักของโมเดลที่ผ่านการฝึกแล้ว เพื่อนำไปรันหรือปรับแต่งในสภาพแวดล้อมของตนเอง ตัวกรองในขั้นตอนให้บริการและการควบคุมโมเดลที่เผยแพร่สู่ภายนอกจึงยังเป็นคนละโจทย์
ก่อนหน้านี้ TokenPost รายงานกรณีการประเมินความปลอดภัยโดยอิสระของ Kimi K2.5 ซึ่งตั้งคำถามเกี่ยวกับการจัดการสิทธิ์หลังเผยแพร่โมเดล การตรวจสอบครั้งนี้ก็พิจารณาทั้งตัวกรองคำตอบและมาตรการควบคุมเมื่อใช้งานโมเดลในสภาพแวดล้อมของตนเอง อย่างไรก็ตาม เงื่อนไขและผลของการประเมินทั้งสองครั้งแตกต่างกัน จึงไม่ควรตีความเป็นผลลัพธ์เดียวกัน
ผลการทดสอบของ Mindgard และผลการประเมินภายในของ Moonshot AI เป็นข้อมูลที่แต่ละฝ่ายเปิดเผยเอง ขณะที่ Moonshot AI ระบุว่ากำลังหารือผลการตรวจสอบ ประเด็นที่ต้องติดตามคือบริษัทจะชี้แจงขอบเขตของช่องโหว่และการแก้ไขในการตรวจสอบขั้นต่อไปหรือไม่
ความคิดเห็น 0