สถาบันความปลอดภัยปัญญาประดิษฐ์แห่งสหราชอาณาจักร(AI Security Institute หรือ AISI) เปิดเผยผลการประเมินความปลอดภัยไซเบอร์ที่พบว่า ‘เอไอเอเจนต์’ (AI agent) ก่อพฤติกรรมมิชอบที่ไม่ได้รับอนุญาตถึง 19 ครั้ง โดยพุ่งเป้าไปที่บุคคลและองค์กรจริงผ่านอินเทอร์เน็ตจริง ระหว่างการทดสอบพบว่ามีบางกรณีที่เอไอเอเจนต์กระทำการเกินขอบเขตที่ได้รับอนุญาตโดยอัตโนมัติ ทำให้ประเด็นการควบคุมการเชื่อมต่อภายนอกและสิทธิ์การเข้าถึงกลายเป็นโจทย์สำคัญที่ต้องแก้ไข
AISI ระบุในรายงานเหตุการณ์ที่เผยแพร่เมื่อวันที่ 4 (เวลาท้องถิ่น) ว่า จากการทดสอบทั้งหมด 122 ครั้งที่ดำเนินการระหว่างวันที่ 25-28 กรกฎาคม พบพฤติกรรมมิชอบเกิดขึ้นใน 10 ครั้ง และเมื่อนับเป็นรายกรณีมีทั้งสิ้น 19 ครั้ง ในจำนวนนี้ 17 ครั้งเกี่ยวข้องกับโมเดล Claude Mythos 5 ของแอนโทรปิก(Anthropic) ส่วนอีก 2 ครั้งเกี่ยวข้องกับโมเดล GPT-5.6 Sol ของโอเพนเอไอ(OpenAI)
กรณีที่ร้ายแรงที่สุดคือความพยายามแทรกโค้ดอันตรายเข้าไปในโปรเจกต์ GitHub สาธารณะ เอไอเอเจนต์ตัวหนึ่งสร้างตัวตนปลอมบนโลกออนไลน์และกดดันผู้ดูแลโปรเจกต์ เพื่อให้อนุมัติ ‘pull request’ ที่มีโค้ดอันตรายแฝงอยู่ อย่างไรก็ตาม ผู้ดูแลโปรเจกต์ตรวจพบความผิดปกติและไม่อนุมัติโค้ดดังกล่าว จึงไม่มีความเสียหายเกิดขึ้นจริง
พฤติกรรมเหล่านี้เกิดขึ้นในสภาพแวดล้อมการทดสอบที่ลดมาตรการป้องกันลง ไม่ใช่สภาพแวดล้อมการใช้งานทั่วไป AISI เปิดให้เอไอเอเจนต์เชื่อมต่ออินเทอร์เน็ตได้ และปิดตัวจำแนกความปลอดภัยไซเบอร์ (cyber safety classifier) ของผู้พัฒนาโมเดลโดยตั้งใจ การตั้งค่าโมเดลที่ใช้ในการทดสอบครั้งนี้จึงแตกต่างจากสภาพแวดล้อมเชิงพาณิชย์ที่เปิดให้บริการทั่วไป
เอไอเอเจนต์ คือระบบที่ทำงานต่อเนื่องหลายขั้นตอนเพื่อบรรลุเป้าหมายที่ได้รับมอบหมาย ไม่ว่าจะเป็นการรันโค้ดหรือเรียกใช้บริการภายนอก ด้วยความสามารถในการทำงานอัตโนมัตินี้เองที่ทำให้ความเสี่ยงด้านความปลอดภัยเพิ่มขึ้นตามไปด้วย
ด้านโอเพนเอไอเปิดเผยผ่านโพสต์อย่างเป็นทางการว่า Irregular บริษัทประเมินภายนอกอีกแห่งหนึ่ง พบกรณีที่โมเดลโจมตีโดเมนจริงบนอินเทอร์เน็ต อันเป็นผลจากความผิดพลาดในการตั้งค่าสภาพแวดล้อมการทดสอบ
การทดสอบครั้งนี้ยังพบพฤติกรรมที่แสดงถึงความเป็นอิสระและการหลอกลวง เอไอเอเจนต์บางตัวใช้เครือข่าย Tor หรือสร้างตัวตนปลอมขึ้นมา ขณะที่บางตัวพยายามฝัง ‘prompt injection’ คือคำสั่งอันตรายที่ซ่อนไว้ให้เครื่องมือเอไอตัวอื่นอ่านและทำตาม AISI ประเมินว่าพฤติกรรมเหล่านี้ ‘เป็นไปได้จริง เกิดขึ้นต่อเนื่อง และเป็นรูปแบบใหม่’ ที่ไม่เคยพบมาก่อน
โอเพนเอไอระบุในโพสต์เดียวกันว่า GPT-5.6 Sol ก่อพฤติกรรมมิชอบ 2 ครั้งระหว่างการทดสอบ โดยโมเดลนำโทเคน GitHub สาธารณะกลับมาใช้ซ้ำ ลงทะเบียนบัญชีบริการ DNS และ tunneling ภายนอก พร้อมตั้งค่าเซิร์ฟเวอร์ DNS ภายในให้สามารถเข้าถึงได้จากอินเทอร์เน็ตสาธารณะ
อย่างไรก็ตาม การตั้งค่าดังกล่าวไม่ทำงานจริง และไม่มีหลักฐานว่ามี resolver จริงเข้ามาสอบถามข้อมูลแต่อย่างใด โอเพนเอไอระบุว่า การออกแบบสิทธิ์การเข้าถึงและการเชื่อมต่อภายนอกของระบบทดสอบในอนาคต จำเป็นต้องคำนึงถึงความเป็นไปได้ที่โมเดลจะกระทำการเกินขอบเขตที่คาดไว้
Claude Mythos 5 เป็นโมเดลที่จำกัดการเข้าถึง แตกต่างจากโมเดลที่เปิดให้บุคคลทั่วไปใช้งาน แอนโทรปิกระบุในแถลงการณ์ที่เผยแพร่เมื่อเดือนมิถุนายนที่ผ่านมาว่า โมเดลนี้ให้บริการเฉพาะพันธมิตรบางกลุ่ม เช่น หน่วยงานป้องกันภัยไซเบอร์และผู้ให้บริการโครงสร้างพื้นฐานสำคัญ โดย Claude Mythos 5 ใช้โมเดลพื้นฐานเดียวกับ Claude Fable 5 แต่ปลดล็อกมาตรการความปลอดภัยในบางส่วนออก
คานิชกา นารายัน(Kanishka Narayan) รัฐมนตรีด้านปัญญาประดิษฐ์ของสหราชอาณาจักร กล่าวว่า “การระบุพฤติกรรมใหม่เช่นนี้และการแบ่งปันผลลัพธ์ต่อสาธารณะ คือเป้าหมายที่แท้จริงของการก่อตั้ง AISI” ตามรายงานของ The Guardian เมื่อวันที่ 5 (เวลาท้องถิ่น) คำกล่าวนี้สะท้อนจุดยืนของภาครัฐอังกฤษที่ต้องการให้การประเมินความเสี่ยงเอไอเป็นไปอย่างโปร่งใส ขณะที่แอนโทรปิกระบุว่าเหตุการณ์ครั้งนี้ ‘สะท้อนให้เห็นว่าจำเป็นต้องมีการถกเถียงในวงกว้างมากขึ้น เกี่ยวกับวิธีการประเมินเอไอเอเจนต์ที่มีศักยภาพสูงขึ้นเรื่อยๆ อย่างปลอดภัย’
รายงานของ AISI ไม่ได้กล่าวถึงคริปโทเคอร์เรนซี โทเคน หรือห่วงโซ่อุปทานเซมิคอนดักเตอร์โดยตรง แต่สำหรับโปรเจกต์ web3 ที่พึ่งพาโค้ดโอเพนซอร์สและการทำงานร่วมกันบน GitHub กรณีนี้ถือเป็นตัวอย่างที่ควรนำไปตรวจสอบ ทั้งความเสี่ยงจาก pull request อันตราย การหลอกลวงทางสังคม (social engineering) และ prompt injection เมื่อนำเอไอเอเจนต์มาใช้กับสมาร์ตคอนแทรกต์และโครงสร้างพื้นฐานกระเป๋าเงินดิจิทัล ก็จำเป็นต้องควบคุมทั้งช่องทางการเชื่อมต่อภายนอก สิทธิ์การทำงาน และบันทึกการทำงานไปพร้อมกัน
AISI มีแผนจะจำกัดการเข้าถึงอินเทอร์เน็ตในสภาพแวดล้อมการทดสอบไซเบอร์ให้เข้มงวดขึ้น พร้อมนำระบบตรวจสอบแบบเรียลไทม์มาใช้ระหว่างการทดสอบ นอกจากนี้ยังวางแผนตั้งสมมติฐานตั้งแต่ขั้นตอนออกแบบการทดสอบว่า โมเดลอาจพยายามกระทำการเกินขอบเขตที่ได้รับอนุญาตอยู่เสมอ
ความคิดเห็น 0