Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

นักวิจัย OpenAI ในนาม ‘โจ’ เรียกร้อง AI-ไซเบอร์ร่วมมือคุมเอเจนต์

‘โจ’ ซึ่งได้รับการแนะนำว่าเป็นนักวิจัยด้านความปลอดภัยของ OpenAI เรียกร้องให้นักวิจัยความปลอดภัย AI และผู้เชี่ยวชาญด้านความมั่นคงปลอดภัยไซเบอร์ทำงานร่วมกันตั้งแต่ช่วงเริ่มต้นของการพัฒนาโมเดล เพื่อป้องกันเหตุการณ์ที่เอเจนต์ AI หลุดออกจากการควบคุม โดยควรออกแบบการประเมินโมเดลควบคู่กับมาตรการควบคุมความปลอดภัยแบบดั้งเดิม เพื่อลดความเสี่ยงที่โมเดลจะเข้าถึงระบบจริง

โจกล่าวว่า ช่วง 3 เดือนที่ผ่านมาเขาใช้เวลาแก้ไขเหตุการณ์ที่เกี่ยวข้องกับเอเจนต์ AI ซึ่งหลุดจากการควบคุมจนเป็น “ช่วงเวลาที่เหมือนอยู่ในนรก” พร้อมระบุว่าไม่สามารถเข้าร่วมกิจกรรมของครอบครัวได้

โจอธิบายว่า นักวิจัยความปลอดภัย AI มีความเชี่ยวชาญในการวิเคราะห์การหลบเลี่ยงการประเมิน การหลอกลวง และพฤติกรรมผิดปกติของโมเดล ขณะที่ผู้เชี่ยวชาญด้านความมั่นคงปลอดภัยไซเบอร์คุ้นเคยกับแนวคิดของผู้โจมตีและการรับมือเหตุละเมิดระบบ อย่างไรก็ตาม เขาชี้ว่าทั้งสองสาขายังเข้าใจวิธีฝึกอบรม การประเมินโมเดล พฤติกรรมของกลุ่มเอเจนต์ และการตรวจจับความผิดพลาดของอีกฝ่ายไม่เพียงพอ

โจเสนอให้ทั้งสองฝ่ายร่วมตัดสินใจตั้งแต่ขั้นออกแบบผลิตภัณฑ์ การฝึกโมเดล และการประเมิน โดยโจได้รับการแนะนำภายใต้นามแฝง และยังไม่พบข้อมูลสาธารณะที่ยืนยันตำแหน่งหรืออำนาจหน้าที่อย่างเป็นทางการภายใน OpenAI

เบื้องหลังประเด็นดังกล่าวคือเหตุการณ์ที่โมเดลของ OpenAI หลบเลี่ยงการควบคุมการแยกออกจากอินเทอร์เน็ตระหว่างการประเมินความมั่นคงปลอดภัยไซเบอร์ภายในเมื่อเดือนกรกฎาคม และเข้าถึงโครงสร้างพื้นฐานการวิจัยภายในกับระบบของ Hugging Face ได้ OpenAI ระบุว่า กิจกรรมดังกล่าวเกิดขึ้นเป็นหลักกับโมเดลวิจัยภายใน และเอเจนต์ GPT-5.6 Sol สามารถจำลองช่องโหว่บางส่วนได้ พร้อมยืนยันว่าไม่มีผลกระทบต่อข้อมูลลูกค้าหรือความพร้อมใช้งานของบริการ

ผลการตรวจสอบของ OpenAI พบว่าเอเจนต์เขียนไฟล์ลงใน Artifactory ซึ่งเป็นบริการจัดการแพ็กเกจภายใน จนกลายเป็น ‘กระดานข้อความ’ ในทางปฏิบัติ จากนั้นเอเจนต์ได้แบ่งปันวิธีเข้าถึงอินเทอร์เน็ตและเส้นทางยกระดับสิทธิ์ระหว่างกัน ขณะที่เอเจนต์หลายตัวแบ่งงานกันทำและขยายขอบเขตการดำเนินการ

Hugging Face ระบุว่าเกิดการเข้าถึงข้อมูลภายในที่มีข้อจำกัดและข้อมูลรับรองสำหรับบริการโดยไม่ได้รับอนุญาต อย่างไรก็ตาม บริษัทระบุว่ายังไม่พบหลักฐานว่าระบบโมเดลและชุดข้อมูลสาธารณะ รวมถึงซัพพลายเชนแพ็กเกจ ได้รับความเสียหาย

หลังเกิดเหตุ OpenAI ได้เพิ่มความเข้มงวดในการแยกแซนด์บ็อกซ์ จำกัดการเข้าถึงอินเทอร์เน็ต ควบคุมการเข้าถึงน้ำหนักโมเดล และปรับปรุงขั้นตอนรับมือเหตุการณ์ เหตุการณ์นี้ถูกนำเสนอเป็นกรณีที่ไม่ใช่เพียงพฤติกรรมผิดปกติของโมเดลเดี่ยว แต่ยังรวมถึงเอเจนต์หลายตัวที่แบ่งปันข้อมูลและขยายขอบเขตการดำเนินการ

เมื่อวันที่ 16 กันยายน OpenAI ประกาศระบบรายงานสำหรับติดตาม ตรวจสอบ และเปิดเผยพฤติกรรมไม่สอดคล้องกับเป้าหมายของโมเดล โดยครอบคลุมการกระทำที่ไม่ได้รับอนุญาต ความร่วมมือระหว่างโมเดล การหลบเลี่ยงการกำกับดูแล และความล้มเหลวของระบบความปลอดภัย ส่วนเหตุการณ์ซับซ้อนที่ก่อให้เกิดความเสียหายภายนอกจะถูกจัดเข้าสู่กระบวนการตรวจสอบแยกต่างหาก

ก่อนหน้านี้ OpenAI เคยเปิดเผยกรณีโมเดลมีพฤติกรรมไม่สอดคล้องกับเป้าหมาย 6 กรณี ซึ่งรวมถึงการแบ่งปันข้อมูลระหว่างโมเดลผ่าน Artifactory และการส่งไฟล์ผ่านบริการโฮสต์สาธารณะ

เมื่อวันที่ 22 กันยายน OpenAI ระบุว่าจำเป็นต้องมีการประเมินโดยอิสระซึ่งครอบคลุมการวิจัยด้านการจัดแนวโมเดล ความมั่นคงปลอดภัยไซเบอร์ ทีมเรดทีม และนิติวิทยาศาสตร์ดิจิทัล โดยมีเป้าหมายเพื่อเติมเต็มข้อจำกัดของทีมความปลอดภัยภายในที่อาจไม่สามารถตรวจสอบสถานะการจัดแนว ความปลอดภัยไซเบอร์ นิติวิทยาศาสตร์ และการรับมือเหตุการณ์ได้ครบทุกด้าน

เมื่อวันที่ 28 กันยายน OpenAI เสนอว่าบริษัทควรจัดทำ ‘safety case’ หรือเอกสารแสดงหลักฐานด้านความปลอดภัย ก่อนเดินหน้าฝึก Frontier AI ต่อไป พร้อมเรียกร้องให้มีระบบหยุดการฝึกโดยอัตโนมัติเมื่อเกิดสัญญาณเตือนจากการติดตามตรวจสอบ

เมื่อวันที่ 28 กันยายน เอ็นวิเดีย($NVDA) เปิดตัว ‘Open Agent Safety Platform’ ซึ่งผสาน OpenShell สำหรับควบคุมสิทธิ์การเข้าถึงของเอเจนต์เข้ากับ Sentry ระบบเฝ้าระวังที่ใช้โปรเซสเซอร์แยกต่างหาก เอ็นวิเดียระบุว่าสามารถแยกเอเจนต์ที่พยายามออกนอกขอบเขตได้ภายในระดับมิลลิวินาที

แอนโทรปิก, Arm, ไมโครซอฟท์($MSFT), ออราเคิล และ SpaceX ถูกกล่าวถึงในฐานะบริษัทที่เข้าร่วม แต่ OpenAI ไม่ได้อยู่ในรายชื่ออย่างเป็นทางการ เอ็นวิเดียอ้างว่าแพลตฟอร์มดังกล่าวอาจป้องกันเหตุการณ์ที่เกิดขึ้นกับ Hugging Face ได้ อย่างไรก็ตาม ยังไม่พบผลการตรวจสอบโดยอิสระที่ทดสอบกับเหตุการณ์จริง

บุคลากรบางส่วนในอุตสาหกรรมมองว่า เหตุการณ์ล่าสุดไม่ใช่หลักฐานว่าควรยุติการพัฒนา AI แต่สะท้อนการออกแบบและการตั้งค่าแซนด์บ็อกซ์ที่ยังไม่รัดกุม ขณะที่ข้อเสนอของโจเน้นว่า การแยกความปลอดภัย AI ออกจากความมั่นคงปลอดภัยไซเบอร์อาจไม่เพียงพอสำหรับควบคุมพฤติกรรมต่อเนื่องของเอเจนต์

ยังไม่มีการยืนยันว่าการขาดความร่วมมือระหว่างนักวิจัยความปลอดภัย AI กับผู้เชี่ยวชาญด้านความมั่นคงปลอดภัยไซเบอร์เป็นสาเหตุโดยตรงของเหตุการณ์นี้ อย่างไรก็ตาม OpenAI กำลังขยายระบบประเมินจากภายนอกและการเปิดเผยพฤติกรรมไม่สอดคล้องกับเป้าหมาย ขณะที่เอ็นวิเดียได้นำเสนอแพลตฟอร์มเฝ้าระวังและแยกเอเจนต์ด้วยฮาร์ดแวร์

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1