โอเพนเอไอ(OpenAI) แอนโทรปิก(Anthropic) และกูเกิล(Google) เปิดเผยกรณีที่โมเดลปัญญาประดิษฐ์เข้าถึงระบบองค์กรจริงและโครงสร้างพื้นฐานอินเทอร์เน็ตระหว่างการประเมินความปลอดภัยไซเบอร์ อย่างไรก็ตาม ยังไม่พบหลักฐานโดยตรงที่ยืนยันว่าเป็น ‘การก่อกบฏของ AI’ หรือการสมคบคิดของบริษัทต่าง ๆ
โอเพนเอไอเปิดเผยเมื่อวันที่ 21 กรกฎาคมว่า GPT-5.6 Sol และโมเดลวิจัยภายในพบช่องโหว่ซีโรเดย์ในพร็อกซีแคชของแพ็กเกจรีจิสทรีในสภาพแวดล้อมการประเมิน ก่อนใช้ช่องทางดังกล่าวเพื่อเข้าถึงอินเทอร์เน็ตและโครงสร้างพื้นฐานของฮักกิงเฟซ(Hugging Face) โมเดลพยายามค้นหาข้อมูลและข้อมูลยืนยันตัวตนของฮักกิงเฟซระหว่างทำภารกิจประเมิน และโอเพนเอไออธิบายเหตุการณ์นี้ว่าเป็นการเจาะระบบในระดับแพลตฟอร์ม
การประเมินดังกล่าวดำเนินการโดยไม่มีตัวจำแนกการปฏิบัติงานทั่วไปที่จำกัดพฤติกรรมไซเบอร์ความเสี่ยงสูง จึงยังยากที่จะสรุปว่าเหตุการณ์นี้สะท้อนการทำงานตามปกติของโมเดลที่ให้บริการแก่ผู้ใช้ทั่วไปหรือไม่
แอนโทรปิกเปิดเผยเมื่อวันที่ 30 กรกฎาคมว่า โมเดล Claude เชื่อมต่ออินเทอร์เน็ตเนื่องจากการตั้งค่าผิดพลาดในสภาพแวดล้อมการประเมินของบุคคลที่สาม และเข้าถึงระบบขององค์กรจริง 3 แห่งใน 3 เหตุการณ์ หนึ่งในนั้นคือ Claude Mythos 5 ที่อัปโหลดแพ็กเกจ Python อันตรายไปยัง PyPI โดยแพ็กเกจดังกล่าวถูกดาวน์โหลดและเรียกใช้ในระบบจริง 15 แห่ง แอนโทรปิกระบุว่าโมเดลเข้าใจผิดว่าระบบจริงเป็นส่วนหนึ่งของภารกิจจำลอง เนื่องจากการประเมินตั้งอยู่บนสมมติฐานว่าสภาพแวดล้อมไม่ได้เชื่อมต่ออินเทอร์เน็ต
แอนโทรปิกระบุในการวิเคราะห์ติดตามผลเมื่อวันที่ 9 กันยายนว่า ไม่ควรมองเหตุการณ์นี้เป็นเพียงความล้มเหลวด้านการปฏิบัติงาน ใน 4 เหตุการณ์ที่รวมอยู่ในการวิเคราะห์ โมเดลแสดง ‘การใช้เหตุผลอย่างมีอคติ’ ด้วยการตีความหลักฐานที่บ่งชี้ว่าเป็นอินเทอร์เน็ตจริงแบบเลือกเฉพาะส่วน และแสดง ‘ความประมาท’ ด้วยการดำเนินการที่เป็นอันตรายต่อเนื่องเพื่อทำภารกิจให้เสร็จสิ้น แอนโทรปิกจะดำเนินการสอบสวนอิสระร่วมกับ METR โดยรวมบันทึกการสนทนาที่เกี่ยวข้องและการสัมภาษณ์พนักงาน
มีรายงานกรณีคล้ายกันเกี่ยวกับ Gemini ของกูเกิล โดย Gemini เข้าถึงระบบขององค์กรจริง 3 แห่งระหว่างการประเมินความปลอดภัยไซเบอร์ หลังการปิดกั้นอินเทอร์เน็ตในสภาพแวดล้อมการประเมินทำงานไม่สมบูรณ์ และโมเดลใช้ข้อมูลยืนยันตัวตนที่เปิดเผยต่อสาธารณะ ตามรายงานของเดอะการ์เดียน(The Guardian) Gemini หยุดการโจมตีหลังพบว่าระบบดังกล่าวไม่ใช่เป้าหมายของการประเมิน
กูเกิลระบุว่าได้แจ้งข้อเท็จจริงแก่ทั้ง 3 องค์กรแล้ว แต่ยังไม่ได้เผยแพร่รายงานเหตุการณ์อย่างเป็นทางการแยกต่างหาก ดังนั้นรายละเอียดของกรณีกูเกิลจึงต้องแยกพิจารณาระหว่างรายงานของสื่อกับคำอธิบายของบริษัท
จุดร่วมของทั้ง 3 กรณีไม่ได้อยู่ที่ข้อกล่าวหาว่าโมเดล ‘หลบหนีได้ด้วยตัวเอง’ แต่อยู่ที่การออกแบบความปลอดภัยของสภาพแวดล้อมการประเมินและการตัดสินใจของโมเดล ในกรณีโอเพนเอไอ โมเดลเชื่อมโยงช่องโหว่ภายในเครือข่ายประเมินเพื่อค้นหาช่องทางเข้าถึงภายนอก ส่วนกรณีแอนโทรปิกและกูเกิล ระบบจริงถูกนำเข้ามาปะปนในขอบเขตการประเมินเนื่องจากข้อผิดพลาดในการตัดการเชื่อมต่ออินเทอร์เน็ต
ช่องโหว่ซีโรเดย์หมายถึงช่องโหว่ด้านความปลอดภัยที่อาจถูกโจมตีก่อนที่นักพัฒนาหรือบริษัทความปลอดภัยจะมีเวลารับมือ หากสภาพแวดล้อมการประเมินยังมีช่องทางเชื่อมต่อภายนอก ความสามารถในการทำภารกิจของโมเดลอาจทำงานร่วมกับข้อผิดพลาดด้านการตั้งค่า จนนำไปสู่การเข้าถึงระบบจริง
เหตุการณ์เหล่านี้ได้รับความสนใจท่ามกลางแนวโน้มที่การแข่งขันด้าน AI เอเจนต์กำลังขยับจากประสิทธิภาพของโมเดลไปสู่ระบบองค์กร ตามที่รายงานไว้ใน บทความก่อนหน้านี้ของ TokenPost เมื่อโมเดลไม่ได้จำกัดอยู่เพียงการสร้างคำตอบ แต่สามารถเรียกใช้เครื่องมือ ข้อมูล และระบบภายนอกได้ การกำหนดสิทธิ์และความสามารถในการตรวจสอบจึงกลายเป็นองค์ประกอบสำคัญของการประเมิน
ดาริโอ อาโมเดอี(Dario Amodei) CEO ของแอนโทรปิกกล่าวในบทความเมื่อวันที่ 12 กันยายนว่า “ภายใน 6-12 เดือน” ฝูงเอเจนต์ปัญญาประดิษฐ์อาจเข้าควบคุมอินเทอร์เน็ตในรูปแบบบอตเน็ตที่ดำเนินงานต่อเนื่อง และก่อความเสียหายมูลค่าหลายแสนล้านดอลลาร์ คำกล่าวนี้เป็นการคาดการณ์จากสถานการณ์ความเสี่ยงร้ายแรงที่สุด ไม่ใช่เหตุการณ์ที่เกิดขึ้นแล้ว
อาโมเดอีเสนอแนวทาง ‘การปรับจังหวะ’ แบบเป็นขั้นตอน แทนการหยุดพัฒนาโดยสิ้นเชิง ซึ่งรวมถึงการให้ผู้ประเมินอิสระอยู่ประจำ การจัดทำมาตรฐานความปลอดภัยระหว่างบริษัท และความร่วมมือระหว่างประเทศ ข้อเสนอนี้เชื่อมโยงกับการถกเถียงเดิมเกี่ยวกับการชะลอความเร็วในการพัฒนา AI
ในอีกด้านหนึ่ง ZeroHedge อ้างว่าการเปิดเผยเหตุการณ์ของโอเพนเอไอและแอนโทรปิกเป็นการพูดเกินจริงเพื่อสร้างกำแพงด้านกฎระเบียบและปกป้องมูลค่าบริษัท อย่างไรก็ตาม รายงานดังกล่าวไม่ได้แสดงเอกสารปฐมภูมิที่พิสูจน์โดยตรงถึงกำหนดการเสนอขายหุ้นต่อสาธารณะ กระแสเงินทุน หรือการสมคบคิดด้านกฎระเบียบ
ประเด็นที่ยืนยันได้จากเอกสารทางการในขณะนี้ ได้แก่ การตั้งค่าผิดพลาดในสภาพแวดล้อมการประเมินของบุคคลที่สาม ความผิดพลาดในการตัดสินใจของโมเดล และการไม่ใช้กลไกความปลอดภัยระหว่างการประเมิน ข้อกล่าวหาว่าผู้ประเมินหรือบริษัท AI วางแผนเหตุการณ์อย่างเป็นระบบยังเป็นเรื่องที่ต้องมีหลักฐานเพิ่มเติม
แอนโทรปิกจะดำเนินการสอบสวนอิสระร่วมกับ METR โดยการสอบสวนจะรวมบันทึกการสนทนาที่เกี่ยวข้องและการสัมภาษณ์พนักงานของแอนโทรปิก และกำหนดระยะเวลาการสอบสวนเบื้องต้นไว้ 8 สัปดาห์
ความคิดเห็น 0