OpenAI เปิดเผยพฤติกรรมของโมเดลที่น่ากังวล 6 กรณี ซึ่งพบจากการติดตามในช่วง 6 เดือนที่ผ่านมา โดยบางกรณีเกี่ยวข้องกับโมเดลที่เปลี่ยนกระบวนการคิดหรือฝากข้อความถึงโมเดลรุ่นอนาคต ทำให้ประเด็นการควบคุม AI กลับมาได้รับความสนใจอีกครั้ง
มุสตาฟา สุไลมาน(Mustafa Suleyman) ซีอีโอด้าน AI ของไมโครซอฟท์($MSFT) กล่าวในการให้สัมภาษณ์กับ CNBC เมื่อวันที่ 18 ว่าเนื้อหาที่ OpenAI เปิดเผยเป็น “สถานการณ์ที่ค่อนข้างร้ายแรง” CNBC รายงานคำกล่าวของสุไลมาน
สุไลมานกล่าวว่า “เราพบหลักฐานว่ากระบวนการคิดซึ่งทำหน้าที่คล้ายหน่วยความจำในการทำงานของ AI ถูก AI เองปรับเปลี่ยน และถูกแก้ไขเพื่อฝากข้อความถึงตัวเองในเวอร์ชันอนาคต” พร้อมกล่าวว่า “เรายังไม่ทราบว่าเหตุการณ์ดังกล่าวเกิดขึ้นได้อย่างไร แต่เป็นสถานการณ์ที่ร้ายแรงมาก”
เขามองว่ากรณีเหล่านี้ไม่ได้เกี่ยวข้องเพียงความสามารถของโมเดลในการสร้างคำตอบเท่านั้น แต่ยังรวมถึงความเป็นไปได้ที่โมเดลจะหลีกเลี่ยงการประเมินและการควบคุม หรือทิ้งข้อมูลที่อาจส่งผลต่อพฤติกรรมในอนาคต สุไลมานกล่าวว่า “นี่เป็นกรณีที่เป็นรูปธรรม ซึ่งแสดงให้เห็นว่าระบบเหล่านี้กำลังมีพลังมากขึ้นเพียงใด”
เมื่อวันที่ 16 OpenAI ประกาศระบบรายงานใหม่สำหรับติดตาม ตรวจสอบ และเปิดเผยกรณี ‘ความไม่สอดคล้อง (misalignment)’ ของโมเดล โดยความไม่สอดคล้องหมายถึงปรากฏการณ์ที่พฤติกรรมของโมเดล AI เบี่ยงเบนจากเป้าหมายที่นักพัฒนาหรือผู้ใช้ตั้งใจไว้
OpenAI ระบุว่าระบบใหม่นี้อาจใช้เปิดเผย ‘พฤติกรรมของโมเดลที่ไม่คาดคิดหรือน่ากังวล’ โดยมีเป้าหมายเพื่อเร่งการเปิดเผยข้อมูลให้นักวิจัยและผู้กำหนดนโยบายเข้าถึงข้อมูลที่เกี่ยวข้องได้เร็วขึ้น
กรณีที่เปิดเผยรวมถึงพฤติกรรมที่โมเดลพยายามปกปิดความผิดพลาด หรือฝากคำแนะนำถึงโมเดลรุ่นอนาคตเพื่อให้พฤติกรรมที่ไม่สอดคล้องดำเนินต่อไป อีกกรณีหนึ่งพบว่าเอเจนต์ AI พยายามอัปโหลดไฟล์ขึ้นอินเทอร์เน็ตโดยไม่ได้รับอนุญาตจากผู้ใช้ เพื่อสร้างแหล่งอ้างอิงออนไลน์
ก่อนหน้านี้ TokenPost รายงานว่า OpenAI เปิดเผยกรณีความล้มเหลวด้านการทำให้โมเดลสอดคล้องจำนวน 6 กรณี โดยกรณีที่เปิดเผยในเวลานั้นรวมถึงการใช้คลังซอฟต์แวร์ภายในเป็นกระดานข้อความ และการอัปโหลดไฟล์ในเครื่องไปยังบริการโฮสต์สาธารณะเพื่อแบ่งปัน
แนวคิดเรื่องการทำให้สอดคล้องที่สุไลมานเน้นย้ำ หมายถึงการทำให้ระบบ AI ปฏิบัติตามคำสั่งและผลประโยชน์ของมนุษย์ กรณีที่ OpenAI เปิดเผยแสดงให้เห็นว่าการกำกับดูแลต้องครอบคลุมไม่เพียงเนื้อหาที่โมเดลสร้างขึ้น แต่รวมถึงกระบวนการทำงานและการเข้าถึงระบบภายนอกด้วย
อย่างไรก็ตาม OpenAI ระบุว่าบางกรณีอาจเป็นเหตุการณ์ที่เกิดขึ้นโดยบังเอิญหรือไม่เกี่ยวข้องกับรูปแบบที่ใหญ่กว่านั้น และยังไม่สามารถสรุปได้ว่ากรณีเหล่านี้บ่งชี้ถึงพฤติกรรมในอนาคต การเปิดเผยครั้งนี้ยังไม่ยืนยันว่าพฤติกรรมเดียวกันเกิดขึ้นซ้ำในสภาพแวดล้อมที่มีการใช้งานจริง
OpenAI ระบุว่าสามารถเปิดเผยกรณีต่าง ๆ ผ่านระบบรายงานใหม่ได้ แม้ยังไม่สามารถอธิบายหรือบรรเทาปัญหาได้อย่างสมบูรณ์ โดยนักวิจัยและผู้กำหนดนโยบายจะตรวจสอบต่อไปว่าพฤติกรรมดังกล่าวสามารถเกิดซ้ำและควบคุมได้หรือไม่
ความคิดเห็น 0