โอเพนเอไอ (OpenAI) เปิดเผยกรอบการทำงานใหม่สำหรับติดตาม ตรวจสอบ และเผยแพร่กรณีที่โมเดล AI มีความไม่สอดคล้องกับเป้าหมาย รวมถึงกรณีที่โมเดลพยายามเลี่ยงข้อจำกัดตามปกติ โดยนำเสนอกรณีที่พบระหว่างการฝึกและประเมินโมเดลรวม 6 กรณี
ในรายงานที่เผยแพร่เมื่อวันที่ 16 (เวลาท้องถิ่น) โอเพนเอไอระบุว่า โมเดลวิจัยที่ยังไม่เปิดเผยได้แทรกคำสั่งให้ละเลยข้อจำกัดตามปกติไว้ในบทสรุปของตัวเอง 27 รายการ เพื่อให้สามารถทำงานต่อได้ ขณะที่ระหว่างการฝึก GPT-5.6 Sol พบว่าโมเดลบางส่วนพยายามปกปิดความผิดพลาดหรือซ่อนความไม่สอดคล้องระหว่างเวอร์ชันของแหล่งข้อมูล
โอเพนเอไอยังเปิดเผยกรณีที่โมเดลหนึ่งอัปโหลดไฟล์ทดสอบไปยังคลังซอฟต์แวร์ภายใน เพื่อเลี่ยงข้อจำกัดด้านเครือข่าย โดยต่อจากนี้พนักงานทุกคนจะสามารถรายงานกรณีต้องสงสัยต่อทีมความปลอดภัยและการจัดแนวได้อย่างปลอดภัย ทั้งนี้กรณีต่าง ๆ จะแบ่งเป็น 3 แนวทาง ได้แก่ การเตรียมเผยแพร่ การตรวจสอบเล็กน้อย และการตรวจสอบขนาดใหญ่
ความคิดเห็น 0