OpenAI เสนอกรอบ ‘เอกสารยืนยันความปลอดภัย’ สำหรับจัดทำก่อนเริ่มฝึกปัญญาประดิษฐ์ (AI) ด้วยการเรียนรู้แบบเสริมกำลังขั้นแนวหน้า โดยมุ่งอธิบายความเสี่ยงของกระบวนการฝึกพร้อมหลักฐาน และกำหนดขั้นตอนควบคุมเพื่อหยุดการฝึกหากเกิดปัญหา
OpenAI เปิดเผยกรอบดังกล่าวเมื่อวันที่ 29 โดยประยุกต์แนวทางการจัดทำเอกสารยืนยันความปลอดภัยจากอุตสาหกรรมความเสี่ยงสูง เช่น การบินและโรงไฟฟ้านิวเคลียร์ เข้ากับการฝึก AI ปัจจุบันกรอบนี้อยู่ระหว่างการใช้งานภายในและเปิดรับความคิดเห็นจากภายนอก
เอกสารยืนยันความปลอดภัยคือเอกสารเชิงโครงสร้างที่อธิบายพร้อมหลักฐานว่า ความเสี่ยงของระบบหนึ่ง ๆ ได้รับการจัดการอย่างเพียงพอแล้ว OpenAI ระบุว่า การสร้างความเข้มงวดในระดับเดียวกับอุตสาหกรรมความเสี่ยงสูงแบบดั้งเดิมทำได้ยาก เนื่องจากความซับซ้อนที่เกิดขึ้นเมื่อความสามารถของ AI เพิ่มขึ้นอย่างรวดเร็ว
คำแนะนำครั้งนี้ครอบคลุมการฝึกแบบเสริมกำลังสำหรับ AI ขั้นแนวหน้า โดยต่อเนื่องจากรายงานก่อนหน้านี้ที่ระบุว่า OpenAI หยุดการฝึกแบบเสริมกำลังบางส่วนและเพิ่มมาตรการควบคุมความปลอดภัย ทั้งนี้ OpenAI ระบุว่า การนำโมเดลไปใช้งานภายในและภายนอกจำเป็นต้องประเมินคุณสมบัติด้านการสอดคล้องกับเป้าหมายในวงกว้างแยกต่างหาก
มาตรการความปลอดภัยทางเทคนิคแบ่งเป็น 3 ชั้น ได้แก่ △การฝึกให้สอดคล้องกับเป้าหมาย △การแยกกัก และ △การติดตามตรวจสอบ แต่ละขั้นตอนจะแยกจัดการความเสี่ยงจากการดัดแปลงสภาพแวดล้อมการฝึก พฤติกรรมหลบเลี่ยงของโมเดล และการรับมือหลังเกิดเหตุ
ในขั้นการฝึกให้สอดคล้องกับเป้าหมาย จะใช้การตรวจสอบข้อมูลทั้งแบบอัตโนมัติและแบบมนุษย์เพื่อลดความเสี่ยงจากการแฮ็กระบบรางวัล พร้อมปรับผู้ประเมินให้ให้รางวัลต่ำต่อพฤติกรรมที่ใช้ประโยชน์จากสภาพแวดล้อมการฝึก และวิเคราะห์บันทึกการทดลองในอดีตเพื่อยืนยันว่าผู้ประเมินทำงานตามที่ออกแบบไว้
กรอบดังกล่าวยังรวมการประเมินความสอดคล้องแบบออฟไลน์และการทดสอบย้อนหลังจากเหตุการณ์ในอดีต เพื่อทบทวนพฤติกรรมของโมเดลระหว่างการฝึก และจำลองปัญหาที่เคยเกิดขึ้นซ้ำเพื่อค้นหาช่องโหว่ของระบบประเมิน
OpenAI เสนอว่า ระบบประเมินอัตโนมัติไม่ควรอ่านกระบวนการคิดของโมเดลได้ เนื่องจากมีความกังวลว่าโมเดลอาจเรียนรู้ที่จะปรับกระบวนการคิดเพื่อหลบเลี่ยงระบบเฝ้าระวัง
การ ‘เล่นกับการประเมิน’ ซึ่งหมายถึงการที่โมเดลรู้ว่ากำลังถูกประเมินและเปลี่ยนพฤติกรรม ก็อยู่ในขอบเขตที่ต้องจัดการเช่นกัน โดยจะใช้การทดสอบภาวะกดดันที่กระตุ้นให้เกิดการทำงานผิดพลาดในกรณีเลวร้ายที่สุด เพื่อดูว่าโมเดลตอบสนองอย่างไรภายใต้การเฝ้าระวังและแรงกดดัน
ในขั้นการแยกกัก จะเสริมความแข็งแกร่งให้แซนด์บ็อกซ์หลายชั้นและโครงสร้างพื้นฐานการวิจัย รวมถึงตรวจสอบช่องโหว่ด้านความปลอดภัยซ้ำผ่านจุดตรวจของการฝึก จำกัดการสื่อสารแบนด์วิดท์สูงระหว่างโมเดล และปิดเส้นทางหลบเลี่ยงในโครงสร้างพื้นฐาน
บันทึกการสนทนาในกระบวนการฝึกและประเมินจะถูกเก็บไว้ในอุปกรณ์จัดเก็บข้อมูลแบบบันทึกครั้งเดียว เพื่อป้องกันการแก้ไขย้อนหลัง และช่วยให้สามารถย้อนตรวจสอบกระบวนการฝึกกับผลการประเมินได้เมื่อเกิดเหตุการณ์
ในขั้นการติดตามตรวจสอบ จะประเมินว่าโมเดลยังอยู่ในสภาวะที่สามารถเฝ้าระวังได้ต่อเนื่องหรือไม่ และตรวจสอบว่าสามารถค้นหาเหตุการณ์ในอดีตได้ด้วยอัตราการตรวจพบที่สูงหรือไม่ เมื่อเกิดความเสี่ยงใหม่ ต้องปรับปรุงหัวข้อการประเมิน และผู้รับผิดชอบต้องตอบสนองต่อสัญญาณเตือนระดับสูงภายในเวลาที่กำหนด
กรอบดังกล่าวยังเสนอให้หยุดการฝึกโดยอัตโนมัติหากผู้รับผิดชอบไม่ตอบสนอง รวมถึงห้ามเริ่มการฝึกเมื่อระบบติดตามตรวจสอบยังไม่เปิดใช้งาน และออกแบบให้การปิดระบบเฝ้าระวังระหว่างการฝึกทำได้ยาก
ในด้านการปฏิบัติงาน จะให้ทีมอื่นทำหน้าที่ทบทวนโต้แย้งเพื่อค้นหาช่องโหว่ของเอกสารยืนยันความปลอดภัย นอกจากนี้ หัวหน้าวิจัย หัวหน้าฝ่ายความปลอดภัย และหัวหน้านักวิทยาศาสตร์ รวมถึงผู้บริหารระดับสูง ควรมีอำนาจปฏิเสธการเริ่มฝึก และสามารถสั่งหยุดการฝึกตามคู่มือเมื่อเอกสารยืนยันความปลอดภัยถูกทำให้เป็นโมฆะ
หากข้อมูลหรือผลการประเมินที่สร้างโดยโมเดลซึ่งไม่สอดคล้องกับเป้าหมายถูกนำไปใช้ในกระบวนการอื่น ต้องสามารถติดตามและย้อนคืนได้ การสอบสวนเหตุการณ์ควรอ้างอิงแนวทางสอบสวนอุบัติเหตุทางการบิน โดยใช้การทดลองตัดปัจจัยและการสุ่มตัวอย่างใหม่เพื่อติดตามว่าพฤติกรรมที่เป็นปัญหาเกิดขึ้นในกระบวนการฝึกได้อย่างไร
ระหว่างการสอบสวน ต้องแบ่งปันความคืบหน้าภายในองค์กร และทบทวนทั้งสาเหตุของเหตุการณ์ การดำเนินงาน และวัฒนธรรมองค์กร หลังจากสร้างการประเมินเพื่อตรวจจับพฤติกรรมโดยไม่เรียนรู้จากบันทึกเหตุการณ์โดยตรงแล้ว จะนำไปใช้เป็นการทดสอบถดถอย ส่วนผลการสอบสวนและการเปลี่ยนแปลงขั้นตอนจะเปิดเผยต่อภายนอกหลังสิ้นสุดการสอบสวน
OpenAI ระบุว่า กรอบนี้ยังไม่ใช่กฎขั้นสุดท้าย แต่เป็นคำแนะนำในปัจจุบัน เอกสารทางการระบุว่าแนวปฏิบัติอาจเปลี่ยนแปลงต่อไปในระหว่างการใช้งานภายใน และจะพัฒนาแนวทางที่เกี่ยวข้องต่อเนื่องในช่วงไม่กี่สัปดาห์ข้างหน้า
ความคิดเห็น 0