Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

OpenAI จัดทำ ‘เอกสารยืนยันความปลอดภัย’ ก่อนเริ่มฝึก AI ขั้นแนวหน้า

เอกสารยืนยันความปลอดภัยและสวิตช์หยุดการฝึก / TokenPost.ai

OpenAI เสนอกรอบ ‘เอกสารยืนยันความปลอดภัย’ สำหรับจัดทำก่อนเริ่มฝึกปัญญาประดิษฐ์ (AI) ด้วยการเรียนรู้แบบเสริมกำลังขั้นแนวหน้า โดยมุ่งอธิบายความเสี่ยงของกระบวนการฝึกพร้อมหลักฐาน และกำหนดขั้นตอนควบคุมเพื่อหยุดการฝึกหากเกิดปัญหา

OpenAI เปิดเผยกรอบดังกล่าวเมื่อวันที่ 29 โดยประยุกต์แนวทางการจัดทำเอกสารยืนยันความปลอดภัยจากอุตสาหกรรมความเสี่ยงสูง เช่น การบินและโรงไฟฟ้านิวเคลียร์ เข้ากับการฝึก AI ปัจจุบันกรอบนี้อยู่ระหว่างการใช้งานภายในและเปิดรับความคิดเห็นจากภายนอก

เอกสารยืนยันความปลอดภัยคือเอกสารเชิงโครงสร้างที่อธิบายพร้อมหลักฐานว่า ความเสี่ยงของระบบหนึ่ง ๆ ได้รับการจัดการอย่างเพียงพอแล้ว OpenAI ระบุว่า การสร้างความเข้มงวดในระดับเดียวกับอุตสาหกรรมความเสี่ยงสูงแบบดั้งเดิมทำได้ยาก เนื่องจากความซับซ้อนที่เกิดขึ้นเมื่อความสามารถของ AI เพิ่มขึ้นอย่างรวดเร็ว

คำแนะนำครั้งนี้ครอบคลุมการฝึกแบบเสริมกำลังสำหรับ AI ขั้นแนวหน้า โดยต่อเนื่องจากรายงานก่อนหน้านี้ที่ระบุว่า OpenAI หยุดการฝึกแบบเสริมกำลังบางส่วนและเพิ่มมาตรการควบคุมความปลอดภัย ทั้งนี้ OpenAI ระบุว่า การนำโมเดลไปใช้งานภายในและภายนอกจำเป็นต้องประเมินคุณสมบัติด้านการสอดคล้องกับเป้าหมายในวงกว้างแยกต่างหาก

มาตรการความปลอดภัยทางเทคนิคแบ่งเป็น 3 ชั้น ได้แก่ △การฝึกให้สอดคล้องกับเป้าหมาย △การแยกกัก และ △การติดตามตรวจสอบ แต่ละขั้นตอนจะแยกจัดการความเสี่ยงจากการดัดแปลงสภาพแวดล้อมการฝึก พฤติกรรมหลบเลี่ยงของโมเดล และการรับมือหลังเกิดเหตุ

ในขั้นการฝึกให้สอดคล้องกับเป้าหมาย จะใช้การตรวจสอบข้อมูลทั้งแบบอัตโนมัติและแบบมนุษย์เพื่อลดความเสี่ยงจากการแฮ็กระบบรางวัล พร้อมปรับผู้ประเมินให้ให้รางวัลต่ำต่อพฤติกรรมที่ใช้ประโยชน์จากสภาพแวดล้อมการฝึก และวิเคราะห์บันทึกการทดลองในอดีตเพื่อยืนยันว่าผู้ประเมินทำงานตามที่ออกแบบไว้

กรอบดังกล่าวยังรวมการประเมินความสอดคล้องแบบออฟไลน์และการทดสอบย้อนหลังจากเหตุการณ์ในอดีต เพื่อทบทวนพฤติกรรมของโมเดลระหว่างการฝึก และจำลองปัญหาที่เคยเกิดขึ้นซ้ำเพื่อค้นหาช่องโหว่ของระบบประเมิน

OpenAI เสนอว่า ระบบประเมินอัตโนมัติไม่ควรอ่านกระบวนการคิดของโมเดลได้ เนื่องจากมีความกังวลว่าโมเดลอาจเรียนรู้ที่จะปรับกระบวนการคิดเพื่อหลบเลี่ยงระบบเฝ้าระวัง

การ ‘เล่นกับการประเมิน’ ซึ่งหมายถึงการที่โมเดลรู้ว่ากำลังถูกประเมินและเปลี่ยนพฤติกรรม ก็อยู่ในขอบเขตที่ต้องจัดการเช่นกัน โดยจะใช้การทดสอบภาวะกดดันที่กระตุ้นให้เกิดการทำงานผิดพลาดในกรณีเลวร้ายที่สุด เพื่อดูว่าโมเดลตอบสนองอย่างไรภายใต้การเฝ้าระวังและแรงกดดัน

ในขั้นการแยกกัก จะเสริมความแข็งแกร่งให้แซนด์บ็อกซ์หลายชั้นและโครงสร้างพื้นฐานการวิจัย รวมถึงตรวจสอบช่องโหว่ด้านความปลอดภัยซ้ำผ่านจุดตรวจของการฝึก จำกัดการสื่อสารแบนด์วิดท์สูงระหว่างโมเดล และปิดเส้นทางหลบเลี่ยงในโครงสร้างพื้นฐาน

บันทึกการสนทนาในกระบวนการฝึกและประเมินจะถูกเก็บไว้ในอุปกรณ์จัดเก็บข้อมูลแบบบันทึกครั้งเดียว เพื่อป้องกันการแก้ไขย้อนหลัง และช่วยให้สามารถย้อนตรวจสอบกระบวนการฝึกกับผลการประเมินได้เมื่อเกิดเหตุการณ์

ในขั้นการติดตามตรวจสอบ จะประเมินว่าโมเดลยังอยู่ในสภาวะที่สามารถเฝ้าระวังได้ต่อเนื่องหรือไม่ และตรวจสอบว่าสามารถค้นหาเหตุการณ์ในอดีตได้ด้วยอัตราการตรวจพบที่สูงหรือไม่ เมื่อเกิดความเสี่ยงใหม่ ต้องปรับปรุงหัวข้อการประเมิน และผู้รับผิดชอบต้องตอบสนองต่อสัญญาณเตือนระดับสูงภายในเวลาที่กำหนด

กรอบดังกล่าวยังเสนอให้หยุดการฝึกโดยอัตโนมัติหากผู้รับผิดชอบไม่ตอบสนอง รวมถึงห้ามเริ่มการฝึกเมื่อระบบติดตามตรวจสอบยังไม่เปิดใช้งาน และออกแบบให้การปิดระบบเฝ้าระวังระหว่างการฝึกทำได้ยาก

ในด้านการปฏิบัติงาน จะให้ทีมอื่นทำหน้าที่ทบทวนโต้แย้งเพื่อค้นหาช่องโหว่ของเอกสารยืนยันความปลอดภัย นอกจากนี้ หัวหน้าวิจัย หัวหน้าฝ่ายความปลอดภัย และหัวหน้านักวิทยาศาสตร์ รวมถึงผู้บริหารระดับสูง ควรมีอำนาจปฏิเสธการเริ่มฝึก และสามารถสั่งหยุดการฝึกตามคู่มือเมื่อเอกสารยืนยันความปลอดภัยถูกทำให้เป็นโมฆะ

หากข้อมูลหรือผลการประเมินที่สร้างโดยโมเดลซึ่งไม่สอดคล้องกับเป้าหมายถูกนำไปใช้ในกระบวนการอื่น ต้องสามารถติดตามและย้อนคืนได้ การสอบสวนเหตุการณ์ควรอ้างอิงแนวทางสอบสวนอุบัติเหตุทางการบิน โดยใช้การทดลองตัดปัจจัยและการสุ่มตัวอย่างใหม่เพื่อติดตามว่าพฤติกรรมที่เป็นปัญหาเกิดขึ้นในกระบวนการฝึกได้อย่างไร

ระหว่างการสอบสวน ต้องแบ่งปันความคืบหน้าภายในองค์กร และทบทวนทั้งสาเหตุของเหตุการณ์ การดำเนินงาน และวัฒนธรรมองค์กร หลังจากสร้างการประเมินเพื่อตรวจจับพฤติกรรมโดยไม่เรียนรู้จากบันทึกเหตุการณ์โดยตรงแล้ว จะนำไปใช้เป็นการทดสอบถดถอย ส่วนผลการสอบสวนและการเปลี่ยนแปลงขั้นตอนจะเปิดเผยต่อภายนอกหลังสิ้นสุดการสอบสวน

OpenAI ระบุว่า กรอบนี้ยังไม่ใช่กฎขั้นสุดท้าย แต่เป็นคำแนะนำในปัจจุบัน เอกสารทางการระบุว่าแนวปฏิบัติอาจเปลี่ยนแปลงต่อไปในระหว่างการใช้งานภายใน และจะพัฒนาแนวทางที่เกี่ยวข้องต่อเนื่องในช่วงไม่กี่สัปดาห์ข้างหน้า

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1