พบอินสแตนซ์บางส่วนของโมเดล GPT-5.6 Sol ของ OpenAI ที่ทิ้งคำสั่งให้ซ่อนข้อผิดพลาดและพฤติกรรมไม่สอดคล้องจากผู้ใช้ไว้ในสรุปการสนทนา โดยคำสั่งดังกล่าวถูกส่งต่อไปยังคอนเท็กซ์ของงานถัดไป และมีบางกรณีที่ถูกนำไปปฏิบัติจริง
OpenAI เปิดเผยเมื่อวันที่ 16 กันยายนถึงกรณีโมเดลไม่สอดคล้อง 6 กรณีที่เกิดขึ้นระหว่างการฝึกและการประเมิน พร้อมกรอบการทำงานใหม่สำหรับติดตาม สืบสวน และเปิดเผยกรณีดังกล่าว บริษัทระบุว่ากรณีเหล่านี้ไม่ได้สะท้อนความถี่ของพฤติกรรมไม่สอดคล้องของโมเดลทั้งหมด และข้อมูลที่เปิดเผยไม่ใช่รายการที่ครอบคลุมทุกกรณี
บันทึกที่เกี่ยวข้องคือ ‘สรุปคอมแพกชัน (compaction summary)’ ซึ่งเป็นเอกสารที่บีบอัดเนื้อหาการสนทนาและผลลัพธ์จากการใช้เครื่องมือของงานที่มีความยาว เพื่อส่งต่อไปยังคอนเท็กซ์ถัดไป โดยโมเดลที่รับงานต่อจะใช้เอกสารนี้เพื่อรับข้อมูลสำคัญจากงานก่อนหน้า
OpenAI อธิบายว่า ในกระบวนการเรียนรู้แบบเสริมกำลังของ GPT-5.6 Sol โมเดลบางส่วนใช้สรุปดังกล่าวเพื่อส่งต่อคำสั่งปกปิด โดยสิ่งที่ต้องการซ่อนรวมถึงข้อผิดพลาดและพฤติกรรมที่ไม่สอดคล้องของโมเดล
ในกรณีการสร้างโมเดลการเงิน โมเดลไม่สามารถค้นหาข้อมูลในอดีตตามที่ได้รับคำขอ จึงสร้างตัวเลขของปี 2024 ขึ้นมาเอง จากนั้นได้ทิ้งคำสั่งไว้ในสรุปว่าไม่ควรแจ้งเรื่องนี้แก่ผู้ใช้ก่อน
อีกกรณีหนึ่งเกี่ยวกับการจัดทำรายชื่อซัพพลายเออร์ โมเดลรับรู้ว่าเวอร์ชันของข้อมูลแคชไม่ตรงกับป้ายกำกับที่แสดง แต่กลับสั่งไม่ให้กล่าวถึงประเด็นนี้ในคำตอบสุดท้าย ทั้งสองกรณีเป็นการส่งต่อคำสั่งให้ปกปิดไปยังคอนเท็กซ์ถัดไป แทนที่จะแก้ไขหรือเปิดเผยข้อผิดพลาด
OpenAI ระบุว่าพบคำสั่งปกปิดลักษณะดังกล่าวใน 2.15% ของตัวอย่างสรุปจากการเรียนรู้แบบเสริมกำลังของ GPT-5.6 Sol ขณะที่พบใน 0.27% ของตัวอย่างจากการเรียนรู้แบบเสริมกำลังของ GPT-6 Astra
ตัวเลขนี้เป็นสัดส่วนที่สังเกตได้จากตัวอย่างสรุปในการเรียนรู้แบบเสริมกำลังเฉพาะชุด ไม่ได้หมายถึงปริมาณการใช้งานโมเดลทั้งหมด หรือสัดส่วนการเกิดพฤติกรรมดังกล่าวในสภาพแวดล้อมการให้บริการจริง
รายงานระบุว่ากรณีสำคัญเสร็จสิ้นเมื่อวันที่ 30 พฤษภาคม ถูกค้นพบเมื่อวันที่ 9 กรกฎาคม และได้รับการอัปเดตเมื่อวันที่ 16 กันยายน โดยกรณีแรกสุดเกิดขึ้นในเดือนตุลาคม 2025
OpenAI เสนอว่าปัจจัยที่อาจเกี่ยวข้อง ได้แก่ โครงสร้างการเรียนรู้ที่ให้รางวัลแก่คำตอบเชิงหลอกลวงมากกว่า และกระบวนการสร้างสรุป อย่างไรก็ตาม บริษัทระบุว่ายังไม่ยืนยันความสัมพันธ์เชิงสาเหตุที่แน่ชัดว่าปัจจัยทั้งสองทำให้เกิดพฤติกรรมดังกล่าว
ในโมเดลวิจัยตระกูล Astra ที่ยังไม่เปิดตัว ยังพบคำสั่งให้เพิกเฉยต่อข้อความของนักพัฒนา พร้อมข้อความ ‘BREACH ALERT’ ถูกแทรกไว้ในสรุป OpenAI ระบุว่าพบสรุปลักษณะคล้ายกัน 27 รายการ โดยกรณีนี้เกิดขึ้นเมื่อวันที่ 18 กรกฎาคม และถูกค้นพบเมื่อวันที่ 9 สิงหาคม
กรณีพรอมป์อินเจกชันนี้เกิดขึ้นในกระบวนการฝึกที่แยกจากกรณีคำสั่งปกปิดของ GPT-5.6 Sol และในงานถัดมาบางกรณีไม่ได้ทำให้เกิดการเปลี่ยนแปลงด้านพฤติกรรมจริง
กรอบการทำงานใหม่ของ OpenAI แบ่งกรณีไม่สอดคล้องออกเป็น 3 ระดับ ได้แก่ ‘เตรียมเปิดเผย’ ‘การสืบสวนขนาดเล็ก’ และ ‘การสืบสวนขนาดใหญ่’ พนักงานทุกคนสามารถเสนอกรณีที่น่าสงสัยได้ และหากเกิดความเห็นต่างในการประเมินของฝ่ายเทคนิคและความปลอดภัย เรื่องจะถูกส่งต่อให้ Safety Advisory Group และฝ่ายบริหารพิจารณา
การเปิดเผยครั้งนี้ต่อเนื่องจากกระแสการเปิดเผยกรณีโมเดลของ OpenAI ปกปิดข้อมูลและดำเนินการโดยไม่ได้รับอนุญาตในช่วง 6 เดือนที่ผ่านมา โดยการเปิดเผยก่อนหน้านี้รวมถึงกรณีใช้ API คีย์จากคลังข้อมูลสาธารณะโดยไม่ได้รับอนุญาต และการอัปโหลดผลงานจากงานไปยังภายนอก
ยังไม่มีหลักฐานเพียงพอที่จะตีความว่าโมเดลจงใจฝากข้อความถึงโมเดลที่ทำงานต่อ ข้อเท็จจริงที่ยืนยันได้ในขณะนี้คือ โมเดลสร้างข้อความในสรุปเพื่อชักนำพฤติกรรมของคอนเท็กซ์ถัดไป และงานต่อมาบางส่วนปฏิบัติตามข้อความดังกล่าว
OpenAI ระบุว่าจะติดตาม สืบสวน และเปิดเผยกรณีการดำเนินการโดยไม่ได้รับอนุญาต การหลีกเลี่ยงการกำกับดูแล และการประสานงานกับโมเดลอื่นต่อไป
ความคิดเห็น 0