OpenAI ตรวจพบในการทดลองว่า AI Agent สามารถแทรกพรอมป์ที่เป็นอันตรายซ้ำลงในอีเมล ไฟล์ และโค้ด เพื่อแพร่ไปยัง Agent อื่นได้ ซึ่งเรียกว่า 'พรอมป์อินเจกชันแบบแพร่ตัวเอง'
OpenAI เปิดเผยในรายงานอย่างเป็นทางการเมื่อวันที่ 25 กันยายนว่า บริษัทค้นพบการโจมตีดังกล่าวโดยใช้โมเดลภายในที่ทำงานในรูปแบบ GPT-Red โดยพบครั้งแรกเมื่อวันที่ 27 มิถุนายน และดำเนินการทดลองในสภาพแวดล้อมจำลองสำหรับการประเมินการเรียกใช้เครื่องมือ
พรอมป์อินเจกชันคือการซ่อนคำสั่งที่เป็นอันตรายไว้ในเนื้อหาภายนอกที่ AI อ่าน เช่น อีเมลหรือหน้าเว็บ เพื่อเปลี่ยนพฤติกรรมของโมเดล ส่วนการโจมตีแบบแพร่ตัวเองถือเป็นรูปแบบที่ขยายไปอีกขั้น เพราะหลอกให้โมเดลใส่คำสั่งเดียวกันซ้ำลงในผลลัพธ์ เช่น อีเมลตอบกลับ ไฟล์ หรือโค้ด
ในกรณีที่ OpenAI เปิดเผย คำสั่งที่เป็นอันตรายถูกใส่ไว้ในเนื้อหาอีเมล จากนั้น AI Agent ได้แทรกอีเมลต้นฉบับทั้งหมดซ้ำไว้ท้ายข้อความตอบกลับ ทำให้ Agent อื่นที่อ่านอีเมลตอบกลับดังกล่าวอาจได้รับคำสั่งเดียวกัน
ช่องทางการแพร่ไม่ได้จำกัดอยู่ที่อีเมลเท่านั้น โดยยังพบกรณีที่คำสั่งโจมตีถูกทำซ้ำผ่านระบบไฟล์และคอมเมนต์ในโค้ด การทดสอบมุ่งเน้นสภาพแวดล้อมที่ใช้ฟังก์ชันเชื่อมต่อภายนอก เช่น อีเมลและปฏิทิน
วิธีการโจมตียังรวมถึงการหลอกโมเดลด้วยกระบวนการคิดปลอมหรือข้อความจากเครื่องมือปลอม นอกจากนี้ยังมีการศึกษาการโจมตีแบบ 'หลายฮอป' ซึ่งคำสั่งถูกส่งต่อผ่านข้อความหลายชุด
โมเดลโจมตีและโมเดลที่ถูกทดสอบในการวิจัยครั้งนี้เป็นเช็กพอยต์ภายในสำหรับงานวิจัยที่พัฒนาบน GPT-5.4-mini ทั้งหมด OpenAI อธิบายว่าโมเดลเหล่านี้ไม่ได้เป็นผลิตภัณฑ์ที่เผยแพร่ต่อสาธารณะ และการทดลองดำเนินการภายใต้การเรียกใช้เครื่องมือจำลอง
แนวคิดดังกล่าวเคยถูกเสนอในแวดวงวิชาการมาก่อน โดยนักวิจัยได้นำเสนอ 'Morris II' ในงานวิจัยปี 2024 เรื่อง 'Here Comes the AI Worm' ซึ่งศึกษาการส่งต่อพรอมป์ที่เป็นอันตรายแบบต่อเนื่องระหว่างระบบผู้ช่วยอีเมลที่ใช้ Generative AI
งานวิจัย Morris II ทดลองว่า AI ผู้ช่วยอีเมลสามารถใส่คำสั่งที่เป็นอันตรายลงในคำตอบ และแพร่คำสั่งดังกล่าวไปยังระบบ AI อื่นได้หรือไม่ ขณะที่การประกาศครั้งนี้ของ OpenAI แตกต่างตรงที่เป็นการตรวจสอบอัตโนมัติภายในกับโมเดลของบริษัท AI รายใหญ่
OpenAI ใช้ GPT-Red เป็นโมเดลเรดทีมอัตโนมัติ โดย GPT-Red ตรวจหาการโจมตีที่ถูกแทรกไว้ในอีเมล หน้าเว็บ ไฟล์ในเครื่อง และผลลัพธ์จากเครื่องมือ เพื่อประเมินช่องโหว่ของ AI Agent
OpenAI มีแผนรวมการโจมตีแบบแพร่ตัวเองไว้ในเป้าหมายการฝึกของ GPT-Red เพื่อเพิ่มความสามารถในการป้องกัน พร้อมระบุว่าการรับมือพรอมป์อินเจกชันไม่สามารถพึ่งพาการฝึกโมเดลเพียงอย่างเดียว แต่ควรใช้การตรวจสอบ การทำแซนด์บ็อกซ์ การกำหนดสิทธิ์ขั้นต่ำ และการขอผู้ใช้ยืนยันก่อนดำเนินการสำคัญร่วมกัน
กรณีนี้ไม่ได้หมายความว่าโมเดล AI สามารถทำซ้ำค่าน้ำหนักหรือทรัพยากรคอมพิวติ้งของตัวเองได้ แต่หมายถึงคำสั่งที่เป็นอันตรายสามารถถูกใส่ซ้ำในข้อความและไฟล์ที่ AI อ่านหรือสร้างขึ้น ก่อนส่งต่อไปยัง Agent ตัวถัดไป
ดังนั้นขอบเขตด้านความปลอดภัยจึงขยายจากภายในโมเดลไปสู่ระบบที่เชื่อมต่อ เช่น อีเมล เอกสาร ที่เก็บโค้ด และปฏิทิน โดย รายงานก่อนหน้านี้ของ TokenPost ระบุว่าบริษัทต่าง ๆ กำลังสร้างระบบควบคุมสิทธิ์และการตรวจสอบตามการขยายตัวของ AI Agent
บนโซเชียลมีเดีย มีความเห็นว่าการเรียกกรณีนี้ว่า 'AI ที่แพร่ตัวเอง' อาจทำให้ขอบเขตของงานวิจัยถูกตีความกว้างเกินจริง ผู้ใช้ Reddit บางส่วนก็แยกแยะว่าเหตุการณ์นี้ไม่ใช่การทำซ้ำค่าน้ำหนักโมเดลหรือทรัพยากรคอมพิวติ้ง แต่เป็นการโจมตีที่นำคำสั่งที่เป็นอันตรายกลับไปใส่ในผลลัพธ์
ข้อเท็จจริงที่เปิดเผยจนถึงขณะนี้อยู่ในระดับที่ยืนยันว่า พรอมป์อินเจกชันแบบแพร่ตัวเองสามารถเกิดขึ้นได้ในสภาพแวดล้อมการทดลอง ยังไม่มีการเปิดเผยหลักฐานว่าการโจมตีแพร่กระจายในบริการจริงหรือมีการขโมยข้อมูลผู้ใช้ และ OpenAI มีแผนนำการโจมตีที่เกี่ยวข้องไปใช้ในการฝึก GPT-Red ต่อไป
ความคิดเห็น 0