Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

วอเตอร์มาร์ก AI เปลี่ยนการปฏิเสธคำขออันตรายและการเรียกใช้เครื่องมือ

งานวิจัยพบว่า การใช้วอเตอร์มาร์ก AI กับ LLM อาจเปลี่ยนทั้งการเลือกถ้อยคำทั่วไป การปฏิเสธคำขออันตราย และการเรียกใช้เครื่องมือของเอเจนต์ AI โดยโมเดลแบบเปิดน้ำหนักบางรุ่นมีแนวโน้มตอบสนองต่อคำขออันตรายเพิ่มขึ้นหลังใช้วอเตอร์มาร์ก

Lasso Security เปิดเผยงานวิจัยเมื่อวันที่ 17 โดยนำวิธี SynthID-Text ของ Google DeepMind มาปรับใช้กับโมเดลแบบเปิดน้ำหนักเพื่อเปรียบเทียบการเปลี่ยนแปลงด้านพฤติกรรม การทดลองใช้โมเดลและพรอมต์เดียวกัน โดยเปลี่ยนเฉพาะการเปิดใช้วอเตอร์มาร์ก

แอนเดรีย ซิโปโซวา (Andrea Siposova) นักวิจัยของ Lasso Security กล่าวว่า “วอเตอร์มาร์กเปลี่ยนพฤติกรรมของโมเดลอย่างชัดเจนเมื่ออยู่ในเงื่อนไขที่เป็นปฏิปักษ์หรือเมื่อเอเจนต์เรียกใช้เครื่องมือ” เธออธิบายว่า แม้กระบวนการสร้างเครื่องหมายที่มองไม่เห็นในผลลัพธ์ ก็อาจส่งผลต่อการเลือกโทเคนของโมเดลได้

SynthID-Text ไม่ได้ทำงานด้วยการเติมข้อมูลแยกต่างหากหลังการสร้างข้อความ แต่ใช้คีย์ลับและการสุ่มตัวอย่างแบบทัวร์นาเมนต์ในกระบวนการที่โมเดลเลือกโทเคนถัดไป เพื่อสร้างรูปแบบทางสถิติ

โมเดลจะเปรียบเทียบความน่าจะเป็นของโทเคนหลายตัวก่อนเลือกคำถัดไป หากวอเตอร์มาร์กเข้ามาแทรกแซงในขั้นตอนนี้ ผลลัพธ์ที่เลือกอาจแตกต่างกันตามคีย์ แม้ใช้พรอมต์และโมเดลเดียวกัน

ในประโยคทั่วไป ความเปลี่ยนแปลงอาจจำกัดอยู่ที่คำบางคำ แต่ในสภาพแวดล้อมที่เอเจนต์ AI สร้างชื่อเครื่องมือและค่าอาร์กิวเมนต์ในรูปแบบ JSON วอเตอร์มาร์กอาจเปลี่ยนทั้งการเลือกเครื่องมือและค่าอาร์กิวเมนต์ เช่น เส้นทาง ผู้รับ คำค้นหา และจำนวนเงิน

Lasso Security ใช้ BFCL v4 single-turn AST ประเมินการเรียกใช้เครื่องมือ หลังใช้วอเตอร์มาร์ก ความแม่นยำในการเรียกใช้เครื่องมือลดลงในโมเดล 6 จาก 7 รุ่น และใน 4 รุ่นมีการลดลงอย่างมีนัยสำคัญทางสถิติ

สัดส่วนผลลัพธ์การเรียกใช้ที่เปลี่ยนไปก่อนและหลังใช้วอเตอร์มาร์กอยู่ที่ค่าเฉลี่ย 6.5% จากชุดโมเดลและอุณหภูมิ 21 แบบ ภายใต้บางเงื่อนไข ผลลัพธ์การเรียกใช้ของ phi-4 เปลี่ยนแปลง 16.8% และของ Llama-3.1-8B เปลี่ยนแปลง 9.9%

การทดลองปฏิเสธคำขออันตรายใช้พฤติกรรมอันตราย 200 รายการจาก HarmBench และคำขอปกติ 100 รายการจาก JailbreakBench นักวิจัยเปรียบเทียบกรณีที่มีเฉพาะคำขออันตรายกับกรณีที่เพิ่มพรอมต์อินเจกชันแบบคงที่ โดยผลกระทบของวอเตอร์มาร์กต่อพฤติกรรมการปฏิเสธมีมากขึ้นเมื่อใช้ร่วมกับพรอมต์อินเจกชัน

นักวิจัยเรียกปรากฏการณ์นี้ว่า ‘sampling drift’ หมายถึง วอเตอร์มาร์กไม่ได้เปลี่ยนน้ำหนักของโมเดลหรือพรอมต์ แต่เปลี่ยนการเลือกโทเคนจนทำให้คำตอบของโมเดลและพฤติกรรมของเอเจนต์แตกต่างกัน

อย่างไรก็ตาม งานวิจัยนี้ไม่ได้ทดสอบโมเดล Claude โดยการทดลองครอบคลุมโมเดลแบบเปิดน้ำหนัก 6 รุ่น และใช้การติดตั้ง SynthIDTextWatermarkLogitsProcessor ของ Hugging Face ที่ไม่ได้ปรับแก้

Anthropic ประกาศเมื่อวันที่ 14 สิงหาคมว่าจะนำวอเตอร์มาร์กข้อความที่อ้างอิง SynthID-Text ของ Google DeepMind มาใช้กับโมเดล Claude ในอนาคต โดยระบุว่าวอเตอร์มาร์กจะไม่ส่งผลอย่างมีนัยสำคัญต่อคุณภาพหรือความอ่านง่ายของผลลัพธ์ และผู้อ่านจะไม่สามารถระบุได้

งานวิจัยของ Google DeepMind รายงานผลการประเมินจากคำตอบ Gemini ราว 20 ล้านรายการว่าไม่พบคุณภาพลดลงจากวอเตอร์มาร์ก ผลการรักษาคุณภาพประโยคโดยเฉลี่ยและผลที่ระบุว่าการรันแต่ละครั้งอาจแตกต่างกันตามพรอมต์ คีย์ และโมเดล สามารถเกิดขึ้นพร้อมกันได้

ในสภาพแวดล้อมที่เอเจนต์ AI เรียกใช้เครื่องมือภายนอก สิ่งที่ต้องควบคุมไม่ใช่แค่คำตอบของโมเดล แต่รวมถึงสิทธิ์และเส้นทางการทำงานด้วย ประเด็นที่ต้องควบคุมพรอมต์อินเจกชันและการเรียกใช้เครื่องมือไปพร้อมกันสอดคล้องกับข้อเสนอที่ว่าโครงสร้างควบคุมความปลอดภัย AI สำหรับองค์กรต้องจัดการทั้งคำตอบของโมเดลและสิทธิ์ของเครื่องมือภายนอก

มาตรา 50 วรรค 2 ของกฎหมาย AI ของสหภาพยุโรปกำหนดให้ผู้ให้บริการระบบสร้างข้อความ ภาพ เสียง และวิดีโอสังเคราะห์ แสดงผลลัพธ์ในรูปแบบที่เครื่องอ่านได้ และทำให้สามารถตรวจจับได้ว่าเป็นเนื้อหาที่สร้างโดย AI แม้การใช้วอเตอร์มาร์กจะขยายตัว แต่การนำไปใช้และผลกระทบด้านความปลอดภัยของแต่ละโมเดลยังต้องตรวจสอบแยกกัน

งานวิจัยนี้ไม่ได้หมายความว่าวอเตอร์มาร์กจะทำให้ระบบป้องกันความปลอดภัยของโมเดลทุกตัวและทุกคีย์อ่อนแอลง แต่ยืนยันว่าการเปลี่ยนแปลงด้านพฤติกรรมอาจเกิดขึ้นตามเงื่อนไขของโมเดล คีย์ และพรอมต์ อีกทั้งยังไม่ได้พิสูจน์ความเสียหายจากเอเจนต์ที่ใช้งานจริงจนเรียกใช้เครื่องมืออันตรายโดยตรง และยังไม่พบความเชื่อมโยงโดยตรงระหว่างวอเตอร์มาร์ก LLM กับสินทรัพย์ดิจิทัลหรือบล็อกเชน

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1