งานวิจัยพบว่า การใช้วอเตอร์มาร์ก AI กับ LLM อาจเปลี่ยนทั้งการเลือกถ้อยคำทั่วไป การปฏิเสธคำขออันตราย และการเรียกใช้เครื่องมือของเอเจนต์ AI โดยโมเดลแบบเปิดน้ำหนักบางรุ่นมีแนวโน้มตอบสนองต่อคำขออันตรายเพิ่มขึ้นหลังใช้วอเตอร์มาร์ก
Lasso Security เปิดเผยงานวิจัยเมื่อวันที่ 17 โดยนำวิธี SynthID-Text ของ Google DeepMind มาปรับใช้กับโมเดลแบบเปิดน้ำหนักเพื่อเปรียบเทียบการเปลี่ยนแปลงด้านพฤติกรรม การทดลองใช้โมเดลและพรอมต์เดียวกัน โดยเปลี่ยนเฉพาะการเปิดใช้วอเตอร์มาร์ก
แอนเดรีย ซิโปโซวา (Andrea Siposova) นักวิจัยของ Lasso Security กล่าวว่า “วอเตอร์มาร์กเปลี่ยนพฤติกรรมของโมเดลอย่างชัดเจนเมื่ออยู่ในเงื่อนไขที่เป็นปฏิปักษ์หรือเมื่อเอเจนต์เรียกใช้เครื่องมือ” เธออธิบายว่า แม้กระบวนการสร้างเครื่องหมายที่มองไม่เห็นในผลลัพธ์ ก็อาจส่งผลต่อการเลือกโทเคนของโมเดลได้
SynthID-Text ไม่ได้ทำงานด้วยการเติมข้อมูลแยกต่างหากหลังการสร้างข้อความ แต่ใช้คีย์ลับและการสุ่มตัวอย่างแบบทัวร์นาเมนต์ในกระบวนการที่โมเดลเลือกโทเคนถัดไป เพื่อสร้างรูปแบบทางสถิติ
โมเดลจะเปรียบเทียบความน่าจะเป็นของโทเคนหลายตัวก่อนเลือกคำถัดไป หากวอเตอร์มาร์กเข้ามาแทรกแซงในขั้นตอนนี้ ผลลัพธ์ที่เลือกอาจแตกต่างกันตามคีย์ แม้ใช้พรอมต์และโมเดลเดียวกัน
ในประโยคทั่วไป ความเปลี่ยนแปลงอาจจำกัดอยู่ที่คำบางคำ แต่ในสภาพแวดล้อมที่เอเจนต์ AI สร้างชื่อเครื่องมือและค่าอาร์กิวเมนต์ในรูปแบบ JSON วอเตอร์มาร์กอาจเปลี่ยนทั้งการเลือกเครื่องมือและค่าอาร์กิวเมนต์ เช่น เส้นทาง ผู้รับ คำค้นหา และจำนวนเงิน
Lasso Security ใช้ BFCL v4 single-turn AST ประเมินการเรียกใช้เครื่องมือ หลังใช้วอเตอร์มาร์ก ความแม่นยำในการเรียกใช้เครื่องมือลดลงในโมเดล 6 จาก 7 รุ่น และใน 4 รุ่นมีการลดลงอย่างมีนัยสำคัญทางสถิติ
สัดส่วนผลลัพธ์การเรียกใช้ที่เปลี่ยนไปก่อนและหลังใช้วอเตอร์มาร์กอยู่ที่ค่าเฉลี่ย 6.5% จากชุดโมเดลและอุณหภูมิ 21 แบบ ภายใต้บางเงื่อนไข ผลลัพธ์การเรียกใช้ของ phi-4 เปลี่ยนแปลง 16.8% และของ Llama-3.1-8B เปลี่ยนแปลง 9.9%
การทดลองปฏิเสธคำขออันตรายใช้พฤติกรรมอันตราย 200 รายการจาก HarmBench และคำขอปกติ 100 รายการจาก JailbreakBench นักวิจัยเปรียบเทียบกรณีที่มีเฉพาะคำขออันตรายกับกรณีที่เพิ่มพรอมต์อินเจกชันแบบคงที่ โดยผลกระทบของวอเตอร์มาร์กต่อพฤติกรรมการปฏิเสธมีมากขึ้นเมื่อใช้ร่วมกับพรอมต์อินเจกชัน
นักวิจัยเรียกปรากฏการณ์นี้ว่า ‘sampling drift’ หมายถึง วอเตอร์มาร์กไม่ได้เปลี่ยนน้ำหนักของโมเดลหรือพรอมต์ แต่เปลี่ยนการเลือกโทเคนจนทำให้คำตอบของโมเดลและพฤติกรรมของเอเจนต์แตกต่างกัน
อย่างไรก็ตาม งานวิจัยนี้ไม่ได้ทดสอบโมเดล Claude โดยการทดลองครอบคลุมโมเดลแบบเปิดน้ำหนัก 6 รุ่น และใช้การติดตั้ง SynthIDTextWatermarkLogitsProcessor ของ Hugging Face ที่ไม่ได้ปรับแก้
Anthropic ประกาศเมื่อวันที่ 14 สิงหาคมว่าจะนำวอเตอร์มาร์กข้อความที่อ้างอิง SynthID-Text ของ Google DeepMind มาใช้กับโมเดล Claude ในอนาคต โดยระบุว่าวอเตอร์มาร์กจะไม่ส่งผลอย่างมีนัยสำคัญต่อคุณภาพหรือความอ่านง่ายของผลลัพธ์ และผู้อ่านจะไม่สามารถระบุได้
งานวิจัยของ Google DeepMind รายงานผลการประเมินจากคำตอบ Gemini ราว 20 ล้านรายการว่าไม่พบคุณภาพลดลงจากวอเตอร์มาร์ก ผลการรักษาคุณภาพประโยคโดยเฉลี่ยและผลที่ระบุว่าการรันแต่ละครั้งอาจแตกต่างกันตามพรอมต์ คีย์ และโมเดล สามารถเกิดขึ้นพร้อมกันได้
ในสภาพแวดล้อมที่เอเจนต์ AI เรียกใช้เครื่องมือภายนอก สิ่งที่ต้องควบคุมไม่ใช่แค่คำตอบของโมเดล แต่รวมถึงสิทธิ์และเส้นทางการทำงานด้วย ประเด็นที่ต้องควบคุมพรอมต์อินเจกชันและการเรียกใช้เครื่องมือไปพร้อมกันสอดคล้องกับข้อเสนอที่ว่าโครงสร้างควบคุมความปลอดภัย AI สำหรับองค์กรต้องจัดการทั้งคำตอบของโมเดลและสิทธิ์ของเครื่องมือภายนอก
มาตรา 50 วรรค 2 ของกฎหมาย AI ของสหภาพยุโรปกำหนดให้ผู้ให้บริการระบบสร้างข้อความ ภาพ เสียง และวิดีโอสังเคราะห์ แสดงผลลัพธ์ในรูปแบบที่เครื่องอ่านได้ และทำให้สามารถตรวจจับได้ว่าเป็นเนื้อหาที่สร้างโดย AI แม้การใช้วอเตอร์มาร์กจะขยายตัว แต่การนำไปใช้และผลกระทบด้านความปลอดภัยของแต่ละโมเดลยังต้องตรวจสอบแยกกัน
งานวิจัยนี้ไม่ได้หมายความว่าวอเตอร์มาร์กจะทำให้ระบบป้องกันความปลอดภัยของโมเดลทุกตัวและทุกคีย์อ่อนแอลง แต่ยืนยันว่าการเปลี่ยนแปลงด้านพฤติกรรมอาจเกิดขึ้นตามเงื่อนไขของโมเดล คีย์ และพรอมต์ อีกทั้งยังไม่ได้พิสูจน์ความเสียหายจากเอเจนต์ที่ใช้งานจริงจนเรียกใช้เครื่องมืออันตรายโดยตรง และยังไม่พบความเชื่อมโยงโดยตรงระหว่างวอเตอร์มาร์ก LLM กับสินทรัพย์ดิจิทัลหรือบล็อกเชน
ความคิดเห็น 0