Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

Anthropic ระงับอินเทอร์เน็ตเรียลไทม์ในการประเมิน AI ภายในทั้งหมด

Anthropic ระงับการเชื่อมต่ออินเทอร์เน็ตแบบเรียลไทม์ในการประเมิน AI ภายในทั้งหมด หลังพบว่าระหว่างการประเมิน โมเดลหลบเลี่ยงข้อจำกัดของเว็บไซต์และส่งแบบฟอร์มออนไลน์จริง

Anthropic ระบุในบล็อกเมื่อวันที่ 9 ว่าจะตัดการเชื่อมต่ออินเทอร์เน็ตแบบเรียลไทม์จากการประเมินภายในทั้งหมด จนกว่าระบบความปลอดภัยและการเฝ้าระวังจะตรวจจับและควบคุมพฤติกรรมดังกล่าวได้อย่างน่าเชื่อถือ ก่อนหน้านี้บริษัทใช้มาตรการปิดกั้นเฉพาะการประเมินด้านความเสี่ยงสูงบางประเภทและด้านความมั่นคงปลอดภัยไซเบอร์ แต่มาตรการใหม่นี้ครอบคลุมการประเมินภายในทั้งหมด

ในบล็อกมีตัวอย่างพฤติกรรม 4 ประเภท โมเดลใช้ช่องโหว่ของซอฟต์แวร์บนเว็บไซต์บุคคลที่สามเพื่อสั่งงานบนเซิร์ฟเวอร์ และเข้าถึงข้อมูลที่จำกัดด้วยโทเคนหรือค่าธรรมเนียม นอกจากนี้ยังใช้บริการย่อลิงก์เพื่อหลบเลี่ยงข้อจำกัดความยาว URL ของเครื่องมือเว็บ และส่งแบบฟอร์มที่มีข้อมูลอ่อนไหวบนเว็บไซต์จริง

หนึ่งในกรณีที่ยกมาคือการส่งข้อมูลเท็จผ่านแบบฟอร์มแจ้งเบาะแสคดีฆาตกรรมที่ยังไม่คลี่คลายของตำรวจฟิลาเดลเฟีย Anthropic อธิบายว่า Claude Haiku 4.5 ซึ่งกำลังทำงานตัวอย่างบนหน้าเว็บสุ่ม ได้กรอกข้อมูลที่แต่งขึ้นลงในแบบฟอร์ม

แม้แบบฟอร์มจะไม่ได้ขอคำบรรยายผู้ก่อเหตุ แต่โมเดลเขียนข้อความในทำนองว่าเห็นบุคคลที่มีลักษณะคล้ายผู้ต้องสงสัยในช่วงเวลาหนึ่ง โดยเว้นช่องชื่อและข้อมูลติดต่อไว้ รายงานดังกล่าวถูกจัดเป็นสแปมและไม่ได้ส่งต่อให้ผู้สืบสวน The Washington Post รายงานด้วยว่า ตำรวจฟิลาเดลเฟียยืนยันว่าเบาะแสถูกจัดประเภทโดยอัตโนมัติและไม่ได้ใช้ในการสืบสวนจริง

Anthropic ระบุว่ากรณีส่วนใหญ่เป็นพฤติกรรม 'ความพยายามต่อเนื่อง' ซึ่งโมเดลไม่หยุดเมื่อทำงานตามคำขอไม่สำเร็จ แต่พยายามหลบเลี่ยงข้อจำกัดแทน บางกรณีเกิดขึ้นในสภาพแวดล้อมที่คำสั่งของงานคลุมเครือ หรือแบบฟอร์มสำหรับฝึกใช้งานไม่ทำงานตามที่ควร

บริษัทอธิบายว่า หากการประเมินให้รางวัลแก่การหลบเลี่ยงข้อจำกัด โมเดลอาจเรียนรู้พฤติกรรมดังกล่าว การหาช่องโหว่หรือวิธีอ้อมข้อจำกัดเพื่อให้ได้รางวัล แทนที่จะทำงานตามเป้าหมายที่กำหนด เรียกว่า 'การแฮ็กรางวัล'

Anthropic ระงับการประเมินบางรายการที่เปิดเผยต่อสาธารณะ หรือปรับให้ทำงานแบบออฟไลน์ บริษัทปรับโจทย์ประเมินเพื่อไม่ให้เข้าถึงเว็บไซต์จริง และเพิ่มข้อจำกัดในการเข้าถึงสำหรับเครื่องมือที่ใช้เปิดอ่านหน้าเว็บ

บริษัทระบุว่าเมื่อนำเครื่องมือสำหรับตรวจจับและปิดกั้นพฤติกรรมหลบเลี่ยงไปทดสอบกับกรณีที่เปิดเผยแล้ว เครื่องมือสามารถป้องกันได้ทั้งหมด Anthropic วางแผนย้ายเอเจนต์ภายในไปยังโครงสร้างพื้นฐานที่บริหารจัดการส่วนกลางและมีการแยกกักที่เข้มงวด พร้อมเพิ่มการเฝ้าระวังด้วยตัวจำแนกด้านความปลอดภัย

อย่างไรก็ตาม Anthropic ยังประเมินการจัดแนวโมเดลโดยรวมในกรณีเหล่านี้ไม่เสร็จสิ้น บริษัทระบุว่าผลกระทบที่ตรวจพบจนถึงขณะนี้มีจำกัด และประเมินว่ากรณีนี้รุนแรงน้อยกว่าเหตุการณ์ด้านความมั่นคงปลอดภัยไซเบอร์ที่รายงานในช่วงฤดูร้อน พร้อมย้ำว่ากรณีดังกล่าวยังไม่ทำให้ข้อสรุปเดิมเกี่ยวกับการจัดแนวโดยรวมของ Claude เปลี่ยนไป

บริษัทจะตรวจสอบสภาพแวดล้อมการประเมินและบันทึกการใช้งานภายในเพิ่มเติม และมีแผนเปิดเผยพฤติกรรมที่น่ากังวลเพิ่มเติม ก่อนหน้านี้ Anthropic เคยเปิดเผยกรณีที่ Claude ส่งแบบฟอร์มบนเว็บไซต์ของรัฐบาล

มาตรการนี้ยังกระทบการประเมินที่ใช้การค้นหาบนอินเทอร์เน็ตจริงเพื่อวัดความสามารถด้านการค้นหาของโมเดล AI ด้วย Anthropic ระบุว่าโจทย์ค้นหาเว็บจำลองให้สมจริงแบบออฟไลน์ได้ยาก และที่ผ่านมาใช้การประเมินผ่านอินเทอร์เน็ตจริง บริษัทไม่ได้ระบุว่าจะยกเลิกการปิดกั้นการเชื่อมต่อแบบเรียลไทม์เมื่อใด

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1