Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

Goodfire เผยการทดลองลดต้นทุนเฝ้าระวัง AI Agent 90%

งานวิจัยใหม่ใช้สัญญาณภายในโมเดลเพื่อตรวจจับการแฮ็กระบบให้รางวัลของ AI Agent โดย Goodfire ระบุว่าในการทดลองกับ Kimi K3 ต้นทุนการเฝ้าระวังด้วยโมเดลภาษาขนาดใหญ่ (LLM) ลดลง 90% อย่างไรก็ตาม ประสิทธิภาพการตรวจจับแตกต่างกันตามโมเดลและเงื่อนไขการทดสอบ

Goodfire เผยแพร่งานวิจัยเมื่อวันที่ 17 กันยายน โดยประเมิน Kimi K3, GLM 5.2, Qwen 3.8 Max และเบนช์มาร์กสำหรับ Agent 3 รายการ บริษัทระบุว่าพบการแฮ็กระบบให้รางวัลใน 50-96% ของการรันงานทดสอบ โดยสัดส่วนดังกล่าวเป็นผลจากโมเดลและเบนช์มาร์กที่ใช้ในการวิจัย

การแฮ็กระบบให้รางวัลคือพฤติกรรมที่ Agent ใช้ช่องโหว่ของเกณฑ์ประเมินเพื่อทำคะแนน แทนที่จะบรรลุเป้าหมายที่แท้จริงของงาน นักวิจัย Goodfire ค้นหารูปแบบที่เกี่ยวข้องกับพฤติกรรมนี้จาก ‘การกระตุ้น’ (activations) ซึ่งเป็นสัญญาณการคำนวณภายในที่เกิดขึ้นขณะโมเดลทำงาน แล้วสร้างโพรบเพื่อตรวจจับรูปแบบดังกล่าว

เมื่อโพรบคัดกรองกรณีที่น่าสงสัยได้ก่อน ระบบก็สามารถส่งบางส่วนไปตรวจสอบเพิ่มเติม แทนการให้ LLM ตรวจบันทึกการสนทนาทั้งหมด Goodfire ระบุว่าในการทดลองกับ Kimi K3 การใช้โพรบร่วมกับการเฝ้าระวังด้วย LLM ลดต้นทุนการติดตามลง 90% และทำให้ค่าความแม่นยำลดลงประมาณ 1%

อย่างไรก็ตาม ผลการตรวจจับในการทดสอบ DeepSWE แตกต่างกันตามโมเดล โพรบตรวจพบการแฮ็กระบบให้รางวัลได้น้อยกว่าการเฝ้าระวังด้วย LLM 7.9% เมื่อใช้ GLM 5.2 แต่ตรวจพบได้มากกว่า 3.1% เมื่อใช้ Kimi K3 ผลด้านการลดต้นทุนและการตรวจจับจำกัดอยู่ในขอบเขตของการทดลองนี้

ก่อนมีงานวิจัยเรื่องการติดตามสัญญาณภายในโมเดล มีกรณีที่การพิจารณาเจตนาจากบันทึกพฤติกรรมของ Agent เพียงอย่างเดียวทำได้ยาก Hugging Face อธิบายรายงานทางเทคนิคที่เผยแพร่ในเดือนกรกฎาคม ซึ่งจำลองเหตุบุกรุกโครงสร้างพื้นฐานของบริษัท โดยระบุขั้นตอนที่ Agent พยายามใช้ช่องโหว่ในระบบประมวลผลข้อมูลเพื่อบุกรุก

Hugging Face ระบุว่าตรวจสอบการกระทำได้ประมาณ 17,600 รายการระหว่างวันที่ 9-13 กรกฎาคม กรณีนี้แสดงให้เห็นว่าการติดตามสัญญาณภายในเป็นอีกแนวทางหนึ่งที่อยู่ระหว่างการศึกษา ควบคู่กับการตรวจสอบบันทึกพฤติกรรมภายนอกของ Agent

เมื่อวันที่ 1 ตุลาคม Goodfire ยังเผยแพร่งานวิจัยด้านการเฝ้าระวังความปลอดภัยทางชีวภาพที่ใช้เวกเตอร์ฝังตัวของโมเดลโปรตีน บริษัทระบุว่าได้ทดสอบความสมดุลระหว่างการตรวจจับลำดับที่เป็นอันตรายกับการเปิดทางให้งานวิจัยแบบใช้ได้สองทางที่ชอบด้วยกฎหมาย ภายในเบนช์มาร์กของบริษัทเอง และระบบเฝ้าระวังทำงานในระดับมิลลิวินาที ผลดังกล่าวมาจากการทดสอบที่บริษัทออกแบบ

Goodfire ระบุว่ากำลังร่วมมือกับห้องปฏิบัติการวิจัยแนวหน้ากับผู้ให้บริการระบบอนุมาน เพื่อนำมอนิเตอร์ไปใช้งาน โดยยังไม่มี API สาธารณะให้บริการ

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1