โมเดลรุ่นล่าสุดในตระกูล Opus, Sonnet และ GPT ตรวจพบธุรกรรมและมูลค่าความเสียหายจากการฉ้อโกงได้น้อยกว่ารุ่นก่อน ในการประเมินธุรกรรมชำระเงินย้อนหลังของ Coinbase โดย GPT-5.6 (sol) ระบุธุรกรรมว่าเป็นการฉ้อโกงได้แม่นยำขึ้น แต่มีอัตราตรวจพบธุรกรรมฉ้อโกงโดยรวมลดลง
Coinbase($COIN) เปิดเผยการประเมินของบริษัทเมื่อวันที่ 7 ตุลาคม โดยเปรียบเทียบ Opus 4.5 กับ Opus 5, Sonnet 4.6 กับ Sonnet 5 และ GPT-5.4 กับ GPT-5.6 (sol) การทดสอบนำธุรกรรม 16,140 รายการจากประวัติ 9 สัปดาห์มาประเมินซ้ำ ครอบคลุมผู้ใช้ 7,293 ราย และธุรกรรมฉ้อโกงที่ยืนยันแล้ว 813 รายการ เกณฑ์แปลงการประเมินความเสี่ยงของแต่ละโมเดลเป็นการตัดสินใจระงับธุรกรรมคงเดิม
โมเดลรุ่นล่าสุดทั้งสามตระกูลมีค่า Recall, คะแนน F1 และ Recall แบบถ่วงน้ำหนักด้วยมูลค่าเงินดอลลาร์ต่ำกว่ารุ่นก่อนทั้งหมด Recall คือสัดส่วนธุรกรรมฉ้อโกงที่โมเดลตรวจพบจากธุรกรรมฉ้อโกงที่เกิดขึ้นจริง ส่วน Recall แบบถ่วงน้ำหนักด้วยมูลค่าเงินดอลลาร์คือสัดส่วนมูลค่าความเสียหายที่ตรวจพบจากยอดฉ้อโกงที่ยืนยันแล้ว คะแนน F1 สะท้อนทั้งความแม่นยำและ Recall
GPT-5.6 (sol) มีค่า Precision สูงกว่ารุ่นก่อน 11.5 จุดเปอร์เซ็นต์ แต่ค่า Recall ลดลง 20.7 จุดเปอร์เซ็นต์ และ Recall แบบถ่วงน้ำหนักด้วยมูลค่าเงินดอลลาร์ลดลง 21.8 จุดเปอร์เซ็นต์ แม้การระบุธุรกรรมที่ติดป้ายว่าเป็นการฉ้อโกงจะแม่นยำขึ้น แต่ขอบเขตการตรวจพบธุรกรรมฉ้อโกงและมูลค่าความเสียหายโดยรวมแคบลง
Opus 5 และ Sonnet 5 มีผลต่ำกว่ารุ่นก่อนในตัวชี้วัดทั้งสี่รายการ ค่า Recall ของ Opus ลดลง 0.8 จุดเปอร์เซ็นต์ ขณะที่ Sonnet มีค่า Recall และ Recall แบบถ่วงน้ำหนักด้วยมูลค่าเงินดอลลาร์ลดลง 22.2 และ 22.9 จุดเปอร์เซ็นต์ตามลำดับ Coinbase ระบุว่ายังยืนยันไม่ได้ว่าสาเหตุของการลดลงมาจากวิธีฝึกโมเดลหรือการเปลี่ยนแปลงเฉพาะจุด
การประเมินครั้งนี้ไม่ได้วัดความเสียหายของลูกค้าที่เกิดขึ้นในบริการแบบเรียลไทม์ แต่เป็นการนำธุรกรรมในอดีตมาทดสอบซ้ำภายใต้เงื่อนไขเดียวกันเพื่อดูความแตกต่างระหว่างโมเดลแต่ละรุ่น นอกจากนี้ยังไม่ได้วัดประสิทธิภาพหากนำโมเดล AI รุ่นล่าสุดมาแทนระบบป้องกันการฉ้อโกงทั้งหมดที่ใช้อยู่
ก่อนหน้านี้ Coinbase เปิดเผยผลการทดลองออนไลน์อีกชุดหนึ่งว่า ธุรกรรมฉ้อโกงลดลง 30% และมูลค่าการฉ้อโกงลดลง 22% หลังเพิ่มการตรวจสอบด้วย AI เข้าไปในโมเดลแมชชีนเลิร์นนิงและกฎที่ใช้อยู่เดิม การทดลองดังกล่าวเป็นการเสริม AI ให้กับระบบเดิม และใช้วิธีทดสอบต่างจากการเปรียบเทียบรุ่นโมเดลครั้งนี้ บริษัทเคยเผยแพร่ผลการทดลองป้องกันการฉ้อโกงและการนำ AI เข้ามาช่วยตรวจสอบในรายงานอีกฉบับ
ในการประเมินอีกชุดที่เผยแพร่เมื่อวันที่ 8 ตุลาคม Coinbase ระบุว่า Qwen3.5-9B ซึ่งฝึกเพิ่มเติมด้วยข้อมูลการฉ้อโกง ทำผลได้ดีกว่า Opus 4.5 ในตัวชี้วัดการตรวจจับทั้งสี่รายการ คะแนน F1 สูงกว่า 9.6 จุดเปอร์เซ็นต์ และเวลาแฝงในการอนุมานออนไลน์สั้นลง 55% ผลดังกล่าวอิงข้อมูลภายในของ Coinbase และเงื่อนไขการประเมินอีกชุดหนึ่ง
การเปรียบเทียบนี้แสดงให้เห็นว่าการเปลี่ยนรุ่นโมเดลอาจส่งผลต่อการตรวจจับภายใต้ข้อมูลการฉ้อโกงจากการชำระเงินและเกณฑ์ตัดสินชุดหนึ่ง แต่ผลการประเมินนี้เพียงอย่างเดียวไม่อาจใช้สรุปได้ว่าจะเกิดผลแบบเดียวกันกับบริการอื่นหรือความเสียหายของลูกค้าในระบบเรียลไทม์หรือไม่
ความคิดเห็น 0