Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

Claude Opus 5.5 ประเมิน 78 ข้อทุกวัน เก็บค่ามาตรฐานของ Livenerf

โครงการโอเพนซอร์สเริ่มติดตามการเปลี่ยนแปลงด้านประสิทธิภาพของ Claude Opus 5.5 จาก Anthropic หลังเปิดตัว โดย Livenerf (ลิเวอร์เนิร์ฟ) ประเมินโมเดลภายใต้เงื่อนไขเดิมทุกวัน แต่ ณ วันที่ 1 ตุลาคม ยังไม่มีผลสรุปว่าประสิทธิภาพลดลงหรือไม่

Livenerf พัฒนาโดยนักพัฒนารายบุคคล ninjahawk และมุ่งประเมิน Opus 5.5 ซึ่งเปิดตัวเมื่อวันที่ 22 กันยายน โครงการระบุในคลังข้อมูลว่าเป็นโครงการอิสระที่ไม่เกี่ยวข้องกับ Anthropic ใช้กฎและวิธีให้คะแนนแบบตายตัวที่เปิดเผยต่อสาธารณะ พร้อมเผยแพร่บันทึกการประเมินดิบอย่างต่อเนื่อง

คำอธิบายเดิมของ Anthropic เกี่ยวกับการเปิดตัว Opus 5.5 มีการนำเสนอไว้ในรายงานก่อนหน้านี้ Livenerf ใช้ประสิทธิภาพในช่วงเปิดตัวเป็นค่ามาตรฐาน แล้ววัดแยกว่าการกระจายผลลัพธ์เปลี่ยนไปหรือไม่ภายใต้เงื่อนไขเดียวกันในเวลาต่อมา

ชุดประเมินประกอบด้วยคำถาม 2,336 ข้อจาก GPQA Diamond, MMLU-Pro, คณิตศาสตร์แข่งขัน และ AIME 2025–2026 โดยให้ Opus 5.5 ตอบแต่ละข้อ 4 ครั้ง ผลพบว่าตอบถูกประมาณ 93% ตั้งแต่ครั้งแรก และ 97% ของคำถามตอบถูกทั้ง 4 ครั้งหรือตอบผิดทั้ง 4 ครั้ง ส่วนคำถามที่ผลลัพธ์ถูกผิดสลับกันมี 78 ข้อ

Livenerf ใช้คำถาม 78 ข้อนี้เป็นชุดติดตามจริง เนื่องจากคำถามที่ตอบถูกเสมออาจไม่แสดงการเปลี่ยนแปลงแม้โมเดลอ่อนลง ขณะที่คำถามที่ตอบผิดเสมอก็ยากต่อการแยกแยะว่ามีการปรับปรุงเกิดขึ้นหรือไม่ โดยจะประเมินแต่ละข้อวันละครั้ง และให้คะแนนด้วยการเปรียบเทียบกับคำตอบที่ถูกต้องโดยตรง ไม่ใช้โมเดลภาษาเป็นผู้ตรวจ

ระยะเวลาประเมินทั้งหมด 30 วัน โดย 10 วันแรกใช้เป็นค่ามาตรฐานหลังเปิดตัว จากนั้นจะเปรียบเทียบข้อมูลเป็น 2 ช่วง ช่วงละ 10 วัน เอกสารลงทะเบียนล่วงหน้าระบุว่าช่วงเก็บค่ามาตรฐานแรกเริ่มวันที่ 24 กันยายน 2026

ณ วันที่ 1 ตุลาคม การเก็บค่ามาตรฐานยังดำเนินอยู่ ส่วน ณ วันที่ 30 กันยายน มีการเก็บข้อมูลในช่วงแรกแล้ว 7 วัน และต้องรอให้ช่วงเปรียบเทียบทั้ง 2 ช่วงเสร็จสิ้นจึงจะสามารถสรุปผลได้เร็วที่สุด

เกณฑ์ตัดสินถูกกำหนดไว้ล่วงหน้าเช่นกัน โดยในช่วงเวลา 10 วันติดต่อกัน 2 ช่วง ความแตกต่างจากค่ามาตรฐานต้องมีช่วงความเชื่อมั่น 99% ที่ไม่ครอบคลุมค่า 0 และต้องมีการเปลี่ยนแปลงอย่างน้อย 3 จุดเปอร์เซ็นต์ในแต่ละช่วง

โครงการใช้ Claude Opus 5 เป็นกลุ่มควบคุม หากโมเดลทั้ง 2 รุ่นเคลื่อนไหวไปในทิศทางเดียวกันภายใต้สภาพแวดล้อมการประเมินเดียวกัน จะจัดประเภทว่าเป็นการเปลี่ยนแปลงของเครื่องมือหรือแพลตฟอร์ม ไม่ใช่การเปลี่ยนแปลงเฉพาะของโมเดลใดโมเดลหนึ่ง

อย่างไรก็ตาม ความไวในการตรวจจับของ Livenerf มีข้อจำกัด เอกสารลงทะเบียนล่วงหน้าระบุว่าการเปลี่ยนแปลงความแม่นยำประมาณ 7.5 จุดเปอร์เซ็นต์ในช่วง 10 วันเป็นระดับที่คาดว่าจะตรวจจับได้ ส่วนการเปลี่ยนแปลงที่เล็กกว่านี้อาจถูกกลบด้วยสัญญาณรบกวนทางสถิติ

ในการทดสอบยืนยัน เมื่อเปลี่ยน Opus 5.5 เป็น Opus 5 ความแม่นยำลดลง 3.8±6.3 จุดเปอร์เซ็นต์ แต่ไม่สามารถแยกความแตกต่างได้ที่ระดับ 99% ขณะที่การใช้โทเคนลดลง 23% ซึ่งการเปลี่ยนแปลงระดับนี้ก็ตรวจสอบได้ยากด้วยวิธีประเมินดังกล่าว

เส้นทางการวัดผลก็มีข้อจำกัดเช่นกัน Livenerf ไม่ได้ประเมินโมเดลต้นฉบับผ่าน API แต่ประเมิน Opus 5.5 ที่ให้บริการผ่าน Claude Code แบบไร้หน้าต่างจากการสมัครสมาชิก Claude Max โดยล็อกเวอร์ชัน CLI ไว้ที่ 2.1.280

แม้จะล็อกระดับการใช้เหตุผล พรอมต์ ผู้ตรวจ เงื่อนไขการทำงาน และปัจจัยอื่นไว้ แต่การประเมินไม่ได้สะท้อนการเปลี่ยนแปลงทั้งหมดของการตั้งค่าเริ่มต้น เครื่องมือ หรือฟังก์ชันความจำที่ผู้ใช้จริงพบเจอ ดังนั้น สิ่งที่ Livenerf วัดจึงใกล้เคียงกับ Opus 5.5 ที่ให้บริการผ่าน Claude Code มากกว่าโมเดล API โดยตรง

Anthropic เคยอธิบายข้อถกเถียงด้านคุณภาพของ Claude Code ว่าอาจเกิดจากทั้งการเปลี่ยนแปลงของตัวโมเดลและปัญหาในองค์ประกอบของบริการ การวิเคราะห์ภายหลังในเดือนกันยายน 2025 กล่าวถึงบั๊กโครงสร้างพื้นฐานและข้อผิดพลาดในการกำหนดเส้นทางหน้าต่างบริบท ขณะที่การอัปเดตในเดือนเมษายน 2026 อธิบายการเปลี่ยนแปลงระดับการใช้เหตุผลเริ่มต้น แคชการคิด และพรอมต์ระบบ ข้อมูลดังกล่าวชี้ว่าการเปลี่ยนแปลงในชั้นบริการอาจส่งผลต่อคุณภาพที่ผู้ใช้รับรู้

Livenerf จึงเป็นเครื่องมือบันทึกระยะยาวเพื่อดูว่าการกระจายประสิทธิภาพเปลี่ยนไปภายใต้เงื่อนไขเดียวกันหลังเปิดตัวหรือไม่ มากกว่าจะเป็นเครื่องมือที่ตอบได้ทันทีว่าโมเดล 'แอบอ่อนลงหรือไม่' การตัดสินครั้งแรกจะมีขึ้นหลังการประเมิน 30 วันและช่วงเปรียบเทียบ 10 วัน 2 ช่วงเสร็จสิ้น

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1