Claude Sonnet 5.5 (Max) ได้อันดับ 3 ในตารางจัดอันดับสาธารณะของ Agent Arena ด้วยคะแนนการปรับปรุงสุทธิ 12.52% โดยห่างจาก GPT-6 Astra (Max) ซึ่งอยู่อันดับ 4 เพียง 0.25 จุดเปอร์เซ็นต์ น้อยกว่าช่วงค่าคลาดเคลื่อนของคะแนน Sonnet 5.5
Arena.ai เปิดเผยตารางจัดอันดับเมื่อวันที่ 2 ตุลาคม โดย Claude Fable 5.1 (Max) ได้อันดับ 1 ด้วยคะแนน 14.31% และ Claude Opus 5.5 (High) ตามมาเป็นอันดับ 2 ที่ 13.82% ส่วน GPT-6 Astra (Max) ทำคะแนนได้ 12.27%
คะแนนของ Sonnet 5.5 มีช่วงค่าคลาดเคลื่อน ±3.09% ผลครั้งนี้แสดงว่า Sonnet 5.5 อยู่ในกลุ่มอันดับต้น ๆ ของการประเมินดังกล่าว แต่ยังไม่เพียงพอที่จะสรุปว่ามีประสิทธิภาพเหนือกว่า GPT-6 Astra อย่างชัดเจน
Agent Arena ใช้วิธีประเมินต่างจากการวัดความชอบต่อคำตอบแบบถามตอบทั่วไป Arena.ai ระบุว่าคะแนนการปรับปรุงสุทธิคำนวณจากสัญญาณหลายด้านในงานเอเจนต์จริง เช่น ความสำเร็จของงาน ความคิดเห็นจากผู้ใช้ และการใช้เครื่องมือ โดยเปรียบเทียบกับออร์เคสเตรเตอร์ทั่วไป คะแนนนี้สรุปการพัฒนาความสามารถในการทำงานของระบบเอเจนต์ และไม่ได้แสดงว่าโมเดลใดเหนือกว่าในทุกงาน
ตารางยังแสดงต้นทุนและปริมาณผลลัพธ์ควบคู่กับคะแนนประสิทธิภาพด้วย Sonnet 5.5 มีต้นทุนค่ามัธยฐาน 2.76 ดอลลาร์ต่อหนึ่งงาน และจำนวนโทเคนผลลัพธ์ค่ามัธยฐาน 115,800 โทเคน Anthropic เปิดเผยราคาโทเคนไว้ที่ 2 ดอลลาร์ต่อโทเคนขาเข้า 1 ล้านโทเคน และ 10 ดอลลาร์ต่อโทเคนขาออก 1 ล้านโทเคน อย่างไรก็ตาม ต้นทุนต่องานอาจเปลี่ยนแปลงตามปริมาณการใช้งานและลักษณะงาน จึงประเมินความคุ้มค่าจากราคาโทเคนเพียงอย่างเดียวได้ยาก
Anthropic เปิดตัว Sonnet 5.5 เมื่อวันที่ 28 กันยายน พร้อมเน้นความสามารถด้านการเขียนโค้ดและงานหลายขั้นตอน ผลการประเมินของบริษัทเองกับอันดับจาก Agent Arena ใช้การตั้งค่าและเกณฑ์ต่างกัน จึงไม่อาจนำมาเปรียบเทียบเป็นตัวชี้วัดเดียวกันได้ การเปรียบเทียบโมเดลเอเจนต์จึงควรพิจารณาทั้งอันดับประสิทธิภาพและต้นทุนกับปริมาณโทเคนที่ใช้จริง เช่น คะแนน Agent Arena และราคาของ GPT-6 Sol ที่เปิดเผยก่อนหน้านี้
ความคิดเห็น 0