แอนโทรปิก (Anthropic) เปิดตัว Claude Opus 5.5 โดยระบุว่าลดต้นทุนงานทั่วไปลง 40% จากรุ่นก่อน พร้อมยกระดับประสิทธิภาพด้านการเขียนโค้ด การใช้งานคอมพิวเตอร์ และงานด้านความรู้
แอนโทรปิกเปิดเผยเมื่อวันที่ 22 ผ่าน ประกาศอย่างเป็นทางการว่า Opus 5.5 เป็นโมเดลแรกในตระกูล Claude 5.5 โดย คู่มือโมเดลระบุว่า Opus 5.5 ให้บริการบน Claude และ Claude Platform
แอนโทรปิกระบุว่า จากการตรวจสอบการทำงานอัตโนมัติภายในบริษัท Opus 5.5 แสดงประสิทธิภาพสูงสุดเมื่อเทียบกับโมเดลที่ทดสอบมาจนถึงปัจจุบัน อย่างไรก็ตาม บริษัทเสริมว่าความแตกต่างของคะแนนเบนช์มาร์กไม่สามารถสะท้อนความแตกต่างของประสิทธิภาพการทำงานจริงได้ทั้งหมด
ค่าบริการอยู่ที่ 4 ดอลลาร์ต่อโทเคนอินพุต 1 ล้านรายการ (ประมาณ 5,500 วอน) และ 20 ดอลลาร์ต่อโทเคนเอาต์พุต 1 ล้านรายการ (ประมาณ 28,000 วอน) ลดลง 20% จาก Opus 5 ซึ่งมีค่าบริการอินพุต 5 ดอลลาร์ (ประมาณ 6,880 วอน) และเอาต์พุต 25 ดอลลาร์ (ประมาณ 34,400 วอน)
ค่าการอ่านแคชอยู่ที่ 0.20 ดอลลาร์ต่อโทเคน 1 ล้านรายการ (ประมาณ 275 วอน) ลดลง 60% จากเดิมที่ 0.50 ดอลลาร์ (ประมาณ 688 วอน)
การอ่านแคชคือการนำบริบทที่บันทึกไว้ก่อนหน้านี้กลับมาใช้ใหม่ ช่วยลดภาระการคำนวณข้อมูลอินพุตซ้ำเมื่อต้องประมวลผลเอกสารขนาดยาวซ้ำ ๆ หรือทำงานต่อเนื่องในเวิร์กโฟลว์เดิม
แอนโทรปิกอธิบายว่า ในการตั้งค่าเริ่มต้น ต้นทุนงานทั่วไปลดลง 40% จาก Opus 5 ขณะที่ความเร็วในการสร้างเอาต์พุตเพิ่มขึ้นมากกว่า 30% นอกจากนี้ ยังขยายขีดจำกัดการใช้งาน 5 ชั่วโมงสำหรับแพ็กเกจ Pro, Max และ Team
ผลการทดสอบแสดงให้เห็นการพัฒนาในด้านการเขียนโค้ด การใช้งานคอมพิวเตอร์ และงานด้านความรู้ โดย Opus 5.5 ทำคะแนนได้ 66.4% ใน Terminal-Bench 4.0 ขณะที่ Fable 5.1 และ Opus 5 ทำได้ 55.8% และ 52.3% ตามลำดับ
ในการประเมินงานด้านความรู้ GDPval-AA v2.1 Opus 5.5 ทำได้ 1,846 คะแนน สูงกว่า Fable 5.1 ที่ 1,735 คะแนน และ Opus 5 ที่ 1,708 คะแนน
แอนโทรปิกระบุว่า ในการประเมินภายใน ความแตกต่างด้านการทำงานจริงระหว่าง Opus 5.5 กับ Fable 5.1 แคบกว่าความแตกต่างของคะแนนเบนช์มาร์ก สะท้อนว่าความได้เปรียบในเบนช์มาร์กไม่ได้แปลเป็นความแตกต่างของประสิทธิภาพในทุกงานในระดับเดียวกัน
ด้านการเขียนโค้ด บริษัทเน้นความสามารถในการจัดการโค้ดเบสขนาดใหญ่ โดยระบุว่าผู้ทดสอบกลุ่มแรกสามารถย้ายโค้ดขนาด 680,000 บรรทัดเสร็จภายในหนึ่งวัน และตรวจสอบพร้อมแก้ไขโค้ดเบสขนาด 200,000 บรรทัดได้ภายใน 3 ชั่วโมง
งานขนาด 200,000 บรรทัดเดียวกันใช้เวลามากกว่า 20 ชั่วโมงเมื่อทำด้วย Opus 5 แอนโทรปิกระบุว่าผลลัพธ์ดังกล่าวแสดงให้เห็นจุดแข็งของโมเดลใหม่ในการทำงานเขียนโค้ดหลายขั้นตอนต่อเนื่องกัน
มาตรการความปลอดภัยของ Opus 5.5 อยู่ในระดับใกล้เคียงกับ Fable 5.1 แอนโทรปิกประเมินว่า Opus 5.5 มีความสามารถเทียบเคียง Claude Mythos 5.1 ในด้านชีววิทยาและความมั่นคงปลอดภัยไซเบอร์ จึงใช้ระบบป้องกันเฉพาะสำหรับงานในสองสาขานี้
ผู้สนใจสามารถสมัครเข้าร่วมโครงการตรวจสอบด้านวิทยาศาสตร์ชีวภาพได้ ส่วนการเข้าถึงโครงการตรวจสอบด้านความมั่นคงปลอดภัยไซเบอร์จะขยายภายในไม่กี่สัปดาห์ข้างหน้า
แอนโทรปิกระบุว่า Opus 5.5 ใช้ศัพท์เทคนิคน้อยลงเมื่อเทียบกับรุ่นก่อน และวางข้อมูลสำคัญไว้ช่วงต้นประโยค ขณะที่ Sonnet 5.5 และ Haiku 5.5 มีกำหนดเปิดตัวภายในไม่กี่สัปดาห์ข้างหน้า
ความคิดเห็น 0