Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

คิวเหวิน 27B แซงมูส กลิมเมอร์ของเมตา(META) ใน 8 เบนช์มาร์ก

โมเดลปัญญาประดิษฐ์ (AI) แบบ 'โอเพนเวท' (open-weight) ขนาด 27B ของคิวเหวิน(Qwen) ในเครืออาลีบาบา ถูกประเมินว่าทำคะแนนแซงหน้ามูส กลิมเมอร์(Muse Glimmer) ของเมตา(META) ในทั้ง 8 รายการเบนช์มาร์กที่นำมาเปรียบเทียบ สะท้อนว่าการแข่งขันของโมเดล AI ที่รันบนเครื่องท้องถิ่นกำลังเปลี่ยนจุดโฟกัสไปที่ความสามารถด้านการเขียนโค้ดและการทำงานแบบเอเจนต์

บล็อกบีตส์(BlockBeats) รายงานโดยอ้างอิงการติดตามข้อมูลของบัญชี 动察 Beating ว่าโมเดล Qwen3.8-27B ทำคะแนนแซงมูส กลิมเมอร์ ซึ่งเป็นโมเดลขนาด 30B ของเมตา ในการเปรียบเทียบเบนช์มาร์กอย่างเป็นทางการทั้ง 8 รายการ อย่างไรก็ตาม บล็อกทางการของคิวเหวินและหน้าโมเดลการ์ดบน Hugging Face ระบุชื่อโมเดล 27B ที่เปิดเผยต่อสาธารณะไว้ว่า Qwen3.6-27B ไม่ใช่ Qwen3.8-27B ตามที่ BlockBeats อ้างถึง โมเดลนี้เป็นโมเดลภาษาขนาด 27B พารามิเตอร์ที่รวมตัวเข้ารหัสภาพ (vision encoder) และจดทะเบียนบน Hugging Face ภายใต้ใบอนุญาต Apache 2.0

ตามข้อมูลเปรียบเทียบที่ BlockBeats นำเสนอ โมเดลระดับ 27B ของคิวเหวินทำคะแนนใน Terminal-Bench 2.1 ได้ 73.0 คะแนน ขณะที่มูส กลิมเมอร์ทำได้ 51.7 คะแนน ส่วน SWE-bench Pro อยู่ที่ 61.7 ต่อ 51.2 คะแนน และ OSWorld-Verified อยู่ที่ 84.3 ต่อ 65.9 คะแนน โดยทั้งสามตัวชี้วัดใช้ประเมินความสามารถด้านการทำงานผ่านเทอร์มินัล การแก้ปัญหาด้านวิศวกรรมซอฟต์แวร์ และการทำงานแบบเอเจนต์ที่ควบคุมคอมพิวเตอร์ตามลำดับ

BlockBeats ยังนำเสนอการเปรียบเทียบกับคลอด โอปุส 4.6(Claude Opus 4.6) ของแอนโทรปิก(Anthropic) โดยระบุว่าจากการทดสอบทั้งหมด 19 รายการที่ทั้งสองโมเดลมีคะแนน โมเดล 27B ของคิวเหวินทำคะแนนแซงหน้าใน 15 รายการ โดยมีความได้เปรียบใน SWE-bench Pro, LiveCodeBench, OSWorld, AndroidWorld และงานด้านการมองเห็นบางส่วน ขณะที่ตามหลังใน Terminal-Bench, GPQA, HLE และ NL2Repo

อย่างไรก็ตาม โมเดลการ์ดอย่างเป็นทางการของ Qwen3.6-27B ระบุตัวเลขคะแนนอีกชุดหนึ่ง โดยคิวเหวินระบุว่า Qwen3.6-27B ทำคะแนน SWE-bench Verified ได้ 77.2 คะแนน SWE-bench Pro ได้ 53.5 คะแนน และ Terminal-Bench 2.0 ได้ 59.3 คะแนน เนื่องจากเกณฑ์การประเมิน (evaluation harness) และเวอร์ชันที่ต่างกันอาจให้ผลคะแนนต่างกัน การนำตารางเบนช์มาร์กจากแหล่งต่างกันมาเทียบกันโดยตรงจึงทำได้ยาก

ก่อนหน้านี้ มูส กลิมเมอร์ของเมตาเปิดตัวในฐานะโมเดลเอเจนต์แบบโอเพนซอร์สที่รันได้ทั้งบน Mac และพีซี โดยโทเคนโพสต์เคยอธิบายไว้ว่าโมเดลเอเจนต์คือ AI ที่วางแผนงานและดำเนินการหลายขั้นตอนตามคำสั่งของผู้ใช้ ต่อมายังมีการอธิบายความแตกต่างระหว่างโอเพนเวทและโอเพนซอร์สเพิ่มเติมด้วย

ประเด็นสำคัญของการเปรียบเทียบครั้งนี้ไม่ใช่แค่อันดับ แต่คือการที่มาตรฐานประเมินประสิทธิภาพของ AI ที่รันบนเครื่องท้องถิ่นกำลังเปลี่ยนไป ในอดีตโมเดลขนาดเล็กมักถูกพูดถึงในแง่ต้นทุนและความสะดวกในการติดตั้งใช้งานเป็นหลัก แต่การเปรียบเทียบล่าสุดให้น้ำหนักกับความสามารถในสภาพแวดล้อมการพัฒนาจริง เช่น การแก้ไขที่เก็บโค้ด (code repository) งานผ่านเทอร์มินัล และการควบคุมหน้าจอ

การเชื่อมโยงกับตลาดสินทรัพย์ดิจิทัลโดยตรงยังมีจำกัด การแข่งขันของโมเดล AI แบบรันในเครื่องและโอเพนเวทอาจเกี่ยวพันกับพื้นที่คอมพิวติ้งแบบกระจายศูนย์ การตรวจสอบ AI และเครื่องมือสำหรับนักพัฒนาในระยะต่อไป แต่ยังไม่มีการยืนยันว่าผลเบนช์มาร์กครั้งนี้ส่งผลโดยตรงต่อราคาหรือปริมาณการซื้อขายโทเคนที่เกี่ยวข้องแต่อย่างใด

แหล่งข้อมูลตรวจสอบ: บล็อกทางการของ Qwen, หน้าโมเดลการ์ด Qwen3.6-27B บน Hugging Face, หน้าเว็บสำหรับนักพัฒนาของ Meta AI

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1