ห้องแล็บ AI ของเสี่ยวหงซู (Xiaohongshu) อย่าง dots.studio เปิดตัวโมเดลโอเพนซอร์ส 'dots3-note preview' ที่ทำคะแนน Terminal-Bench 2.1 ได้ 75.1 คะแนน สูงกว่าโมเดลโอเพนเวทของสหรัฐฯ ที่ทำคะแนนสูงสุดถึง 4.9 คะแนน โดยโมเดลนี้ใช้โครงสร้าง MoE ขนาด 2.8 แสนล้านพารามิเตอร์ พร้อมหน้าต่างบริบทยาวถึง 512,000 โทเคน
เมื่อวันที่ 15 (เวลาท้องถิ่น) PANews รายงานว่า dots.studio ได้เปิดตัว dots3-note preview เป็นโมเดลโอเพนซอร์สอย่างเป็นทางการ โดยระบุว่าพารามิเตอร์ที่ถูกเปิดใช้งานจริงมีเพียง 1.6 หมื่นล้านตัว จากทั้งหมด 2.8 แสนล้านตัว นอกจากข้อความแล้ว โมเดลยังรองรับการทำความเข้าใจข้อมูลภาพและเสียงด้วย
dots.studio ระบุว่าได้นำวิธีการเรียนรู้แบบเสริมกำลัง (Reinforcement Learning) ที่ชื่อ 'TEMPO' มาใช้ เพื่อฝึกฝนความสามารถของ AI เอเจนต์ในการทำงานระยะยาว ไฟล์น้ำหนักโมเดล (Model Weights) ถูกอัปโหลดไว้บน Hugging Face ส่วน API เชื่อมต่อผ่าน OpenRouter เรียบร้อยแล้ว
ด้านผลการทดสอบประสิทธิภาพก็ถูกเปิดเผยออกมาเช่นกัน จากกราฟที่ SemiAnalysis เผยแพร่ dots3-note ทำคะแนน Terminal-Bench 2.1 ได้ 75.1 คะแนน ซึ่งสูงกว่าโมเดลโอเพนเวทสัญชาติอเมริกันที่ทำคะแนนได้สูงสุดในกราฟดังกล่าวถึง 4.9 คะแนน
อย่างไรก็ตาม SemiAnalysis ระบุว่ากำลังทดสอบเพิ่มเติมเพื่อตรวจสอบคุณภาพการใช้งานจริงในชีวิตประจำวัน และความเป็นไปได้ที่ผลคะแนนจะถูก 'ปรับแต่ง' ให้เหมาะกับการประเมินโดยเฉพาะ กล่าวคือ คะแนนเบนช์มาร์กที่สูงอาจไม่ได้สะท้อนคุณภาพการใช้งานจริงในสภาพแวดล้อมพัฒนาเสมอไป จึงยังต้องมีการตรวจสอบเพิ่มเติม
ทีมงาน Terminal-Bench อธิบายไว้ในเอกสารทางการว่า Terminal-Bench 2.1 เป็นเบนช์มาร์กสำหรับประเมินความสามารถของ AI เอเจนต์ในสภาพแวดล้อมเทอร์มินัล โดยเวอร์ชันนี้เป็นฉบับปรับปรุงที่แก้ไขโจทย์ไปแล้ว 28 จาก 89 ข้อ ซึ่งหัวใจสำคัญคือการแก้ไขปัญหาความเปลี่ยนแปลงของการพึ่งพาภายนอก (External Dependency) เงื่อนไขทรัพยากรที่ไม่สอดคล้องกัน และข้อผิดพลาดในการระบุรายละเอียดโจทย์
โครงสร้าง MoE (Mixture of Experts) คือสถาปัตยกรรมที่เปิดใช้งานเฉพาะบางส่วนของ 'โมเดลผู้เชี่ยวชาญ' หลายตัวในเวลาเดียวกัน เพื่อเพิ่มประสิทธิภาพการประมวลผล โดยไม่จำเป็นต้องใช้พารามิเตอร์ทั้งหมดของโมเดลขนาดใหญ่ แต่เลือกใช้เฉพาะส่วนที่จำเป็นสำหรับงานนั้น ๆ ส่วนหน้าต่างบริบทที่ยาวก็ช่วยให้โมเดลประมวลผลเอกสารยาว โค้ดเบส หรือประวัติการสนทนาได้ในคราวเดียว
ในช่วงหลังมานี้ การประเมินโมเดล AI เริ่มเปลี่ยนทิศทางจากการตอบคำถามทั่วไปไปสู่การวัดความสามารถในการทำงานจริงมากขึ้น ก่อนหน้านี้ TokenPost เคยรายงานว่า เบนช์มาร์กที่ประเมินความสามารถในการทำงานบนเทอร์มินัลและแก้ปัญหาด้านวิศวกรรมซอฟต์แวร์ กำลังกลายเป็นตัวชี้วัดหลักในการเปรียบเทียบโมเดลโอเพนซอร์ส
การเปิดตัวครั้งนี้อาจเกี่ยวข้องกับโครงสร้างพื้นฐานด้านการพัฒนา AI มากกว่าตลาดคริปโตโดยตรง แต่เนื่องจาก OpenRouter เป็นแพลตฟอร์มที่รวมโมเดล AI หลายตัวไว้ใน API เดียว การเปิดตัวนี้จึงเพิ่มช่องทางให้นักพัฒนาและนักวิจัยได้เปรียบเทียบและทดลองใช้โมเดลโอเพนเวทมากขึ้นอีกหนึ่งช่องทาง ส่วนคุณภาพการให้บริการจริงและผลการประเมินซ้ำจะชัดเจนขึ้นจากการทดสอบเพิ่มเติมของ SemiAnalysis ในระยะต่อไป
ความคิดเห็น 0