Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

MoE ของ Cursor เพิ่มขึ้น 41% ตามรายงานจากจีน

ภาพที่เกี่ยวข้องกับเอ็นวิเดีย / TokenPost.ai

เทคโนโลยีการฝึกโมเดลผสมผู้เชี่ยวชาญ (Mixture-of-Experts หรือ MoE) ของ Cursor เครื่องมือเขียนโค้ดด้วย AI ถูกรายงานว่าช่วยเพิ่มปริมาณงานโดยรวมขึ้น 41% บนระบบที่ใช้ GPU GB300 ของเอ็นวิเดีย($NVDA) จำนวน 512 ตัว วิธีการนี้คือการประมวลผลการส่งข้อมูลระหว่าง GPU และการคำนวณไปพร้อมกัน เพื่อลดปัญหาคอขวดในการฝึกโมเดล

ช่องติดตามข้อมูลจากจีน Dongchal Beating รายงานเมื่อวันที่ 5 ว่า Cursor เปิดตัวเคอร์เนลโอเพนซอร์สสำหรับฝึกโมเดล MoE ชื่อ Mixture-of-Kittens (MoK) โดยอ้างว่าในการทดสอบเลเยอร์ MoE เดี่ยว เทคโนโลยีนี้ทำงานได้เร็วกว่าทางเลือกโอเพนซอร์สอื่นสูงสุดถึง 2.37 เท่า

โครงสร้างผสมผู้เชี่ยวชาญคือการวางเครือข่ายผู้เชี่ยวชาญหลายตัวไว้ในโมเดลเดียว โดยเรียกใช้เพียงบางส่วนตามข้อมูลนำเข้า ช่วยขยายขนาดโมเดลได้โดยไม่เพิ่มปริมาณการคำนวณมากนัก แต่เมื่อผู้เชี่ยวชาญกระจายอยู่บน GPU หลายตัว เวลาที่ใช้ในการเคลื่อนย้ายข้อมูลและรอการคำนวณก็จะเพิ่มขึ้น เทคโนโลยีที่ถูกรายงานในครั้งนี้มุ่งเน้นการประมวลผลการส่งข้อมูลและการคำนวณที่เคยแยกจากกันให้ทำงานพร้อมกันภายในเคอร์เนลเดียว เพื่อลดเวลารอ

อย่างไรก็ตาม จนถึงขณะที่เขียนข่าวนี้ ยังไม่พบประกาศชื่อเดียวกันบนบล็อกทางการและคลัง GitHub ของ Cursor ตัวเลข 41% และ 2.37 เท่าดังกล่าวอ้างอิงจากรายงานของ Dongchal Beating เท่านั้น ขณะที่โค้ดจริง รายละเอียดการพัฒนา และผลการทดสอบที่สามารถทำซ้ำได้ยังไม่ถูกเปิดเผย

ก่อนหน้านี้ Cursor ระบุในบทความเกี่ยวกับเคอร์เนล MXFP8 ที่เผยแพร่เมื่อเดือนสิงหาคม 2025ว่าได้เขียนเลเยอร์ MoE สำหรับ GPU Blackwell ใหม่ในระดับเคอร์เนล ทำให้ประสิทธิภาพของเลเยอร์นี้เพิ่มขึ้น 3.5 เท่า และความเร็วในการฝึกโดยรวมเพิ่มขึ้น 1.5 เท่า ขณะนั้นเลเยอร์ MoE ใช้เวลา 53% ของขั้นตอน forward pass และ 27% ของขั้นตอน backward pass

ในรายงานเทคนิค Composer 2 Cursor ยังระบุว่าเคอร์เนลความละเอียดต่ำบน GPU Blackwell ไปป์ไลน์การเรียนรู้แบบเสริมกำลังแบบอะซิงโครนัส (asynchronous reinforcement learning) และสภาพแวดล้อมแซนด์บ็อกซ์ขนาดใหญ่ เป็นองค์ประกอบหลักของโครงสร้างพื้นฐานการฝึกโมเดล ส่วนในบทความเทคนิค warp decode บริษัทระบุว่าได้ปรับโครงสร้างเส้นทางการอนุมาน (inference) ของโมเดล MoE ใหม่ ทำให้ปริมาณงานบน GPU Blackwell เพิ่มขึ้น 1.84 เท่า

เทคโนโลยีนี้ไม่เกี่ยวข้องโดยตรงกับโทเคนหรือเหตุการณ์บล็อกเชนใดเป็นการเฉพาะ แต่สำหรับบริษัทบล็อกเชนที่ใช้ AI เอเจนต์และเครื่องมืออัตโนมัติในการเขียนโค้ด นี่อาจเป็นปัจจัยทางเทคนิคที่ส่งผลต่อต้นทุนและประสิทธิภาพของโครงสร้างพื้นฐานการฝึกโมเดล

ในด้านฮาร์ดแวร์ คลัสเตอร์ GPU ประสิทธิภาพสูงขนาดใหญ่ยังคงเป็นรากฐานสำคัญ เอ็นวิเดียระบุว่าGB300 NVL72รวม GPU Blackwell Ultra จำนวน 72 ตัว และ CPU Grace จำนวน 36 ตัว ไว้ในแพลตฟอร์มระดับแร็ค (rack-scale) เดียว

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1