แยนเด็กซ์(Yandex) เปิดตัวโมเดลภาษาขนาดใหญ่ที่มีพารามิเตอร์รวม 80,000 ล้านรายการ แต่เปิดใช้งานเพียง 3,000 ล้านรายการต่อการประมวลผลแต่ละโทเคน โดยมุ่งเน้นความรู้และการให้เหตุผลในภาษารัสเซีย และยังไม่ใช่แชตบอตสำเร็จรูปสำหรับผู้ใช้ทั่วไป
แยนเด็กซ์เปิดตัว AliceAI-Foundation-80B-A3B-Base เมื่อวันที่ 21 พร้อมเผยแพร่น้ำหนักโมเดลบน Hugging Face ภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งานเชิงพาณิชย์ รวมถึงแก้ไขและเผยแพร่ต่อได้
โมเดลใช้โครงสร้าง MoE(Mixture of Experts) ซึ่งให้โมดูลผู้เชี่ยวชาญเพียงบางส่วนจากทั้งหมดเข้าร่วมการคำนวณ ประกอบด้วย 48 เลเยอร์และโมดูลผู้เชี่ยวชาญ 512 ชุด รองรับบริบทสูงสุด 262,144 โทเคน
แยนเด็กซ์ระบุว่าโมเดลนี้ได้รับการฝึกตั้งแต่ต้นโดยไม่ได้ใช้น้ำหนักจากโมเดลที่เปิดเผยต่อสาธารณะ อย่างไรก็ตาม ขนาดข้อมูลฝึกสอนถูกระบุแตกต่างกันในเอกสารแต่ละชุด
เวโดโมสตีรายงานโดยอ้างคำอธิบายของตัวแทนแยนเด็กซ์ว่า ขนาดการฝึกอยู่ที่ 18 ล้านล้านโทเคน ขณะที่โมเดลการ์ดระบุว่ามีการทดลองฝึกแยกกันหลายครั้ง โดยแต่ละครั้งใช้ข้อมูล 2 ล้านล้านโทเคน จึงยังไม่ควรสรุปว่าตัวเลขทั้งสองเป็นข้อมูลของขั้นตอนการฝึกเดียวกัน
โมเดลที่เปิดเผยยังเป็นโมเดลพื้นฐานจากการฝึกล่วงหน้า ไม่ใช่โมเดลผลิตภัณฑ์ที่ผ่านการฝึกตามคำสั่งหรือการปรับแต่งสำหรับการสนทนา นักพัฒนาจึงต้องฝึกเพิ่มเติมให้เหมาะกับงานเฉพาะ หรือผสานเข้ากับแอปพลิเคชันของตน
แยนเด็กซ์นำเสนอโมเดลนี้เป็นฐานทดลองสำหรับพัฒนาโมเดลการให้เหตุผลแบบผสานรวมและฟังก์ชันเอเจนต์ของ Alice AI แต่ยังไม่ได้เปิดเผยกำหนดการเปิดตัวหรือเป้าหมายด้านประสิทธิภาพของผลิตภัณฑ์ขั้นสุดท้าย
ผลการประเมินแสดงให้เห็นจุดแข็งในงานภาษารัสเซีย โดยโมเดลการ์ดระบุว่า AliceAI ทำคะแนนในเบนช์มาร์กความรู้ข้อเท็จจริงภาษารัสเซีย WikiWebFacts และ HardMultiQA ได้ 86.5 คะแนนและ 67.9 คะแนนตามลำดับ
ในการประเมินเดียวกัน DeepSeek-V4-Flash-Base ทำได้ 83.2 คะแนนและ 65.4 คะแนนตามลำดับ โดย WikiWebFacts และ HardMultiQA เป็นเบนช์มาร์กที่แยนเด็กซ์เผยแพร่เพื่อประเมินความรู้ข้อเท็จจริงและความรู้เฉพาะทางในภาษารัสเซีย
ผลการประเมินภาษาอังกฤษแตกต่างออกไป ใน TriviaQA นั้น AliceAI ทำได้ 79.0 คะแนน ตามหลัง DeepSeek-V4-Flash-Base ที่ทำได้ 89.4 คะแนน และ Nemotron-3-Super-120B-A12B-Base ที่ทำได้ 89.8 คะแนน
การเปรียบเทียบประสิทธิภาพในโมเดลการ์ดอ้างอิงสภาพแวดล้อมการประเมินและเบนช์มาร์กที่แยนเด็กซ์จัดทำขึ้นเอง ขณะนี้ยังไม่พบผลการทดสอบซ้ำภายใต้เงื่อนไขเดียวกันจากหน่วยงานอิสระ
โครงสร้างแบบเบาบางช่วยให้โมเดลคงขนาดความจุรวมไว้ ขณะที่ใช้ผู้เชี่ยวชาญเพียงบางส่วนในการประมวลผลแต่ละโทเคน อย่างไรก็ตาม การมีพารามิเตอร์ที่เปิดใช้งาน 3,000 ล้านรายการไม่ได้หมายความโดยอัตโนมัติว่าอุปกรณ์ที่ใช้รันโมเดลจะมีข้อกำหนดต่ำ
เนื่องจากต้องจัดเก็บน้ำหนักโมเดลทั้งหมดราว 80,000 ล้านรายการ บน Hugging Face มีตัวอย่างวิธีรันโมเดลด้วย vLLM, SGLang และ Transformers รวมถึงตัวอย่างการฝึกเพิ่มเติม
การประเมินจากอุตสาหกรรมมีทั้งมุมบวกและข้อจำกัด เวโดโมสตีรายงานว่า สเบอร์แบงก์มองว่าการเปิดตัวครั้งนี้สะท้อนศักยภาพด้านวิศวกรรมของรัสเซีย แต่ชี้ว่าเกณฑ์การแข่งขัน AI ระดับโลกอยู่ที่โมเดลเรือธงซึ่งมีขนาดตั้งแต่หลายหมื่นล้านถึงหลายล้านล้านพารามิเตอร์
ตัวแทนจากองค์กรด้านเศรษฐกิจดิจิทัลของรัสเซียและพันธมิตรอุตสาหกรรม AI ประเมินว่าใบอนุญาตแบบเปิดช่วยลดอุปสรรคทางกฎหมายในการพัฒนาผลิตภัณฑ์เชิงพาณิชย์ อย่างไรก็ตาม ยังไม่มีการเปิดเผยขนาดการนำไปใช้งานเชิงพาณิชย์จริง
การเปิดตัวครั้งนี้มีความสำคัญจากการนำเสนอทั้งขนาดโมเดลรวม น้ำหนักที่เปิดเผย และโครงสร้างที่เปิดใช้งานพารามิเตอร์เพียงบางส่วนต่อโทเคน การเปรียบเทียบโครงสร้างระหว่างโมเดลขนาดใหญ่แบบเบาบางเคยถูกนำเสนอในรายงานของ TokenPost เรื่องพารามิเตอร์ที่เปิดใช้งานของ DeepSeek V4.1 Flash
ความคิดเห็น 0