Zhipu (智谱) เปิดตัว GLM-5.3-FlashX โดยชูความเร็วอนุมานสูงสุด 200 tokens/s จากชิปที่ผลิตในประเทศจำนวน 100,000 ชิ้น พร้อมเริ่มให้บริการ API และศูนย์ทดลองใช้งาน
Zhipu ระบุว่า GLM-5.3-FlashX เพิ่มความเร็วบนพลังประมวลผลอนุมานจากชิปที่ผลิตในประเทศจำนวน 100,000 ชิ้น บริษัทเปิดเผยว่าได้ลงทุนเพิ่มเติมในโครงสร้างพื้นฐานและการเพิ่มประสิทธิภาพการอนุมาน PANews รายงาน
การเปิดตัวครั้งนี้ไม่ได้มุ่งเฉพาะประสิทธิภาพของโมเดล แต่ยังนำเสนอโครงสร้างพื้นฐานสำหรับการอนุมานที่จำเป็นต่อการให้บริการจริงด้วย การอนุมานคือกระบวนการที่โมเดลสร้างคำตอบจากข้อมูลนำเข้า ขณะที่ความเร็วในการประมวลผลได้รับอิทธิพลจากโครงสร้างโมเดล การจัดวางฮาร์ดแวร์ และการเพิ่มประสิทธิภาพซอฟต์แวร์
โมเดลพื้นฐานของ GLM-5.3-FlashX คือ GLM-5.3-Flash ซึ่งเปิดตัวเมื่อวันที่ 26 สิงหาคม มีพารามิเตอร์ทั้งหมด 320,000 ล้านรายการ พารามิเตอร์ที่ทำงานในกระบวนการอนุมานแต่ละครั้งอยู่ที่ 18,000 ล้านรายการ และรองรับบริบทขนาด 1 ล้าน tokens โดยข้อมูลเหล่านี้และกำหนดการเปิดตัวระบุไว้ใน เอกสารโมเดล
พารามิเตอร์ทั้งหมดหมายถึงขนาดรวมของน้ำหนักที่โมเดลเรียนรู้และจัดเก็บไว้ ส่วนพารามิเตอร์ที่ทำงานคือส่วนที่เข้าร่วมการคำนวณจริงเมื่อประมวลผลข้อมูลนำเข้า แนวทางนี้ช่วยลดปริมาณการคำนวณที่จำเป็นต่อคำขอหนึ่งครั้ง ขณะที่ยังคงขนาดรวมของโมเดลไว้
บริบทขนาด 1 ล้าน tokens หมายถึงขอบเขตของข้อมูลนำเข้าและประวัติการสนทนาที่โมเดลสามารถประมวลผลได้ในคำขอเดียว อย่างไรก็ตาม ขนาดหน้าต่างบริบทและความเร็วในการตอบสนองเป็นคนละตัวชี้วัด จึงไม่อาจสรุปได้ว่าความเร็วสูงสุดจะคงเดิมเมื่อประมวลผลข้อมูลนำเข้าขนาดยาว
Zhipu ระบุความเร็วอนุมานสูงสุดของ GLM-5.3-FlashX ไว้ที่ 200 tokens/s ตัวเลขดังกล่าวเป็นค่าสูงสุดที่บริษัทนำเสนอ ขณะที่ความเร็วเฉลี่ยที่ผู้ใช้ทั่วไปได้รับอาจแตกต่างกันตามประเภทคำขอและสภาพแวดล้อมการให้บริการ
บริษัทไม่ได้เปิดเผยความเร็วเฉลี่ยในการประมวลผล ผู้ผลิตชิป ราคาให้บริการ หรือข้อมูลเปรียบเทียบประสิทธิภาพระหว่างโมเดล ดังนั้นจึงยังต้องติดตามข้อมูลการดำเนินงานเพิ่มเติมว่าอัตรา 200 tokens/s วัดจากความยาวอินพุตและการจัดวางฮาร์ดแวร์ในเงื่อนไขใด
ก่อนเปิดตัว GLM-5.3-Flash มีการทดสอบแบบไม่เปิดเผยชื่อภายใต้ชื่อ 'Ox Alpha' ต่อมาหลังเปิดเผยชื่อโมเดลอย่างเป็นทางการ จึงยืนยันว่าเป็นโมเดลในตระกูล GLM-5 ของ Zhipu ขณะที่การเปิดตัว FlashX นำโมเดลตระกูลดังกล่าวไปใช้งานผ่าน API และบริการทดลอง
API เป็นช่องทางที่ช่วยให้บริการภายนอกหรือนักพัฒนาสามารถเรียกใช้ความสามารถของโมเดลได้ ส่วนศูนย์ทดลองช่วยให้ผู้ใช้ทดสอบการตอบสนองของโมเดลได้โดยไม่ต้องสร้างบริการแยกต่างหาก การเริ่มให้บริการทั้งสองรูปแบบสะท้อนการนำเสนอทั้งโมเดลและสภาพแวดล้อมการใช้งานจริง
ประสิทธิภาพจริงของ GLM-5.3-FlashX จะสามารถเปรียบเทียบได้จากผลการทดสอบมาตรฐานโดยละเอียดและข้อมูลการให้บริการ API ที่จะเปิดเผยในอนาคต ประเด็นสำคัญคือเงื่อนไขที่ใช้วัดความเร็วสูงสุด รวมถึงการเปิดเผยความเร็วเฉลี่ยในการประมวลผล
ความคิดเห็น 0