Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

GLM-5.3-FlashX เปิดตัว ความเร็วอนุมานสูงสุด 200 tokens/s

Zhipu (智谱) เปิดตัว GLM-5.3-FlashX โดยชูความเร็วอนุมานสูงสุด 200 tokens/s จากชิปที่ผลิตในประเทศจำนวน 100,000 ชิ้น พร้อมเริ่มให้บริการ API และศูนย์ทดลองใช้งาน

Zhipu ระบุว่า GLM-5.3-FlashX เพิ่มความเร็วบนพลังประมวลผลอนุมานจากชิปที่ผลิตในประเทศจำนวน 100,000 ชิ้น บริษัทเปิดเผยว่าได้ลงทุนเพิ่มเติมในโครงสร้างพื้นฐานและการเพิ่มประสิทธิภาพการอนุมาน PANews รายงาน

การเปิดตัวครั้งนี้ไม่ได้มุ่งเฉพาะประสิทธิภาพของโมเดล แต่ยังนำเสนอโครงสร้างพื้นฐานสำหรับการอนุมานที่จำเป็นต่อการให้บริการจริงด้วย การอนุมานคือกระบวนการที่โมเดลสร้างคำตอบจากข้อมูลนำเข้า ขณะที่ความเร็วในการประมวลผลได้รับอิทธิพลจากโครงสร้างโมเดล การจัดวางฮาร์ดแวร์ และการเพิ่มประสิทธิภาพซอฟต์แวร์

โมเดลพื้นฐานของ GLM-5.3-FlashX คือ GLM-5.3-Flash ซึ่งเปิดตัวเมื่อวันที่ 26 สิงหาคม มีพารามิเตอร์ทั้งหมด 320,000 ล้านรายการ พารามิเตอร์ที่ทำงานในกระบวนการอนุมานแต่ละครั้งอยู่ที่ 18,000 ล้านรายการ และรองรับบริบทขนาด 1 ล้าน tokens โดยข้อมูลเหล่านี้และกำหนดการเปิดตัวระบุไว้ใน เอกสารโมเดล

พารามิเตอร์ทั้งหมดหมายถึงขนาดรวมของน้ำหนักที่โมเดลเรียนรู้และจัดเก็บไว้ ส่วนพารามิเตอร์ที่ทำงานคือส่วนที่เข้าร่วมการคำนวณจริงเมื่อประมวลผลข้อมูลนำเข้า แนวทางนี้ช่วยลดปริมาณการคำนวณที่จำเป็นต่อคำขอหนึ่งครั้ง ขณะที่ยังคงขนาดรวมของโมเดลไว้

บริบทขนาด 1 ล้าน tokens หมายถึงขอบเขตของข้อมูลนำเข้าและประวัติการสนทนาที่โมเดลสามารถประมวลผลได้ในคำขอเดียว อย่างไรก็ตาม ขนาดหน้าต่างบริบทและความเร็วในการตอบสนองเป็นคนละตัวชี้วัด จึงไม่อาจสรุปได้ว่าความเร็วสูงสุดจะคงเดิมเมื่อประมวลผลข้อมูลนำเข้าขนาดยาว

Zhipu ระบุความเร็วอนุมานสูงสุดของ GLM-5.3-FlashX ไว้ที่ 200 tokens/s ตัวเลขดังกล่าวเป็นค่าสูงสุดที่บริษัทนำเสนอ ขณะที่ความเร็วเฉลี่ยที่ผู้ใช้ทั่วไปได้รับอาจแตกต่างกันตามประเภทคำขอและสภาพแวดล้อมการให้บริการ

บริษัทไม่ได้เปิดเผยความเร็วเฉลี่ยในการประมวลผล ผู้ผลิตชิป ราคาให้บริการ หรือข้อมูลเปรียบเทียบประสิทธิภาพระหว่างโมเดล ดังนั้นจึงยังต้องติดตามข้อมูลการดำเนินงานเพิ่มเติมว่าอัตรา 200 tokens/s วัดจากความยาวอินพุตและการจัดวางฮาร์ดแวร์ในเงื่อนไขใด

ก่อนเปิดตัว GLM-5.3-Flash มีการทดสอบแบบไม่เปิดเผยชื่อภายใต้ชื่อ 'Ox Alpha' ต่อมาหลังเปิดเผยชื่อโมเดลอย่างเป็นทางการ จึงยืนยันว่าเป็นโมเดลในตระกูล GLM-5 ของ Zhipu ขณะที่การเปิดตัว FlashX นำโมเดลตระกูลดังกล่าวไปใช้งานผ่าน API และบริการทดลอง

API เป็นช่องทางที่ช่วยให้บริการภายนอกหรือนักพัฒนาสามารถเรียกใช้ความสามารถของโมเดลได้ ส่วนศูนย์ทดลองช่วยให้ผู้ใช้ทดสอบการตอบสนองของโมเดลได้โดยไม่ต้องสร้างบริการแยกต่างหาก การเริ่มให้บริการทั้งสองรูปแบบสะท้อนการนำเสนอทั้งโมเดลและสภาพแวดล้อมการใช้งานจริง

ประสิทธิภาพจริงของ GLM-5.3-FlashX จะสามารถเปรียบเทียบได้จากผลการทดสอบมาตรฐานโดยละเอียดและข้อมูลการให้บริการ API ที่จะเปิดเผยในอนาคต ประเด็นสำคัญคือเงื่อนไขที่ใช้วัดความเร็วสูงสุด รวมถึงการเปิดเผยความเร็วเฉลี่ยในการประมวลผล

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1