Prime Intellect ระบุว่าระบบอนุมานภายในของบริษัทประมวลผลเกือบ 1 ล้านล้านโทเคนต่อวัน พร้อมเปิดบริการดังกล่าวแก่ผู้ใช้ภายนอกและเริ่มให้บริการโมเดล GLM-5.3
BlockBeats รายงานว่า Prime Inference ถูกใช้กับงานเรียนรู้แบบเสริมกำลัง การสร้างข้อมูลสังเคราะห์ การประเมินโมเดล และงานของเอเจนต์เขียนโค้ด ผู้ใช้เรียกใช้การอนุมานของโมเดลเมื่อต้องการ หรือจองความจุไว้ล่วงหน้าเพื่อใช้งานต่อเนื่องได้ โดย API รองรับการทำงานร่วมกับ OpenAI API
Prime Intellect เพิ่มบริการอนุมานเข้าไปในโครงสร้างพื้นฐานเดิมสำหรับการเรียนรู้แบบเสริมกำลัง การประเมิน และการฝึกในแซนด์บ็อกซ์ ทำให้สามารถจัดการทั้งการฝึกโมเดลและการนำไปใช้งานจริงบนแพลตฟอร์มเดียวกัน อีกทั้งนำข้อมูลที่เกิดขึ้นระหว่างให้บริการไปใช้ฝึกโมเดลในขั้นต่อไปได้ BlockBeats รายงานด้วยว่า บริษัทให้บริการใช้งานขนาดใหญ่แก่ลูกค้ามาตั้งแต่เดือนมกราคมปีนี้
บริษัทออกแบบระบบโดยแยกการประมวลผลข้อมูลขาเข้าและการสร้างคำตอบไปยังกลุ่ม GPU คนละชุด เพื่อรองรับข้อมูลป้อนเข้าที่ยาวและงานเอเจนต์ ผลทดสอบภายในของบริษัทระบุว่า ค่า p90 ของเวลาแฝงระหว่างโทเคนลดลงราว 40% จากเดิม โดย p90 หมายถึงค่าที่การวัด 90% อยู่ที่ระดับนั้นหรือต่ำกว่า
บริษัทระบุว่าการบีบอัด KV cache ทำให้ตัวถอดรหัสหนึ่งชุดเก็บโทเคนได้เพิ่มจาก 1.09 ล้านเป็น 1.63 ล้านโทเคนในหน่วยความจำเท่าเดิม หรือเพิ่มขึ้นราว 50% ทั้งตัวเลขเวลาแฝงและความจุแคชเป็นผลจากการทดสอบภายในของบริษัท
ความคิดเห็น 0