มีรายงานว่าเคอร์เนล Attention ของ Kimi ที่ AI เขียนใหม่ให้เหมาะกับ GPU ของ NVIDIA ทำความเร็วในการอนุมานได้เกือบ 3 เท่าเมื่อเทียบกับการใช้งานเวอร์ชันทางการ
BlockBeats รายงานว่า AI ได้ปรับแต่งเคอร์เนล GPU ที่ใช้ในการคำนวณ Attention ของ Kimi โดยการใช้งานที่เขียนใหม่ทำความเร็วได้เกือบ 3 เท่าของเวอร์ชันทางการ เคอร์เนลคือโค้ดระดับล่างที่ใช้ประมวลผล Attention ของโมเดล AI บน GPU
Moonshot AI เปิดเผย FlashKDA สำหรับ Kimi Delta Attention ซึ่งพัฒนาบนพื้นฐาน CUTLASS ของ NVIDIA ขณะที่ vLLM ระบุว่าได้นำเคอร์เนล CUDA แบบผสานการทำงานและเคอร์เนลที่พัฒนาร่วมกับ NVIDIA มาใช้กับ Kimi K3
ความคิดเห็น 0