Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

3,000 โทเคนต่อวินาทีบน GPU ทั่วไป คอก(Kog) อ้างเร่งอนุมาน AI ได้ถึง 30 เท่า

คอก(Kog) สตาร์ทอัพสัญชาติฝรั่งเศส เปิดเทคนิคเร่งความเร็วการอนุมาน AI (AI inference) บนจีพียู (GPU) ดาต้าเซ็นเตอร์ทั่วไป โดยไม่ต้องพึ่งชิปอนุมานเฉพาะทางตัวใหม่ แนวทางของบริษัทคือออกแบบซอฟต์แวร์และโครงสร้างโมเดลควบคู่กัน เพื่อดึงศักยภาพของจีพียูเอ็นวิเดีย(NVDA) และเอเอ็มดี(AMD) ที่มีอยู่แล้วให้ใช้งานได้เต็มที่ขึ้น

TechCrunch รายงานว่าคอกมองว่าความเชื่อที่ว่า GPU ไม่เหมาะกับงานอนุมานแบบ agentic workflow เป็นความเข้าใจที่คลาดเคลื่อน กาเอล เดอลาโล(Gaël Delalleau) ผู้ก่อตั้งและซีอีโอของคอก ให้สัมภาษณ์ในรายงานเดียวกันว่า 'GPU ยังมีอนาคตที่สดใส' สะท้อนมุมมองว่าจีพียูที่มีอยู่เดิมยังใช้งานในตลาดอนุมานได้อีกนานและลึกกว่าที่หลายฝ่ายคิด

จุดที่คอกโฟกัสคือความเร็วในการตอบสนองต่อคำขอเดียวของผู้ใช้ เพราะเอเจนต์ AI ต้องทำงานต่อเนื่องเป็นขั้นตอน ตั้งแต่วางแผน เขียนโค้ด ทดสอบ ไปจนถึงแก้ไข หากขั้นตอนใดขั้นตอนหนึ่งประมวลผลช้า ขั้นตอนถัดไปก็สะดุดตาม ทำให้ 'เวลาแฝงของคำขอเดียว' กลายเป็นตัวกำหนดความเร็วโดยรวมของงานทั้งชุด

บริษัทระบุว่าได้รวมรันไทม์ เคอร์เนลจีพียู และสถาปัตยกรรมโมเดลเข้าไว้ในไปป์ไลน์เดียวที่ออกแบบมาเพื่อลดคอขวดดังกล่าวโดยเฉพาะ ต่างจากการแข่งขันด้านโครงสร้างพื้นฐาน AI ทั่วไปที่มักมุ่งไปที่การสร้างโมเดลใหญ่ขึ้นและสะสมตัวเร่งความเร็วให้มากขึ้น คอกเลือกเน้นดึงประสิทธิภาพที่เหลืออยู่จากจีพียูที่ติดตั้งในดาต้าเซ็นเตอร์อยู่แล้ว

เมื่อวันที่ 28 พฤษภาคม คอกเปิดตัวพรีวิวเทคนิคของ Kog Inference Engine พร้อมตัวเลขผลทดสอบบนจีพียูเอเอ็มดี MI300X จำนวน 8 ตัว ซึ่งทำได้ 3,000 โทเคนขาออกต่อวินาทีต่อคำขอ ขณะที่ผลทดสอบเงื่อนไขเดียวกันบนจีพียูเอ็นวิเดีย(NVDA) H200 จำนวน 8 ตัว อยู่ที่ 2,100 โทเคนขาออกต่อวินาทีต่อคำขอ โดยเงื่อนไขการทดสอบคือ FP16, batch size 1 และไม่ใช้ speculative decoding

ตัวเลขเหล่านี้มาจากบล็อกและการสาธิตของคอกเองเป็นหลัก เว็บไซต์บริษัทก็โปรโมตผลิตภัณฑ์ในลักษณะเดียวกัน คือ 3,000 โทเคนต่อวินาทีต่อคำขอ และการอนุมานที่เร็วขึ้นถึง 30 เท่า พร้อมระบุกลุ่มเป้าหมายหลักเป็นเอเจนต์เขียนโค้ด AI และงาน agentic workflow

วันที่ 24 มิถุนายน คอกยังเปิดตัวโมเดล Laneformer 2B บน Hugging Face โดยโพสต์ของบริษัทอธิบายว่าเป็นโมเดลเขียนโค้ดแบบ instruction-tuned ขนาด 2,300 ล้านพารามิเตอร์ พร้อมผลทดสอบ HumanEval+ ที่ 45.1% และ MBPP+ ที่ 51.6% ตัวเลขนี้ต่างจากที่ TechCrunch ระบุไว้ว่าโมเดลมีขนาดราว 2,000 ล้านพารามิเตอร์ แต่ทั้งสองแหล่งต่างเห็นตรงกันว่าเป็นโมเดลเขียนโค้ดขนาดเล็ก

หน้าเว็บทางการของงาน AMD AI DevDay 2026 ก็มีการพูดถึงการนำเสนอเทคโนโลยีของคอกเช่นกัน โดยอธิบายเซสชันของคอกว่าเป็นสแต็กอนุมานแบบเรียลไทม์ที่ตั้งเป้าไว้ที่ 2,500 โทเคนต่อวินาทีต่อคำขอบนจีพียูตระกูล Instinct ของเอเอ็มดี ส่วนโพสต์บน LinkedIn ของคอกเมื่อเดือนสิงหาคม ระบุว่าการสาธิตจริงทำได้ 2,857 โทเคนต่อวินาที ตามคำชี้แจงของบริษัทเอง

ประเด็นที่ถกเถียงกันคือการตีความตัวเลขความเร็วเหล่านี้ ในคอมเมนต์บน LinkedIn มีทั้งเสียงตอบรับเชิงบวก และคำถามว่าเงื่อนไขการเปรียบเทียบเหมือนกันหรือไม่ ขณะที่บางความเห็นชี้ว่า Cerebras เคยทำความเร็วใกล้เคียงกันได้บนโมเดลที่ใหญ่กว่า สะท้อนว่าตัวเลขโทเคนต่อวินาทีที่เท่ากัน อาจเทียบกันตรงๆ ไม่ได้ หากขนาดโมเดล ฮาร์ดแวร์ ขนาดแบตช์ ความละเอียดตัวเลข และวิธี decoding แตกต่างกัน

การอนุมาน (inference) คือขั้นตอนที่โมเดล AI ที่ผ่านการเทรนแล้วนำไปใช้ตอบคำถามหรือเขียนโค้ดจริง ส่วนโทเคน (token) คือหน่วยพื้นฐานที่โมเดลใช้ประมวลผลข้อความ จำนวนโทเคนขาออกต่อวินาทีต่อคำขอจึงเชื่อมโยงโดยตรงกับความเร็วที่ผู้ใช้รู้สึกได้จริง ไม่ว่าจะเป็นแชทบอท เครื่องมือเขียนโค้ด หรือบริการระบบอัตโนมัติแบบเอเจนต์

ในเชิงโครงสร้างตลาด การแข่งขันด้านอนุมาน AI ไม่ได้จบแค่ประสิทธิภาพของชิป แต่ยังเกี่ยวพันกับการจัดหาจีพียู การเคลื่อนย้ายข้อมูล การปรับแต่งเคอร์เนล โครงสร้างโมเดล และวิธีจัดการแบตช์ไปพร้อมกัน นี่คือเหตุผลที่คอกเน้นย้ำแนวทางออกแบบซอฟต์แวร์และโมเดลร่วมกัน

ผู้อ่านในไทยอาจมองประเด็นนี้เป็นอีกหนึ่งภาพสะท้อนของการแข่งขันด้านโครงสร้างพื้นฐานอนุมาน AI ที่บริการ AI แบบเอเจนต์ต้องการ ก่อนหน้านี้ TokenPost เคยรายงานเรื่องการแข่งขันด้านโครงสร้างพื้นฐานอนุมานที่มุ่งลดเวลาที่จีพียูต้องรอข้อมูลมาแล้วเช่นกัน

อย่างไรก็ตาม ยังไม่มีการยืนยันความเชื่อมโยงโดยตรงระหว่างคอกกับโครงการบล็อกเชนใดๆ ประเด็นหลักของเรื่องนี้ไม่ใช่การออกโทเคนหรือการเชื่อมต่อกับบล็อกเชน แต่อยู่ที่วิธีลดเวลาแฝงให้ต่ำพอสำหรับบริการ AI แบบเอเจนต์ บนโครงสร้างพื้นฐานจีพียูที่มีอยู่แล้ว

โจทย์ต่อไปของคอกคือการพิสูจน์ว่าแนวทางเดียวกันนี้ใช้ได้จริงกับโมเดลขนาดใหญ่ขึ้นและในสภาพแวดล้อมใช้งานจริง ไม่ใช่แค่ในดีโมของบริษัทเอง เดอลาโล ซีอีโอ กล่าวกับ TechCrunch ว่าหากทำความเร็วโมเดลหลักตัวแรกได้เร็วขึ้น 10 เท่าภายในเดือนกันยายน บริษัทมีความเป็นไปได้ที่จะเริ่มดึงลูกค้าและเปิดการเจรจาระดมทุนรอบซีรีส์เอ (Series A) ทั้งนี้ยังเป็นเพียงแผนที่วางไว้ ยังต้องติดตามว่าจะเป็นไปตามเป้าหมายหรือไม่

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1