Chutes และนักวิจัยจากมหาวิทยาลัยฮาร์วาร์ดเปิดตัวชุดข้อมูลคำขอจากโมเดลภาษาขนาดใหญ่ (LLM) จำนวน 6,122,413,756 รายการ โดยเปิดเผยเฉพาะข้อมูลเมตาดาทาของระบบให้บริการ ไม่ใช่เนื้อหาการสนทนาจริง เพื่อใช้วิเคราะห์โครงสร้างแคชและการจัดเส้นทางของโครงสร้างพื้นฐาน Generative AI
งานวิจัย ‘A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing’ วิเคราะห์คำขอที่เกิดขึ้นบน Chutes ตั้งแต่วันที่ 11 เมษายน 2025 ถึงวันที่ 12 เมษายน 2026 โดยข้อมูลครอบคลุมโมเดล 9,174 รายการ และบันทึกคำขอจากผู้ใช้ที่ผ่านการทำให้ไม่ระบุตัวตน 314,970 ราย
คลังข้อมูลเปิดเผยเวลาที่ส่งคำขอ ตัวระบุโมเดล ผู้ใช้ และอินสแตนซ์ให้บริการแบบไม่เปิดเผยตัวตน จำนวนโทเค็นขาเข้าและขาออก เวลาในการสร้างโทเค็นแรก (TTFT) และจำนวนโทเค็นที่มาจากแคช ข้อมูลชุดนี้เผยแพร่ในรูปแบบ Parquet ผ่านคลังข้อมูลสาธารณะ
ไฟล์ทั้งหมดมีขนาดประมาณ 91GB โดยแต่ละแถวแทนการเรียก API หนึ่งครั้ง ตัวระบุผู้ใช้จะถูกทำให้ไม่ระบุตัวตนใหม่ทุก 3 เดือน ขณะที่พรอมต์และคำตอบจริงจากโมเดลไม่ถูกรวมอยู่ในข้อมูลที่เปิดเผย
ประเด็นที่นักวิจัยให้ความสนใจคือการกระจุกตัวของคำขอที่เกิดขึ้นซ้ำในช่วงเวลาใกล้กัน ในกรณีที่ผู้ใช้คนเดียวกันส่งคำขอไปยังโมเดลเดิมอีกครั้ง 99% ของคำขอดังกล่าวเกิดขึ้นภายใน 15 นาทีหลังคำขอก่อนหน้า
เมื่อคำขอจากผู้ใช้รายเดียวกันเกิดขึ้นต่อเนื่องในช่วงเวลาสั้น ๆ ระบบสามารถนำบางส่วนของอินพุตก่อนหน้ากลับมาใช้ผ่านแคชคำนำหน้า (prefix cache) ซึ่งช่วยลดการคำนวณช่วงพรีฟิลและลดเวลาในการสร้างโทเค็นแรก
อย่างไรก็ตาม ประสิทธิภาพของแคชกับการกระจายโหลดไม่ได้เคลื่อนไหวไปในทิศทางเดียวกัน การส่งคำขอที่เกี่ยวข้องไปยังอินสแตนซ์ GPU เดียวกันช่วยเพิ่มการนำแคชกลับมาใช้ใหม่ แต่อาจทำให้คำขอกระจุกตัวในอินสแตนซ์นั้น ขณะที่การกระจายไปยังหลายอินสแตนซ์ช่วยแบ่งโหลดให้สมดุลขึ้น แต่อาจทำให้สถานะแคชเดียวกันถูกทำซ้ำในหลายจุด
นักวิจัยเสนอรูปแบบการจัดเส้นทางที่คำนึงถึงแคช โดยยอมรับความไม่สมดุลของโหลดในระดับหนึ่งเพื่อเพิ่มอัตราการจับคู่โทเค็นกับแคช การจัดเส้นทางคือกระบวนการตัดสินใจว่าจะส่งคำขอไปยังโมเดลและอินสแตนซ์ให้บริการใด ซึ่งต้องพิจารณาทั้งการนำแคชกลับมาใช้ใหม่และการจัดสรรทรัพยากร GPU
ข้อมูลยังสะท้อนว่ารูปแบบการใช้งาน LLM กำลังเปลี่ยนแปลง โดยความยาวอินพุตค่อนข้างคงที่ตลอดช่วงการเก็บข้อมูล แต่ค่ามัธยฐานของความยาวเอาต์พุตลดลงจากหลายร้อยโทเค็นเหลือต่ำกว่า 100 โทเค็น
นักวิจัยระบุว่าอาจมีคำขออัตโนมัติที่สั้นและเกิดซ้ำเพิ่มขึ้น แทนการใช้งานแบบสนทนาที่มีการแลกเปลี่ยนคำตอบยาว ๆ อย่างไรก็ตาม ข้อมูลเพียงอย่างเดียวไม่สามารถแยกได้อย่างสมบูรณ์ว่าผู้ส่งคำขอเป็นมนุษย์หรือซอฟต์แวร์
สัดส่วนการใช้งานของแต่ละโมเดลก็ไม่ได้คงที่ ในช่วงแรกโมเดลตระกูล DeepSeek เป็นผู้นำด้านทราฟฟิก ก่อนที่สัดส่วนการใช้งานจะย้ายไปยัง Qwen3-32B และ DeepSeek-V3.2 ขณะที่โมเดลนอกกระแสหลักก็มีสัดส่วนทราฟฟิกเพิ่มขึ้น
นักวิจัยเตือนว่าการประเมินกำลังการรองรับของ GPU หรือความต้องการโมเดลในระยะยาวจากการสังเกตในช่วงเวลาใดเวลาหนึ่งทำได้ยาก การเปลี่ยนแปลงการใช้งานบนแพลตฟอร์มเดียวจึงไม่ควรถูกมองว่าเท่ากับการเปลี่ยนแปลงของอุปสงค์ในตลาดบริการ LLM ทั้งหมด
ชุดข้อมูลนี้ยังมีความสำคัญเนื่องจาก Chutes เป็นโครงสร้างพื้นฐานการอนุมาน AI แบบกระจายศูนย์ที่ดำเนินงานบนซับเน็ต 64 ของ Bittensor แพลตฟอร์มการอนุมานแบบกระจายศูนย์จะแบ่งคำขอไปประมวลผลผ่านหลายอินสแตนซ์ และข้อมูลครั้งนี้นำกระแสคำขอจากสภาพแวดล้อมการใช้งานจริงมาเป็นหัวข้อศึกษา
อย่างไรก็ตาม ข้อมูลดังกล่าวถูกรวบรวมจากแพลตฟอร์มการอนุมานแบบกระจายศูนย์เพียงแห่งเดียว จึงไม่สามารถเป็นตัวแทนของตลาด LLM ทั้งหมดหรือพฤติกรรมการใช้บริการ AI ในประเทศได้โดยตรง นอกจากนี้ ยังไม่มีข้อมูลยืนยันว่าการเปิดเผยชุดข้อมูลครั้งนี้ส่งผลโดยตรงต่อราคาของ TAO หรือความต้องการโทเค็น
การใช้งานหลักของชุดข้อมูลอยู่ที่การวิจัยประสิทธิภาพการดำเนินงานของโมเดล AI และการออกแบบโครงสร้างพื้นฐาน ประเด็นสำคัญคือการใช้บันทึกคำขอจริงเพื่อวิเคราะห์ความสัมพันธ์ระหว่างอัตราการนำแคชกลับมาใช้ใหม่กับการกระจายโหลด GPU
นักวิจัยเปิดเผยข้อมูลที่ช่วยให้วิเคราะห์รูปแบบคำขอ การเปลี่ยนแปลงการใช้งานโมเดล และเวลาแฝงของระบบให้บริการได้พร้อมกัน เนื่องจากตัดพรอมต์และคำตอบออก ข้อมูลจึงมุ่งศึกษาวิธีดำเนินงานของบริการ LLM และการจัดสรรทรัพยากรโครงสร้างพื้นฐาน มากกว่าการตรวจสอบบทสนทนาของผู้ใช้
คำถามที่พบบ่อย
Q. ชุดข้อมูลนี้มีเนื้อหาบทสนทนาจริงของผู้ใช้หรือไม่?
ไม่ใช่ ชุดข้อมูลไม่รวมพรอมต์หรือคำตอบจากโมเดล แต่เปิดเผยเฉพาะข้อมูลเมตาดาทาของระบบให้บริการ เช่น เวลาที่ส่งคำขอ จำนวนโทเค็น เวลาแฝง และข้อมูลที่เกี่ยวข้องกับแคช
Q. ตัวเลข 99% หมายถึงอะไร?
ในกรณีที่ผู้ใช้คนเดียวกันส่งคำขอซ้ำไปยังโมเดลเดิม 99% ของคำขอเหล่านั้นเกิดขึ้นภายใน 15 นาทีหลังคำขอก่อนหน้า ตามผลการวิจัย
Q. Bittensor มีความเกี่ยวข้องโดยตรงหรือไม่?
Chutes เป็นแพลตฟอร์มการอนุมานที่ดำเนินงานบนซับเน็ต 64 ของ Bittensor แต่ยังไม่มีข้อมูลยืนยันว่าการเปิดเผยชุดข้อมูลครั้งนี้ส่งผลโดยตรงต่อราคาของ TAO หรือความต้องการโทเค็น
ความคิดเห็น 0