ผลการทดสอบจริงพบว่า Qwen 3.8 Flash มีความเร็วสร้างข้อความลดลงเหลือ 18–21 โทเคนต่อวินาที เมื่อเพิ่มความยาวบริบทของโมเดล AI ที่ทำงานบนเครื่องให้เกิน 100,000 โทเคน เทียบกับ 28–33 โทเคนต่อวินาทีในบริบทสั้น
วิทาลิก บูเทอริน (Vitalik Buterin) เปิดเผยผลการทดสอบดังกล่าวหลังรัน Qwen 3.8 Flash บนแล็ปท็อปที่ใช้แพลตฟอร์ม AMD Strix Halo ผ่านเฟรมเวิร์กอนุมานโอเพนซอร์ส llama.cpp โดย Chainnews (ABMedia) รายงานว่าเขาเผยแพร่ตารางประสิทธิภาพจากการทดสอบ 10 ครั้ง
ตารางดังกล่าวระบุความยาวพรอมป์เดิม ความยาวพรอมป์ใหม่ จำนวนโทเคนที่สร้าง ความเร็วประมวลผลอินพุต และความเร็วเอาต์พุต การทดสอบแบ่งเป็น 2 กลุ่มตามความยาวบริบทเดิม ได้แก่ บริบทสั้นและบริบทยาว
การทดสอบ 6 ครั้งที่มีบริบทเดิม 2,136–7,799 โทเคน ให้ความเร็วเอาต์พุต 28.07–33.37 โทเคนต่อวินาที โดยค่าที่เร็วที่สุดอยู่ที่ 33.37 โทเคนต่อวินาที และค่าต่ำสุดอยู่ที่ 28.07 โทเคนต่อวินาที
ส่วนการทดสอบ 4 ครั้งที่มีบริบทเดิม 104,535–107,402 โทเคน ให้ความเร็วเอาต์พุต 18.42–20.78 โทเคนต่อวินาที หรือลดลงราว 30–40% เมื่อเทียบกับบริบทสั้น
ความเร็วประมวลผลอินพุตก็แตกต่างกันตามความยาวบริบทเช่นกัน กลุ่มบริบทสั้นมีความเร็ว 300–373 โทเคนต่อวินาที ยกเว้น 1 ครั้ง ขณะที่กลุ่มบริบทยาวลดลงเหลือ 150–198 โทเคนต่อวินาที
ค่าความเร็วประมวลผลอินพุตที่ผิดไปจากกลุ่มบริบทสั้นอยู่ที่ 109.82 โทเคนต่อวินาที การทดสอบดังกล่าวมีพรอมป์เดิม 2,136 โทเคน และพรอมป์ใหม่ 110 โทเคน
โทเคนคือหน่วยพื้นฐานที่โมเดล AI ใช้ประมวลผลและสร้างข้อความ ส่วนความยาวบริบทหมายถึงขอบเขตข้อมูลอินพุตที่โมเดลสามารถอ้างอิงได้ในคราวเดียว เมื่อบริบทยาวขึ้น ปริมาณข้อมูลที่โมเดลต้องประมวลผลก็เพิ่มขึ้นตาม
ผลลัพธ์นี้เป็นการเปรียบเทียบการเปลี่ยนแปลงด้านประสิทธิภาพตามความยาวบริบทบนแล็ปท็อปเครื่องเดียวกัน อย่างไรก็ตาม ยังไม่มีการเปิดเผยรายละเอียดความแม่นยำในการควอนไทซ์ของโมเดล การจัดสรรหน่วยความจำ รวมถึงสเปกย่อยและการตั้งค่าพลังงานของ Strix Halo
ด้วยเหตุนี้ จึงยังเปรียบเทียบตัวเลขดังกล่าวโดยตรงกับผลการทดสอบจากคอมพิวเตอร์เครื่องอื่นได้ยาก เนื่องจากความเร็วอินพุตและเอาต์พุตของโมเดลเดียวกันอาจแตกต่างกันตามฮาร์ดแวร์และการตั้งค่าการทำงาน
บูเทอรินกล่าวว่า ประสิทธิภาพของ llama.cpp ในการประมวลผลโมเดลดังกล่าวกำลังได้รับการปรับปรุงอย่างรวดเร็ว พร้อมประเมินว่าโมเดลที่ทำงานบนเครื่องกำลังเข้าใกล้จุดที่ “สามารถจัดการงานส่วนใหญ่ได้โดยตรง”
วิทาลิก บูเทอริน (Vitalik Buterin) ผู้ร่วมก่อตั้งอีเธอเรียม ยังเสนอแนวทางใช้โมเดลที่ทำงานบนเครื่องเป็นชั้นประสานงานเพื่อคุ้มครองความเป็นส่วนตัว โดยกล่าวว่าเวิร์กโฟลว์ที่ “ให้โมเดลบนเครื่องประสานคำถามไปยังโมเดลที่มีความสามารถสูงกว่า เพื่อไม่ให้คำถามที่มีข้อมูลส่วนตัวรั่วไหล” เริ่มมีความเป็นไปได้มากขึ้น
ในแนวทางนี้ โมเดลบนเครื่องจะประมวลผลคำถามของผู้ใช้ก่อน จากนั้นจะแยกว่าข้อมูลใดควรส่งไปยังโมเดลบนคลาวด์ และข้อมูลใดควรเก็บไว้ในอุปกรณ์ จุดสำคัญคือคำขอที่มีข้อมูลอ่อนไหวอาจไม่จำเป็นต้องถูกส่งไปยังเซิร์ฟเวอร์ภายนอกโดยตรง
ก่อนหน้านี้ บูเทอรินกล่าวว่าต้นทุนการนำมาใช้และความสะดวกในการใช้งานเป็นปัจจัยสำคัญต่อการทำให้เทคโนโลยีความเป็นส่วนตัวแพร่หลาย ผลการทดสอบครั้งนี้สะท้อนความแตกต่างของความเร็วประมวลผลโมเดล AI บนเครื่องตามความยาวบริบทในแล็ปท็อปเครื่องหนึ่ง
อย่างไรก็ตาม ผลลัพธ์ดังกล่าวมาจากแล็ปท็อปและสภาพแวดล้อมการทำงานเฉพาะ การประเมินความเป็นไปได้ในการใช้งานโมเดล AI บนเครื่องจริงยังต้องอาศัยการทดสอบเพิ่มเติมที่เปิดเผยการตั้งค่าโมเดล การจัดสรรหน่วยความจำ และเงื่อนไขด้านพลังงานอย่างครบถ้วน
ความคิดเห็น 0