Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

ลดเวลาแฝง 2.5 เท่า! AI สื่อสารผ่าน KV-แคชโดยตรง

การ์ดเร่งความเร็ว AI สองใบวางประกบกันในห้องปฏิบัติการ / TokenPost.ai

เทคโนโลยีสื่อสารระหว่างโมเดลภาษาขนาดใหญ่ (LLM) ที่ส่งต่อ KV-แคชซึ่งเป็นสถานะภายในโดยตรงแทนข้อความ ช่วยลดเวลาแฝงเฉลี่ยระหว่างโมเดลลง 2.5 เท่าเมื่อเทียบกับการสื่อสารผ่านข้อความ ทีมวิจัยจากมหาวิทยาลัยชิงหัว (Tsinghua University) เปิดเผยผลการทดลองดังกล่าว

งานวิจัยเสนอระบบ ‘Cache-to-Cache (C2C)’ ซึ่งแปลง KV-แคชของโมเดลหนึ่งไปเป็นพื้นที่ตัวแทนของอีกโมเดล ก่อนนำมารวมกัน งานวิจัยเผยแพร่ครั้งแรกเมื่อวันที่ 3 ตุลาคม 2025 และแก้ไขเมื่อวันที่ 2 มีนาคม 2026 โดยได้รับการบรรจุเป็นบทความในการประชุม International Conference on Learning Representations (ICLR) 2026

ระบบหลาย LLM แบบเดิมให้โมเดลหนึ่งสร้างผลวิเคราะห์เป็นข้อความ แล้วส่งให้โมเดลอื่นอ่านซ้ำ กระบวนการนี้บีบอัดข้อมูลมิติสูงภายในโมเดลให้เหลือเพียงประโยค และยังเพิ่มเวลาแฝงจากการสร้างโทเค็นทีละลำดับ

C2C ใช้เครือข่ายประสาทเทียมที่เรียกว่า ‘Cache Fuser’ ฉาย KV-แคชของโมเดล ‘Sharer’ ซึ่งเป็นผู้ให้ข้อมูล แล้วรวมเข้ากับแคชของโมเดล ‘Receiver’ หรือผู้รับข้อมูล ขณะที่เกตที่สามารถฝึกได้จะเลือกว่าจะส่งข้อมูลไปยังชั้นใดของ Receiver

KV-แคชคือสถานะภายในในรูปคีย์และค่าที่โมเดลสะสมระหว่างประมวลผลข้อมูลนำเข้าก่อนหน้า เมื่อบริบทมีความยาวมากขึ้น แคชจะมีขนาดใหญ่ขึ้นและอาจส่งผลต่อความเร็วในการอนุมานและการใช้หน่วยความจำ จึงถือเป็นองค์ประกอบสำคัญของโครงสร้างพื้นฐานสำหรับการอนุมานข้อความยาว

ทีมวิจัยทดสอบกับโมเดลหลายตระกูล ได้แก่ Qwen2.5, Qwen3, Llama3.2 และ Gemma3 โดยมีขนาดโมเดลตั้งแต่ 0.6B ถึง 14B และใช้ชุดทดสอบ OpenBookQA, MMLU-Redux, ARC-Challenge และ C-Eval

ผลการทดลองพบว่า C2C มีความแม่นยำเฉลี่ยสูงกว่าโมเดลเดี่ยว 6.4-14.2% และเมื่อเทียบกับการสื่อสารระหว่างโมเดลผ่านข้อความ ความแม่นยำเพิ่มขึ้น 3.1-5.4%

เวลาแฝงเฉลี่ยลดลง 2.5 เท่าเมื่อเทียบกับการสื่อสารผ่านข้อความ ทีมวิจัยระบุว่าโครงสร้างที่ส่งต่อตัวแทนภายในของโมเดลโดยตรง โดยไม่ต้องสร้างคำอธิบายระหว่างทาง ช่วยลดการสูญเสียข้อมูลและความล่าช้าจากการสร้างข้อความแบบลำดับ

บทความอธิบายว่า KV-แคชอาจทำหน้าที่เป็นช่องทางถ่ายทอดความหมายระหว่างโมเดล ไม่ได้เป็นเพียงพื้นที่จัดเก็บชั่วคราวสำหรับการคำนวณ แม้ได้รับข้อมูลนำเข้าเดียวกัน แต่ละโมเดลอาจสะสมบริบทและความรู้ในรูปแบบที่แตกต่างกัน การนำข้อมูลเหล่านี้มารวมกันจึงอาจช่วยเติมเต็มข้อมูลที่โมเดลเดี่ยวพลาดไป

อย่างไรก็ตาม การเพิ่มประสิทธิภาพไม่ได้รับประกันว่าจะเกิดขึ้นในทุกสถานการณ์ ทีมวิจัยระบุว่าหาก Sharer ส่งต่อข้อมูลที่ไม่ถูกต้อง Receiver อาจตอบผิดในโจทย์ที่เดิมสามารถตอบถูกได้ด้วยตัวเอง และวิเคราะห์ว่าความเสี่ยงนี้อาจเพิ่มขึ้นเมื่อเชื่อมต่อ Sharer ที่มีความสามารถต่ำกว่ากับ Receiver ที่แข็งแกร่ง

ความสามารถในการขยายระบบยังเป็นความท้าทาย C2C ในปัจจุบันออกแบบโดยเน้นโครงสร้างแบบจับคู่ ซึ่งต้องฝึกโปรเจกเตอร์และฟิวเซอร์แยกตามชุดโมเดล หากต้องการให้หลายโมเดลสื่อสารพร้อมกัน อาจต้องใช้พื้นที่แฝงร่วมกัน

งานวิจัยเสนอแนวทางใช้พื้นที่แฝงร่วมสำหรับหลายโมเดลแล้ว แต่ระบุว่ายังอยู่ในขั้นการทดลองเบื้องต้น ยิ่งจำนวนชุดโมเดลเพิ่มขึ้น ก็ยิ่งต้องจัดการทั้งต้นทุนการฝึกฟิวเซอร์และข้อผิดพลาดที่เกิดขึ้นระหว่างการสื่อสาร

ผลการทดลองวัดจากการใช้ GPU NVIDIA A100 เพียงหนึ่งตัว ความยาวคำตอบที่จำกัด และชุดโมเดลที่ทีมวิจัยกำหนด ดังนั้น ยังต้องมีการตรวจสอบเพิ่มเติมก่อนสรุปผลไปยังต้นทุน ปริมาณงาน ความปลอดภัย และระดับการส่งต่อข้อผิดพลาดในสภาพแวดล้อมบริการจริง

โค้ดอย่างเป็นทางการเผยแพร่บนคลัง GitHub ภายใต้ใบอนุญาต Apache-2.0 โดยมีฟิวเซอร์ที่ฝึกไว้ล่วงหน้าสำหรับชุดโมเดลบางส่วน รวมถึงตัวอย่างการฝึกและการประเมินผล อย่างไรก็ตาม C2C ยังไม่ได้เปิดตัวเป็นมาตรฐานการสื่อสารทั่วไปที่ใช้ได้ทันทีสำหรับทุกชุดโมเดล

งานวิจัยนี้มีความสำคัญในแง่ที่ทีมวิจัยจากจีนเสนอแนวทางเปลี่ยนโครงสร้างการสื่อสารระหว่างโมเดล AI แต่ในขอบเขตงานวิจัยที่ยืนยันได้ ยังไม่มีการระบุถึงการนำไปใช้ในบริการเชิงพาณิชย์ หรือความเชื่อมโยงโดยตรงกับอุตสาหกรรมสินทรัพย์ดิจิทัล บล็อกเชน หรือเซมิคอนดักเตอร์

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1