เทเธอร์ ดาต้า(Tether Data) เปิดโอเพนซอร์สโมเดล AI ด้านภาพและภาษาแบบออนดีไวซ์ ‘วิชันไซ-นาโน(VisionPsy-Nano)’ ที่มีพารามิเตอร์ประมาณ 460 ล้านรายการ โดยมุ่งให้โมเดลมัลติโมดัลขนาดเล็กประมวลผลภาพและภาษาได้ภายในอุปกรณ์อย่างสมาร์ตโฟน
โครงการวิจัย AI คิวแวค(QVAC) ในเครือเทเธอร์ ดาต้า ระบุว่า โมเดลดังกล่าวทำคะแนนมาตรฐานรวมได้ 62.3 ซึ่งเป็นระดับสูงสุดในอุตสาหกรรมเมื่อเทียบกับโมเดลภาพและภาษาที่มีพารามิเตอร์ต่ำกว่า 500 ล้านรายการ พร้อมระบุว่าประสิทธิภาพโดยรวมเหนือกว่าโมเดลระดับเดียวกันของลิควิด เอไอ(Liquid AI) และฮักกิงเฟซ(Hugging Face)
เวอร์ชันที่เปิดเผยมี 2 รุ่น ได้แก่ รุ่นมาตรฐาน ‘VisionPsy-Nano-460M’ และรุ่นลดเวลาแฝง ‘VisionPsy-Nano-460M-Flash’ โดยรุ่น Flash ถูกนำเสนอว่ามีความเร็วในการสร้างโทเคนแรกบน Pixel 9, Galaxy S23, Galaxy S25 Ultra และ iPhone 15 เร็วกว่า SmolVLM2-500M สูงสุดประมาณ 19-36 เท่า
น้ำหนักของทั้งสองโมเดลเผยแพร่ภายใต้ไลเซนส์ Apache 2.0 และรองรับการใช้งานผ่าน Transformers, การติดตั้งแบบโลคัลด้วย llama.cpp GGUF quantization รวมถึงการอนุมานบนเซิร์ฟเวอร์ประสิทธิภาพสูงผ่าน vLLM ความเคลื่อนไหวนี้ทำให้ตลาดจับตาว่าโมเดล AI ขนาดเล็กสำหรับรันบนอุปกรณ์จะถูกนำไปใช้ในงานภาพและภาษาได้กว้างขึ้นเพียงใด
ความคิดเห็น 0