นักวิจัย 21 คน ซึ่งรวมถึงนักวิจัยจากกูเกิล ดีปมายด์ (Google DeepMind) และมหาวิทยาลัยฮาร์วาร์ด ได้เผยแพร่เอกสารไวท์เปเปอร์ที่พิจารณาประสบการณ์เชิงภาพ (visual experience) ว่าเป็นแนวทางหลักแนวทางหนึ่งสำหรับการวิจัยปัญญาประดิษฐ์ทั่วไป (AGI) โดยไวท์เปเปอร์ฉบับนี้ไม่ได้ระบุโมเดลเฉพาะเจาะจงหรือกรอบเวลาที่ AGI จะเกิดขึ้นจริงแต่อย่างใด
ทีมวิจัยที่นำโดยฮิโรคัตสึ คาตาโอกะ (Hirokatsu Kataoka) เผยแพร่เอกสาร “Visual General Intelligence: A White Paper” เมื่อวันที่ 26 สิงหาคม รายชื่อผู้เขียนยังมีโรเบิร์ต ไกร์ฮอส (Robert Geirhos) นักวิจัยจากกูเกิล ดีปมายด์ และอี้ลุน ตู้ (Yilun Du) นักวิจัยจากมหาวิทยาลัยฮาร์วาร์ดรวมอยู่ด้วย
แนวคิด “ปัญญาทั่วไปเชิงภาพ” หรือ VGI ที่ไวท์เปเปอร์นำเสนอ ไม่ได้หมายถึงโมเดลหรือสถาปัตยกรรมเดียว แต่หมายถึงทิศทางการวิจัยที่ให้ระบบเรียนรู้การทำนาย การสร้างสรรค์ การฟื้นฟูข้อมูล ความเข้าใจเชิงพื้นที่ และความสามารถในการกระทำ โดยอาศัยข้อมูลภาพ วิดีโอ และข้อมูลเรขาคณิตเป็นพื้นฐาน
ทีมวิจัยตั้งคำถามว่าข้อมูลภาพจะสามารถก่อให้เกิดปัญญาในลักษณะเดียวกับที่งานวิจัย AGI สายภาษาได้ขยายความสามารถด้านการสรุปทั่วไปผ่านการทำนายข้อความมาโดยตลอดหรือไม่ ทีมวิจัยอธิบายว่าข้อมูลเชิงภาพมีข้อมูลที่ภาษาไม่สามารถระบุได้ชัดเจน เช่น รูปทรงของวัตถุ ความสัมพันธ์เชิงพื้นที่ การเคลื่อนไหว และโครงสร้างทางกายภาพ
ไวท์เปเปอร์ไม่ได้จำกัดปัญญาเชิงภาพไว้เพียงการรู้จำภาพเท่านั้น แต่ยังกำหนดหัวข้อวิจัยให้ครอบคลุมถึงการทำนายสถานการณ์ในอนาคต การฟื้นฟูโครงสร้างที่มองไม่เห็น การแสดงพื้นที่สามมิติ และการเรียนรู้อย่างต่อเนื่องในสภาพแวดล้อมใหม่
ประเด็นปัญญาแบบมีร่างกาย (embodied intelligence) และการรับรู้เชิงรุก ซึ่งหมายถึงหุ่นยนต์ที่สังเกตสภาพแวดล้อมรอบตัวแล้วลงมือทำ จากนั้นนำผลลัพธ์กลับไปใช้ในการเรียนรู้ ก็ถูกบรรจุอยู่ในหัวข้อที่หารือด้วยเช่นกัน สะท้อนว่าขอบเขตงานวิจัยได้ขยายจากการจำแนกข้อมูลเชิงภาพเพียงอย่างเดียว ไปสู่การปฏิสัมพันธ์กับสภาพแวดล้อมจริง
ทั้งนี้ ทีมวิจัยไม่ได้เสนอให้ตัดภาษาออกไปจากการพิจารณา แต่เสนอแนวทางแบบหลายรูปแบบ (multimodal) ที่ใช้ภาพเป็นแกนหลัก ควบคู่กับการผนวกภาษา การได้ยิน การสัมผัส และการรับรู้ตำแหน่งร่างกาย (proprioception) เข้าด้วยกัน
โรเบิร์ต ไกร์ฮอส (Robert Geirhos) นักวิจัยจากกูเกิล ดีปมายด์ ระบุในไวท์เปเปอร์ว่า “โมเดลวิดีโอเชิงสร้างสรรค์ (generative video model) จะกลายเป็นโมเดลพื้นฐานด้านการมองเห็น” ซึ่งสะท้อนมุมมองการวิจัยที่ว่าโมเดลวิดีโอเชิงสร้างสรรค์อาจพัฒนาไปไกลกว่าการเป็นเครื่องมือที่ทำงานเฉพาะอย่าง จนกลายเป็นโมเดลพื้นฐานที่รองรับงานด้านการมองเห็นได้หลากหลายรูปแบบ
อย่างไรก็ตาม คำกล่าวนี้ไม่ได้หมายความว่าประสิทธิภาพของผลิตภัณฑ์ได้รับการพิสูจน์แล้ว หรือมีความเห็นตรงกันในอุตสาหกรรมแต่อย่างใด ไวท์เปเปอร์ไม่ได้ระบุตัวเลขประสิทธิภาพของโมเดลวิดีโอเชิงสร้างสรรค์ หรือแผนการเปิดตัวผลิตภัณฑ์ใดๆ
ไวท์เปเปอร์ยังระบุด้วยว่า นิยามของ VGI เกณฑ์การวัดผล (benchmark) วิธีการฝึกฝน รวมถึงความสัมพันธ์ระหว่างภาพและภาษา ยังไม่มีข้อสรุปที่เป็นเอกภาพ และไม่มีผลการพิสูจน์เชิงประจักษ์ที่ยืนยันว่าประสบการณ์เชิงภาพเพียงอย่างเดียวจะนำไปสู่ AGI ได้
การหารือครั้งนี้เริ่มต้นจากเวิร์กช็อป CVPR 2026 VGI ซึ่งจัดขึ้นในเดือนมิถุนายน 2026 โดยโปรแกรมอย่างเป็นทางการของ CVPR มีเวิร์กช็อปหัวข้อ “Visual General Intelligence” บรรจุอยู่ และข้อมูลกิจกรรมของกูเกิล รีเสิร์ช (Google Research) ก็ระบุถึงเซสชันเกี่ยวกับ VGI ที่ไกร์ฮอสเป็นผู้บรรยายไว้เช่นกัน
ก่อนหน้านี้ กูเกิล ดีปมายด์ เคยหารือถึงกรอบการจัดประเภทประสิทธิภาพ ความสามารถทั่วไป และความเป็นอิสระของ AGI รวมถึงเส้นทางที่จะนำไปสู่ซูเปอร์อินเทลลิเจนซ์ (superintelligence) หลังยุค AGI มาแล้ว งานวิจัย AGI ของกูเกิล ดีปมายด์ ยังนำไปสู่การถกเถียงเรื่องเกณฑ์ด้านประสิทธิภาพ ความสามารถทั่วไป และความเป็นอิสระด้วยเช่นกัน
ไวท์เปเปอร์ฉบับนี้เป็นการขยายแนวทางวิจัยดังกล่าวไปสู่มุมมองด้านประสบการณ์เชิงภาพและความเข้าใจโลกทางกายภาพ ซึ่งอาจเชื่อมโยงกับงานวิจัยด้านวิดีโอเชิงสร้างสรรค์ ปัญญาประดิษฐ์เชิงพื้นที่ การเรียนรู้ของหุ่นยนต์ และโมเดลจำลองโลก (world model) ได้ แต่ยังไม่มีการระบุกำหนดการเชิงพาณิชย์ที่ชัดเจน
ก่อนหน้านี้ กูเกิล ดีปมายด์ ยังเคยหารือถึงความเป็นไปได้ของการพัฒนาตนเองแบบวนซ้ำ (recursive self-improvement) ในฐานะเส้นทางหนึ่งจาก AGI ไปสู่ซูเปอร์อินเทลลิเจนซ์ด้วย ความเป็นไปได้ของการพัฒนาตนเองแบบวนซ้ำหลังยุค AGI เคยถูกหยิบยกขึ้นมาพูดถึงในวงการวิจัยและการลงทุนมาแล้ว
ปัจจุบัน VGI ยังไม่ใช่เทคโนโลยีหรือผลิตภัณฑ์ที่เสร็จสมบูรณ์ แต่เป็นวาระวิจัยที่มุ่งสำรวจเงื่อนไขว่าการเรียนรู้เชิงภาพจะนำไปสู่ปัญญาทั่วไปได้หรือไม่ ไวท์เปเปอร์ฉบับนี้ไม่มีเนื้อหาเกี่ยวกับกำหนดการเปิดตัวโมเดล ช่วงเวลาที่จะบรรลุ AGI หรือความได้เปรียบด้านประสิทธิภาพแต่อย่างใด
ความคิดเห็น 0