Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

Google DeepMind เปิดตัว Gemini 3.8 Live รองรับเสียงและการเข้าใจภาพแบบเรียลไทม์

สมาร์ทโฟนสนทนาขณะส่องกล้องไปที่ปฏิทิน / TokenPost.ai

Google DeepMind เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ซึ่งรองรับการสนทนาด้วยเสียงแบบเรียลไทม์ การเข้าใจข้อมูลภาพ และการให้เหตุผลที่ซับซ้อน

Gemini 3.8 Live เป็นโมเดลอินเทอร์เฟซเสียงที่มุ่งเน้นประสิทธิภาพด้านต้นทุนและการประมวลผลในปริมาณมาก โมเดลรองรับการสนทนาและการให้เหตุผลที่ใกล้เคียงเรียลไทม์ พร้อมทำความเข้าใจข้อมูลภาพระหว่างการสนทนา ไม่ได้จำกัดอยู่เพียงการรับข้อมูลเสียง

Google DeepMind อธิบายบนหน้า Gemini Audio อย่างเป็นทางการว่า โมเดลใหม่สามารถนำข้อมูลภาพมาใช้เป็นบริบทในการสนทนาได้ ถือเป็นการขยายอินเทอร์เฟซปัญญาประดิษฐ์จากระบบที่เน้นเสียง ไปสู่การทำความเข้าใจทั้งหน้าจอและกล้อง

Gemini 3.8 Live Extended Thinking มุ่งรองรับการให้เหตุผลที่ซับซ้อนและการทำงานหลายขั้นตอน โดยมีการนำเสนอตัวอย่างการใช้งานที่โมเดลแบ่งงานเบื้องหลังให้เอเจนต์หลายตัว ขณะยังคงสนทนาด้วยเสียงอย่างเป็นธรรมชาติ

นักพัฒนาสามารถทดลองโมเดลทั้งสองผ่าน Google AI Studio และ Gemini Live API เพื่อสร้างฟังก์ชันโต้ตอบด้วยเสียงและวิดีโอ ส่วนเอาต์พุตเสียงใช้ SynthID ซึ่งเป็นเทคโนโลยีของ Google สำหรับระบุคอนเทนต์ที่สร้างขึ้น

Google DeepMind ระบุว่า SynthID สามารถช่วยระบุเสียงที่สร้างหรือแก้ไขด้วยปัญญาประดิษฐ์ของ Google ได้ อย่างไรก็ตาม เอกสารที่เผยแพร่ยังไม่มีตัวเลขจากการทดสอบมาตรฐานอิสระ ผลประเมินจากภายนอก เวลาแฝงของการตอบสนอง หรือต้นทุนการใช้งาน

Google กำลังขยายปัญญาประดิษฐ์ด้านเสียงจากเครื่องมือสนทนาไปสู่เครื่องมือที่ดำเนินงานได้ ในการอัปเดต Gemini Live ที่เปิดตัวเมื่อวันที่ 26 สิงหาคม บริษัทนำเสนอฟังก์ชันสรุปข้อมูลจาก Gmail และ Calendar รวมถึงค้นหา จัดหมวดหมู่ และจัดเก็บอีเมลด้วยคำสั่งเสียง พร้อมระบุว่า 63% ของผู้ใช้ Gemini ในขณะนั้นใช้บริการด้วยเสียง

สำหรับผู้ใช้ในไทย ขอบเขตการรู้จำเสียงและการประมวลผลหลายภาษายังคงเป็นประเด็นสำคัญ ก่อนหน้านี้ TokenPost รายงานว่าเอกสารอย่างเป็นทางการยืนยันโมเดลปัญญาประดิษฐ์แปลงเสียงเป็นข้อความของ Google รองรับภาษาเกาหลี ดังนั้น คุณภาพการสนทนาภาษาเกาหลีและขอบเขตการใช้งานจริงของโมเดลใหม่จึงต้องติดตามต่อไป

ผลกระทบของการเปิดตัว Gemini 3.8 Live ต่อความสามารถในการแข่งขันด้านปัญญาประดิษฐ์ของ Google จะขึ้นอยู่กับการใช้งานจริง เวลาแฝง ต้นทุน และผลประเมินด้านความปลอดภัย โดย Google DeepMind เตรียมให้บริการโมเดลดังกล่าวควบคู่กับเครื่องมือนักพัฒนา

ยังไม่มีการนำเสนอกรณีใช้งานโดยตรงหรือผลกระทบต่อตลาดในภาคสินทรัพย์ดิจิทัลและบล็อกเชน แม้จะยืนยันได้ว่าปัญญาประดิษฐ์ด้านเสียงขยายไปสู่การเข้าใจภาพและการจัดการงานผ่านเอเจนต์แล้ว แต่ความเชื่อมโยงกับอุตสาหกรรมดังกล่าวยังต้องรอการประกาศเพิ่มเติมและการประเมินจากภายนอก

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

บทความหลัก

Uniswap v4 Hook กว่า 80.6% ถูกจัดเป็นอันตรายหรือน่าสงสัย

ทรัมป์โทรหาเจนเซ่น หวง บอกความกังวลเรื่อง AI เป็น 'เรื่องหลอกลวง'

ประธาน SEC หนุนกฎหมาย CLARITY เดินหน้ากฎเกณฑ์คริปโตต่อเนื่อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1