Google เปิดตัว Gemini 3.8 Live ซึ่งรองรับการสนทนาด้วยเสียงแบบเรียลไทม์และการประมวลผลข้อมูลภาพ แต่การเปิดตัวฟีเจอร์อวตารวิดีโอ ‘Live Avatar’ ยังไม่พบการยืนยันแยกต่างหากในเอกสารทางการของ Google
Google เปิดตัว Gemini 3.8 Live (Gemini 3.8 Live) และ Gemini 3.8 Live Extended Thinking (Gemini 3.8 Live Extended Thinking) เมื่อวันที่ 15 โดยโมเดลทั้งสองถูกออกแบบให้สนทนาด้วยเสียงต่อเนื่องพร้อมประมวลผลข้อมูลภาพ รวมถึงเรียกใช้เครื่องมือและ API เบื้องหลังระหว่างการสนทนา
สำหรับบริการองค์กร Google เริ่มเปิดตัวแบบพรีวิวส่วนตัวสำหรับ Gemini Enterprise และมีแผนให้บริการแก่ลูกค้า Gemini Enterprise Customer Experience ด้วย
การเปิดตัวครั้งนี้เป็นการยืนยันต่อเนื่องจากข่าวการเปิดตัว Gemini 3.8 Live สองโมเดลที่รองรับการสนทนาด้วยเสียงแบบเรียลไทม์และการอนุมานเพิ่มเติมของ Google ประเด็นสำคัญคือฟีเจอร์อวตารวิดีโอเปิดตัวพร้อมกับโมเดลหรือไม่
CryptoBriefing รายงานเมื่อวันที่ 24 ว่า Google เปิดตัวฟีเจอร์อวตารวิดีโอแบบเรียลไทม์สำหรับองค์กรในชื่อ ‘Live Avatar’ โดยระบุว่าฟีเจอร์ดังกล่าวรองรับการขยับริมฝีปากและการแสดงสีหน้าของอวตารให้สอดคล้องกับเสียง ระบบกำกับดูแลข้อมูลสำหรับองค์กร และลายน้ำ SynthID
อย่างไรก็ตาม เอกสารประกาศอย่างเป็นทางการและเอกสารสำหรับนักพัฒนาของ Google ไม่ได้ระบุฟีเจอร์หรือผลิตภัณฑ์แยกต่างหากในชื่อ ‘Live Avatar’ เช่นเดียวกับข้อมูลเรื่องรายชื่อผู้ได้รับอนุญาตให้ใช้อวตารแบบกำหนดเอง การใช้ SynthID กับวิดีโอที่สร้างขึ้นทั้งหมด หรือกำหนดการเปิดตัวอวตารวิดีโอสำหรับลูกค้าองค์กร
ตัวเลขด้านการรองรับภาษาก็แตกต่างกันตามเอกสาร ประกาศ Gemini 3.8 Live ของ Google ระบุว่าสามารถตรวจจับและสลับภาษาอัตโนมัติระหว่างการสนทนาได้ 97 ภาษา ขณะที่เอกสาร Gemini Live API ระบุว่ารองรับ 99 ภาษา
ตัวเลขทั้งสองอาจครอบคลุมการใช้งานคนละประเภท โดยยังไม่มีหลักฐานว่า 99 ภาษาที่ Gemini Live API รองรับนั้นใช้กับฟีเจอร์อวตารวิดีโอได้โดยตรง
ข้อมูลทางการของ Google ระบุว่า SynthID ใช้กับเสียงที่สร้างโดย AI โดย Google อธิบายว่าระบบจะแทรกลายน้ำที่มนุษย์ตรวจจับได้ยากลงในเสียงพูด เพื่อช่วยระบุคอนเทนต์ที่สร้างโดย AI
ดังนั้น คำอธิบายว่า ‘วิดีโอที่สร้างขึ้นทั้งหมดใช้ SynthID’ ควรแยกออกจากการใช้ลายน้ำในเสียง การนำเทคโนโลยีเดียวกันมาใช้กับอวตารวิดีโอยังเป็นประเด็นที่ต้องรอการประกาศเพิ่มเติม
Google ไม่ได้ไม่มีบริการอวตาร AI สำหรับองค์กร โดย Google Vids มีฟีเจอร์อวตาร AI แบบกำหนดเองที่สร้างวิดีโอนำเสนอจากสคริปต์ และสามารถใส่โลโก้กับพื้นหลังขององค์กรได้
วิดีโอที่สร้างด้วย Google Vids ใช้ลายน้ำ SynthID อย่างไรก็ตาม บริการนี้เป็นเครื่องมือผลิตวิดีโอ จึงมีรูปแบบการให้บริการแตกต่างจากบริการอวตารที่สนทนาด้วยเสียงแบบเรียลไทม์อย่าง Gemini 3.8 Live
นักพัฒนาสามารถใช้งาน Gemini 3.8 Live ผ่าน Gemini API และ Google AI Studio ได้ โดย Google ชูการโต้ตอบแบบเรียลไทม์ที่เน้นเสียงและความเข้าใจบริบทด้านภาพเป็นฟังก์ชันหลัก
กรณีใช้งานจริงของลูกค้าองค์กร ราคา พื้นที่ให้บริการ และวิธีเข้าถึงฟีเจอร์อวตารวิดีโอผ่าน API ยังไม่เปิดเผย โพสต์ที่นำเสนอฟีเจอร์ดังกล่าวถูกแชร์ในชุมชน Reddit แต่โพสต์บนโซเชียลมีเดียเพียงอย่างเดียวยังไม่เพียงพอที่จะยืนยันการเปิดตัวอย่างเป็นทางการหรือรายละเอียดทางเทคนิค
ขณะนี้ข้อมูลที่ยืนยันได้จากเอกสารทางการของ Google คือการเปิดตัว Gemini 3.8 Live และโมเดล Extended Thinking รวมถึงพรีวิวส่วนตัวของ AI เสียงสำหรับองค์กร ส่วนการเปิดตัว Live Avatar อย่างเป็นทางการและรายละเอียดฟีเจอร์วิดีโอยังต้องรอประกาศเพิ่มเติมจาก Google
ความคิดเห็น 0