Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

เจมิไน 3.8 Live และ TTS เป็นคนละโมเดล

Google($GOOGL) เปิดตัวโมเดลเจมิไน 3.8 Live จำนวน 2 รุ่นที่รองรับการสนทนาด้วยเสียงแบบเรียลไทม์และการให้เหตุผลขั้นสูง ขณะที่ยังไม่พบชื่อโมเดลแปลงข้อความเป็นเสียงแยกต่างหากว่าเจมิไน 3.8 TTS ในเอกสารทางการของ Google

เมื่อวันที่ 15 Google เปิดตัวเจมิไน 3.8 Live (Gemini 3.8 Live) และเจมิไน 3.8 Live Extended Thinking ผ่าน Gemini API สำหรับนักพัฒนาและ Google AI Studio

เจมิไน 3.8 Live เป็นโมเดลที่ประมวลผลข้อมูลภาพระหว่างสนทนาด้วยเสียงแบบเรียลไทม์ นักพัฒนายังสามารถสร้างฟังก์ชันให้โมเดลเรียกใช้ API และเครื่องมือภายนอกเบื้องหลังระหว่างการสนทนาได้

ส่วนเจมิไน 3.8 Live Extended Thinking มุ่งเน้นการให้เหตุผลที่ซับซ้อนและการทำงานหลายขั้นตอน โดยโมเดลจะประมวลผลงานแยกต่างหากขณะที่ผู้ใช้ยังคงสนทนาด้วยเสียงต่อเนื่อง

โมเดลทั้งสองรองรับภาษามากกว่า 97 ภาษาและความสม่ำเสมอของสำเนียง นอกจากอินพุตเสียงแล้ว ยังสามารถประมวลผลวิดีโอและภาพแบบเรียลไทม์ได้

Google ระบุว่าโมเดล Extended Thinking ได้คะแนน 82.6 คะแนนและครองอันดับ 1 ใน Speech to Speech Quality Index ของ Artificial Analysis โดยตัวเลขดังกล่าวอ้างอิงจากข้อมูลเปรียบเทียบที่ Google เปิดเผยเอง จึงยังไม่ยืนยันว่ามีการตรวจสอบซ้ำโดยอิสระ

การเปิดตัวครั้งนี้สะท้อนว่า Google นำเสนอฟังก์ชันที่ผสานการสนทนาแบบเรียลไทม์ อินพุตภาพ การให้เหตุผล และการเรียกใช้เครื่องมือไว้ด้วยกัน อย่างไรก็ตาม จุดสำคัญของกลุ่มเจมิไน 3.8 Live อยู่ที่การพัฒนา AI แบบสนทนา มากกว่าการแปลงข้อความเป็นเสียง

TTS คือเทคโนโลยีแปลงข้อความเป็นเสียง ขณะที่เจมิไน 3.8 Live เข้าใจอินพุตเสียงและตอบกลับด้วยเสียง ทำให้กระบวนการประมวลผลและวัตถุประสงค์การใช้งานแตกต่างกัน

โมเดล TTS แยกต่างหากที่ Google เปิดตัวอย่างเป็นทางการคือเจมิไน 3.1 Flash TTS (Gemini 3.1 Flash TTS) ซึ่งรองรับคำสั่งภาษาธรรมชาติและแท็กเสียงที่สื่อถึงรูปแบบการแสดงออก เพื่อปรับน้ำเสียง ความเร็ว และอารมณ์ได้

เจมิไน 3.1 Flash TTS รองรับมากกว่า 70 ภาษาและการสนทนาหลายผู้พูด โดยมุ่งเน้นการแปลงเนื้อหาที่เป็นข้อความให้เป็นเสียงพูดที่เป็นธรรมชาติ

เอกสารของ Google Cloud ยังแนะนำ Gemini-TTS ซึ่งรองรับหลายภาษา รวมถึงภาษาไทย และมีฟังก์ชันอ่านออกเสียงเชิงแสดงอารมณ์สำหรับบทกวี ข่าว และการเล่าเรื่อง ตลอดจนการควบคุมอารมณ์ น้ำเสียง และความเร็วในการพูด

อย่างไรก็ตาม ยังไม่ยืนยันว่าเอกสาร Gemini-TTS หมายถึงการเปิดตัวเจมิไน 3.8 TTS หรือไม่ เมื่อพิจารณาจากชื่อผลิตภัณฑ์อย่างเป็นทางการ เจมิไน 3.8 Live และเจมิไน 3.1 Flash TTS เป็นผลิตภัณฑ์คนละกลุ่ม

ก่อนหน้านี้มีการรายงานว่า Google เปิดตัวโมเดลเจมิไน 3.8 Live จำนวน 2 รุ่นที่รองรับการสนทนาด้วยเสียงแบบเรียลไทม์และการให้เหตุผลขั้นสูง โดย [รายงานก่อนหน้า](https://www.tokenpost.kr/news/ai/408512) การตรวจสอบครั้งนี้มีความสำคัญต่อการแยกแยะวัตถุประสงค์การใช้งานของโมเดลดังกล่าวกับเทคโนโลยี TTS

เอกสารทางการของ Google ยังยืนยันว่าเจมิไน 3.5 Transcribe (Gemini 3.5 Transcribe) รองรับภาษาไทย อย่างไรก็ตาม คุณภาพการสนทนาภาษาไทยและขอบเขตการใช้งานจริงของเจมิไน 3.8 Live ยังไม่สามารถประเมินได้จากการประกาศครั้งนี้เพียงอย่างเดียว

เจมิไน 3.8 Live ทั้ง 2 รุ่นเปิดให้นักพัฒนาใช้งานผ่าน Gemini API และ Google AI Studio ส่วนชื่อผลิตภัณฑ์ที่แน่นอนและการเปิดตัวแยกต่างหากของเจมิไน 3.8 TTS ยังต้องรอการประกาศเพิ่มเติมจาก Google

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1