Grok Voice เชื่อมต่อกับ fal.ai แพลตฟอร์มโครงสร้างพื้นฐานเสียง AI สำหรับนักพัฒนาแล้ว โดยคิดค่าบริการ 0.00083 ดอลลาร์ต่อวินาทีของเสียง หรือประมาณ 1.13 วอน
นักพัฒนาสามารถใช้โมเดลเสียงถึงเสียงเพื่อสร้างเอเจนต์เสียงแบบเรียลไทม์ได้ โดยไม่ต้องเชื่อม API แปลงเสียงเป็นข้อความ การประมวลผลภาษา และการสังเคราะห์เสียงแยกกัน fal.ai ระบุใน หน้าบริการว่ารองรับ HTTP API สำหรับประมวลผลไฟล์บันทึกเสียง และ WebSocket API สำหรับการสนทนาแบบสองทางเรียลไทม์
WebSocket API ใช้โครงสร้างการสื่อสารแบบฟูลดูเพล็กซ์ ทำให้เอเจนต์ตอบกลับได้ระหว่างที่ผู้ใช้กำลังพูด โดยตั้งเป้าให้เสียงตอบกลับครั้งแรกเกิดขึ้นภายใน 1 วินาที อย่างไรก็ตาม ความหน่วงจริงอาจแตกต่างกันตามสภาพแวดล้อมอินพุตและเครือข่าย
โดยทั่วไปเอเจนต์เสียงเดิมจะเชื่อมระบบรู้จำเสียงพูด (STT) การประมวลผลด้วยโมเดลภาษาขนาดใหญ่ และการสังเคราะห์เสียง (TTS) ตามลำดับ ขณะที่ Grok Voice รวมกระบวนการเหล่านี้ไว้ในโมเดลเสียงถึงเสียง เพื่อลดภาระในการจัดการบริการและโครงสร้างพื้นฐานหลายส่วนแยกกัน
ค่าบริการที่ fal.ai แจ้งอยู่ที่ประมาณ 0.05 ดอลลาร์ต่อนาที หรือประมาณ 68 วอน ส่วนการโต้ตอบด้วยเสียงต่อเนื่อง 1 ชั่วโมงมีค่าใช้จ่ายประมาณ 3 ดอลลาร์ หรือประมาณ 4,080 วอน โดยคิดค่าบริการตามการใช้งานและไม่มีขั้นต่ำ
ระบบรองรับมากกว่า 25 ภาษา มีเสียงพื้นฐาน 25 แบบ รวมถึงเสียงที่ผู้ใช้กำหนดเอง และรองรับฟังก์ชันโคลนเสียง
xAI ระบุใน ประกาศว่า เมื่อวันที่ 6 กรกฎาคม ได้เพิ่มเสียงหลายภาษา 21 แบบจากเดิม 5 แบบ พร้อมอธิบายว่าสามารถสร้างเสียงที่ผู้ใช้กำหนดเองได้จากเสียงตัวอย่างประมาณ 1 นาที
ระบบยังรองรับการเรียกใช้ฟังก์ชันภายนอกระหว่างการสนทนา เช่น การตรวจสอบบัญชีลูกค้า เช็กสินค้าคงคลัง และประมวลผลธุรกรรมผ่านระบบภายนอก
การนำไปใช้จริงจำเป็นต้องจัดการเรื่องความยินยอมของบุคคลที่ถูกโคลนเสียง การคุ้มครองข้อมูลส่วนบุคคล และสิทธิ์เข้าถึงระบบภายนอกแยกกัน โดยเฉพาะการเรียกใช้ฟังก์ชันภายนอกที่เชื่อมการสนทนาด้วยเสียงเข้ากับการดำเนินงานจริง จึงควรกำหนดขอบเขตสิทธิ์ให้ชัดเจน
การเชื่อมต่อครั้งนี้มีลักษณะเป็นการขยาย API สำหรับนักพัฒนาและองค์กร มากกว่าการอัปเดตแอปพลิเคชัน Grok สำหรับผู้บริโภค โดย xAI เปิดตัว API เสียงสำหรับนักพัฒนาในเดือนธันวาคม 2025 ผ่าน เอกสารเผยแพร่ Grok Voice Agent API
xAI เปิดตัว Grok Voice Think Fast 1.0 ในเดือนเมษายน 2026 และเผยแพร่ Think Fast 2.0 ในเดือนกรกฎาคม โดยการประกาศแต่ละครั้งระบุถึงการปรับปรุงด้านการอนุมานด้วยเสียง การสนทนา และการใช้งานเครื่องมือ
fal.ai ให้สภาพแวดล้อมการพัฒนาที่เชื่อมต่อโมเดล AI เชิงสร้างสรรค์หลายประเภทผ่าน SDK เดียวและ serverless API การเชื่อมต่อครั้งนี้ทำให้ Grok Voice กลายเป็นหนึ่งในตัวเลือกโมเดลสำหรับนักพัฒนา ร่วมกับโมเดลสร้างภาพและวิดีโอ
ระบบเสียงถึงเสียงเชื่อมอินพุตเสียงเข้ากับเอาต์พุตเสียงโดยไม่แบ่งกระบวนการเป็นขั้นตอนประมวลผลข้อความและสังเคราะห์เสียงแยกกัน ส่วน WebSocket คือวิธีการสื่อสารที่เซิร์ฟเวอร์และไคลเอนต์คงการเชื่อมต่อไว้เพื่อแลกเปลี่ยนข้อมูลแบบเรียลไทม์
ยังไม่พบข้อมูลเชิงปริมาณเกี่ยวกับการแพร่กระจายบนโซเชียลมีเดียหรือความคิดเห็นเพิ่มเติมจากผู้เกี่ยวข้องในอุตสาหกรรมอย่างมีนัยสำคัญ นอกเหนือจากราคาและฟังก์ชันบนหน้าทางการแล้ว ปริมาณการใช้งานจริงและผลกระทบต่อคุณภาพบริการยังต้องได้รับการตรวจสอบเพิ่มเติม
ความคิดเห็น 0