โมเดลเอ็มเบดดิงตามบริบทของ Perplexity ทำคะแนน nDCG@10 ได้ 81.96% ในการทดสอบมาตรฐานด้านการค้นหาเอกสาร โดยสะท้อนบริบทของเอกสารทั้งฉบับแทนการประมวลผลแต่ละส่วนแยกจากกัน เพื่อยกระดับคุณภาพการค้นหาในระบบการสร้างเสริมด้วยการค้นคืนข้อมูล (RAG)
Perplexity เปิดตัว ‘pplx-embed-v1’ สำหรับการค้นหาทั่วไป และ ‘pplx-embed-context-v1’ สำหรับการค้นหาตามบริบทเมื่อวันที่ 26 กุมภาพันธ์ 2026 ทั้งสองตระกูลมีรุ่นขนาด 0.6B และ 4B รองรับใบอนุญาต MIT และ API ตามประกาศอย่างเป็นทางการของบริษัท
โมเดลตามบริบทไม่ได้ฝังเวกเตอร์ของแต่ละส่วนแบบอิสระเมื่อเอกสารยาวถูกแบ่งออกเป็นหลายส่วน แต่จะนำประโยคก่อนหน้า ประโยคถัดไป และข้อมูลจากเอกสารทั้งฉบับมาพิจารณาร่วมกัน ทำให้แยกแยะคำสรรพนามหรือชื่อบริษัทที่อาจไม่ชัดเจนเมื่อดูเฉพาะส่วนเดียวได้
ตัวอย่างเช่น หากประมวลผลเฉพาะประโยค ‘เขากลายเป็นจักรพรรดิในปี 1804’ อาจระบุผู้ที่ประโยคดังกล่าวกล่าวถึงได้ยาก แต่เมื่อพิจารณาข้อมูลบุคคลที่ปรากฏในช่วงต้นของเอกสาร ระบบจะเข้าใจความหมายของประโยคได้แม่นยำขึ้นในขั้นตอนการค้นหา
วิธีการนี้แสดงจุดแข็งในการทดสอบ ConTEB ซึ่งประเมินการค้นหาที่ต้องอาศัยบริบทของเอกสารทั้งฉบับ โดย ‘pplx-embed-context-v1-4B’ ของ Perplexity ทำคะแนน nDCG@10 ได้ 81.96%
Perplexity ระบุว่า ในการเปรียบเทียบเดียวกัน ‘voyage-context-3’ ของ Voyage ทำได้ 79.45% ขณะที่โมเดลของแอนโทรปิก(Anthropic) ทำได้ 72.4% ทั้งนี้เป็นผลการเปรียบเทียบที่ Perplexity นำเสนอ และงานวิจัยที่เกี่ยวข้องก็ได้กล่าวถึงการเปรียบเทียบประสิทธิภาพของโมเดลเหล่านี้
ตารางเปรียบเทียบที่เผยแพร่บน OpenReview ระบุว่า ‘pplx-embed-v1-4B’ สำหรับการค้นหาทั่วไปทำคะแนน nDCG@10 ได้ 69.66% ในหมวดการค้นหาหลายภาษาของ MTEB ขณะที่ Qwen3-Embedding-4B ทำได้ 69.60% และ ‘gemini-embedding-001’ ทำได้ 67.71%
โมเดลมาตรฐานและโมเดลตามบริบทมีเป้าหมายการใช้งานและเงื่อนไขการทดสอบแตกต่างกัน ดังนั้นจึงไม่สามารถนำคะแนน 81.96% จาก ConTEB ไปเปรียบเทียบโดยตรงกับ 69.66% จาก MTEB ในฐานะผลการทดสอบภายใต้เงื่อนไขเดียวกันได้
โมเดลรองรับหน้าต่างบริบทขนาด 32K โทเคนและกลไกความสนใจแบบสองทิศทาง นอกจากนี้ยังรองรับการทำควอนไทซ์แบบ INT8 และไบนารี โดย Perplexity อธิบายว่าการทำควอนไทซ์แบบไบนารีอาจลดพื้นที่จัดเก็บได้สูงสุด 32 เท่า
ราคาการใช้งาน API อยู่ที่ 0.03 ดอลลาร์ต่อ 1 ล้านโทเคน (ประมาณ 41 วอน) สำหรับโมเดลมาตรฐาน 4B และ 0.05 ดอลลาร์ต่อ 1 ล้านโทเคน (ประมาณ 68 วอน) สำหรับโมเดลตามบริบท 4B โดยเป็นราคาที่ระบุไว้ในประกาศอย่างเป็นทางการของ Perplexity
ConTEB ถูกออกแบบมาเพื่อประเมินสถานการณ์ที่คำตอบไม่ได้อยู่ครบในส่วนของเอกสารเพียงส่วนเดียว แต่ต้องอาศัยข้อมูลจากเอกสารทั้งฉบับ งานวิจัย ConTEB อธิบายว่าการประมวลผลแต่ละส่วนแยกจากกันอาจทำให้ความเชื่อมโยงด้านความหมายภายในเอกสารลดลง
ระบบ RAG มักแบ่งเอกสารยาวออกเป็นหลายส่วนแล้วจัดเก็บไว้ในฐานข้อมูลเวกเตอร์ หากฝังเวกเตอร์ของแต่ละส่วนแยกกัน หัวข้อหรือบริบทก่อนหน้าและถัดไปของเอกสารอาจไม่ถูกสะท้อนในผลการค้นหาอย่างเพียงพอ
ชุมชนนักพัฒนาให้ความสนใจไม่เพียงประสิทธิภาพของโมเดล แต่ยังรวมถึงความเร็วในการใช้งานจริงและปริมาณการใช้ API นักพัฒนารายหนึ่งเปิดเผยผลการทดลองส่วนตัวว่า ในสภาพแวดล้อม A100 เดียวกัน ความเร็วในการสร้างดัชนีของ ‘pplx-embed-v1-4B’ ช้ากว่า Qwen3-Embedding-4B ราว 7-8 เท่า แต่ผลดังกล่าวไม่ควรถูกมองว่าเป็นประสิทธิภาพทั่วไป
ในฟอรัมสำหรับนักพัฒนาของ Perplexity มีการตั้งคำถามว่าปริมาณการใช้ API ถูกคำนวณตามจำนวนส่วนของเอกสาร ไม่ใช่ตามจำนวนคำขอเอกสารหรือไม่ Perplexity ตอบว่าการทำงานดังกล่าวเป็นปกติ และระบุในโพสต์ฟอรัมว่าได้แก้ไขคำว่า ‘QPS’ ในเอกสารให้หมายถึงจำนวนส่วนที่ประมวลผลได้ต่อวินาที
คอลเลกชันโมเดลอย่างเป็นทางการบน Hugging Face มีโมเดลตระกูล ‘pplx-embed-v1’ และ ‘pplx-embed-context-v1’ อยู่ ณ วันที่ 1 ตุลาคม 2026 ส่วน ‘pplx-embed-v2-context-9b-preview’ ที่ปรากฏในเบาะแสการรายงานข่าวยังไม่พบการยืนยันในประกาศอย่างเป็นทางการหรือการ์ดโมเดล และข้อกล่าวอ้างที่เกี่ยวข้องปรากฏอยู่ในรายงานของ Crypto Briefing
นักพัฒนาที่กำลังพิจารณานำโมเดลไปใช้งานควรทดสอบความเร็วในการสร้างดัชนี การใช้หน่วยความจำ ปริมาณส่วนเอกสารที่ API ประมวลผลได้ และประสิทธิภาพการค้นหาภาษาเกาหลีแยกจากคะแนนมาตรฐานด้วย ขณะที่รายละเอียดที่ Perplexity อธิบายว่าโมเดลมาตรฐานและโมเดลตามบริบทมุ่งเป้าการค้นหาคนละประเภทได้รับการสรุปไว้ในงานวิจัย และการเปรียบเทียบประสิทธิภาพของ Search API ของ Perplexity ก็เคยถูกรายงานโดยสำนักข่าวแห่งนี้
ความคิดเห็น 0