Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

OpenRouter เปิดตัว Ori Eval เครื่องมือเทียบโมเดล AI จากงานจริง

OpenRouter เปิดตัวเครื่องมือประเมินโมเดลปัญญาประดิษฐ์ (AI) ชื่อ 'Ori Eval' ที่เปรียบเทียบประสิทธิภาพ ความเร็ว และต้นทุนของโมเดลต่าง ๆ โดยอิงจากโค้ดและขั้นตอนการทำงานจริงของนักพัฒนา ช่วยลดภาระที่นักพัฒนาต้องทดลองใช้โมเดลทีละตัว และช่วยให้เลือกโมเดลที่เหมาะกับผลิตภัณฑ์ของตนได้ง่ายขึ้น

OpenRouter ระบุผ่านบล็อกทางการเมื่อวันที่ 4 (เวลาท้องถิ่น) ว่า Ori Eval จะรันพรอมต์จริงของแอปพลิเคชัน ตรวจสอบการเรียกใช้เครื่องมือ (tool call) และคุณภาพของคำตอบ เพื่อเป็นหลักฐานประกอบการเลือกโมเดล ทั้งนี้ OpenRouter เป็นบริการรูปแบบเกตเวย์ที่ให้ผู้ใช้เข้าถึงโมเดล AI หลายตัวผ่าน API เดียว

Ori Eval ไม่ได้จัดอันดับโมเดลแบบสากลเหมือนลีดเดอร์บอร์ดสาธารณะทั่วไป แต่ประเมินว่าโมเดลใด 'ทำงานได้ดีกว่า' ในบริการเฉพาะแต่ละแบบ แนวคิดนี้เกิดจากมุมมองที่ว่าเบนช์มาร์กทั่วไปหรือคำแนะนำจากโซเชียลมีเดียเพียงอย่างเดียวไม่สามารถสะท้อนข้อมูล พรอมต์ และสภาพแวดล้อมการทำงานจริงของแต่ละผลิตภัณฑ์ได้

เครื่องมือนี้จะค้นหาจุดที่โค้ดของนักพัฒนาเรียกใช้โมเดลจากซอร์สโค้ดเบส (codebase) แล้วสร้างไฟล์ประเมินขึ้นมา จากนั้นนำโมเดลที่เป็นตัวเลือกมารันภายใต้เงื่อนไขเดียวกันเพื่อเปรียบเทียบผลลัพธ์ นักพัฒนาสามารถกำหนดเกณฑ์ที่ต้องการให้ตรงกับผลิตภัณฑ์ของตนได้ เช่น ความแม่นยำ ความเร็ว ต้นทุน เวลาแฝง (latency) และความแม่นยำในการเรียกใช้เครื่องมือ

ระหว่างการประเมิน สภาพแวดล้อมการทำงาน การตั้งค่าโมเดล และระดับความเข้มข้นของการอนุมาน (inference) จะถูกล็อกไว้คงที่ เพื่อป้องกันไม่ให้ผลลัพธ์คลาดเคลื่อนจากการที่แต่ละโมเดลถูกทดสอบภายใต้เงื่อนไขที่ต่างกัน

ผลการประเมินจะถูกบันทึกเป็นไฟล์โค้ดรูปแบบ '*.eval.ts' และรันด้วยคำสั่ง 'bun test' โดยตรวจสอบว่าเอเจนต์เรียกใช้เครื่องมือที่จำเป็นหรือไม่ หลีกเลี่ยงการเรียกใช้เครื่องมือที่ไม่ควรใช้หรือไม่ และตอบคำถามจนจบหรือไม่ ส่วนคำตอบที่ไม่มีคำตอบตายตัว สามารถให้โมเดลภาษาขนาดใหญ่ (LLM) อีกตัวหนึ่งช่วยตรวจให้คะแนนได้

Ori Eval ยังมีฟีเจอร์แปลงบั๊กที่อธิบายด้วยภาษาธรรมชาติให้กลายเป็นชุดทดสอบ ตัวอย่างเช่น หากป้อนปัญหาว่าเอเจนต์ฝ่ายบริการลูกค้าดำเนินการคืนเงินโดยไม่ตรวจสอบคำสั่งซื้อก่อน ระบบจะสร้างชุดประเมินที่ตรวจสอบว่ามีการเรียกใช้เครื่องมือค้นหาคำสั่งซื้อหรือไม่ เมื่อทีมพัฒนาแก้ไขปัญหาเสร็จแล้ว ก็สามารถรันชุดทดสอบเดิมซ้ำเพื่อยืนยันว่าปัญหาไม่กลับมาเกิดซ้ำอีก

เมื่อเชื่อมต่อกับ GitHub Actions ชุดประเมินสามารถใช้เป็นการทดสอบถดถอย (regression test) ได้ โดยตั้งค่าให้กระบวนการ Continuous Integration (CI) ล้มเหลวเมื่อการประเมินไม่ผ่าน และสามารถรันด้วยตนเองหรือให้ทำงานอัตโนมัติตามตารางเวลาที่กำหนดไว้ได้

การเปิดตัวครั้งนี้สะท้อนว่าธุรกิจของ OpenRouter กำลังขยายจากการเป็นตัวกลางเชื่อมต่อโมเดล ไปสู่การบริหารจัดการด้านการพัฒนาและปฏิบัติการ เมื่อเดือนกรกฎาคมที่ผ่านมา OpenRouter ได้เปิดตัว 'Classifiers' เครื่องมือติดตามงานและต้นทุนของเอเจนต์ พร้อมเผยแพร่วิธีประเมินประสิทธิภาพของผู้ให้บริการ LLM โดยพิจารณาจากเวลาแฝง ปริมาณงานที่ประมวลผลได้ และเวลาที่ระบบทำงานได้ต่อเนื่อง ก่อนหน้านี้ TokenPost เคยรายงานกรณีการวิเคราะห์ปริมาณการใช้งานและประสิทธิภาพของโมเดล AI จากบันทึกคำขอจำนวนมากของ OpenRouterมาแล้ว

ความเชื่อมโยงกับคริปโตของ OpenRouter จำกัดอยู่แค่ช่องทางการชำระเงินเท่านั้น โดยนอกจากบัตรเครดิตและ Alipay แล้ว OpenRouter ยังรองรับการชำระเงินด้วยยูเอสดีคอยน์(USDC) ซึ่งเป็นสเตเบิลคอยน์ที่ผูกมูลค่ากับเงินดอลลาร์สหรัฐ ส่วนตัว Ori Eval เองไม่ได้ถูกนำเสนอในฐานะบริการบล็อกเชนหรือโปรเจกต์โทเคนแต่อย่างใด

แหล่งข้อมูลอ้างอิง: บล็อกของ OpenRouter เรื่อง Ori Eval, เอกสารประกอบ Ori Eval, คู่มือเริ่มต้นใช้งานฉบับย่อ และ คำถามที่พบบ่อย

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1