Microsoft($MSFT) เปิดตัว Microsoft-Decision-1 โมเดล AI ที่ให้คะแนนตัวเลือกที่กำหนดไว้ล่วงหน้า เพื่อนำผลไปใช้จำแนก จัดลำดับความสำคัญ และควบคุม AI agent โมเดลนี้ให้ผลการตัดสินใจพร้อมคะแนนความน่าจะเป็น แทนการสร้างคำตอบยาว ๆ เพื่อช่วยทำงานตัดสินใจที่ต้องทำซ้ำโดยอัตโนมัติ
Microsoft แนะนำโมเดลผ่านสิ่งพิมพ์สำหรับนักพัฒนาเมื่อวันที่ 9 ตุลาคม 2026 โดยระบุว่าสามารถใช้งานได้บน Microsoft Foundry และมีแผนจะเปิดให้ใช้บน OpenRouter ด้วย ผู้ใช้กำหนดตัวเลือกไว้ล่วงหน้า แล้วใช้คะแนนตัดสินใจว่าจะดำเนินการขั้นต่อไป ลองทำงานซ้ำ หรือส่งให้คนตรวจสอบ
กรณีใช้งานที่ระบุไว้ ได้แก่ การจำแนกคำขอ จัดลำดับความสำคัญของงาน ตรวจสอบคำตอบจาก AI เลือกโมเดล และควบคุมการทำงานของ agent ตัวอย่างเช่น ประเมินคำตอบที่ AI สร้างตามเกณฑ์ที่กำหนด แล้วเลือกยอมรับ แก้ไข หรือปฏิเสธ หรือส่งรายงานเหตุการณ์ไปยังทีมที่รับผิดชอบตามระดับความเร่งด่วน
Microsoft-Decision-1 พัฒนาต่อยอดจาก Qwen3.5-9B ของ Alibaba และออกแบบให้ให้คะแนนการตัดสินใจได้ภายในการอนุมานครั้งเดียว Microsoft ระบุว่ามีแผนอัปเดตโมเดลในอนาคตโดยต่อยอดจากโมเดลอื่นของ Microsoft AI และ OpenAI ด้วย
ตัวเลขประสิทธิภาพที่ Microsoft เปิดเผยเป็นผลการประเมินของบริษัทเอง Microsoft ระบุว่าโมเดลทำความแม่นยำได้สูงสุดในการทดสอบ 36 ชุด ซึ่งมีคำถามรวมประมาณ 150,000 ข้อ และวัดผลได้เร็วกว่า Quyet-1.0-Large 4.5 เท่า และ GPT-6 Sol 35 เท่า อัตราการเปลี่ยนคำตัดสินเมื่อปรับรูปแบบข้อมูลนำเข้าอยู่ที่เฉลี่ย 1.3% นอกจากนี้ บริษัทยังประเมินคำขอ 5,250 รายการจากเกณฑ์ทดสอบ 11 ชุด ซึ่งครอบคลุมคำขอที่เป็นอันตราย ความพยายามเจลเบรก และ prompt injection
ตัวอย่างการทดสอบภายในที่เปิดเผยคือการจำแนกความคิดเห็นเกี่ยวกับเกมของ Xbox Research โดยจัดหมวดหมู่ความคิดเห็นเกี่ยวกับเกมมากกว่า 10,000 รายการจากแบบสำรวจ Steam และ X ตามหัวข้อ Microsoft ระบุว่าได้คุณภาพใกล้เคียง GPT-6 Sol ด้วยความเร็วมากกว่า 14 เท่าและค่าใช้จ่ายประมาณหนึ่งใน 200
สำหรับการประเมินคุณภาพคำตอบของทีม Copilot บริษัทระบุว่าได้ผลลัพธ์ที่แข่งขันกับ GPT-5.6 Luna โดยใช้ความเร็วมากกว่า 100 เท่า นอกจากนี้ยังเปิดเผยผลทดสอบการค้นหาความรู้เพื่อรับมือเหตุการณ์และเวิร์กโฟลว์ด้านการวิจัยทางวิทยาศาสตร์ ซึ่งทั้งหมดเป็นการประเมินที่บริษัทนำเสนอ
คะแนนความน่าจะเป็นอาจใช้เป็นเกณฑ์แยกงานที่ให้ระบบจัดการอัตโนมัติกับงานที่ต้องให้คนตรวจสอบได้ อย่างไรก็ตาม คะแนนเพียงอย่างเดียวไม่ได้รับประกันว่าการตัดสินใจจะแม่นยำ การใช้งานจริงยังต้องพิจารณางานแก้ไขจากการตัดสินใจผิด ภาระการตรวจสอบ และต้นทุนการดำเนินงานควบคู่กันไป โดยกรณีใช้งานที่เปิดเผยในขณะนี้ยังเน้นการทดสอบภายใน Microsoft
ความคิดเห็น 0