GPT-6 Astra ของ OpenAI ทำคะแนนรวม 58.3 คะแนนในการประเมิน HealthBench ซึ่งเป็นการทดสอบปัญญาประดิษฐ์ด้านสุขภาพ โดยคะแนน 57.3 คะแนนจาก ‘MentalHealthBench’ ที่ปรากฏในรายงานแยกต่างหาก ต้องแยกออกจากผลการประเมินอย่างเป็นทางการของ OpenAI
OpenAI เปิดเผยคะแนน HealthBench Professional ที่ 64.7 คะแนน, HealthBench Hard ที่ 36.6 คะแนน และ HealthBench Consensus ที่ 95.5 คะแนนในเอกสารระบบอย่างเป็นทางการของ GPT-6 Astra โดยการประเมินแต่ละรายการมีกลุ่มเป้าหมายและวิธีคำนวณคะแนนแตกต่างกัน
Crypto Briefing รายงานเมื่อวันที่ 23 ว่า OpenAI พัฒนา ‘MentalHealthBench’ โดยอาศัยผู้เชี่ยวชาญด้านสุขภาพจิตมากกว่า 80 คนจาก 22 ประเทศ และ GPT-6 Astra ได้คะแนน 57.3 คะแนน รายงานดังกล่าวระบุว่าเกณฑ์ประเมินครอบคลุมความปลอดภัย ความเหมาะสมด้านบริบท การเคารพสิทธิในการตัดสินใจของผู้ใช้ และคำแนะนำที่นำไปปฏิบัติได้
อย่างไรก็ตาม เอกสารระบบที่ OpenAI เผยแพร่ระบุถึง HealthBench ไม่ใช่ ‘MentalHealthBench’ รายละเอียดอื่นที่ปรากฏในรายงานแยกต่างหาก เช่น การมีส่วนร่วมของผู้เชี่ยวชาญมากกว่า 80 คน 22 ประเทศ มาตรวัดตั้งแต่ -1 ถึง +10 คะแนน และความเหนือกว่ารุ่นก่อนหน้า ยังไม่พบการยืนยันในเอกสารอย่างเป็นทางการของ OpenAI
คะแนน HealthBench คำนวณด้วยวิธีปรับตามความยาวของคำตอบ OpenAI ระบุว่าคะแนน HealthBench Professional สูงกว่า GPT-5.6 Sol 4.2 จุด ขณะที่คะแนนรวม HealthBench เพิ่มขึ้น 1.3 จุด และ HealthBench Hard เพิ่มขึ้น 3.5 จุด
ดังนั้นจึงไม่สามารถเปรียบเทียบคะแนนรวม HealthBench ที่ 58.3 คะแนนกับ MentalHealthBench ที่ 57.3 คะแนนโดยตรงได้ เนื่องจากชื่อการประเมิน ระบบคะแนน และกลุ่มเป้าหมายอาจแตกต่างกัน
OpenAI ระบุว่าได้ดำเนินการประเมินบทสนทนาหลายรอบในหัวข้อสุขภาพจิต การพึ่งพาทางอารมณ์ และการทำร้ายตัวเองด้วย การประเมินไม่ได้พิจารณาคำตอบต่อคำถามตายตัวเพียงข้อเดียว แต่จำลองสถานการณ์ที่บทสนทนาดำเนินต่อไปตามคำตอบของโมเดล
การประเมินดังกล่าวใช้การจำลองผู้ใช้ที่มีท่าทีเป็นปฏิปักษ์ และนับสัดส่วนคำตอบที่ไม่ละเมิดนโยบายความปลอดภัยเป็นตัวชี้วัด ‘safe’ โดย OpenAI อธิบายว่า GPT-6 Astra ปรับปรุงผลลัพธ์จาก GPT-5.6 Sol ได้ในทั้งสามด้าน
อย่างไรก็ตาม กรณีศึกษาสำหรับการประเมินมุ่งเน้นสถานการณ์ยากที่โมเดลรุ่นก่อนหน้าไม่สามารถให้คำตอบที่เหมาะสมที่สุดได้ OpenAI ย้ำว่าผลลัพธ์นี้ไม่ได้หมายถึงอัตราความผิดพลาดที่เกิดขึ้นในสภาพแวดล้อมการใช้งานจริง
HealthBench ประเมินการตอบสนองต่อภาวะฉุกเฉิน การตรวจสอบบริบท และการสื่อสารให้เหมาะกับระดับความเชี่ยวชาญในการสนทนาด้านสุขภาพ แพทย์เป็นผู้พิจารณาว่าสถานการณ์จำเป็นต้องได้รับการรักษาฉุกเฉินหรือไม่ และตรวจสอบว่ามีการแนะนำให้เข้ารับการรักษาฉุกเฉินอย่างชัดเจนตั้งแต่ช่วงต้นของคำตอบหรือไม่
งานวิจัย HealthBench ชี้ว่าโมเดลยังมีช่องว่างในการตรวจสอบบริบทที่จำเป็นให้เพียงพอและจัดการกับความไม่แน่นอน ประเด็นนี้สะท้อนเหตุผลว่าการประเมินบทสนทนาด้านสุขภาพจิตควรพิจารณาทั้งการระบุภาวะวิกฤตและความปลอดภัยของกระบวนการสนทนา ไม่ใช่ดูเพียงคะแนนเดียว
สมาคมจิตเวชศาสตร์อเมริกัน (American Psychiatric Association) ระบุในผลสำรวจปี 2026 ว่า ผู้ใหญ่ 17% เคยปรึกษาปัญหาสุขภาพจิตกับแชตบอต AI และ 35% ตอบว่ามีแนวโน้มจะพูดคุยกับแชตบอต AI แทนผู้เชี่ยวชาญด้านสุขภาพจิตเมื่อเผชิญปัญหา
ในอีกด้านหนึ่ง ผู้ตอบแบบสำรวจ 58% แสดงความกังวลต่อการใช้แชตบอต AI ให้คำปรึกษาด้านสุขภาพจิตแก่เด็ก สมาคมจิตเวชศาสตร์อเมริกันมีจุดยืนว่า AI ไม่สามารถทดแทนการวินิจฉัยทางคลินิกหรือการบำบัดสุขภาพจิตโดยผู้เชี่ยวชาญได้
OpenAI เปิดตัว GPT-6 Astra เมื่อวันที่ 3 กันยายน โดยอธิบายว่าโมเดลรุ่นนี้เพิ่มประสิทธิภาพด้านการใช้งานคอมพิวเตอร์ วิศวกรรมซอฟต์แวร์ วิทยาศาสตร์ และความมั่นคงปลอดภัยไซเบอร์ พร้อมเดินหน้าบริการแบบชำระเงินเป็นระยะและการให้บริการ API สำหรับนักพัฒนา สำหรับ GPT-6 Astra
ปัจจุบัน เอกสารระบบอย่างเป็นทางการยืนยันได้เฉพาะคะแนน HealthBench และการประเมินบทสนทนาหลายรอบในหัวข้อสุขภาพจิต การพึ่งพาทางอารมณ์ และการทำร้ายตัวเองเท่านั้น ส่วนข้อความว่า ‘MentalHealthBench ได้ 57.3 คะแนน’ ยังไม่ควรถูกระบุว่าเป็นผลการประเมินอย่างเป็นทางการของ OpenAI จนกว่าจะมีการเปิดเผยวิธีการประเมินและข้อมูลต้นฉบับของการทดสอบดังกล่าว
ความคิดเห็น 0