Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

Grok 4.7 ติดอันดับ 1–3 ในการทดสอบเขียนโค้ด แต่คะแนนยังเทียบตรงกับโมเดลอื่นไม่ได้

Grok 4.7 ได้อันดับ 1–3 ในการประเมินความสามารถด้านการเขียนโค้ดตามระดับการใช้เหตุผล แต่รูปแบบกรรมการที่แตกต่างกันทำให้ยังสรุปจากคะแนนเพียงอย่างเดียวไม่ได้ว่าโมเดลนี้เขียนโค้ดได้ดีกว่าโมเดลอื่น

VulcanBench เปิดเผยผลประเมิน Frontier v4 เมื่อวันที่ 4 ตุลาคม โดยให้ Grok 4.7 ทำโจทย์ 23 ข้อผ่าน CLI ของเอเจนต์เขียนโค้ด Cursor โมเดลได้ 93.15 คะแนนและอันดับ 1 ในการตั้งค่าระดับสูงสุด, 92.71 คะแนนและอันดับ 2 ในระดับสูง และ 92.30 คะแนนและอันดับ 3 ในระดับกลาง ส่วนระดับต่ำได้ 89.42 คะแนน อยู่อันดับ 12

ระดับการใช้เหตุผลที่สูงขึ้นช่วยให้ผ่านโจทย์ได้มากขึ้น แต่ใช้เวลานานขึ้นด้วย ระดับต่ำผ่าน 18 จาก 23 ข้อ ใช้เวลาเฉลี่ย 20.2 นาทีต่อข้อ ขณะที่ระดับสูงสุดผ่านครบทั้ง 23 ข้อ โดยใช้เวลาเฉลี่ย 28.5 นาที ระดับกลางผ่าน 21 ข้อ และทำโจทย์หนึ่งข้อไม่เสร็จภายในเวลาที่กำหนด

การประเมินครั้งนี้วัดการทำงานร่วมกันระหว่าง Grok 4.7 กับสภาพแวดล้อมการทำงานของ Cursor ไม่ได้วัดตัวโมเดลแยกต่างหาก คะแนนพิจารณาทั้งความถูกต้องของฟังก์ชัน คุณภาพโค้ด ความซับซ้อน และการตรวจสอบความปลอดภัย คุณภาพโค้ดมีสัดส่วน 33% ของคะแนนรวม โดยกรรมการที่เป็นโมเดลประเมินความอ่านง่ายและการบำรุงรักษาโค้ดด้วย

วิธีตัดสินอาจมีผลต่อการเปรียบเทียบคะแนนระหว่างโมเดล VulcanBench ใช้ Grok 4.6 เป็นกรรมการประเมินคุณภาพโค้ดของโมเดลอื่น แต่ใช้ GPT-6.1 Sol แทนในการประเมิน Grok 4.7 เมื่อให้คะแนนผลงานชุดเดียวกัน GPT-6.1 Sol ให้คะแนนสูงกว่า Muse Spark 1.3 อยู่ 5.4–6.3 คะแนน VulcanBench ระบุว่าความแตกต่างนี้ทำให้คะแนนรวมของ Grok 4.7 ยังมีข้อจำกัดเมื่อนำไปเทียบตรงกับโมเดลอื่น

แม้เปรียบเทียบเฉพาะคะแนนจาก Muse Spark 1.3 ซึ่งเป็นกรรมการร่วม Grok 4.7 ก็ยังอยู่ในกลุ่มคะแนนสูงในระดับกลาง สูง และสูงสุด แต่ในระดับต่ำได้คะแนนน้อยกว่า Claude Fable 5.1 การปรับให้ใช้กรรมการชุดเดียวกันจึงอาจทำให้อันดับรวมที่เผยแพร่และผลบางรายการเปลี่ยนไป

การประเมินนี้ไม่ได้คำนวณค่าใช้จ่ายต่อโจทย์ VulcanBench ระบุว่าไม่มีข้อมูลราคาของ Grok 4.7 และการทดสอบทำผ่านการสมัครใช้ Cursor จึงไม่สามารถระบุต้นทุนแยกตามโจทย์ได้ คะแนนและเวลาที่ใช้จึงยังไม่เพียงพอสำหรับตัดสินว่าทีมพัฒนาจะลดค่าใช้จ่ายได้หรือไม่

xAI เปิดตัว Grok 4.7 เมื่อวันที่ 21 กันยายน โดยระบุว่าใช้โมเดลพื้นฐานขนาดใหญ่กว่า Grok 4.6 ราคาที่บริษัทแจ้งสำหรับ API อยู่ที่ 2 ดอลลาร์ (ประมาณ 2,686 วอน) ต่อโทเค็นขาเข้า 1 ล้านโทเค็น และ 6 ดอลลาร์ (ประมาณ 8,058 วอน) ต่อโทเค็นขาออก 1 ล้านโทเค็น ราคาเหล่านี้ไม่ได้หมายถึงค่าใช้จ่ายต่อโจทย์ในการประเมินของ VulcanBench

xAI ยังเปิดเผยผลการประเมินอื่น เช่น CursorBench 4.0 ในเอกสารเปิดตัว แต่ตัวชี้วัดและเงื่อนไขการทดสอบต่างกัน จึงนำมาเทียบตรงกับคะแนน Frontier v4 ได้ยาก รายงานก่อนหน้าของ TokenPost ที่ระบุว่า Grok 4.7 ทำคะแนนตามหลัง Claude ในเบนช์มาร์กอื่นก็ควรอ่านโดยแยกเงื่อนไขของแต่ละการประเมิน

ผลครั้งนี้แสดงให้เห็นว่า Grok 4.7 ทำคะแนนได้สูงในโจทย์เขียนโค้ดชุดหนึ่งภายใต้สภาพแวดล้อม Cursor การประเมินประสิทธิภาพและความคุ้มค่ากับงานพัฒนาจริงยังต้องเปรียบเทียบโดยใช้ประเภทโจทย์และสภาพแวดล้อมการทำงานที่ตรงกัน

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1