Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

ชนะ 17 จาก 28 การเทียบ Claude Code ครองมวยรวด 7-0 ในหมวดโค้ด

ในผลทดสอบมาตรฐาน AI coding agent ที่ Tencent เผยแพร่ Claude Code ของ Anthropic เอาชนะ CodeBuddy Code ได้ 17 จาก 28 การเปรียบเทียบในโมเดลเดียวกัน โดยในหมวดโค้ด โมเดลทั้ง 7 ตัวที่ถูกประเมินทำคะแนนได้สูงขึ้นทุกตัวเมื่อรันผ่าน Claude Code

Tencent YouTu Lab ร่วมกับ Keen Security Lab, Xuanwu Lab และทีม WorkBuddy เปิดตัว WorkBuddy Bench ชุดทดสอบที่ประกอบด้วยโจทย์ 260 ข้อซึ่งออกแบบย้อนกลับจากงานจริง โดยแบ่งเป็นโค้ด 80 ข้อ เว็บ 70 ข้อ งานออฟฟิศ 50 ข้อ และความปลอดภัย 60 ข้อ ทีมวิจัยนำโมเดลทั้ง 7 ตัวไปรันบนสองกรอบการทำงาน (harness) คือ CodeBuddy และ Claude Code เพื่อเปรียบเทียบประสิทธิภาพ

harness คือชั้นการทำงานของเอเจนต์ที่อยู่นอกตัวโมเดล ทำหน้าที่จัดการบริบท เรียกใช้เครื่องมือ และดำเนินการตามงาน ผลการประเมินครั้งนี้พบว่า แม้โมเดลพื้นฐานจะเหมือนกัน แต่ผลลัพธ์กลับแตกต่างกันไปตาม harness ที่ใช้ โดยในหมวดเว็บและงานออฟฟิศ CodeBuddy นำอยู่ที่ 4 ต่อ 3 ในแต่ละหมวด ขณะที่หมวดความปลอดภัย Claude Code เป็นฝ่ายนำด้วยคะแนน 4 ต่อ 3

คะแนนรายละเอียดก็แสดงความแตกต่างเช่นกัน คะแนนเว็บของ GLM-5.2 บนสอง harness อยู่ที่ 67.43 และ 60.71 ตามลำดับ ส่วนคะแนนความปลอดภัยของ GPT-5.5 อยู่ที่ 77.91 และ 64.39 บอร์ดจัดอันดับนี้อ้างอิงเวอร์ชัน CodeBuddy 2.109.3 และ Claude Code 2.1.187 เป็นมาตรฐาน โดยแต่ละคะแนนคำนวณจากค่าเฉลี่ยของการรัน 3 ครั้งในโหมด think

ผลลัพธ์ครั้งนี้สะท้อนว่า การประเมินเครื่องมือ AI coding ต้องพิจารณาทั้งโมเดลพื้นฐานและโครงสร้างการทำงานรวมถึงวิธีควบคุมเครื่องมือไปพร้อมกัน อย่างกรณีที่ Claude Code ขยายตัวเชื่อมต่อ (connector) ที่ตั้งค่าไว้บนเว็บไปสู่เทอร์มินัลและ API โครงสร้างที่เชื่อมโยงเครื่องมือทำงานจริง สิทธิ์การเข้าถึง และสภาพแวดล้อมการทำงานเข้าด้วยกัน สามารถกำหนดทั้งประสิทธิภาพและขอบเขตการใช้งานได้

อย่างไรก็ตาม โจทย์ประเมินมีเพียง 50-80 ข้อต่อหมวด และ harness ที่นำมาเปรียบเทียบก็จำกัดอยู่แค่สองแบบ BlockBeats รายงานว่า ผู้ใช้บางส่วนในคอมมูนิตี้แสดงความเห็นว่าอันดับอาจเปลี่ยนแปลงได้หากเพิ่มโจทย์ที่ยากขึ้น พร้อมทั้งมีข้อสังเกตว่า Codex ไม่ได้ถูกนำมารวมอยู่ในการเปรียบเทียบครั้งนี้

WorkBuddy Bench เปิดให้เข้าถึงผ่านที่เก็บข้อมูลสาธารณะและชุดข้อมูลบน Hugging Face โดยชุดข้อมูลประกอบด้วยคำสั่งของแต่ละโจทย์ สภาพแวดล้อมการทำงาน และการตั้งค่าการทดสอบ Tencent ระบุว่านี่เป็นบอร์ดจัดอันดับเวอร์ชันพรีวิวเพื่อการวิจัย และมีแผนอัปเดตตามการเปลี่ยนแปลงของโมเดลและ harness ต่อไป

แหล่งตรวจสอบ: WorkBuddy Bench ของ Tencent, บอร์ดจัดอันดับ WorkBuddy Bench, ชุดข้อมูลบน Hugging Face

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1