Back to top
  • 공유 แชร์
  • 인쇄 พิมพ์
  • 글자크기 ขนาดตัวอักษร
ลิงก์ถูกคัดลอกแล้ว

Gemini 4 Argon ติดอันดับ 8 จาก 224 โมเดลในการประเมินภายนอก

หน้าจอแล็ปท็อปที่เปิดโปรแกรมแก้ไขโค้ด / TokenPost.ai

Gemini 4 Argon ของ Google ติดอันดับ 8 จาก 224 โมเดลในการประเมินภายนอก โดย Google ยังเปิดเผยคะแนนจากการทดสอบภายในและกรณีปรับแต่งการใช้หน่วยความจำในศูนย์ข้อมูล แต่ประสิทธิภาพในการทำงานจริงขององค์กรภายนอกยังผ่านการตรวจสอบอย่างจำกัด

Google เปิดตัว Gemini 4 Argon เมื่อวันที่ 30 กันยายน คอเรย์ คาวุกชูโอกลู (Koray Kavukcuoglu) รองประธานอาวุโสของ Google DeepMind และหัวหน้าสถาปนิกด้าน AI ของ Google อธิบายในประกาศอย่างเป็นทางการว่า โมเดลนี้ออกแบบมาเพื่อจัดการงานซับซ้อนที่ต้องทำต่อเนื่องเป็นเวลานาน Google ระบุว่าสามารถนำไปใช้กับการพัฒนาซอฟต์แวร์ งานด้านกฎหมายและการเงิน รวมถึงความมั่นคงปลอดภัยไซเบอร์

ในช่วงแรก Google จะเปิดให้ผู้เชี่ยวชาญด้านความมั่นคงปลอดภัยไซเบอร์ที่ได้รับความไว้วางใจและเข้าร่วมโครงการ Fairwind ใช้งาน จากนั้นมีแผนขยายไปยังลูกค้า API แบบชำระเงินและผู้สมัครสมาชิก Google AI Ultra แต่ยังไม่ได้ประกาศวันเปิดให้ใช้งานทั่วไป ก่อนหน้านี้ OpenAI และ Anthropic ก็เคยจำกัดการเข้าถึงโมเดล AI ประสิทธิภาพสูงเช่นกัน

Google ระบุว่า Gemini 4 Argon ทำคะแนนได้ 77.9% ใน DeepSWE v1.1 ซึ่งประเมินโจทย์วิศวกรรมซอฟต์แวร์ระยะยาว และ 51.3% ใน AutomationBench ซึ่งประเมินการทำงานอัตโนมัติ ตัวเลขทั้งสองเป็นผลการทดสอบภายในที่ Google เปิดเผย

Artificial Analysis ซึ่งเป็นองค์กรประเมินภายนอก ให้คะแนน Gemini 4 Argon ที่ตั้งค่าการใช้เหตุผลระดับสูงไว้ 53 คะแนน โมเดลนี้อยู่อันดับ 8 ในดัชนี Intelligence Index ขององค์กรดังกล่าวจากทั้งหมด 224 โมเดล โดยดัชนีรวมผลการประเมิน 10 ด้าน เช่น งานที่ใช้ความรู้ การทำงานอัตโนมัติ การเขียนโค้ด และการใช้เหตุผล

โจทย์และเกณฑ์ให้คะแนนแตกต่างกันไปในแต่ละการประเมิน จึงยากที่จะใช้เพียงอันดับรวมตัดสินว่าโมเดลทำงานจริงได้ดีกว่าในทุกด้าน ผลทดสอบของ Google เองกับผลจากองค์กรภายนอกก็มีวิธีและขอบเขตการวัดต่างกัน จึงควรพิจารณาแยกจากกัน

Google ยกตัวอย่างการใช้งานภายในด้วยการปรับแต่งหน่วยความจำของศูนย์ข้อมูล บริษัทระบุว่าเอเจนต์ของโมเดลค้นพบและนำวิธีปรับแต่งที่ช่วยเพิ่มหน่วยความจำได้มากกว่า 300 TiB ไปใช้ ส่วนการประหยัดเพิ่มเติมประเมินไว้ที่ 500 TiB ถึง 1 PiB ตัวเลขดังกล่าวเป็นผลการดำเนินงานภายในและค่าประมาณที่ Google เปิดเผย

Bloomberg รายงานโดยอ้างแหล่งข่าวนิรนามว่า พนักงาน Google บางส่วนประเมินประสิทธิภาพการเขียนโค้ดจากการใช้งานจริงไว้ต่ำกว่าผลเบนช์มาร์ก รายงานนี้สะท้อนการประเมินของพนักงานภายใน และแตกต่างจากผลการทดสอบซ้ำโดยอิสระที่เปิดเผยต่อสาธารณะ

Google มีแผนขยายผู้ใช้งาน Gemini 4 Argon เป็นลำดับ จากผู้เชี่ยวชาญด้านความมั่นคงปลอดภัยไซเบอร์ไปยังลูกค้า API แบบชำระเงินและผู้สมัครสมาชิก Google AI Ultra ขณะที่บริษัทยังไม่ได้ประกาศกำหนดการเปิดให้ใช้งานทั่วไป

<ลิขสิทธิ์ ⓒ TokenPost ห้ามเผยแพร่หรือแจกจ่ายซ้ำโดยไม่ได้รับอนุญาต>

บทความที่มีคนดูมากที่สุด

บทความที่เกี่ยวข้อง

ความคิดเห็น 0

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม

0/1000

ข้อแนะนำสำหรับความคิดเห็น

ขอบคุณสำหรับบทความดี ๆ ต้องการบทความติดตามเพิ่มเติม เป็นการวิเคราะห์ที่ยอดเยี่ยม
1