โมเดล V4.1 Flash ของดีปซีก(DeepSeek) ทำคะแนนได้ 81.2 คะแนนในการประเมินความสามารถด้านออกแบบเว็บไซต์ ต่างจาก GPT-6 Astra ของโอเพนเอไอ(OpenAI) เพียง 1.5 คะแนน ขณะที่ต้นทุนเฉลี่ยต่อการออกแบบหนึ่งชิ้นของ V4.1 Flash อยู่ที่ 0.023 ดอลลาร์ (ประมาณ 31 วอน) ต่ำกว่า Astra ราว 70 เท่า
เวทีประเมิน OpenDesign Arena ได้ทดสอบโมเดลปัญญาประดิษฐ์ทั้งหมด 13 ตัว โดยพิจารณาความสามารถในการสร้างเว็บแอปพลิเคชัน แดชบอร์ด หน้าจอมือถือ และแลนดิ้งเพจ ผลปรากฏว่า GPT-6 Astra ได้อันดับ 1 ด้วยคะแนน 82.7 ส่วน V4.1 Flash ของดีปซีกอยู่ในอันดับ 2
ส่วนต่างต้นทุนของสองโมเดลอยู่ที่ 1.61 ดอลลาร์ (ประมาณ 2,165 วอน) เทียบกับ 0.023 ดอลลาร์ (ประมาณ 31 วอน) ขณะที่ Claude Fable 5.1 ของแอนโทรปิก(Anthropic) ทำคะแนนได้ 80.3 คะแนน แต่มีต้นทุนต่องานสูงถึง 3.66 ดอลลาร์ (ประมาณ 4,923 วอน)
ด้านเวลาในการประมวลผล V4.1 Flash ก็ใช้เวลาสั้นกว่าเช่นกัน โดยใช้เวลาเฉลี่ยต่องาน 5.3 นาที น้อยกว่า Astra ที่ใช้ 11.1 นาที อยู่ 5.8 นาที ส่วน Claude Fable 5.1 ใช้เวลาถึง 12.8 นาที
V4.1 Flash เปิดตัวอย่างเป็นทางการเมื่อวันที่ 10 กันยายนที่ผ่านมา ก่อนหน้านี้ดีปซีกเคยระบุว่า V4.1 Flash มีกำหนดเปิดตัวช่วงวันที่ 10 กันยายน
V4.1 Flash เป็นโมเดลแบบผสมผู้เชี่ยวชาญ (Mixture of Experts) ที่มีพารามิเตอร์รวมทั้งสิ้น 5.52 แสนล้านตัว แต่เปิดใช้งานจริงเพียงราว 8 พันล้านตัวสำหรับการประมวลผลอินพุต และราว 1.6 หมื่นล้านตัวสำหรับการสร้างเอาต์พุต
โมเดลแบบผสมผู้เชี่ยวชาญจะไม่เปิดใช้งานพารามิเตอร์ทั้งหมดในทุกครั้ง แต่จะเปิดใช้เฉพาะส่วนที่จำเป็นต่องานนั้น ๆ ดีปซีกอธิบายโครงสร้างนี้ว่าเป็น “สถาปัตยกรรมแบบไม่สมมาตร” และระบุว่าการประมวลผลเฉพาะส่วนที่จำเป็นช่วยลดทั้งต้นทุนและเวลาในการทำงาน
สัดส่วนผลงานที่สามารถนำไปใช้ได้ทันทีโดยไม่ต้องแก้ไขในเวที OpenDesign Arena สูงที่สุดคือ Astra ที่ 60% ตามด้วย V4.1 Flash ที่ 57.7% และ Claude Fable 5.1 ที่ 56.7%
กล่าวคือ V4.1 Flash มีความได้เปรียบด้านต้นทุนและเวลาทำงาน แต่กลับตามหลัง Astra อยู่ 2.3 จุดเปอร์เซ็นต์ในด้านความพร้อมใช้งานทันทีของผลงาน สะท้อนว่าประสิทธิภาพและประสิทธิผลไม่ได้อยู่ในอันดับเดียวกันทุกตัวชี้วัด
การประเมินครั้งนี้จำกัดอยู่เฉพาะงานออกแบบเว็บไซต์ ครอบคลุมเว็บแอปพลิเคชัน แดชบอร์ด หน้าจอมือถือ และแลนดิ้งเพจเท่านั้น จึงยังไม่อาจสรุปได้ว่าโมเดลเหล่านี้จะให้ผลลัพธ์ในระดับเดียวกันกับงานด้านอื่น เช่น การเขียนโค้ด การให้เหตุผลเชิงตรรกะ หรือการวิจัยทางวิทยาศาสตร์
ความได้เปรียบด้านต้นทุนของ V4.1 Flash มาจากโครงสร้างที่ลดปริมาณการประมวลผลที่จำเป็นสำหรับการอนุมานจริง ขณะยังคงรักษาความสามารถด้านความรู้โดยรวมของโมเดลขนาดใหญ่เอาไว้ อย่างไรก็ตาม ต้นทุนและความเร็วในการให้บริการจริงอาจแตกต่างกันไปตามความยาวของอินพุต รูปแบบการเรียกใช้งาน และเงื่อนไขของเซิร์ฟเวอร์
TokenPost เคยรายงานก่อนหน้านี้ว่าการทดสอบภายในพบว่า V4.1 Flash มีความเร็วในการสร้างเอาต์พุตอยู่ที่ 420 โทเคนต่อวินาที แต่ในครั้งนั้นก็มีการระบุว่าเงื่อนไขและกลุ่มเปรียบเทียบไม่ได้เหมือนกันทั้งหมด การเปรียบเทียบโดยตรงจึงยังมีข้อจำกัด
เมื่อการใช้งานโมเดลต้นทุนต่ำแพร่หลายมากขึ้น ต้นทุนต่องานและระยะเวลาในการประมวลผลอาจกลายเป็นเกณฑ์สำคัญในการเลือกใช้โมเดล ขณะที่ความจำเป็นในการแก้ไขผลงาน ความแม่นยำเฉพาะงาน และความเสถียรของบริการยังต้องได้รับการตรวจสอบแยกต่างหาก
ดีปซีกกล่าวในช่วงเปิดตัว V4.1 Flash ว่า “ด้วยสถาปัตยกรรมที่มีประสิทธิภาพมากขึ้น เราสามารถให้บริการผู้ใช้จำนวนมากขึ้นด้วยต้นทุนที่ต่ำลง” พร้อมระบุว่า “กำลังส่งต่อต้นทุนที่ประหยัดได้คืนให้กับผู้ใช้งาน”
ผลการประเมินครั้งนี้สะท้อนว่า V4.1 Flash สามารถทำคะแนนใกล้เคียงกับ Astra ในด้านการออกแบบเว็บไซต์ พร้อมกับรักษาต้นทุนที่ต่ำกว่าอย่างชัดเจน
ความคิดเห็น 0