Alibaba เปิดตัว Qwen-Image-2.1 โมเดลโอเพนซอร์สขนาด 7B ที่รวมการสร้างและแก้ไขภาพไว้ในระบบเดียว พร้อมรองรับการสร้างภาพโปร่งใสและการผสานภาพอ้างอิงได้สูงสุด 10 ภาพ
บล็อกทางการของ Qwen ระบุว่า Qwen-Image-2.1 รวมความสามารถแปลงข้อความเป็นภาพและแก้ไขภาพเดิมไว้ในโมเดลเดียว
ผู้ใช้สามารถป้อนภาพอ้างอิงหลายภาพเพื่อสร้างภาพแบบผสานหลายแหล่งได้ นอกจากนี้ยังรองรับการเลือกพื้นที่เฉพาะของภาพด้วยการวาดวงกลมหรือระบายด้วยแปรงเพื่อแก้ไขบางส่วน
การสร้างและแก้ไขภาพโปร่งใสถูกรวมเป็นฟังก์ชันพื้นฐานด้วย จุดเด่นคือผู้ใช้ไม่จำเป็นต้องแยกเครื่องมือสำหรับการสร้างภาพและการแก้ไขภาพ แต่สามารถดำเนินการผ่านโมเดลเดียวได้
Qwen ระบุว่าได้ปรับปรุงความสามารถในการรักษารูปลักษณ์เดิมของบุคคลและสินค้าเมื่อนำไปผสานกับภาพอ้างอิงหลายภาพ พร้อมอธิบายว่าคุณภาพการจัดวางตัวอักษรในภาพได้รับการพัฒนาแล้ว อย่างไรก็ตาม ยังไม่มีการเปิดเผยตัวเลขจากเกณฑ์มาตรฐานหรือคู่เปรียบเทียบแต่อย่างใด
ก่อนหน้านี้ Qwen เคยระบุในบทความแนะนำ Qwen-Image ว่าการแสดงตัวอักษรในภาพและความสามารถด้านการแก้ไขเป็นคุณสมบัติสำคัญ โดยโมเดลเดิมมีขนาด 20B ขณะที่โมเดลใหม่ปรับขนาดในส่วนการสร้างภาพให้เหลือ 7B
คุณภาพการใช้งานจริงและภาระด้านการประมวลผลของ Qwen-Image-2.1 ยังต้องติดตามเพิ่มเติมจากสภาพแวดล้อมการใช้งานเวอร์ชันสาธารณะและการประเมินในระยะต่อไป
ความคิดเห็น 0