สถาปัตยกรรม Single-Stream DiT และการผสานตัวเข้ารหัส Qwen3-VL

เมื่อวันที่ 20 กันยายน 2026 ทีมวิจัยของ Alibaba ได้เปิดตัว Qwen-Image-2.1 โมเดลสร้างสรรค์และแก้ไขรูปภาพที่พัฒนาขึ้นบนสถาปัตยกรรม Diffusion Transformer (DiT) แบบ Single-Stream ขนาด 32 เลเยอร์ พร้อมพารามิเตอร์การสร้างภาพ 7 พันล้านพารามิเตอร์ (7B) โดยเชื่อมต่อเข้ากับโมเดลตัวเข้ารหัสข้อความ Qwen3-VL ขนาด 8 พันล้านพารามิเตอร์ (8B) โครงสร้างใหม่นี้ได้รับการออกแบบมาเพื่อรวมเวิร์กโฟลว์การสร้างภาพจากข้อความ (Text-to-Image) และการตัดต่อภาพต้นฉบับ (Image-to-Image) เข้าไว้ในโมเดลเดี่ยวอย่างเป็นหนึ่งเดียว

ในแง่ของกลไกภายใน สถาปัตยกรรมนี้ใช้ระบบ Mixed-Granularity Attention ซึ่งผสานการ Masking ตามลำดับสาเหตุระดับโทเคน (Token-level causal masking) สำหรับประมวลผลข้อความ และการ Masking เชิงบล็อกระดับชิ้นส่วน (Chunk-level masking) สำหรับการสังเคราะห์ภาพ นอกจากนี้ยังนำระบบ Prefix KV Cache Reuse มาใช้เพื่อเพิ่มประสิทธิภาพการประมวลผล ทำให้โมเดลสามารถดึงข้อมูลบริบทของชุดข้อความเดิมซ้ำได้โดยไม่ต้องคำนวณใหม่ทุกขั้นตอนการดีนอยส์ (Denoising steps)

ความละเอียด 2K โดยกำเนิดและระบบเลเยอร์โปร่งใส RGBA VAE

จุดเด่นเชิงวิศวกรรมที่สำคัญของ Qwen-Image-2.1 คือความสามารถในการสังเคราะห์ภาพความละเอียดระดับ 2K แท้ (2048×2048 พิกเซล) ภายใน 40 สเต็ป โดยไม่ต้องพึ่งพาโมเดลอัปสเกลรอง (Secondary upscaler) ซึ่งช่วยรักษาความคมชัดและลดความคลาดเคลื่อนของรายละเอียดพื้นผิวได้อย่างสม่ำเสมอ

ยิ่งไปกว่านั้น โมเดลได้รวมโมดูล Variational Autoencoder (VAE) ชนิด RGBA ขนาด 64 แชนเนล ซึ่งทำให้สามารถเรนเดอร์พื้นหลังแบบโปร่งใส (Alpha channel) ได้ตั้งแต่กระบวนการสร้างครั้งแรก โดยไม่ต้องใช้ซอฟต์แวร์ตัดต่อไดคัทเพิ่มเติม ระบบนี้ยังรองรับการระบุเงื่อนไขด้วยภาพอ้างอิงพร้อมกันสูงสุดถึง 10 ภาพ (Conditioning images) ทำให้รองรับงานผสมองค์ประกอบที่ซับซ้อน เช่น การลองเสื้อผ้าเสมือนจริง (Virtual try-on) การจัดฉากที่มีบุคคลหลายคน หรือการจำลองเฟอร์นิเจอร์ตกแต่งห้อง

สำหรับการแก้ไขเฉพาะจุด (Local image editing) โมเดลสามารถตีความคำสั่งของผู้ใช้ผ่านการวาดสัญลักษณ์บนภาพ เช่น กรอบ Bounding Box, วงกลมระบุสี, หรือหน้ากากบรัช (Brush masks) เพื่อเปลี่ยนรายละเอียดวัตถุโดยไม่กระทบต่อฉากหลังส่วนอื่น

ผลการประเมินและการตอบรับจากชุมชนนักพัฒนา

ในแง่ของผลการทดสอบ Alibaba ได้เผยแพร่ข้อมูลระบุว่าโมเดลมีคะแนนเหนือกว่าโมเดลแบบปิดส่วนใหญ่บนชุดทดสอบ Qwen-Image-Bench อย่างไรก็ดี ตัวเลขประสิทธิภาพดังกล่าวเป็นการประเมินภายในของบริษัทเอง และยังคงต้องรอการยืนยันจากลีดเดอร์บอร์ดสาธารณะและบุคคลภายนอกเพื่อพิสูจน์ความแม่นยำในระยะยาว

ในกลุ่มนักพัฒนาและวิศวกรซอฟต์แวร์ การตอบรับช่วงแรกเป็นไปอย่างคึกคัก โดยเฉพาะความสามารถในการรันโมเดลบนการ์ดจอระดับผู้บริโภคที่มีหน่วยความจำ VRAM 24GB เช่น การ์ดจอระดับ RTX 3090 ซึ่งเปิดโอกาสให้นักพัฒนาอิสระนำไปทดลองใช้งานได้สะดวก ตัวอย่างการใช้งานที่ได้รับความสนใจสูงคือการแก้ไขหลายองค์ประกอบพร้อมกัน เช่น การเปลี่ยนสีผมและเสื้อผ้าผ่านการวงไฮไลต์สี ซึ่งให้ผลลัพธ์ที่แม่นยำโดยไม่ต้องตั้งค่าเวิร์กโฟลว์ซับซ้อน

อย่างไรก็ตาม ชุมชนนักพัฒนาแสดงความกังวลต่อข้อกำหนดสิทธิ์การใช้งาน เนื่องจากโมเดลไม่ได้เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 เหมือนในบางรุ่นก่อนหน้า แต่ปล่อยออกมาภายใต้ข้อตกลง Qwen Research License Agreement ซึ่งจำกัดการใช้งานสำหรับการวิจัยเท่านั้น และต้องขออนุญาตเป็นรายกรณีหากต้องการนำไปใช้เชิงพาณิชย์

นัยสำคัญต่อภาคธุรกิจและการประยุกต์ใช้งานในไทย

สำหรับตลาดองค์กรและธุรกิจดิจิทัลในประเทศไทย ความก้าวหน้าของ Qwen-Image-2.1 มีประโยชน์โดยตรงต่ออุตสาหกรรมอีคอมเมิร์ซ (E-commerce) ดิจิทัลเอเจนซี และผู้ผลิตคอนเทนต์ด้านการตลาด ความสามารถในการสร้างภาพ RGBA ที่มีเลเยอร์โปร่งใสตั้งแต่ต้นช่วยตัดขั้นตอนการตัดขอบวัตถุ (Clipping path) และช่วยให้กระบวนการวางภาพสินค้าลงบนเทมเพลตโปรโมชันทำได้โดยอัตโนมัติ

นอกจากนี้ ความสามารถในการรับภาพอ้างอิงสูงสุด 10 ภาพยังสอดคล้องกับความต้องการของธุรกิจค้าปลีกแฟชั่นและของแต่งบ้านในไทย ที่ต้องการแสดงภาพตัวอย่างสินค้าแบบเสมือนจริงให้ลูกค้าเห็นในบริบทจริง อย่างไรก็ดี ฝ่ายกฎหมายและทีมไอทีขององค์กรจำเป็นต้องตระหนักถึงเงื่อนไขสิทธิ์การใช้งาน เนื่องจากน้ำหนักโมเดลบน Hugging Face มีไว้สำหรับการวิจัยเท่านั้น หากธุรกิจในไทยต้องการนำโมเดลไปผสานเข้ากับระบบหน้าร้านเพื่อสร้างรายได้ จะต้องติดต่อขอใบอนุญาตเชิงพาณิชย์จาก Alibaba อย่างเป็นทางการ

ทำไมเรื่องนี้สำคัญ

Qwen-Image-2.1 ช่วยแก้ปัญหาคอขวดที่พบบ่อยในการสร้างภาพด้วย AI โดยสร้างภาพโปร่งใสแบบแยกเลเยอร์ (RGBA) และความละเอียด 2K ได้ในขั้นตอนเดียว ช่วยลดต้นทุนเวิร์กโฟลว์ตัดต่อภาพสินค้าและงานโฆษณาในไทย แม้ยังต้องระวังข้อจำกัดของสัญญาอนุญาตแบบไม่ใช่เพื่อการค้า

ข้อมูลอ้างอิงหลัก