การเปิดตัวและสถาปัตยกรรมระดับ 309B พารามิเตอร์
Xiaomi ได้เผยแพร่น้ำหนักโมเดลแบบเปิด (Open-weights checkpoint) สำหรับโมเดลปัญญาประดิษฐ์รุ่นล่าสุด MiMo-V2.6-Flash-RL ซึ่งพัฒนาขึ้นบนสถาปัตยกรรม Mixture-of-Experts (MoE) มีพารามิเตอร์รวมทั้งสิ้น 309 พันล้านพารามิเตอร์ (309B) แต่ได้รับการออกแบบให้เปิดใช้งานจริงเพียง 15 พันล้านพารามิเตอร์ (15B) ต่อหนึ่งโทเคน โครงสร้างโมเดลประกอบด้วย 48 เลเยอร์ แบ่งเป็น Dense Layer จำนวน 1 เลเยอร์ และ MoE Layer จำนวน 47 เลเยอร์ โดยมี Routed Experts รวม 256 ตัว และใช้ระบบคัดเลือกแบบ Top-8 Routing เพื่อรักษาความเร็วและความคุ้มค่าในการประมวลผล
จุดเด่นสำคัญของโมเดลรุ่นนี้คือการรองรับข้อมูลหลากหลายรูปแบบหรือ Omnimodal แบบเนทีฟ ทั้งข้อความ ภาพ วิดีโอ และเสียง โดยโมเดลติดตั้ง Vision Encoder ในตัวขนาด 681 ล้านพารามิเตอร์ (MiMo ViT) ควบคู่กับระบบประมวลผลเสียงที่ประกอบด้วย Audio Tokenizer ขนาด 308 ล้านพารามิเตอร์ และ Audio Patch Encoder ขนาด 127 ล้านพารามิเตอร์ นอกจากนี้ Xiaomi ยังได้ติดตั้งโมดูล DFlash Speculative Drafter แบบ 5 เลเยอร์ ซึ่งทำหน้าที่คาดเดาและสร้างโทเคนล่วงหน้าได้ถึง 7 โทเคนต่อรอบการประมวลผล (7 tokens per pass) ช่วยเร่งความเร็วในการอนุมานผลลัพธ์ได้อย่างชัดเจน
คอนเท็กซ์ 1 ล้านโทเคนและเทคนิค Joint Reinforcement Learning
MiMo-V2.6-Flash-RL มาพร้อมหน้าต่างบริบท (Context Window) ระดับเนทีฟที่ยาวถึง 1,048,576 โทเคน หรือประมาณ 1 ล้านโทเคน ทำให้สามารถรับข้อมูลเอกสาร วิดีโอขนาดยาว หรือบันทึกเสียงการประชุมทั้งระบบได้ในพรอมต์เดียว เพื่อให้การจัดเก็บและประมวลผลข้อมูลขนาดใหญ่นี้ทำได้จริง ตัวเช็กพอยต์จึงได้รับการจัดจำหน่ายในฟอร์แมต Microscaling FP4 (MXFP4) และทำงานผ่านการคำนวณแบบ FP8 Block-wise ซึ่งช่วยลดขนาดไฟล์ที่บันทึกลงดิสก์ให้อยู่ระหว่าง 173 ถึง 178 กิกะไบต์ (GB)
ในกระบวนการฝึกฝน Xiaomi ใช้วิธีการที่เรียกว่า Joint Reinforcement Learning หรือ Mixed RL ซึ่งเป็นการผสานการเรียนรู้ผ่าน fully asynchronous GRPO (Group Relative Policy Optimization) ร่วมกับ Groupwise Agentic Grading โดยรวมข้อมูลและเป้าหมายจากหลายสาขาวิชาชีพ ทั้งทักษะการเขียนโค้ด การวิเคราะห์ความปลอดภัยทางไซเบอร์ การใช้งานเครื่องมือของเอเจนต์ และการทำความเข้าใจภาพ เข้าสู่กระบวนการ RL Rollout เดียวกัน ส่งผลให้โมเดลมีพฤติกรรมการตัดสินใจและการใช้เหตุผลที่สอดประสานกันในทุกโดเมน
เสียงสะท้อนจากกลุ่มนักพัฒนาและการทดสอบฮาร์ดแวร์
หลังการเปิดตัว น้ำหนักโมเดลชุดนี้ได้รับความสนใจอย่างกว้างขวางจากกลุ่มนักพัฒนาและวิศวกรปัญญาประดิษฐ์ ผู้เชี่ยวชาญหลายรายแสดงความชื่นชมต่อการผสานโมดูลมัลติโมดอลแบบเนทีฟและแนวคิด Joint RL โดยระบุว่าโครงสร้างดังกล่าวช่วยให้การทำงานด้านการเขียนโปรแกรมและการใช้งานเอเจนต์มีความสามารถทัดเทียมกับโมเดลตระกูล Flash ชั้นนำอย่าง GLM-5.3-Flash และ DeepSeek-V4 Flash
อย่างไรก็ตาม ชุมชนผู้ปฏิบัติงานได้ตั้งข้อสังเกตและข้อจำกัดเกี่ยวกับความต้องการทรัพยากรฮาร์ดแวร์ แม้ว่าขนาดไฟล์ 178 GB ในฟอร์แมต MXFP4 จะช่วยประหยัดพื้นที่จัดเก็บลงมากเมื่อเทียบกับโมเดลขนาด 300B ทั่วไป แต่วิศวกรจำนวนมากพบว่าการรันบริบทเต็ม 1 ล้านโทเคนบนเครื่องเวิร์กสเตชันหรือระบบ GPU คู่ (Dual-GPU) นั้นสร้างภาระให้แก่หน่วยความจำ KV Cache อย่างรุนแรง ผู้ทดสอบหลายรายจึงต้องจำกัดบริบทใช้งานจริงไว้ที่ประมาณ 256,000 ถึง 300,000 โทเคน เพื่อหลีกเลี่ยงปัญหาหน่วยความจำไม่เพียงพอ (Out of Memory) ขณะที่บางกลุ่มกำลังศึกษาแนวทางการทำ Quantization เพิ่มเติมเพื่อให้สามารถใช้งานบนอุปกรณ์ที่มี RAM 128 GB ได้
นัยสำคัญและการปรับใช้สำหรับภาคธุรกิจในไทย
สำหรับองค์กรธุรกิจและกลุ่มสตาร์ตอัปในประเทศไทย การมาถึงของ MiMo-V2.6-Flash-RL มอบทางเลือกสำคัญในเชิงเศรษฐศาสตร์ของการนำ AI มาใช้งาน ในด้านบริการผ่านคลาวด์ แพลตฟอร์ม OpenRouter ได้เปิดให้บริการโมเดลนี้ในอัตราค่าบริการ $0.14 ต่อ 1 ล้านโทเคนอินพุต และ $0.28 ต่อ 1 ล้านโทเคนเอาต์พุต ซึ่งเป็นระดับราคาที่ต่ำมาก เหมาะสำหรับการประมวลผลบันทึกเสียงบริการลูกค้า (Call Center Analytics) หรือการวิเคราะห์สัญญาธุรกิจขนาดยาว
นอกจากนี้ การที่ Xiaomi ปล่อยน้ำหนักโมเดลแบบเปิด ยังช่วยให้ภาคธนาคาร ธุรกิจประกันภัย และหน่วยงานด้านสาธารณสุขในไทยที่มีข้อกำหนดเข้มงวดด้านการคุ้มครองข้อมูลส่วนบุคคล (PDPA) สามารถนำโมเดลไปติดตั้งภายในโครงสร้างพื้นฐานตนเอง (On-Premises หรือ Private Cloud) ได้โดยตรง องค์กรสามารถประมวลผลข้อมูลภาพจากกล้องวงจรปิด ไฟล์เสียงลูกค้า และข้อมูลตัวอักษรได้ในระบบเดียว ลดความเสี่ยงในการส่งข้อมูลรั่วไหลออกนอกประเทศ พร้อมทั้งช่วยควบคุมต้นทุนการอนุมานผลในระยะยาวได้อย่างมีประสิทธิภาพ
ความเคลื่อนไหวของ Xiaomi ครั้งนี้สะท้อนว่าโมเดลระดับแนวหน้าสามารถประมวลผลมัลติโมดอลแบบรอบด้าน (Omnimodal) ได้พร้อมกันในราคาประหยัด ด้วยเทคนิค Joint Reinforcement Learning และคอนเท็กซ์ขนาด 1 ล้านโทเคน ช่วยให้องค์กรธุรกิจในไทยเข้าถึงระบบอัตโนมัติที่ซับซ้อนได้โดยไม่ต้องพึ่งพาคลาวด์แบบปิดราคาแพง