การเปิดตัว Strata และการปลดล็อกข้อจำกัดโมเดล MoE ขนาดใหญ่
นักพัฒนาซอฟต์แวร์ที่ใช้นาม Niko1221 ได้เปิดตัวโครงการโอเพนซอร์สใหม่ภายใต้ชื่อ 'Strata' บนสัญญาอนุญาตแบบ MIT (MIT License) ซึ่งเป็นเอนจินสำหรับการอนุมานผล (Inference Engine) ของโมเดลภาษาขนาดใหญ่ โดยได้รับการออกแบบมาโดยเฉพาะเพื่อรับมือกับโครงสร้างสถาปัตยกรรมแบบ Mixture-of-Experts (MoE) ขนาดมหึมาอย่าง Qwen3.8-Flash-Next ซึ่งมีขนาดพารามิเตอร์รวมสูงถึง 125 พันล้านพารามิเตอร์ (125B)
ในอดีต การประมวลผลโมเดลขนาด 125B ภายในโครงสร้างพื้นฐานของตนเองจำเป็นต้องใช้การ์ดประมวลผลระดับองค์กรหรือดาต้าเซ็นเตอร์ที่มีหน่วยความจำ VRAM ปริมาณมหาศาล เช่น Nvidia H100 หรือต้องรวมกลุ่มการ์ดกราฟิกระดับสูงหลายใบเข้าด้วยกัน แต่ Strata เข้ามาแก้ปัญหานี้ด้วยการเปิดโอกาสให้โมเดลดังกล่าวสามารถทำงานได้อย่างราบรื่นบนการ์ดจอสำหรับผู้บริโภคทั่วไป (Consumer GPUs) ที่มีหน่วยความจำ VRAM เพียง 12 GB ถึง 24 GB ควบคู่กับหน่วยความจำระบบ RAM แบบ DDR5
สถาปัตยกรรมการทำงาน: แคชผู้เชี่ยวชาญแบบไดนามิกและการสตรีมข้อมูลผ่านแรม
กลไกสำคัญที่ทำให้ Strata ทำงานได้อย่างมีประสิทธิภาพ คือการใช้ประโยชน์จากคุณสมบัติการกระตุ้นแบบเบาบาง (Sparse Activation) ของสถาปัตยกรรม Qwen MoE ซึ่งในการประมวลผลแต่ละโทเคน ตัวแบบจะเลือกใช้งานผู้เชี่ยวชาญเพียง 10 ส่วน จากจำนวนผู้เชี่ยวชาญทั้งหมด 24,576 ส่วนเท่านั้น แทนที่จะต้องโหลดน้ำหนักของพารามิเตอร์ทั้งหมดขึ้นมาคำนวณพร้อมกัน
Strata นำเสนอระบบ Dynamic Expert Caching ร่วมกับเทคนิคการสตรีมข้อมูลจากหน่วยความจำหลัก (CPU-RAM Streaming) โดยระบบจะทำการตรวจจับและส่งต่อเครือข่ายผู้เชี่ยวชาญ (Experts) ที่ถูกเรียกใช้งานบ่อยที่สุดให้คงค้างอยู่ใน VRAM ความเร็วสูงบนตัวการ์ดจอ (Hot-routing) ในขณะที่ค่าน้ำหนักหลักส่วนใหญ่ของโมเดลจะถูกจัดเก็บไว้ในหน่วยความจำ RAM ของเครื่องพีซีแบบ DDR5
นอกจากนี้ ตัวเอนจินยังได้รวบรวมเทคโนโลยีการจัดเก็บแคชของ Context แบบ INT8 KV Cache พร้อมสถาปัตยกรรมการสตรีมบริบท ทำให้สามารถรองรับ Prompt ความยาวขนาดมหึมาได้ตั้งแต่ 64K ไปจนถึง 262K โทเคน ซึ่งช่วยขยายขอบเขตการอ่านเอกสารขนาดยาวและการจัดการข้อมูลเชิงลึกในระบบได้อย่างมีเสถียรภาพ
ตัวเลขประสิทธิภาพที่วัดได้: จากการ์ดระดับกลางถึงเรือธง
ข้อมูลการทดสอบประสิทธิภาพที่ได้รับการยืนยันอย่างเป็นทางการในคลังโค้ดของ Strata ระบุว่า ระบบสามารถทำความเร็วในการอนุมานผลได้อย่างน่าประทับใจ ทั้งในระดับการ์ดจอสำหรับผู้เล่นเกมระดับกลางและการ์ดจอเวิร์กสเตชันระดับบน
บนระบบที่ใช้การ์ดจอ Nvidia GeForce RTX 5070 ที่มีหน่วยความจำ VRAM ขนาด 12 GB ร่วมกับแรมระบบ DDR5 ขนาด 64 GB นั้น การทดสอบด้วยการบีบอัดข้อมูลแบบควอนไทเซชันระดับ Q2_0 และ IQ3 สามารถสร้างข้อความคำตอบ (Generation Speed) ได้ที่ความเร็ว 62 ถึง 93 โทเคนต่อวินาที และสามารถประมวลผลข้อความเริ่มต้น (Prompt Processing หรือ Prefill) ได้เร็วกว่า 1,200 ถึง 2,100 โทเคนต่อวินาทีบนความยาวบริบทขนาด 32K โทเคน
ขณะเดียวกัน เมื่อนำไปทดสอบบนการ์ดจอเรือธงอย่าง Nvidia GeForce RTX 5090 ที่มี VRAM ขนาด 32 GB ความเร็วในการสร้างข้อความพุ่งสูงแตะ 100 ถึง 176 โทเคนต่อวินาที และมีอัตราการประมวลผล Prompt สูงถึง 5,200 โทเคนต่อวินาที โดยอาศัยเทคนิค Multi-token Prediction แบบ Speculative Drafting ซึ่งถือเป็นอัตราความเร็วที่สูงกว่าโซลูชันดั้งเดิมที่รันผ่านไลบรารีสแตนดาร์ดอย่างมีนัยสำคัญ
เสียงตอบรับและข้อกังขาจากกลุ่มนักพัฒนาในชุมชนเทคโนโลยี
การเปิดตัวของ Strata จุดกระแสความสนใจอย่างรวดเร็วในหมู่นักพัฒนาและผู้เชี่ยวชาญด้านฮาร์ดแวร์ โดยมีนักพัฒนาจำนวนหนึ่งนำโค้ดไปทดสอบซ้ำบนเครื่องที่มีสถาปัตยกรรมหลากหลาย เช่น ระบบที่ใช้การ์ดคู่ RTX 3090 และระบบ RTX 5080 พร้อมทั้งเริ่มมีการส่ง Pull Requests เพื่อปรับแต่งอัลกอริทึมการจัดการแคชให้มีประสิทธิภาพสูงขึ้น ซึ่งบางรายรายงานว่าสามารถเพิ่มความเร็วในการประมวลผลบนการดัดแปลงของตนเองได้สูงขึ้นอีก
อย่างไรก็ตาม ท่ามกลางความตื่นเต้นในเรื่องความเร็ว ตัวเอนจินยังคงเผชิญกับข้อกังขาด้านความถูกต้องและมาตรฐานทางวิศวกรรมจากนักวิจัยในชุมชน โดยมีการตั้งคำถามว่าเทคนิค Speculative Expert Caching อาจนำไปสู่ปัญหาการเบี่ยงเบนของผลลัพธ์ (Token Divergence) การตกหล่นของโทเคน หรือคุณภาพของรูปแบบคำตอบที่ด้อยลงเมื่อเทียบกับการประมวลผลแบบอ้างอิงมาตรฐาน เช่น llama.cpp หรือไม่ โดยเฉพาะในงานด้านการใช้เหตุผลเชิงตรรกะที่มิใช่งานเขียนโค้ด
นอกจากนี้ นักวิจัยยังชี้ให้เห็นว่า ผู้พัฒนาโครงการในขั้นต้นยังขาดการทดสอบอย่างเข้มงวดด้วยตัวชี้วัดทางสถิติ เช่น Kullback–Leibler Divergence (KLD) หรือการตรวจสอบ Logit เทียบกับโมเดลต้นแบบในการทดสอบมาตรฐาน (Standard Benchmark Suites) ซึ่งการตรวจสอบเบื้องต้นที่ทำเพียงแค่การทดสอบโค้ดจาวาสคริปต์หรือการสร้างโมเดล 3D แบบ One-shot นั้น ยังไม่เพียงพอที่จะยืนยันว่าโมเดลจะไม่เกิดอาการประสาทหลอน (Hallucination) หรือความแม่นยำถดถอยในสภาวะการใช้งานจริง
นัยสำคัญต่อภาคธุรกิจและองค์กรในประเทศไทย
สำหรับองค์กรธุรกิจ สถาบันการเงิน และหน่วยงานภาครัฐในประเทศไทย การเกิดขึ้นของเทคโนโลยีประเภท Strata นับเป็นสัญญาณสำคัญของการเปลี่ยนแปลงโครงสร้างต้นทุน AI แบบ On-Premise ในอดีต นโยบายการคุ้มครองข้อมูลส่วนบุคคล (PDPA) และข้อกำหนดด้านความลับทางธุรกิจทำให้หลายองค์กรไม่สามารถส่งข้อมูลผ่าน Public Cloud API ได้ แต่การซื้อเครื่องแม่ข่าย AI เฉพาะทางก็ต้องใช้เงินลงทุนเริ่มต้นหลักหลายล้านบาท
การที่ระบบสามารถดึงประสิทธิภาพของโมเดลระดับ 125B บนเครื่องเวิร์กสเตชันที่ใช้ฮาร์ดแวร์ระดับผู้บริโภคทั่วไป จะช่วยให้ธุรกิจขนาดกลางและย่อม (SMEs) ตลอดจนแผนกไอทีขององค์กรไทย สามารถสร้างเซิร์ฟเวอร์ประมวลผลภาษาธรรมชาติภายในองค์กรสำหรับการประมวลผลสัญญา คลังเอกสารภายใน และการวิเคราะห์โค้ดคอมพิวเตอร์ได้ด้วยงบประมาณฮาร์ดแวร์เพียงหลักแสนบาทต้นๆ
อย่างไรก็ดี ผู้นำฝ่ายเทคโนโลยีสารสนเทศ (CTO/CIO) ในไทยควรดำเนินกลยุทธ์แบบระมัดระวัง แม้ Strata จะเปิดให้ใช้งานฟรีแบบโอเพนซอร์ส องค์กรควรจำกัดการใช้งานให้อยู่ในสภาพแวดล้อมเพื่อการทดลอง (Staging/PoC) ก่อน และจำเป็นต้องสร้างไปป์ไลน์ตรวจสอบคุณภาพของคำตอบ (Output Drift Evaluation) เพื่อให้มั่นใจว่าความเร็วที่เพิ่มขึ้นจะไม่แลกมาด้วยความผิดพลาดของข้อมูลในภารกิจที่สำคัญต่อธุรกิจ
การรันโมเดลภาษาขนาดใหญ่ระดับ 125B ในเครื่องตนเองเคยจำเป็นต้องพึ่งพาฮาร์ดแวร์ระดับดาต้าเซ็นเตอร์ราคาหลักล้านบาท นวัตกรรมการจัดการแคชและการส่งผ่านข้อมูลระหว่างแรมและจีพียูของ Strata ช่วยทลายกำแพงต้นทุน เปิดทางให้องค์กรธุรกิจและนักพัฒนาในไทยสามารถปรับใช้โมเดล MoE อัจฉริยะสำหรับงานเฉพาะทางได้แบบออฟไลน์และปลอดภัย