การเปิดตัว OpenTPU: สถาปัตยกรรมชิปที่สร้างและปรับปรุงโดย AI Agent
FeSens ได้ประกาศเปิดตัวโครงการโอเพนซอร์ส 'OpenTPU' สู่สาธารณะภายใต้สัญญาอนุญาตแบบ Apache 2.0 ซึ่งเป็นโครงการพัฒนาตัวเร่งการประมวลผลฮาร์ดแวร์สำหรับโมเดลภาษาขนาดใหญ่ (LLMs) ที่มีความพิเศษตรงที่สถาปัตยกรรมหลักถูกสังเคราะห์และปรับแต่งอย่างละเอียดผ่านกระบวนการทำงานของ AI agent โดยอาศัยรากฐานการทดลองจากกรอบการทำงาน auto-arch-tournament
โครงการนี้เป็นการทดสอบสมมติฐานสำคัญสองประการในวงการวิทยาการคอมพิวเตอร์ ได้แก่ ศักยภาพของโมเดลปัญญาประดิษฐ์ในการออกแบบวงจรฮาร์ดแวร์เชิงตรรกะว่าสามารถไปได้ไกลเพียงใด และ AI agent จะสามารถสร้างชิปประมวลผลขึ้นมาเพื่อทำหน้าที่รันกระบวนการอนุมาน (Inference) ให้กับตัวมันเองได้สำเร็จหรือไม่ ซึ่งการเปิดตัวสู่สาธารณะครั้งนี้ยืนยันว่ากระบวนการดังกล่าวสามารถสร้างผลลัพธ์ฮาร์ดแวร์ที่ใช้งานได้จริงบนบอร์ดทดสอบ
เจาะลึกโครงสร้างระบบ: ซอฟต์แวร์สแต็กและผลการทดสอบบน Kintex-7 FPGA
OpenTPU ถูกเผยแพร่ในรูปแบบโมโนรีโป (Monorepo) ที่มีองค์ประกอบทางวิศวกรรมครบถ้วนสมบูรณ์ ตั้งแต่วงจรตรรกะระดับ SystemVerilog RTL, ชุดคำสั่งฮาร์ดแวร์เฉพาะ (Custom ISA), ซอฟต์แวร์จำลองการทำงานที่จำลองระดับรอบสัญญาณนาฬิกาและระดับบิตอย่างแม่นยำ (Cycle- and Bit-Accurate Simulator) พัฒนาด้วยภาษา Python, คอมไพเลอร์ภาษาเคอร์เนล ไปจนถึงไดรเวอร์สำหรับระบบโฮสต์อย่าง otpu-chat และ otpu-smi ตลอดจนระบบวิเคราะห์ประสิทธิภาพการประมวลผลที่มีชื่อว่า Lens
ในแง่ของการนำไปติดตั้งใช้งานจริง สถาปัตยกรรมนี้ได้รับการตรวจสอบความถูกต้องทางกายภาพบนการ์ดอินเทอร์เฟซ PCIe รุ่น Inspur YPCB-00338 ซึ่งใช้ชิป Xilinx Kintex-7 (xc7k480t) FPGA พร้อมหน่วยความจำ DDR3 แบบ Dual-Channel ที่ความถี่สัญญาณนาฬิกา 120 MHz โดยผลการทดสอบพบว่าการถอดรหัสโทเค็นบนฮาร์ดแวร์ตรงกับเอาต์พุตของการจำลองในระดับบิต (Bit-Exact) อย่างสมบูรณ์
ประสิทธิภาพในการรันโมเดลจริงระบุว่า สถาปัตยกรรมสามารถประมวลผลโมเดล LFM2.5-230M แบบ 8-bit quantization (int8) ได้ที่ความเร็วเฉลี่ยประมาณ 55.7 โทเค็นต่อวินาที และสามารถรันโมเดล Qwen3.5-0.8B ได้ที่อัตราความเร็วระหว่าง 14 ถึง 24.6 โทเค็นต่อวินาที พร้อมทั้งสามารถดึงประสิทธิภาพแบนด์วิดท์ของหน่วยความจำ DRAM ในทางทฤษฎีมาใช้งานได้สูงถึงประมาณ 70%
เสียงสะท้อนจากกลุ่มนักพัฒนา: บทเรียนเชิงวิศวกรรมและการถกเถียงเรื่อง ASIC
การเปิดซอร์สโค้ดของ OpenTPU ได้รับความสนใจอย่างกว้างขวางในหมู่วิศวกรระบบและนักพัฒนาฮาร์ดแวร์ โดยผู้ปฏิบัติงานส่วนใหญ่มองว่าโครงการนี้เป็นก้าวสำคัญเชิงการศึกษาและเป็นกรณีศึกษาที่พิสูจน์ให้เห็นอย่างชัดเจนว่า เวิร์กโฟลว์ของ AI agent ในปัจจุบันมีความสามารถเพียงพอที่จะสังเคราะห์ไฟล์ RTL รวมถึงพัฒนาทูลเชน (Toolchain) คู่ขนานกันได้อย่างมีระเบียบและปราศจากข้อผิดพลาดร้ายแรง
อย่างไรก็ตาม ในวงการยังเกิดการถกเถียงเชิงเทคนิคเกี่ยวกับแนวคิดการพัฒนาฮาร์ดแวร์แบบ Recursive Self-Improvement (RSI) และประเด็นที่ว่าเหตุใดห้องปฏิบัติการระดับแนวหน้าจึงไม่ใช้วิธีการฝังน้ำหนักโมเดล (Weights) ลงในวงจร ASIC แบบเฉพาะเจาะจงไปเลย ซึ่งวิศวกรผู้เชี่ยวชาญชี้แจงว่า ความยืดหยุ่นในการอัปเดตโมเดล ต้นทุนการผลิตชิป (Tape-out) ที่สูงลิ่ว และข้อจำกัดทางกายภาพของการนำส่งข้อมูลลงสู่ซิลิคอน ยังคงเป็นอุปสรรคสำคัญที่ทำให้ชิปแบบปรับแต่งได้ (Reconfigurable) อย่าง FPGA มีความสมเหตุสมผลมากกว่าในขั้นตอนนี้
ข้อจำกัดและการประเมินความพร้อมในระดับอุตสาหกรรม
แม้ว่า OpenTPU จะแสดงให้เห็นถึงความสำเร็จของการออกแบบวงจรด้วย AI แต่ข้อจำกัดเชิงโครงสร้างยังคงมีอยู่ชัดเจน โดยตัวเร่งการประมวลผลนี้ได้รับการทดสอบบนฮาร์ดแวร์ FPGA รุ่นเก่าอย่าง Xilinx Kintex-7 ซึ่งถูกจำกัดด้วยทรัพยากรลอจิกเซลล์และแบนด์วิดท์หน่วยความจำ DDR3 ทำให้ปัจจุบันสามารถรองรับการรันโมเดลภาษาที่มีพารามิเตอร์ระดับต่ำกว่า 1 พันล้านพารามิเตอร์ (Sub-1B) เท่านั้น
นอกจากนี้ ยังไม่มีข้อมูลหรือหลักฐานยืนยันความสามารถในการขยายสเกลไปสู่โมเดลระดับแนวหน้า (Frontier Models) ที่มีพารามิเตอร์หลายร้อยพันล้านตัว หรือการต่อยอดไปสู่การสั่งผลิตเป็นชิป ASIC เชิงพาณิชย์จริง ซึ่งหมายความว่า OpenTPU ในสถานะปัจจุบันยังคงเป็นโครงการระดับสาธิตและเครื่องมือวิจัยสำหรับนักพัฒนา มากกว่าที่จะเป็นโซลูชันทดแทนชิปเร่งความเร็วระดับศูนย์ข้อมูลอย่าง GPU เชิงพาณิชย์
นัยสำคัญต่อภาคธุรกิจและเทคโนโลยีในประเทศไทย
สำหรับองค์กรธุรกิจและนักพัฒนาระบบฝังตัวในประเทศไทย โครงการ OpenTPU ชี้ให้เห็นถึงแนวโน้มที่น่าจับตามอง 2 ประการ ประการแรกคือ ต้นทุนการประมวลผล Edge AI ภาคอุตสาหกรรม โดยเฉพาะในโรงงานอัจฉริยะ อุปกรณ์ IoT การเกษตร หรือระบบตรวจสอบอัตโนมัติ ซึ่งต้องการรันโมเดลขนาดเล็กเฉพาะงาน (Domain-Specific Small Models) โดยไม่จำเป็นต้องพึ่งพาชิป GPU ราคาแพงหรือเชื่อมต่อคลาวด์ตลอดเวลา การใช้การ์ด FPGA มือสองหรือการ์ดสำหรับงานอุตสาหกรรมร่วมกับสถาปัตยกรรมแบบเปิดอาจช่วยลดค่าใช้จ่ายลงได้อย่างมีนัยสำคัญ
ประการที่สองคือ การเปลี่ยนผ่านของกระบวนการวิศวกรรมฮาร์ดแวร์ในสถาบันการศึกษาและทีมวิจัยในไทย การที่ AI agent สามารถช่วยเขียน SystemVerilog และออกแบบคอมไพเลอร์ให้สอดคล้องกัน จะช่วยลดช่องว่างด้านบุคลากรผู้เชี่ยวชาญการออกแบบชิป ซึ่งเป็นสาขาที่ขาดแคลนในประเทศ และเปิดโอกาสให้สตาร์ทอัพเทคโนโลยีไทยสามารถทดลองออกแบบสถาปัตยกรรมเฉพาะทางได้รวดเร็วขึ้นโดยใช้ต้นทุนเริ่มต้นที่ต่ำลง
โครงการนี้แสดงให้เห็นเป็นครั้งแรกว่า AI agent สามารถร่วมกันออกแบบสถาปัตยกรรมฮาร์ดแวร์ ชิปเซ็ตจำลอง และซอฟต์แวร์สแต็กจนทำงานได้จริงบนซิลิคอน ซึ่งช่วยลดอุปสรรคด้านต้นทุนและเพิ่มศักยภาพในการพัฒนาชิปประมวลผลเฉพาะทางสำหรับงาน Edge AI ในภาคอุตสาหกรรม