เบื้องหลังการทดสอบ: นำโมเดลภาษาทั่วไปมาบังคับพวงมาลัยรถยนต์จริง

เมื่อวันที่ 22 กันยายน 2026 กลุ่มนักวิจัยอิสระประกอบด้วย Aditya Ramabadran, Simon Mahns และ Tobias Gessler ได้เปิดตัวโครงการทดสอบ DrivingBench ซึ่งเป็นการประเมินศักยภาพของโมเดลภาษาขนาดใหญ่ระดับแนวหน้า (Frontier LLMs) ที่ไม่ได้ผ่านการปรับแต่งเฉพาะทาง (Unmodified) ในการควบคุมยานพาหนะทางกายภาพจริง โครงการนี้ได้เชื่อมต่อโมเดลปัญญาประดิษฐ์เชิงพาณิชย์เข้ากับฮาร์ดแวร์ Comma 4 ที่รันซอฟต์แวร์ openpilot บนรถยนต์นั่งส่วนบุคคล Toyota Corolla

การเชื่อมต่อไม่ได้ใช้สถาปัตยกรรมแบบ End-to-End เฉพาะทางอย่างที่ระบบขับขี่อัตโนมัติทั่วไปใช้งาน แต่ทำหน้าที่ผ่านการเรียกใช้เครื่องมือภายนอก (Tool-Use) ตามมาตรฐาน Model Context Protocol (MCP) โมเดลจะได้รับข้อมูลภาพและสถานะสภาพแวดล้อม จากนั้นส่งคำสั่งควบคุม เช่น องศาการเลี้ยวและการเร่งความเร็วกลับมาเป็นรอบการสนทนา (Discrete Chat Turns)

การทดสอบจัดขึ้นในสนามทดสอบแบบปิดที่เป็นลานจอดรถว่างเปล่า โดยมีการวางกรวยจราจรเป็นเส้นทางคดเคี้ยวระยะทางประมาณ 130 ถึง 135 เมตร ตัวรถถูกจำกัดความเร็วสูงสุดทางซอฟต์แวร์ไว้ไม่เกิน 3.5 เมตรต่อวินาที ขณะที่ความเร็วจริงระหว่างการทดสอบเฉลี่ยอยู่ที่ประมาณ 0.94 ไมล์ต่อชั่วโมง (น้อยกว่า 1 เมตรต่อวินาที) โดยมีผู้ขับขี่ที่เป็นมนุษย์นั่งประจำตำแหน่งเพื่อเหยียบเบรกฉุกเฉินตลอดเวลา

ตัวเลขผลการทดสอบ: ความสำเร็จของ GPT-6 Astra กับราคาต้นทุนการอนุมาน

ผลลัพธ์จากการทดลองแสดงให้เห็นความแตกต่างของความสามารถในการคิดวิเคราะห์เชิงพื้นที่ (Spatial Reasoning) ในหมู่โมเดลชั้นนำ โดยโมเดล GPT-6 Astra สามารถขับผ่านสิ่งกีดขวางได้ครบ 100% ของระยะทางในการทดสอบรอบที่ 2 โดยใช้เวลาไป 5 นาที 22 วินาที อย่างไรก็ตาม ความสำเร็จดังกล่าวต้องแลกมาด้วยการประมวลผลโทเคนถึง 6.6 ล้านโทเคน คิดเป็นต้นทุนค่าบริการ API สูงถึง 7.74 ดอลลาร์สหรัฐต่อการวิ่งหนึ่งรอบ หรือเฉลี่ยประมาณ 92.47 ดอลลาร์สหรัฐต่อไมล์ (เทียบเท่ากว่า 3,200 บาทต่อไมล์)

ในส่วนของโมเดลอื่น Claude Fable 5.1 ทำระยะทางสำเร็จได้ 45% ในการพยายามรอบที่ 3 โดยแสดงให้เห็นการปรับปรุงพฤติกรรมผ่านการเรียนรู้ในบริบท (In-Context Learning) จากรอบแรกที่ทำได้เพียง 9% ขณะที่ Grok 4.6 ทำระยะทางสำเร็จได้ 11% และ GPT-5.6 Sol ทำได้เพียง 6% ของเส้นทางก่อนที่จะหลุดออกนอกเลนหรือหยุดชะงัก

นอกจากความแม่นยำแล้ว ปัญหาทางเทคนิคที่เด่นชัดคือความหน่วง (Latency) ของระบบ ซึ่งต้องใช้เวลาเฉลี่ย 5 ถึง 6 วินาทีต่อการตัดสินใจและส่งคำสั่งเครื่องมือ 1 ครั้ง โมเดลจำนวนมากยังประสบปัญหาการตีความมิติสัมพันธ์ เช่น ไม่สามารถระบุได้ว่าฝั่งใดของแนวกรวยคือเลนที่ถูกต้องตามกฎหมาย และทีมวิจัยยังต้องเปลี่ยนชื่อเซิร์ฟเวอร์ควบคุมเป็น 'DrivingBench Sandbox' เพื่อเลี่ยงไม่ให้ระบบป้องกันความปลอดภัย (Safety Guardrails) ของผู้ให้บริการโมเดลสั่งปฏิเสธคำสั่ง (Refusal) เนื่องจากมองว่าเป็นการควบคุมวัตถุอันตราย

ปฏิกิริยาในกลุ่มวิศวกร: นวัตกรรมเชิงคอนเซปต์ที่ไม่คุ้มค่าในทางเศรษฐศาสตร์

ในหมู่นักพัฒนาซอฟต์แวร์และวิศวกรระบบอัตโนมัติ การทดสอบนี้จุดประเด็นถกเถียงอย่างกว้างขวาง ฝั่งหนึ่งมองว่านี่คือหลักฐานเชิงประจักษ์ที่น่าตื่นเต้นของ Embodied AI ซึ่งแสดงให้เห็นว่าโมเดลภาษาขนาดใหญ่ระดับแนวหน้าสามารถวางแผนเชิงพื้นที่ในโลกจริงแบบ Zero-Shot ได้โดยไม่ต้องมีชุดข้อมูลการขับขี่รถยนต์โดยเฉพาะ แต่ใช้เพียงโครงสร้างเชื่อมต่อแบบ MCP

อย่างไรก็ตาม วิศวกรสายหุ่นยนต์และปัญญาประดิษฐ์ส่วนใหญ่แสดงความกังขาในมิติการใช้งานจริง โดยชี้ว่าต้นทุนการประมวลผล 92.47 ดอลลาร์ต่อไมล์นั้นสูงกว่าค่าน้ำมันหรือพลังงานไฟฟ้าของรถยนต์ทั่วไปถึง 500 เท่า ทำให้โมเดลธุรกิจสำหรับการนำโมเดลภาษาคลาวด์มาขับเคลื่อนยานพาหนะตรงๆ แทบเป็นไปไม่ได้ในเชิงพาณิชย์

นอกจากนี้ นักวิจัยด้านความปลอดภัยยังย้ำเตือนว่าการรายงานข่าวที่ระบุว่าโมเดลภาษา 'ขับรถเองได้แล้ว' เป็นการกล่าวอ้างที่เกินจริงอย่างมาก เพราะการขับขี่บนถนนจริงต้องการการประมวลผลระดับมิลลิวินาที (Low Latency) ซึ่งระบบคลาวด์ที่มีความหน่วง 5 วินาทีต่อคำสั่งไม่สามารถรับมือกับคนเดินถนนหรือสถานการณ์ฉุกเฉินได้ การใช้โมเดลโครงข่ายประสาทขนาดเล็กที่ทำงานบนอุปกรณ์โดยตรง (On-Device Specialized Models) จึงยังคงเป็นแกนหลักของอุตสาหกรรม

นัยสำคัญสำหรับธุรกิจไทย: ขอบเขตที่แท้จริงระหว่าง Generative AI และระบบอัตโนมัติ

สำหรับองค์กรธุรกิจในประเทศไทย โดยเฉพาะในภาคการผลิต การคลังสินค้า และโลจิสติกส์ ผลการทดสอบ DrivingBench ให้บทเรียนสำคัญว่าไม่ควรนำโมเดลภาษาเชิงสร้างสรรค์ (Generative AI) ไปใช้ในการควบคุมการเคลื่อนไหวของเครื่องจักรโดยตรง การสั่งงานแขนกล รถโฟล์กลิฟต์ หรือหุ่นยนต์ AGV (Automated Guided Vehicles) ในโรงงานจำเป็นต้องใช้ระบบ Edge Computing ที่มีความแม่นยำสูงและไร้ความหน่วง

อย่างไรก็ตาม รูปแบบการเชื่อมต่อเครื่องมือผ่านโปรโตคอลมาตรฐานอย่าง MCP สามารถนำมาประยุกต์ใช้ในระดับการวางแผนกลยุทธ์ระดับสูง (High-Level Task Planning) เช่น การให้ LLM ทำหน้าที่ตรวจสอบรายการคำสั่งซื้อ วิเคราะห์เส้นทางการขนส่งภาพรวม หรือกระจายภารกิจไปยังระบบคลาวด์ จากนั้นส่งต่อให้ระบบควบคุมทางกายภาพเฉพาะกิจเป็นผู้ประมวลผลการเคลื่อนที่จริง

ผู้นำด้านเทคโนโลยีของไทยควรพิจารณาความคุ้มค่าของการลงทุน (ROI) อย่างรอบคอบ การเลือกใช้สถาปัตยกรรมที่ถูกต้องจะช่วยป้องกันความสูญเสียจากค่าใช้จ่าย API ที่บานปลาย และป้องกันความเสี่ยงด้านความปลอดภัยทางกายภาพที่อาจส่งผลกระทบต่อพนักงานและทรัพย์สินในโรงงานอุตสาหกรรม

ทำไมเรื่องนี้สำคัญ

การทดลองนี้ยืนยันว่าโมเดลภาษาทั่วไปสามารถแปลงการคิดเชิงเหตุผลเป็นการควบคุมเครื่องจักรทางกายภาพได้ผ่านโปรโตคอลมาตรฐาน แต่ต้นทุนโทเคนและความล่าช้า 5-6 วินาทีต่อคำสั่งชี้ชัดว่าระบบอัตโนมัติในสายการผลิตและโลจิสติกส์ยังจำเป็นต้องพึ่งพาโมเดลเฉพาะทางบน Edge

ข้อมูลอ้างอิงหลัก