การเปิดตัวอย่างเป็นทางการและสถาปัตยกรรม 78.1B MoE

เมื่อวันที่ 3 ตุลาคม 2026 ตรงกับวันเอกภาพเยอรมัน (German Unity Day) Aleph Alpha บริษัทวิจัยปัญญาประดิษฐ์ของเยอรมนี ได้ประกาศเปิดตัวโมเดลภาษาขนาดใหญ่รุ่นล่าสุดชื่อ 'Kolibri' อย่างเป็นทางการ โดยปล่อยน้ำหนักโมเดลทั้งหมดสู่สาธารณะภายใต้สัญญาอนุญาต Apache 2.0 ผ่านทาง Hugging Face ในชื่อ Aleph-Alpha/Kolibri-1

Kolibri ได้รับการออกแบบเป็นโมเดลสองภาษา (Bilingual) ที่เน้นภาษาอังกฤษและเยอรมัน โดยใช้สถาปัตยกรรม Mixture-of-Experts (MoE) ขนาดรวม 78.1 พันล้านพารามิเตอร์ (78.1B) แต่มีพารามิเตอร์ที่ทำงานจริง (Active Parameters) เพียงประมาณ 3.46 พันล้านพารามิเตอร์ต่อหนึ่งโทเคนเท่านั้น สถาปัตยกรรมภายในประกอบด้วย 50 เลเยอร์ โดยมีผู้เชี่ยวชาญแบบกำหนดเส้นทาง (routed experts) จำนวน 384 ตัว พร้อมผู้เชี่ยวชาญส่วนกลาง (shared expert) อีก 1 ตัว และใช้กลไกการเลือกเส้นทางแบบ Top-6 routing

ในด้านประสิทธิภาพการประมวลผลและการใช้หน่วยความจำ Kolibri ใช้เทคนิค Sliding-Window Attention (SWA) ขนาดหน้าต่าง 512 โทเคน ใน 40 เลเยอร์จากทั้งหมด 50 เลเยอร์ โดยสลับมาประมวลผล Full Attention ทุกๆ 5 เลเยอร์ ส่งผลให้โมเดลมีบริบทประมวลผลแบบ Native Context อยู่ที่ 262,144 โทเคน และได้รับการตรวจสอบความแม่นยำ (Validated) รองรับขนาดยาวสูงสุดถึง 1,048,576 โทเคน (1M โทเคน)

กระบวนการเทรน 24T โทเคน และผลการทดสอบมาตรฐาน

กระบวนการฝึกฝน Kolibri ดำเนินการบนคลัสเตอร์ฮาร์ดแวร์ Nvidia B200 จำนวน 768 ตัว ซึ่งตั้งอยู่บนศูนย์ข้อมูลในประเทศเยอรมนีและฟินแลนด์ ครอบคลุมข้อมูลรวมเกือบ 24 ล้านล้านโทเคน (24T tokens) ผ่าน 3 ขั้นตอนหลัก ได้แก่ การทำ Pre-training จำนวน 20 ล้านล้านโทเคน (ประกอบด้วยเนื้อหาภาษาอังกฤษ 62.5%, ภาษาเยอรมัน 23.9% และโค้ดโปรแกรม 13.6%), การทำ Mid-training อีก 3.44 ล้านล้านโทเคน และขั้นตอนขยายความยาวบริบท (Long-context extension) จำนวน 201 พันล้านโทเคน

Kolibri ยังมาพร้อมกับโหมดการคิดแบบมีเหตุผลเชิงประจักษ์ (Explicit Reasoning Mode) ที่ผู้ใช้งานสามารถปรับระดับความพยายามในการประมวลผล (Configurable Effort) ได้ 4 ระดับ คือ low, medium, high และ none รวมถึงความสามารถในการเรียกใช้เครื่องมือภายนอก (Native Tool-Calling) และถูกพัฒนาขึ้นโดยสอดรับกับหลักปฏิบัติ GPAI Code of Practice ภายใต้กฎหมาย EU AI Act

จากเอกสารประเมินประสิทธิภาพของ Aleph Alpha ตัวโมเดลสามารถทำคะแนนการทดสอบด้านการเขียนโค้ดและตรรกะได้อย่างโดดเด่น โดยได้คะแนน LiveCodeBench v6 ที่ 85.9 คะแนน, SWE-Bench Verified ที่ 66.4 คะแนน, HumanEval+ ที่ 92.7 คะแนน และ TerminalBench 2.1 ที่ 27.7 คะแนน ซึ่งถือเป็นระดับแนวหน้าสำหรับโมเดลโอเพนเวตในกลุ่มพารามิเตอร์ระดับเดียวกัน

เสียงสะท้อนจากกลุ่มนักพัฒนาและความโปร่งใสด้านเทคนิค

การเปิดตัว Kolibri ได้รับการตอบรับอย่างคึกคักจากเหล่านักพัฒนาและวิศวกรซอฟต์แวร์ โดยชุมชนสายโอเพนซอร์ซในยุโรปต่างมองว่านี่คือก้าวสำคัญของการสร้าง 'อธิปไตยทางเทคโนโลยี' (Sovereign Compute) ที่เป็นรูปธรรม เพื่อคานอำนาจกับโมเดลพื้นฐานจากสหรัฐฯ และจีน ซึ่งสร้างขึ้นภายใต้กรอบการกำกับดูแลข้อมูลที่เข้มงวดของยุโรป

จุดเด่นที่ได้รับคำชื่นชมอย่างกว้างขวางคือรายงานทางเทคนิคความยาว 189 หน้าของ Aleph Alpha ซึ่งเปิดเผยรายละเอียดการทำงานอย่างโปร่งใส โดยเฉพาะปัญหาฮาร์ดแวร์ขัดข้อง การกู้คืนไปป์ไลน์การเทรน รวมถึงบั๊กในการสับเปลี่ยนข้อมูล (data-shuffling bugs) และอุปสรรคในช่วงแรกของการฝึกตรรกะการใช้เหตุผลในภาษาเยอรมัน นอกจากนี้ กลุ่มผู้ปฏิบัติงานยังหยิบยกประเด็นการคิดเป็นภาษาเยอรมันมาพูดคุยเชิงขบขันว่า โมเดลนี้ให้ความรู้สึกเหมือนการตั้งคณะกรรมการเพื่อพิจารณาอย่างเป็นระบบก่อนตัดสินใจ

อย่างไรก็ตาม ในมิติด้านต้นทุนการฝึกฝน ชุมชนนักพัฒนาได้ร่วมกันประเมินเบื้องต้นจากชั่วโมงการทำงานของ GPU และการคัดกรองข้อมูล คาดว่าค่าใช้จ่ายในการเทรนน่าจะอยู่ระหว่าง 4 ถึง 10 ล้านดอลลาร์สหรัฐ แต่ตัวเลขงบประมาณจริงไม่ได้ระบุไว้ในเอกสารทางการ ทั้งนี้ เหล่านักวิจัยชี้ว่าการที่โมเดลระดับนี้สามารถเทรนได้ในระดับงบประมาณหลักล้านดอลลาร์สะท้อนว่า กำแพงต้นทุนในการสร้างโมเดลขนาดใหญ่เริ่มลดลงสู่ระดับที่องค์กรขนาดใหญ่หรือมหาวิทยาลัยสามารถเข้าถึงได้

นัยสำคัญและแนวทางปรับใช้สำหรับธุรกิจในไทย

สำหรับผู้นำเทคโนโลยีและผู้บริหารองค์กรในประเทศไทย Kolibri แสดงให้เห็นถึงทางเลือกใหม่ในการสร้างระบบปัญญาประดิษฐ์ที่ปลอดจากการผูกขาดของเวนเดอร์ (Vendor Lock-in) สัญญาอนุญาต Apache 2.0 อนุญาตให้องค์กรนำน้ำหนักโมเดลไปปรับแต่ง (Fine-tune) โฮสต์บนคลาวด์ส่วนตัว หรือติดตั้งบนเซิร์ฟเวอร์แบบ On-premise ภายในประเทศได้อย่างสมบูรณ์ ซึ่งสอดคล้องกับข้อกำหนดด้านการรักษาความมั่นคงปลอดภัยของข้อมูลส่วนบุคคลและข้อมูลที่มีความอ่อนไหวสูง

แม้ว่า Kolibri จะได้รับการฝึกฝนหลักในภาษาอังกฤษและเยอรมัน ซึ่งอาจต้องมีการปรับแต่งเพิ่มเติม (Continual Pre-training หรือ Domain Adaptation) หากต้องการนำมาใช้ประมวลผลภาษาไทยในระดับลึก แต่สถาปัตยกรรม MoE ขนาด 78.1B ที่มี Active Parameters เพียง 3.46B ช่วยให้ประหยัดทรัพยากรฮาร์ดแวร์ขณะรันโมเดล (Inference) ได้อย่างมหาศาลเมื่อเทียบกับโมเดลแบบ Dense ทั่วไป

ยิ่งไปกว่านั้น การรองรับบริบทสูงสุดถึง 1 ล้านโทเคน ทำให้ Kolibri มีศักยภาพสูงสำหรับองค์กรธุรกิจในไทยที่ต้องการวิเคราะห์เอกสารทางกฎหมาย สัญญาธุรกิจ หรือบันทึกรายงานการเงินขนาดยาว รวมถึงงานสืบค้นข้อมูลในคลังเอกสารขององค์กร (Enterprise Document Search) โดยไม่ต้องพึ่งพาบริการ API จากต่างประเทศเพียงอย่างเดียว

ทำไมเรื่องนี้สำคัญ

การเปิดตัว Kolibri นำเสนอโมเดล MoE แบบเปิดน้ำหนักที่มีประสิทธิภาพสูงจากยุโรป ซึ่งช่วยลดการพึ่งพาโมเดลปิดจากสหรัฐฯ และจีน พร้อมทั้งเป็นต้นแบบด้านความโปร่งใสและการกำกับดูแลข้อมูลที่องค์กรในไทยสามารถนำไปปรับใช้บนโครงสร้างพื้นฐานภายในได้เองอย่างอิสระ

ข้อมูลอ้างอิงหลัก