llama.cpp เพิ่มประสิทธิภาพ n-gram Cache เร่งความเร็ว Prompt Lookup Decoding สูงสุด 42 เท่า
ช่วยให้ภาคธุรกิจในไทยสามารถลดต้นทุนคลาวด์และฮาร์ดแวร์ได้อย่างมหาศาล โดยงานสกัดข้อมูล JSON และสรุปเอกสารสามารถประมวลผลบนการ์ดจอระดับผู้บริโภคได้อย่างรวดเร็วโดยไม่เปลือง VRAM