Cloudflare เปิดตัวโมเดลการตัดสินใจแบบ Open-Weight 'Clef' และ 'Clef-Flash' บน Workers AI
การสร้างระบบเอเจนต์และเราต์ติ้งเอไอที่ผ่านมาต้องสูญเสียเวลาและทรัพยากรไปกับการรอให้โมเดลภาษาขนาดใหญ่สร้างข้อความออกมาทีละโทเคน การเปลี่ยนไปใช้สถาปัตยกรรมแบบตัดสินใจโดยตรง (Prefill-Only Decision Head) ช่วยให้ภาคธุรกิจสามารถลดค่าใช้จ่ายการประมวลผลอินพุตเหลือเพียง 0.09 ดอลลาร์ต่อ 1 ล้านโทเคน และลดเวลาหน่วง (Latency) ลงเหลือระดับมิลลิวินาที