สรุปข่าว AI ประจำวัน: เบนช์มาร์กเอเจนต์ Terminal-Bench 4.0, นโยบายยืนยันอายุ Claude และการแข่งขันโมเดล MoE

ฉบับนี้ครอบคลุมการเปิดตัว Terminal-Bench v4.0 สำหรับประเมินเอเจนต์ในเทอร์มินัล, การบังคับใช้นโยบายยืนยันอายุ 18+ ของ Anthropic Claude พร้อมความคืบหน้าของ DeepSeek-V4.1-Flash และการพัฒนาการพิสูจน์คณิตศาสตร์ขั้นสูง

ช่วงข่าว

ข่าวในฉบับนี้

4 เรื่องไม่ซ้ำ

01
ยืนยันแล้ว

เปิดตัว Terminal-Bench v4.0 เบนช์มาร์กประเมินเอเจนต์บนเทอร์มินัล พร้อมผลการทดสอบชี้ GPT-6 Astra และ GLM-5.3 นำกลุ่ม

มาตรฐานการประเมินเอเจนต์กำลังเปลี่ยนจากการสร้างโค้ดแบบเดิมไปสู่การสั่งการระบบจริงในเทอร์มินัล ช่วยให้องค์กรประเมินความสามารถของโมเดลในการทำงานด้านวิศวกรรมระบบและ DevOps ได้อย่างแม่นยำยิ่งขึ้น

AI Agents / Terminal-Bench
02
ยืนยันแล้ว

Anthropic บังคับใช้นโยบายจำกัดอายุผู้ใช้ 18 ปีขึ้นไปบน Claude พร้อมระบบตรวจสอบตัวตนอัตโนมัติ

การบังคับใช้การตรวจสอบตัวตน (KYC) และสแกนใบหน้าบนบริการ AI สำหรับผู้บริโภคสะท้อนถึงแรงกดดันทางกฎหมายคุ้มครองเด็กสากล ซึ่งกระทบต่อนักพัฒนาเยาวชนและผลักดันให้ธุรกิจต้องประเมินความเสี่ยงด้านข้อมูลส่วนบุคคล

Anthropic / Claude
03
ยืนยันแล้ว

DeepSeek ให้บริการ DeepSeek-V4.1-Flash สถาปัตยกรรม MoE รองรับบริบท 1M โทเค็นด้วยต้นทุนต่ำ

โครงสร้างราคาและการประมวลผลบริบทขนาดยาวระดับ 1M โทเค็นในราคาเศษเสี้ยวของคู่แข่ง ช่วยให้องค์กรและสตาร์ทอัพในไทยสามารถลดต้นทุนการประมวลผลเอกสารหรือข้อมูลประวัติศาสตร์ขนาดมหึมาได้อย่างก้าวกระโดด

DeepSeek / Mixture-of-Experts
04
กำลังพัฒนา

การวิจัยด้านการพิสูจน์ทฤษฎีบทคณิตศาสตร์ Navier-Stokes บน Lean 4 โดยโมเดลแถวหน้ายังคงอยู่ในขั้นตอนพัฒนา

การเปลี่ยนผ่านจากการสร้างข้อความคาดเดาไปสู่การตรวจสอบความถูกต้องด้วยคณิตศาสตร์รูปนัย (Formal Verification) ด้วย Lean 4 กำลังสร้างมาตรฐานใหม่ด้านความน่าเชื่อถือของ AI ซึ่งส่งผลกระทบโดยตรงต่อการพัฒนาระบบซอฟต์แวร์ระดับภารกิจวิกฤตและความปลอดภัยทางไซเบอร์ในภาคธุรกิจ

Artificial Intelligence / Formal Verification
สรุปข่าว AI ประจำวัน: เบนช์มาร์กเอเจนต์ Terminal-Bench 4.0, นโยบายยืนยันอายุ Claude และการแข่งขันโมเดล MoE | Gauss Labs News