เปิดตัว Terminal-Bench v4.0 เบนช์มาร์กประเมินเอเจนต์บนเทอร์มินัล พร้อมผลการทดสอบชี้ GPT-6 Astra และ GLM-5.3 นำกลุ่ม
มาตรฐานการประเมินเอเจนต์กำลังเปลี่ยนจากการสร้างโค้ดแบบเดิมไปสู่การสั่งการระบบจริงในเทอร์มินัล ช่วยให้องค์กรประเมินความสามารถของโมเดลในการทำงานด้านวิศวกรรมระบบและ DevOps ได้อย่างแม่นยำยิ่งขึ้น