| Answer / output quality | ใช้ชุดตัวอย่างที่ทีมธุรกิจอนุมัติ แยกคำตอบถูก ผิด ไม่มีหลักฐาน และกรณีที่ควรปฏิเสธ | ผ่าน threshold ราย metric ที่บันทึกใน SOW พร้อมเปิดเผย sample size และข้อจำกัด |
|---|
| Task completion | ทดสอบ workflow end-to-end และตรวจ side effect เช่น ticket, record, approval หรือ notification | งานสำเร็จและ state ถูกต้องตาม expected outcome ของ fixture ที่ตกลง |
|---|
| Latency | วัด p50/p95 ตามเส้นทางสำคัญภายใต้ load profile ที่ระบุ ไม่ใช้ผลจาก request เดียว | ไม่เกิน target ของแต่ละเส้นทางที่ตกลง; บันทึก timeout behavior |
|---|
| Unit economics | รวม model/API และบริการแปรผันเป็นบาทต่อ task ที่สำเร็จ พร้อมจำลอง volume | ต้นทุนต่อ successful task ไม่เกินเพดานที่อนุมัติ และมี budget/usage alert |
|---|
| Failure paths | จำลอง bad input, missing data, rate limit, timeout, tool/API failure และ retrieval ที่ไม่พบหลักฐาน | fail safely, ไม่ทำ action ซ้ำ/ผิด และส่งต่อคนหรือ retry ตามกติกาที่ตกลง |
|---|
| Human review | วัดสัดส่วนงานที่ต้องตรวจ แก้ ปฏิเสธ หรือ escalate แยกตามประเภทความเสี่ยง | review rate และ error-after-review อยู่ใน threshold พร้อมเจ้าของ queue ที่ชัดเจน |
|---|
| Rollback | ซ้อมย้อน model/prompt/config/release หรือปิด automation แล้วกลับสู่ manual path | ทำตาม runbook ได้ รักษาข้อมูลสำคัญ และบันทึกผู้มีสิทธิ์ตัดสินใจ rollback |
|---|