คำนวณประสิทธิภาพด้วย Cross-Validation
การเลือก metric ที่เหมาะสมเพื่อ optimize โมเดลนั้นมีความสำคัญมาก เพราะ metric ที่ดีต้องสอดคล้องกับเป้าหมายที่ต้องการ
สมมติว่าต้องการใช้โมเดลนี้เพื่อระบุพนักงานที่คาดว่าจะลาออก โดยอยากให้โมเดลสามารถตรวจจับพนักงานกลุ่มนี้ได้มากที่สุดเท่าที่จะเป็นไปได้ เพื่อจะได้เข้าไปดูแลได้ทันท่วงที metric ที่ตรงกับเป้าหมายนี้คือ recall ดังนั้นจึงใช้ recall เป็นเกณฑ์เดียวในการ optimize และเลือกโมเดล
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ใน Tidyverse
คำแนะนำการฝึกหัด
- คำนวณค่า recall โดยเปรียบเทียบค่าจริงกับค่าที่พยากรณ์ไว้ในแต่ละ fold แล้วกำหนดผลลัพธ์ไว้ในคอลัมน์
validate_recall - แสดงผลคอลัมน์
validate_recall - แสดงผลค่าเฉลี่ยของคอลัมน์นี้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_lr %>%
mutate(validate_recall = map2_dbl(___, ___,
~recall(actual = .x, predicted = .y)))
# Print the validate_recall column
cv_perf_recall$___
# Calculate the average of the validate_recall column
___