สร้างโมเดล classification ขั้นสุดท้าย
เมื่อเปรียบเทียบค่า recall ระหว่างโมเดล logistic regression (0.4) กับโมเดล random forest ที่ดีที่สุด (0.2) จะพบว่าโมเดลที่มีประสิทธิภาพสูงกว่าคือ logistic regression ในแบบฝึกหัดนี้ จะสร้างโมเดล logistic regression โดยใช้ข้อมูล train ทั้งหมด และเตรียม vector ที่จำเป็นสำหรับประเมินประสิทธิภาพของโมเดลบนข้อมูล test
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ใน Tidyverse
คำแนะนำการฝึกหัด
- สร้างโมเดล logistic regression เพื่อพยากรณ์
Attritionโดยใช้ฟีเจอร์ทั้งหมดที่มีในtraining_data - เตรียม binary vector ของค่าจริงจากข้อมูลทดสอบในชื่อ
test_actual - เตรียม binary vector ของค่าพยากรณ์ โดยกำหนดให้ความน่าจะเป็นที่มากกว่า 0.5 หมายถึง
TRUEและเก็บไว้ในชื่อtest_predicted
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Build the logistic regression model using all training data
best_model <- glm(formula = ___,
data = ___, family = "binomial")
# Prepare binary vector of actual Attrition values for testing_data
test_actual <- testing_data$___ == "___"
# Prepare binary vector of predicted Attrition values for testing_data
test_predicted <- predict(___, ___, type = "response") > ___