เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สร้างโมเดล classification ขั้นสุดท้าย

เมื่อเปรียบเทียบค่า recall ระหว่างโมเดล logistic regression (0.4) กับโมเดล random forest ที่ดีที่สุด (0.2) จะพบว่าโมเดลที่มีประสิทธิภาพสูงกว่าคือ logistic regression ในแบบฝึกหัดนี้ จะสร้างโมเดล logistic regression โดยใช้ข้อมูล train ทั้งหมด และเตรียม vector ที่จำเป็นสำหรับประเมินประสิทธิภาพของโมเดลบนข้อมูล test

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning ใน Tidyverse

ดูคอร์ส

คำแนะนำการฝึกหัด

  • สร้างโมเดล logistic regression เพื่อพยากรณ์ Attrition โดยใช้ฟีเจอร์ทั้งหมดที่มีใน training_data
  • เตรียม binary vector ของค่าจริงจากข้อมูลทดสอบในชื่อ test_actual
  • เตรียม binary vector ของค่าพยากรณ์ โดยกำหนดให้ความน่าจะเป็นที่มากกว่า 0.5 หมายถึง TRUE และเก็บไว้ในชื่อ test_predicted

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Build the logistic regression model using all training data
best_model <- glm(formula = ___, 
                  data = ___, family = "binomial")


# Prepare binary vector of actual Attrition values for testing_data
test_actual <- testing_data$___ == "___"

# Prepare binary vector of predicted Attrition values for testing_data
test_predicted <- predict(___, ___, type = "response") > ___
แก้ไขและรันโค้ด