สร้างโมเดล Random Forest
ในแบบฝึกหัดนี้จะใช้ข้อมูล cross-validation ชุดเดิมเพื่อสร้างโมเดล (ด้วย train) และประเมินผล (ด้วย validate) random forest สำหรับแต่ละ partition เนื่องจากใช้ partition cross-validation ชุดเดียวกับโมเดล regression จึงสามารถเปรียบเทียบประสิทธิภาพของโมเดลทั้งสองได้โดยตรง
หมายเหตุ: เราจะจำกัดจำนวนต้นไม้ใน random forest ไว้ที่ 100 ต้น เพื่อให้การ fitting เสร็จสิ้นในเวลาที่เหมาะสม โดยค่าเริ่มต้นของ ranger() คือ 500 ต้น
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ใน Tidyverse
คำแนะนำการฝึกหัด
- ใช้
ranger()สร้างโมเดล random forest เพื่อพยากรณ์life_expectancyโดยใช้ฟีเจอร์ทั้งหมดในtrainสำหรับแต่ละ partition ของ cross-validation - เพิ่มคอลัมน์ใหม่ชื่อ
validate_predictedเพื่อพยากรณ์life_expectancyของข้อมูลในvalidateโดยใช้โมเดล random forest ที่สร้างขึ้น
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))