เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

สร้างโมเดล Random Forest

ในแบบฝึกหัดนี้จะใช้ข้อมูล cross-validation ชุดเดิมเพื่อสร้างโมเดล (ด้วย train) และประเมินผล (ด้วย validate) random forest สำหรับแต่ละ partition เนื่องจากใช้ partition cross-validation ชุดเดียวกับโมเดล regression จึงสามารถเปรียบเทียบประสิทธิภาพของโมเดลทั้งสองได้โดยตรง

หมายเหตุ: เราจะจำกัดจำนวนต้นไม้ใน random forest ไว้ที่ 100 ต้น เพื่อให้การ fitting เสร็จสิ้นในเวลาที่เหมาะสม โดยค่าเริ่มต้นของ ranger() คือ 500 ต้น

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning ใน Tidyverse

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้ ranger() สร้างโมเดล random forest เพื่อพยากรณ์ life_expectancy โดยใช้ฟีเจอร์ทั้งหมดใน train สำหรับแต่ละ partition ของ cross-validation
  • เพิ่มคอลัมน์ใหม่ชื่อ validate_predicted เพื่อพยากรณ์ life_expectancy ของข้อมูลใน validate โดยใช้โมเดล random forest ที่สร้างขึ้น

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

library(ranger)

# Build a random forest model for each fold
cv_models_rf <- cv_data %>% 
  mutate(model = map(___, ~ranger(formula = ___, data = ___,
                                    num.trees = 100, seed = 42)))

# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>% 
  mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))
แก้ไขและรันโค้ด