एक random forest मॉडल बनाएँ
यहाँ आप वही cross-validation डेटा इस्तेमाल करके प्रत्येक partition के लिए random forests बनाएँगे (train का उपयोग करके) और उनका मूल्यांकन करेंगे (validate का उपयोग करके). क्योंकि आप अपने regression मॉडलों जैसी ही cross-validation partitions इस्तेमाल कर रहे हैं, इसलिए आप दोनों मॉडलों के प्रदर्शन की सीधे तुलना कर पाएँगे.
ध्यान दें: हम random forests को 100 पेड़ों तक सीमित रखेंगे ताकि फिटिंग उचित समय में पूरी हो सके. ranger() के लिए डिफ़ॉल्ट पेड़ों की संख्या 500 है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Tidyverse में मशीन लर्निंग
अभ्यास निर्देश
- प्रत्येक cross validation partition के लिए
trainमें मौजूद सभी फीचर्स का उपयोग करते हुएlife_expectancyकी भविष्यवाणी करने वाला random forest बनाने के लिएranger()का उपयोग करें. - अभी बनाए गए random forest मॉडलों का उपयोग करते हुए
validateमें प्रेक्षणों केlife_expectancyकी भविष्यवाणी करकेvalidate_predictedनाम का नया कॉलम जोड़ें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))