Xây dựng mô hình random forest
Tại đây bạn sẽ dùng cùng dữ liệu cross-validation để xây dựng (bằng train) và đánh giá (bằng validate) các random forest cho từng phần chia. Vì bạn đang dùng cùng các phần chia cross-validation như các mô hình hồi quy, bạn có thể so sánh trực tiếp hiệu năng của hai mô hình.
Lưu ý: Chúng ta sẽ giới hạn mỗi random forest ở 100 cây để đảm bảo việc huấn luyện hoàn tất trong thời gian hợp lý. Số cây mặc định của ranger() là 500.
Bài tập này là một phần của khóa học
Machine Learning trong tidyverse
Hướng dẫn bài tập
- Dùng
ranger()để xây dựng một random forest dự đoánlife_expectancyvới tất cả đặc trưng trongtraincho mỗi phần chia cross-validation. - Thêm cột mới
validate_predicteddự đoánlife_expectancycho các quan sát trongvalidatebằng các mô hình random forest bạn vừa tạo.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
library(ranger)
# Build a random forest model for each fold
cv_models_rf <- cv_data %>%
mutate(model = map(___, ~ranger(formula = ___, data = ___,
num.trees = 100, seed = 42)))
# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>%
mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))