Bắt đầu ngayBắt đầu miễn phí

Xây dựng mô hình random forest

Tại đây bạn sẽ dùng cùng dữ liệu cross-validation để xây dựng (bằng train) và đánh giá (bằng validate) các random forest cho từng phần chia. Vì bạn đang dùng cùng các phần chia cross-validation như các mô hình hồi quy, bạn có thể so sánh trực tiếp hiệu năng của hai mô hình.

Lưu ý: Chúng ta sẽ giới hạn mỗi random forest ở 100 cây để đảm bảo việc huấn luyện hoàn tất trong thời gian hợp lý. Số cây mặc định của ranger() là 500.

Bài tập này là một phần của khóa học

Machine Learning trong tidyverse

Xem khóa học

Hướng dẫn bài tập

  • Dùng ranger() để xây dựng một random forest dự đoán life_expectancy với tất cả đặc trưng trong train cho mỗi phần chia cross-validation.
  • Thêm cột mới validate_predicted dự đoán life_expectancy cho các quan sát trong validate bằng các mô hình random forest bạn vừa tạo.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

library(ranger)

# Build a random forest model for each fold
cv_models_rf <- cv_data %>% 
  mutate(model = map(___, ~ranger(formula = ___, data = ___,
                                    num.trees = 100, seed = 42)))

# Generate predictions using the random forest model
cv_prep_rf <- cv_models_rf %>% 
  mutate(validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y)$predictions))
Chỉnh sửa và Chạy Mã