Tạo mô hình random forest đầy đủ
Mô hình random forest tự nhiên thực hiện chọn đặc trưng khi chúng xây nhiều cây con từ các tập con ngẫu nhiên của đặc trưng. Một cách để hiểu tầm quan trọng của đặc trưng là xây một mô hình rồi trích xuất độ quan trọng của đặc trưng. Vì vậy, trong bài tập này, bạn sẽ dùng dữ liệu Healthcare Job Attrition để huấn luyện một mô hình phân loại rand_forest() mà từ đó bạn có thể trích xuất độ quan trọng của đặc trưng. Để có thể lấy được độ quan trọng của đặc trưng, hãy tạo mô hình với importance = "impurity". Các tập train và test đã được cung cấp cho bạn.
Các gói tidyverse, tidymodels, và vip đã được nạp sẵn.
Bài tập này là một phần của khóa học
Giảm Chiều Dữ Liệu với R
Hướng dẫn bài tập
- Định nghĩa một mô hình random forest phân loại với 200 cây để có thể trích xuất độ quan trọng của đặc trưng.
- Fit mô hình random forest với tất cả các biến dự báo.
- Gắn (bind) các dự đoán vào tập test.
- Tính chỉ số F1.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>%
set_engine("___", ___ = "___")
# Fit the random forest model with all predictors
rf_fit <- ___ %>%
___(___, data = ___)
# Create the test set prediction data frame
predict_df <- ___ %>%
bind_cols(predict = ___(___, ___))
# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)