Giảm dữ liệu bằng độ quan trọng của đặc trưng
Bây giờ bạn đã xây dựng xong mô hình random forest đầy đủ, hãy khám phá độ quan trọng của đặc trưng.
Mặc dù mô hình random forest vốn dĩ — nhưng ngầm định — đã thực hiện chọn đặc trưng, việc xây dựng một mô hình rút gọn vẫn thường có lợi. Mô hình rút gọn huấn luyện nhanh hơn, dự đoán nhanh hơn, và dễ hiểu cũng như dễ quản lý hơn. Tất nhiên, luôn có sự đánh đổi giữa mức độ đơn giản của mô hình và hiệu năng mô hình.
Trong bài tập này, bạn sẽ rút gọn tập dữ liệu. Ở bài tập kế tiếp, bạn sẽ huấn luyện một mô hình rút gọn và so sánh hiệu năng của nó với mô hình đầy đủ. rf_fit, train, và test đã được cung cấp sẵn cho bạn.
Các gói tidyverse, tidymodels, và vip đã được nạp sẵn.
Bài tập này là một phần của khóa học
Giảm Chiều Dữ Liệu với R
Hướng dẫn bài tập
- Dùng
vi()với tham sốrankđể trích xuất 10 đặc trưng quan trọng nhất. - Thêm biến mục tiêu trở lại vào danh sách đặc trưng hàng đầu.
- Áp dụng mặt nạ đặc trưng hàng đầu để rút gọn các tập dữ liệu.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Extract the top ten features
top_features <- ___ %>%
___(___ = ___) %>%
filter(___) %>%
pull(Variable)
# Add the target variable to the feature list
top_features <- c(___, "___")
# Reduce and print the data sets
train_reduced <- train[___]
test_reduced <- ___[___]
train_reduced %>% head(5)
test_reduced %>% head(5)