Mức độ quan trọng của biến
Bạn đã biết rằng bagged trees là một mô hình ensemble giúp khắc phục vấn đề phương sai cao của cây quyết định. Giờ đây, bạn học thêm rằng thuật toán random forest còn cải thiện hơn nữa bằng cách chỉ dùng một tập con ngẫu nhiên của các đặc trưng trong mỗi cây. Cách này làm giảm tương quan giữa các cây trong ensemble, từ đó cải thiện hiệu năng dự đoán.
Trong bài tập này, bạn sẽ tự xây dựng một random forest và vẽ mức độ quan trọng của các biến dự báo bằng gói vip. Dữ liệu huấn luyện customers_train đã được nạp sẵn trong không gian làm việc của bạn.
Bài tập này là một phần của khóa học
Machine Learning với Mô hình Dựa trên Cây trong R
Hướng dẫn bài tập
- Tạo
spec, đặc tả của một mô hình phân loại random forest dùng engine"ranger"và kiểu quan trọng biến"impurity". - Tạo
modelbằng cách fit tibblecustomers_trainvàospecvớistill_customerlà biến mục tiêu và tất cả các cột còn lại là biến dự báo. - Vẽ biểu đồ mức độ quan trọng của biến bằng hàm
vip()từ góivip(gói này chưa được nạp sẵn).
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Specify a random forest
spec <- ___ %>%
set_mode("classification") %>%
set_engine(___, importance = ___)
# Train the forest
model <- spec %>%
fit(___,
___)
# Plot the variable importance
vip::___(model)