Sàng lọc theo mức độ quan trọng của biến
Bộ dữ liệu attrition có 839 quan sát và 30 biến dự báo cho "Attrition." Bạn muốn khám phá đánh đổi giữa hiệu năng của một mô hình dùng tất cả biến dự báo hiện có so với một mô hình rút gọn dựa trên một vài biến giàu thông tin.
Trong bài tập này, bạn sẽ fit một mô hình và xem mức độ quan trọng của các biến trong mô hình đã fit. Ở bài tập tiếp theo, bạn sẽ đánh giá hiệu năng mô hình này so với một mô hình rút gọn.
Các tập train và test cùng gói vip() đã có sẵn trong môi trường của bạn, kèm theo một model hồi quy logistic đã được khai báo trước.
Bài tập này là một phần của khóa học
Kỹ thuật đặc trưng (Feature Engineering) với R
Hướng dẫn bài tập
- Tạo một recipe mô hình hóa
Attritionbằng tất cả biến dự báo. - Fit workflow lên dữ liệu huấn luyện.
- Dùng đối tượng
fit_fullđể vẽ biểu đồ mức độ quan trọng của biến trong mô hình của bạn. - Áp dụng hàm
extract_fit_parsnip()trướcvip()để cung cấp thông tin cần thiết cho nó.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a recipe that models Attrition using all the predictors
recipe_full <- ___(___, data = train)
workflow_full <- workflow() %>%
add_model(model) %>%
add_recipe(recipe_full)
# Fit the workflow to the training data
fit_full <- ___ %>%
___(data = train)
# Use the fit_full object to graph the variable importance of your model. Apply extract_fit_parsnip() function before vip()
fit_full %>% ___() %>%
___(aesthetics = list(fill = "steelblue"))