Tạo recipe lọc tương quan cao
Khi bạn đã xác định được các đặc trưng có tương quan cao, thay vì tự xóa thủ công, bạn có thể dùng bước recipe step_corr() trong tidymodels. step_corr() không xóa tất cả các đặc trưng tương quan với đặc trưng khác. Nó cố gắng xóa ít đặc trưng nhất có thể. Về mặt khái niệm, như bạn đã thấy trong bài trắc nghiệm, nó sẽ xóa đặc trưng có mức trùng lặp thông tin lớn nhất với bất kỳ tổ hợp đặc trưng nào khác. Ý tưởng là các đặc trưng còn lại chứa cùng lượng thông tin, nên phần thông tin trùng lặp của đặc trưng bị xóa vẫn được thể hiện trong các đặc trưng kia.
Các gói tidyverse và tidymodels đã được nạp sẵn cho bạn.
Bài tập này là một phần của khóa học
Giảm Chiều Dữ Liệu với R
Hướng dẫn bài tập
- Tạo một recipe dùng
step_corr()với ngưỡng 0.7, chỉ áp dụng bước này cho các biến dự báo dạng số. - Áp dụng recipe lên
house_sales_dfvà lưu dữ liệu đã được lọc vàofiltered_house_sales_df. - Dùng
tidy()để xác định cột hoặc các cột mà bộ lọcstep_corr()đã loại bỏ.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a recipe using step_corr to remove numeric predictors correlated > 0.7
corr_recipe <-
___(price ~ ., data = ___) %>%
___(___, ___ = ___) %>%
___(___)
# Apply the recipe to the data
___ <-
___ %>%
___(new_data = ___)
# Identify the features that were removed
___(___, ___ = ___)