Tworzenie przepisu usuwającego silnie skorelowane cechy
Po zidentyfikowaniu silnie skorelowanych cech zamiast usuwać je ręcznie, możesz skorzystać z kroku step_corr() w pakiecie tidymodels. step_corr() nie usuwa wszystkich cech skorelowanych z innymi – stara się usunąć ich jak najmniej. Koncepcyjnie, jak widzieć mogłeś w ćwiczeniu wielokrotnego wyboru, usuwa cechę, która w największym stopniu pokrywa się z dowolną kombinacją pozostałych cech. Chodzi o to, że pozostałe cechy zawierają te same informacje, więc informacja z usuniętej cechy jest nadal reprezentowana przez inne.
Pakiety tidyverse i tidymodels zostały już wczytane.
To ćwiczenie jest częścią kursu
Redukcja wymiarowości w R
Instrukcje do ćwiczenia
- Utwórz przepis, który używa
step_corr()z progiem 0,7, stosując ten krok wyłącznie do numerycznych predyktorów. - Zastosuj przepis do
house_sales_dfi zapisz przefiltrowane dane wfiltered_house_sales_df. - Użyj
tidy(), aby sprawdzić, którą kolumnę lub kolumny usunął filtrstep_corr().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a recipe using step_corr to remove numeric predictors correlated > 0.7
corr_recipe <-
___(price ~ ., data = ___) %>%
___(___, ___ = ___) %>%
___(___)
# Apply the recipe to the data
___ <-
___ %>%
___(new_data = ___)
# Identify the features that were removed
___(___, ___ = ___)