Zacznij terazZacznij za darmo

Tworzenie przepisu usuwającego silnie skorelowane cechy

Po zidentyfikowaniu silnie skorelowanych cech zamiast usuwać je ręcznie, możesz skorzystać z kroku step_corr() w pakiecie tidymodels. step_corr() nie usuwa wszystkich cech skorelowanych z innymi – stara się usunąć ich jak najmniej. Koncepcyjnie, jak widzieć mogłeś w ćwiczeniu wielokrotnego wyboru, usuwa cechę, która w największym stopniu pokrywa się z dowolną kombinacją pozostałych cech. Chodzi o to, że pozostałe cechy zawierają te same informacje, więc informacja z usuniętej cechy jest nadal reprezentowana przez inne.

Pakiety tidyverse i tidymodels zostały już wczytane.

To ćwiczenie jest częścią kursu

Redukcja wymiarowości w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz przepis, który używa step_corr() z progiem 0,7, stosując ten krok wyłącznie do numerycznych predyktorów.
  • Zastosuj przepis do house_sales_df i zapisz przefiltrowane dane w filtered_house_sales_df.
  • Użyj tidy(), aby sprawdzić, którą kolumnę lub kolumny usunął filtr step_corr().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a recipe using step_corr to remove numeric predictors correlated > 0.7
corr_recipe <-  
  ___(price ~ ., data = ___) %>% 
  ___(___, ___ = ___) %>% 
  ___(___) 

# Apply the recipe to the data
___ <- 
  ___ %>% 
  ___(new_data = ___)

# Identify the features that were removed
___(___, ___ = ___)
Edytuj i uruchom kod