Creează o rețetă pentru corelații ridicate
Odată ce ai identificat caracteristicile puternic corelate, în loc să le elimini manual, poți folosi pasul de rețetă step_corr() din tidymodels. step_corr() nu elimină toate caracteristicile corelate cu altele — încearcă să elimine cât mai puține posibil. Conceptual, așa cum ai văzut în exercițiul cu variante multiple, elimină caracteristica care se suprapune cel mai mult cu orice combinație de alte caracteristici. Ideea este că celelalte caracteristici conțin aceleași informații, astfel încât informația suprapusă a caracteristicii eliminate rămâne reprezentată în celelalte.
Pachetele tidyverse și tidymodels au fost deja încărcate.
Acest exercițiu face parte din cursul
Reducerea dimensionalității în R
Instrucțiuni pentru exercițiu
- Creează o rețetă care folosește
step_corr()cu un prag de 0,7, aplicând pasul doar predictorilor numerici. - Aplică rețeta pe
house_sales_dfși stochează datele filtrate înfiltered_house_sales_df. - Folosește
tidy()pentru a identifica coloana sau coloanele eliminate de filtrulstep_corr().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a recipe using step_corr to remove numeric predictors correlated > 0.7
corr_recipe <-
___(price ~ ., data = ___) %>%
___(___, ___ = ___) %>%
___(___)
# Apply the recipe to the data
___ <-
___ %>%
___(new_data = ___)
# Identify the features that were removed
___(___, ___ = ___)