Creează o rețetă pentru varianță redusă
Pachetul tidymodels oferă o modalitate mai bună de a filtra caracteristicile cu varianță zero sau aproape zero, prin funcțiile step_zv() și, respectiv, step_nzv(). Acești pași de rețetă identifică caracteristicile cu varianță redusă examinând numărul de valori unice și raportul dintre frecvența celor mai comune valori din fiecare caracteristică. Această abordare este mai robustă decât pragul simplu de varianță folosit anterior.
În plus, vei folosi pasul de rețetă step_scale() pentru a normaliza varianța caracteristicilor. Ține minte că este întotdeauna o idee bună să normalizezi datele, astfel încât varianțele să fie comparabile între caracteristici.
Setul de date house_sales_df este disponibil pentru a fi utilizat. Variabila țintă este price. Pachetele tidyverse și tidymodels au fost deja încărcate.
Acest exercițiu face parte din cursul
Reducerea dimensionalității în R
Instrucțiuni pentru exercițiu
- Definește o rețetă pentru un filtru de varianță redusă și pregătește-o folosind
house_sales_df. - Aplică rețeta pe
house_sales_dfși stochează datele filtrate înfiltered_house_sales_df. - Afișează caracteristicile pe care rețeta le-a filtrat în pasul
step_nzv().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Prepare recipe
low_variance_recipe <- recipe(___ ~ ___, ___ = ___) %>%
step_zv(___) %>%
___(___) %>%
___(___) %>%
prep()
# Apply recipe
filtered_house_sales_df <- ___(___, new_data = ___)
# View list of features removed by the near-zero variance step
tidy(___, number = ___)