Dimensionalitate și informații despre caracteristici
Imaginează-ți că lucrezi pentru o bancă și ai colectat informații despre diverse credite acordate unor clienți. Șeful tău vrea să explorezi posibilitatea de a folosi aceste date pentru a clasifica clienții în diferite categorii de scor de credit. Un eșantion din datele disponibile este încărcat în credit_df. Ești curios câte caracteristici conține setul de date și vrei să identifici caracteristicile care nu vor fi utile pentru clasificarea clienților în categorii de credit.
Pachetul tidyverse a fost deja încărcat pentru tine.
Acest exercițiu face parte din cursul
Reducerea dimensionalității în R
Instrucțiuni pentru exercițiu
- Determină numărul de caracteristici din
credit_df. - Calculează varianța fiecărei caracteristici din
credit_df. - Identifică caracteristica cu varianța zero și atribuie-o variabilei
column_to_remove.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Find the number of features
___ %>% ___()
# Compute each column variance
credit_df %>%
___(___(___(), ~ ___(., na.rm = TRUE))) %>%
pivot_longer(everything(), names_to = "feature", values_to = "variance")
# Assign the zero-variance column
column_to_remove <- "___"