CommencezCommencez gratuitement

Dimensionnalité et information des caractéristiques

Imaginez que vous travaillez pour une banque et que vous avez recueilli des renseignements sur différents prêts accordés à différentes personnes. Votre patron souhaite que vous commenciez à explorer la possibilité d'utiliser ces données pour classer les clientes et clients dans différentes catégories de cote de crédit. Un échantillon des données disponibles est chargé dans credit_df. Vous vous demandez combien de caractéristiques contient l'ensemble de données. Vous voulez aussi repérer les caractéristiques qui ne seront pas utiles pour classer la clientèle dans différentes catégories de crédit.

Le paquet tidyverse a été chargé pour vous.

Cette activité fait partie du cours

Réduction de dimension en R

Voir le cours

Instructions de l’exercice

  • Trouvez le nombre de caractéristiques dans credit_df.
  • Calculez la variance de chaque caractéristique dans credit_df.
  • Repérez la caractéristique dont la variance est nulle et assignez-la à column_to_remove.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Find the number of features
___ %>% ___()

# Compute each column variance
credit_df %>% 
  ___(___(___(), ~ ___(., na.rm = TRUE))) %>% 
  pivot_longer(everything(), names_to = "feature", values_to = "variance")

# Assign the zero-variance column
column_to_remove <- "___"
Modifier et exécuter le code