CommencezCommencez gratuitement

Utiliser la PCA comme solution de rechange à nearZeroVar()

Une autre façon de traiter les prédicteurs à faible variance consiste à exécuter une PCA sur votre jeu de données. C'est parfois préférable, car cela ne met pas de côté toutes vos données : plusieurs prédicteurs à faible variance peuvent être regroupés en une seule variable de PCA à forte variance, ce qui peut avoir un effet positif sur la précision de votre modèle.

C'est particulièrement efficace pour les modèles linéaires : l'option pca dans l'argument preProcess va centrer et mettre à l'échelle vos données, combiner les variables à faible variance et s'assurer que tous vos prédicteurs sont orthogonaux. On obtient ainsi un jeu de données idéal pour la modélisation par régression linéaire, ce qui améliore souvent la précision de vos modèles.

Cette activité fait partie du cours

Machine Learning avec caret en R

Voir le cours

Instructions de l’exercice

bloodbrain_x et bloodbrain_y sont chargés dans votre espace de travail.

  • Ajustez un modèle glm sur l'ensemble complet blood-brain en utilisant l'option "pca" dans preProcess.
  • Affichez le modèle dans la console et examinez le résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Fit glm model using PCA: model
model <- train(
  x = ___, 
  y = ___,
  method = ___, 
  preProcess = ___
)

# Print model to console
Modifier et exécuter le code