CommencezCommencez gratuitement

Utiliser l'imputation KNN

Dans l'exercice précédent, vous avez utilisé l'imputation par la médiane pour combler les valeurs manquantes dans l'ensemble de données sur le cancer du sein, mais ce n'est pas la seule façon de traiter les données manquantes.

Une solution de rechange est l'imputation par les k plus proches voisins (KNN). Il s'agit d'une méthode plus avancée où les valeurs manquantes sont remplacées par des valeurs provenant d'autres lignes similaires à la ligne courante. Même si sa mise en œuvre est beaucoup plus complexe en pratique que l'imputation par la médiane, il est très facile de l'explorer dans caret grâce à l'argument preProcess de train(). Il suffit d'utiliser preProcess = "knnImpute" pour changer la méthode d'imputation appliquée avant l'ajustement du modèle.

Cette activité fait partie du cours

Machine Learning avec caret en R

Voir le cours

Instructions de l’exercice

breast_cancer_x et breast_cancer_y sont chargés dans votre espace de travail.

  • Utilisez la fonction train() pour ajuster un modèle glm nommé knn_model à l'ensemble de données sur le cancer du sein.
  • Utilisez l'imputation KNN pour gérer les valeurs manquantes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Apply KNN imputation: knn_model
knn_model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print knn_model to console
Modifier et exécuter le code