Utiliser l'imputation KNN
Dans l'exercice précédent, vous avez utilisé l'imputation par la médiane pour combler les valeurs manquantes dans l'ensemble de données sur le cancer du sein, mais ce n'est pas la seule façon de traiter les données manquantes.
Une solution de rechange est l'imputation par les k plus proches voisins (KNN). Il s'agit d'une méthode plus avancée où les valeurs manquantes sont remplacées par des valeurs provenant d'autres lignes similaires à la ligne courante. Même si sa mise en œuvre est beaucoup plus complexe en pratique que l'imputation par la médiane, il est très facile de l'explorer dans caret grâce à l'argument preProcess de train(). Il suffit d'utiliser preProcess = "knnImpute" pour changer la méthode d'imputation appliquée avant l'ajustement du modèle.
Cette activité fait partie du cours
Machine Learning avec caret en R
Instructions de l’exercice
breast_cancer_x et breast_cancer_y sont chargés dans votre espace de travail.
- Utilisez la fonction
train()pour ajuster un modèleglmnomméknn_modelà l'ensemble de données sur le cancer du sein. - Utilisez l'imputation KNN pour gérer les valeurs manquantes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Apply KNN imputation: knn_model
knn_model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print knn_model to console