Comparer l'imputation KNN et l'imputation par la médiane
Toutes les étapes de prétraitement dans la fonction train() sont effectuées sur l'ensemble d'entraînement de chaque pli de validation croisée. Ainsi, les mesures d'erreur rapportées tiennent compte des effets du prétraitement.
Cela inclut la méthode d'imputation utilisée (p. ex. knnImpute ou medianImpute). C'est utile, car cela vous permet de comparer différentes méthodes d'imputation et de choisir celle qui offre la meilleure performance hors échantillon.
median_model et knn_model sont disponibles dans votre espace de travail, de même que resamples, qui contient les résultats rééchantillonnés des deux modèles. Examinez les résultats des modèles en appelant
dotplot(resamples, metric = "ROC")
et choisissez celui qui fonctionne le mieux hors échantillon. Quelle méthode d'imputation donne le score ROC hors échantillon le plus élevé pour votre modèle glm ?
Cette activité fait partie du cours
Machine Learning avec caret en R
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice